벤치마크와 코딩은 그만, 창작 글쓰기 프로젝트에는 어떤 모델을 쓰시나요?
Stepping away from Benchmarks and Code, what models are you using for Creating writing projects
핵심 요약
벤치마크 점수 경쟁에서 벗어나, 로컬 환경에서 창작 글쓰기에 적합한 오픈 웨이트 모델과 활용법을 공유하는 논의입니다.
- 창작 모델 추천 — Gemma 31B 계열이 긴 글쓰기에 선호됨
- Qwen 모델 평가 — Qwen 시리즈는 창작 글쓰기에 부적합하다는 의견이 지배적
- 글쓰기 프로세스 — 아웃라인과 장면 비트 프롬프트를 활용한 수동 제어 방식
- 모델 한계 — 긴 글에서 일관성 유지와 스타일 준수의 어려움
이 갤러리 놈들은 맨날 하는 소리가 무슨 새 모델이 벤치마크 점수가 몇 점이네, 코딩을 얼마나 잘하네 이딴 소리뿐임. 아니면 Qwen t/s 올리는 기술 같은 거나 떠들고 있고.
그래서 이 갤러리 초심으로 돌아가서, 로컬 모델들이 글쓰기를 얼마나 잘하는지 한번 얘기해 보려고 함.
클로즈드 소스 모델은 언급 안 할 거임. 이 글은 오직 오픈 웨이트 모델들만 다룰 거니까.
내 컴퓨터가 그렇게 좋은 사양은 아니라서 로컬로 돌릴 수 있는 게 좀 제한적임.
지금까지는 주로 Gemma 31b 파인튜닝 모델들을 돌려봤음. 창작 글쓰기용으로 내가 직접 다듬어온 시스템 프롬프트가 있는데, 이건 RP(역할극)보다는 장편 소설 쓰기에 최적화된 거임. SF나 판타지 소설, 단편, 가끔은 팬픽 쓸 때도 이걸 씀.
그리고 Pi를 써서 창작 글쓰기용 하네스도 하나 만들었음. 주로 AI 특유의 뻔한 문체(AI slopisms)를 걸러내고 스스로 교정하게 만드는 용도임.
지금까지 써본 것 중에는 Gemma 31B Mero-mero-v2가 제일 마음에 듦. 글도 잘 쓰고, 지능이 퇴화한 느낌도 안 들고, 검열도 거의 없음. 지시사항 따르는 것도 괜찮은 편임. 가끔 실수해서 캐릭터 설정 꼬일 때도 있는데, 그건 내가 만든 창작 하네스가 다 커버해 줌.
Qwen 3.8 27b 파인튜닝 모델들은 좀 실망스러웠음. 베이스 모델 자체가 창작 글쓰기에는 진짜 개판인 듯. 파인튜닝을 아무리 해도 한계가 있더라. 지시사항은 기가 막히게 잘 따르는데, 글 쓰는 꼬라지가 진짜 처참함.
Muse Glimmer 30b는 좀 흥미로운 놈임. 어떨 때는 진짜 쩌는 문장을 뽑아내는데, 어떨 때는 2b 모델마냥 멍청하게 대답함. 왜 이렇게 편차가 심한지 모르겠음. 챗 템플릿 문제인가 싶기도 하고. 아무튼 상태 안 좋을 때조차 Qwen보다는 나음.
Gemma 4 26b4a는 꽤 괜찮긴 한데, 형님 격인 Gemma 4 31b한테는 밀림. 그래도 빠른 응답이 필요하거나, 내가 짠 초기 장면 비트 프롬프트에 문제 없는지 확인할 때는 이거 씀.
Gemma 31B Artemis, drummer가 파인튜닝한 건데, 음... 좀 실망했음. 장편 소설보다는 RP에 더 치중한 느낌임. Mero 파인튜닝에서는 안 뜨던 거부 메시지도 뜨고 말이야.
로컬 모델로 글 써본 내 경험은 대충 이럼. 너희들은 로컬 창작 프로젝트에 뭐 쓰고 있냐? 창작 글쓰기용 하네스 같은 거 써본 놈들 있음?
글 마치기 전에 내 글쓰기 방식도 짧게 언급하자면, 나는 직접 쓴 개요랑 장면 비트 프롬프트를 사용함. 지금까지 AI는 진정한 창작 측면에서 진짜 실망스러운 수준이었고, 클리셰 범벅인 쓰레기 글 안 쓰게 하려면 여전히 손이 엄청 많이 감.

