2026년 최고의 창작 글쓰기 모델 V3 (17개 모델 테스트)
Best Creative Writing Models of 2026 V3 (17 Models Tested)
핵심 요약
17개 모델을 대상으로 한 창작 글쓰기 벤치마크 V3 결과, Gemini 3.8 Flash가 최고의 모델로 선정되었습니다.
- Gemini 3.8 Flash — 뛰어난 문체와 유연성으로 현재 최고의 창작 글쓰기 모델로 등극함
- GLM 5.3의 논리력 — 복잡한 세계관 구축과 인과관계 추적에서 가장 우수한 성능을 보임
- Anthropic 모델 퇴보 — 최신 Sonnet/Opus 5보다 이전 버전인 4.6/4.8이 창작 글쓰기에 더 적합함
- 벤치마크 신뢰성 — AI 평가 모델의 편향성을 지적하며 객관적인 자체 평가 기준을 제시함
(짧은 시간에 모델이 너무 많이 쏟아져 나오네 🥀)
이전 https://www.reddit.com/r/GeminiAI/comments/1vhf7vc/best_creative_writing_models_of_2026_v2/ V2 랭킹에 이어서, V3 작업 끝냈다. 이번엔 12개 장르에 걸쳐 600개 샘플을 똑같은 엄격한 시스템 인스트럭션 하네스로 돌려본 벤치마크 결과임.
리더보드랑 방법론, 모델별 결함, 그리고 시스템 프롬프트까지 싹 다 정리해서 웹사이트로 만들어봤다: Creative writing benchmark.
(참고: Astra 테스트도 곧 올라올 예정 ;) 창작 글쓰기 쪽은 아직 안 돌려봤는데, 환각 현상 줄어들고 추론 능력은 확실히 좋아졌더라!)
TL;DR:
-
Gemini 3.8 Flash가 MVP임: 기존 플래그십 모델들 산문 리듬이랑 유연성으로 다 씹어먹음. Gemini 3.1 Pro도 3개 카테고리에서 발라버렸고, 속도까지 고려하면 현재 창작 글쓰기 원탑 모델임.
-
GLM 5.3이 논리 왕좌 차지 (#1, 510점): Kimi k3(500점)를 근소하게 제쳤음. 깊이 있는 세계관 연속성, 다변수 논리, 플롯 인과관계 추적 면에서 압도적임. 다만 산문체는 여전히 좀 건조하긴 함.
-
Anthropic의 퇴보: Opus 4.8이 고난도 논리나 서사 일관성 면에서 Opus 5보다 훨씬 나음. Sonnet 5는 창작 스타일을 완전히 망쳐놨으니까, Claude 특유의 문체를 원하면 Sonnet 4.6이나 Opus 4.8에 머무는 게 답임.
-
컨텍스트 윈도우의 미묘한 차이: Kimi k3가 논리는 지리는데, 고가 플랜 결제하거나 API 안 쓰면 256k 제한에 걸림. 게다가 '생각의 사슬(Chain of Thought)'을 무겁게 돌려서 토큰을 순식간에 다 처먹음. 플롯 안 놓치고 100만 토큰 넘게 유지하려면 Gemini 3.1 Pro나 3.6/3.7/3.8 Flash가 여전히 국룰임.




