'직접 돌리지 않으면 네 것이 아니다'의 실제 사례, 그리고 챗GPT와 제미나이를 압도하는 Gemma 4
An actual example of "If you dont run it, you dont own it" and Gemma 4 beats both Chat GPT and Gemini Chat
핵심 요약
로컬 모델을 직접 돌려보니 Gemma 4가 번역 및 문맥 파악에서 챗GPT와 제미나이보다 뛰어난 성능을 보임.
- 로컬 모델 성능 — Gemma 4가 챗GPT 5.3 및 제미나이보다 번역 및 문맥 파악에서 우수한 성능을 입증함.
- 모델 검열 문제 — Qwen 모델들이 번역 과정에서 불필요한 검열로 인해 제대로 작동하지 않는 문제 발생.
- 로컬 LLM의 도약 — 그동안 대형 상용 모델에 밀리던 로컬 LLM이 이제는 번역 등 특정 작업에서 상용 모델을 능가함.
- 사용자 경험 변화 — 기업의 A/B 테스트나 모델 성능 저하로부터 자유로운 로컬 모델의 장점이 부각됨.
모델 성능 저하와 검열에 관한 흥미로운 이야기입니다.
제 AI 활용 사례 중 하나는 중국 소설을 챕터별로 번역하고 읽는 것입니다.
일부 캐릭터의 비밀 신원이나 플롯 포인트 때문에 AI가 번역 시 문맥 단서를 따라가야 했고, 일관성을 유지하기 위해 AI에게 이를 확인하고 번역 시 올바른 이름을 선택하도록 프롬프트를 입력해야 했습니다.
처음 시작했을 때 사용 가능한 주요 모델은 GPT OOS 120B(느림), Qwen 3 max, 그리고 무료 버전인 Chat GPT 4o였습니다.
처음에는 GPT OSS 120B를 시도했지만 실패했습니다. 캐릭터 이름을 섞어버리거나 때로는 일관성 없이 새로운 이름을 만들어내기도 했습니다.
그다음에는 Qwen 3 Max를 사용했습니다. 더 나았지만 여전히 20%의 실패율을 보였습니다. 그러다 (NSFW가 아님에도 불구하고) 지속적으로 검열 필터에 걸리기 시작했습니다.
그 후 당시 무료 버전인 Chat GPT 4o를 시도했는데, 단연 최고였습니다. 이름은 항상 정확했고 번역 품질 자체도 최고 수준이었습니다.
시간이 좀 흐른 뒤 5.2 업데이트 이후, 쿼리의 20%에서 실패하기 시작했습니다. 그러다 A/B 테스트를 목격했는데, 버전 중 하나가 번역에서 지속적으로 실패하며 잘못된 이름을 선택했습니다.
이제 GPT 5.3이 나오면서 A/B 테스트는 끝난 것 같고, 사용자들에게 더 나쁜 버전을 배포하여 예전 Qwen 3 Max와 비슷한 수준이 되었습니다.
이 일로 인해 번역을 위한 현재 최신 로컬 모델들의 상태를 다시 테스트해보고 싶어졌습니다. 놀랍게도 Gemma 4 31B가 폐쇄형 모델들을 압도했습니다. 품질은 전성기 GPT 4o와 매우 유사합니다.
같은 프롬프트와 챕터로 일부 오픈 및 폐쇄형 모델들을 다시 테스트해본 결과, 우리에게 긍정적인 결과가 나왔습니다:
|Model|PASS/FAIL|INFO|
|:-|:-|:-|
|GPT OOS 120B|FAIL|Merges characters names|
|Qwen 3 Max|FAIL (CENSORED)|Ok writing, but model got censored and autodeleted|
|Qwen 3.6 Plus|FAIL (CENSORED)|Good writing, but model got censored and autodeleted|
|Chat GPT 5.3|FAIL|Messes up correct character name, unnaturally feeling translation|
|Gemma 4 31B|PASS|Good translation, feels natural, and is fast|
|Qwen 3.5 27B|PARTIAL PASS|Similar to Gemma 4, a bit less natural sounding and messes character pronouns (calls a Lady a Lord)|
|Gemini Chat|PARTIAL PASS|Surprisingly, worse than Gemma 4, a bit less natural sounding and messes character pronouns (calls a Lady a Lord)|
세상에, 이 글을 쓰기 시작한 후에 테스트를 해봤습니다. 어떻게 Q4 버전의 Gemma 4가 Gemini와 GPT 5.3을 모두 이길 수 있죠? 구글이 사용하는 Gemini가 정말 Gemma보다 못한 건가요? 대체 무슨 일이죠?!


