Qwen과 Gemma가 왜 그렇게 다른지 알겠네
No wonder Qwen and Gemma are so different
핵심 요약
Qwen과 Gemma의 토크나이저 효율성 차이가 코딩 성능 격차를 만든다는 분석입니다.
- 토크나이저 차이 — Qwen은 코드를 효율적으로 토큰화하는 반면 Gemma는 일반 언어처럼 세분화함
- 코딩 성능 격차 — Qwen의 효율적인 토큰화가 코딩 작업에서 더 나은 성능을 내는 이유로 추정됨
- 토큰화 효율 — HTML/JS 코드에서 Qwen이 Gemma보다 훨씬 적은 토큰을 생성함
- 모델 개선 가능성 — 효율적인 토크나이저로 재학습하는 것이 Gemma의 성능 향상에 도움이 될지 주목됨
같은 HTML/JS 코드(330줄)를 Qwen 35B A3B와 Gemma 26B A4B에 붙여넣어 봤음.
Qwen: 입력을 1609개의 토큰으로 토큰화함
Gemma: 입력을 4258개의 토큰으로 토큰화함.
젠장. 전에는 전혀 몰랐던 사실이고, 언급하는 사람도 못 봤음. 이것만 봐도 왜 Qwen이 코딩에 더 뛰어나고 Gemma가 언어 작업에 더 뛰어나다고 평가받는지 설명이 됨.
Qwen은 말 그대로 코드를 특정 형태의 입출력으로 볼 수 있는 반면, Gemma는 일반 언어처럼 단어 조각으로 분해하고 있음. Qwen은 코딩 작업을 줄 때 추론 방식도 완전히 달라짐.
참고로 인스트럭션 문서(55줄)로 테스트했을 때는 토큰화 결과가 1025 대 1039로 거의 비슷했음.
LiquidAI였나? 기존 모델들을 더 효율적인 토크나이저로 재학습시키는 프로젝트를 본 적이 있음. Gemma 같은 모델에 그런 걸 적용하면 어떻게 될지, 성능을 따라잡는 데 도움이 될지 궁금함.




