Gemma4 QAT 사용 경험은 어떠신가요?
What's your experience with Gemma4 QAT?
핵심 요약
Gemma4 QAT 모델의 성능 향상과 속도 개선에 대한 사용자들의 긍정적인 경험 공유가 이어지고 있습니다.
- 성능 향상 — 기존 모델 대비 문맥 이해도와 답변 품질이 개선됨
- 속도 개선 — QAT 및 MTP 적용으로 추론 속도가 눈에 띄게 빨라짐
- VRAM 효율성 — 더 적은 VRAM을 사용하여 멀티 모델 운영이 용이함
- 프로그래밍 성능 — 코딩 작업에서도 기존 모델 대비 우수한 성능을 보임
여러분 안녕하세요!
영어가 모국어가 아니라서 실수하면 좀 고쳐주세요 (배우는 중이니까요!).
나온 지 얼마 안 됐지만 너무 만족스러워서 글을 남깁니다.
먼저 말씀드리자면, 저는 프로그래밍에는 Qwen3.6 27B를 쓰고, 나머지 거의 모든 작업에는 Gemma4를 씁니다. 그래서 프로그래밍에 대해서는 딱히 드릴 말씀이 없네요.
이전에는 Gemma4-31B Q4_K_L(긴 128k Q8_0 컨텍스트 작업용)과 Q6_K_L(짧은 32k Q8_0 컨텍스트 작업용)을 사용했습니다. 짧은 컨텍스트 작업은 빠른 번역, 역할극, 짧지만 정확한 OCR 등을 의미하고, 긴 컨텍스트는 긴 문서 파싱, 웹 검색 조사 등을 의미합니다.
QAT 모델을 쓰면서 두 작업 모두 같은 모델을 사용할 수 있게 되었고(좋네요!), 미묘한 품질 향상도 체감하고 있습니다.
예를 들어 역할극의 경우, 훨씬 다양한 어휘를 사용하고, 문맥에 맞는 발언을 하며, 상관관계를 더 잘 이해하고 활용하는 모습을 보여줍니다.
아쉽게도 Q8_0 모델은 써본 적이 없지만, 제가 보기엔 bartowski의 Q6_K_L보다는 확실히 성능이 좋습니다. 하지만 여전히 캐시 양자화(cache quant) 때문에 심하게 제약을 받긴 합니다. Q8_0은 128k에서 눈에 띄는 성능 저하가 느껴지거든요.
Gemma 31B QAT와 MTP를 같이 쓰는 것도 정말 놀랍습니다! 32k 토큰 위키피디아 페이지 요약 시 50 t/s(기존 21 t/s 대비), 역할극 중에는 약 36 t/s(기존 20 t/s 대비)가 나옵니다. 리눅스를 쓰면 더 높은 수치가 나올 것 같네요 (지금은 윈도우에 묶여 있어서...).
세팅을 좀 조절해야 했는데, 제 경우엔 5 max drafts가 잘 작동했지만 친구들은 4나 6이 더 잘 맞는다고 하더군요. 같은 작업으로 3~7까지 5번 정도 돌려보면서 본인에게 제일 잘 맞는 걸 찾아보세요.
그럼 제 경험은 여기까지! 여러분은 어떠신가요? QAT 모델을 쓰면서 성능 향상이나 저하를 느끼셨나요? 그리고 프로그래밍 성능은 어떤가요?

