Gemma 4 QAT 벤치마크 결과 (AMD 7900 XTX): 더 빠르고 VRAM은 적게, 품질 저하는 없음
Gemma 4 QAT benchmark results (AMD 7900 XTX): faster, less VRAM, no quality loss
핵심 요약
AMD 7900 XTX에서 Gemma 4 QAT 모델을 테스트한 결과, 품질 손실 없이 속도와 VRAM 효율이 크게 개선되었습니다.
- QAT 모델 성능 — 12B 모델 기준 생성 시간 45% 단축 및 VRAM 5.7GB 절약
- 일관된 품질 — 템퍼러처 1.0 환경에서도 기존 모델 대비 품질 저하 없음
- 하드웨어 환경 — AMD 7900 XTX 및 ROCm 환경에서 llama-swap을 통해 테스트
- 추가 검증 필요 — E4B 모델 등 일부 결과는 정밀한 비교 데이터가 더 필요함
7900xtx 이거 가지고 테스트 존나게 돌려봤다. 그동안 내 작업들은 전부 qwen3.6 모델에 의존했는데, 솔직히 이 모델들 훌륭하긴 하지만 좀 다양한 관점이 필요했거든. 특히 Honcho 워크로드 티어나 여러 크론 잡(cron job) 돌릴 때 말이야. 모든 작업이 에이전트 특화 모델에 최적인 건 아니라서 Gemma 4 모델을 좀 더 테스트해봤다. 마침 Gemma 4 시리즈에 QAT(Quantization-aware training) 버전이 나왔는데, 이게 Q4 가중치를 쓰면서도 BF16 가중치 수준의 정밀도를 유지한다고 하더라고.
두 모델군을 A/B 테스트로 비교해서 얼마나 차이가 나는지, 유의미한 결과가 있는지 확인해봤다. 높은 정밀도에 속도까지 빠른 작은 모델? 공짜 점심 마다할 이유가 없지!
설정 버전이랑 플래그 같은 거 정리해뒀다. 내 에이전트가 tok/s 측정값을 제대로 안 긁어오긴 했는데(당연하지 뭐), 대략적인 전체 소요 시간 보면 감 잡힐 거다.
전체 정리 데이터: https://kmarble.dev/posts/gemma-4-qat-benchmark-same-quality-faster-less-vram/
모델별 요약:
• 12B QAT vs Q8_0 — 이게 진짜 물건이다. 전체 생성 시간을 323초에서 176초로 줄였고(45% 더 빠름), 처리량은 83% 증가, VRAM은 5.7GB나 아꼈다. 모든 프롬프트에서 품질은 똑같음. 제약 조건 준수 테스트에서 일반 Q8_0은 초안 잡느라 124초 걸렸는데, QAT는 24초 만에 끝내버림.
• 26B QAT vs UD-Q4 — 확실히 가볍다. 꾸준히 적당한 이득(1.0배~1.38배 속도 향상)이 있고 VRAM 2GB 절약됨. temp=1.0에서 어떤 프롬프트 유형을 써도 품질 저하 없음.
• 31B QAT vs Q4_K_M — VRAM 절약 폭은 작아도 해볼 만함. 1.3배~1.5배 더 빠르고, 실제로 전체 출력량도 8% 더 많았음. 창의적인 글쓰기 이어가기 테스트에서 일반 모델은 710자 쓰고 멈췄는데, QAT는 1256자까지 뽑아냄.
• E4B — 지금은 거르는 거 추천. 비트 폭 차이 때문에 결과가 좀 꼬였음(일반은 q8_0, QAT는 q4 수준). 같은 정밀도로 다시 비교해봐야 함.
AMD 7900 XTX/ROCm 환경에서 llama-swap 사용, temp=1.0, 토큰 제한 없이 테스트함. 전체 원본 출력물(~170KB markdown) 올려뒀으니 직접 뜯어보고 싶은 놈들은 확인해봐라.
