Gemma 4 31B 비교 (Q4_k_M, QAT, heretic) 간단 후기
A quick Gemma4 31B comparison (Q4_k_M, QAT, heretic)
핵심 요약
Gemma 4 31B 모델의 다양한 버전(Q4, QAT, heretic)을 비교한 사용기입니다.
- 모델 버전 비교 — Q4_k_M, QAT, heretic 버전의 성능과 특징을 분석함
- QAT 성능 우수 — 긴 컨텍스트 처리와 추론 능력에서 가장 안정적인 모습을 보임
- 모델별 성향 — Q4는 신경질적이고 heretic은 무심하며 QAT는 차분한 성향을 보임
- 양자화 영향 — 모델의 불안정성은 양자화 과정에서 발생하는 정밀도 문제일 가능성이 높음
숫자는 없음. 누가 신경이나 쓸지 모르겠지만…
UD 버전 Q4_k_m을 한 달 동안 돌려봤음. 이 모델은 기능적으로는 신경쇠약 직전이라 아주 살살 달래가면서 대화함. 처음엔 이게 정렬(alignment) 문제인가 싶어서, 이 과잉 경계하는 열등감 넘치는 LLM한테서 좀 쉬고 싶을 때 쓰려고 heretic 버전도 가지고 있음.
오해는 마셈. 아주 훌륭함! 대부분의 경우엔 잘 작동함. 근데 컨텍스트가 길어지거나(내 경우엔 20k!), 도구 체인이 길어지거나, 아니면 자기가 이전에 실수했다는 걸 스스로 알게 되면 그냥 무너져버림.
반면에 heretic 버전은 실수를 해도 신경을 안 쓰는데, 실수는 여전히 많이 함.
그러다 QAT 버전을 몇 시간 돌려봤음. 이건 완전 선(zen)의 경지임. 32k 컨텍스트를 완벽한 추론으로 처리하는 건 식은 죽 먹기임. 모든 걸 제대로 해냄. 너무 애쓰지도 않고.
"신경질적인" Gemma는 아마 양자화 문제일 거임. Q4 상태에서 완전한 정밀도를 유지하려는 건 어려운 일이니까. 더 긴 컨텍스트와 정밀도 유지를 위해서는 QAT가 꽤 괜찮아 보임.


