Strix Halo에서 Gemma 4 QAT Q4_0 벤치마크
Gemma 4 QAT Q4_0 Bench on Strix Halo
핵심 요약
Strix Halo APU 환경에서 Gemma 4 QAT 모델의 성능을 테스트하고 MTP 어시스턴트 헤드 적용 결과를 공유함.
- QAT 모델 성능 — 일반적인 사후 양자화보다 원본 모델의 동작을 더 잘 유지함
- 테스트 환경 — AMD Ryzen AI Max+ 395 및 128GB LPDDR5X 메모리 기반
- MTP 헤드 최적화 — QAT 전용 어시스턴트 헤드 사용 시 26B 모델에서 71.4 tok/s의 우수한 성능 확인
- 모델 비교 — 26B-A4B 모델이 31B 모델보다 효율성 및 속도 면에서 더 뛰어난 결과를 보임
Gemma 4 QAT Q4_0 벤치마크 (Strix Halo)
이 모델들은 구글의 공식 Gemma 4 QAT Q4_0 GGUF 모델이며, Strix Halo APU에서 llama.cpp Vulkan/RADV를 통해 로컬로 구동되었습니다.
QAT는 양자화 인식 학습(Quantization-aware training)을 의미합니다. 일반 모델을 가져와 학습 후에만 양자화하는 대신, 모델이 실행될 낮은 정밀도 형식을 고려하여 학습하거나 적응시킵니다. 목표는 작은 Q4 모델이 단순 사후 학습 양자화보다 원본 모델의 동작을 더 많이 유지하도록 하는 것입니다.
호스트
시스템: AMD Ryzen AI Max+ 395 / Radeon 8060S, gfx1151
메모리: 128 GB 통합 LPDDR5X
GTT 제한: 96 GiB 클래스 / large-GTT 설정
IOMMU: 활성화됨
OS: Linux Mint 22.3 / Ubuntu noble 기반
커널: 6.17.0-23-generic
Mesa / RADV: Mesa 25.2.8 / RADV
백엔드: llama.cpp Vulkan/RADV, Gemma 4 어시스턴트 헤드 MTP를 위한 Atomic llama.cpp TurboQuant 포크
ROCm: 설치됨, 하지만 이 행들은 Vulkan/RADV 추론 행임
모델
메인 모델: google/gemma-4-26B-A4B-it-qat-q4_0-gguf
메인 모델 파일: gemma-4-26B_q4_0-it.gguf
디스크상 메인 모델 크기: 14,439,361,440 바이트 / 13.45 GiB
아키텍처: Gemma 4 MoE, 총 약 26B / A4B 활성 레인
테스트한 다른 QAT 모델:
모델 파일 크기
Gemma 4 12B QAT Q4_0 6,975,877,728 바이트 / 6.50 GiB
Gemma 4 26B-A4B QAT Q4_0 14,439,361,440 바이트 / 13.45 GiB
Gemma 4 31B QAT Q4_0 17,650,999,456 바이트 / 16.44 GiB
MTP 어시스턴트 헤드
초기 QAT MTP 프로브는 일반적인 비 QAT Gemma 4 어시스턴트 헤드를 빌려왔습니다. 로드는 되었지만 수용력이 약했습니다. 더 나은 결과는 구글의 일치하는 QAT 어시스턴트 소스를 사용하고 해당 어시스턴트 체크포인트를 Atomic/llama.cpp 호환 GGUF 헤드로 변환했을 때 나왔습니다.
공식 QAT 어시스턴트 소스:
text google/gemma-4-12B-it-qat-q4_0-unquantized-assistant google/gemma-4-26B-A4B-it-qat-q4_0-unquantized-assistant google/gemma-4-31B-it-qat-q4_0-unquantized-assistant
변환된 로컬 어시스턴트 헤드:
메인 모델 QAT 어시스턴트 헤드 크기
Gemma 4 12B QAT gemma-4-12B-it-qat-assistant-MTP-Q8_0.gguf 444 MiB
Gemma 4 26B-A4B QAT gemma-4-26B-A4B-it-qat-assistant-MTP-Q8_0.gguf 441 MiB
Gemma 4 31B QAT gemma-4-31B-it-qat-assistant-MTP-Q8_0.gguf 491 MiB
변환 참고: 어시스턴트 GGUF는 이 Atomic llama.cpp 빌드가 예상하는 gemma4_assistant 메타데이터 형태가 필요하며, 여기에는 n_embd_backbone 및 대상 아키텍처 메타데이터가 포함됩니다. 시도했던 공개 31B QAT 어시스턴트 GGUF는 다른 메타데이터를 사용하여 그대로 로드되지 않았습니다. 12B 소스 저장소는 더 새로운 Gemma4UnifiedAssistantForCausalLM 구성 이름을 사용하므로, 임시 구성 별칭을 통해 기존 Gemma 4 어시스턴트 변환기 경로로 변환했습니다. 소스 가중치는 수동으로 편집하지 않았습니다.
최신 측정 수치 (표 데이터 생략)

