Qwen3.6-35B vs Gemma4-26B: 7900 XTX에서의 벤치마크 비교
Qwen3.6-35B vs Gemma4-26B on 7900 XTX
핵심 요약
추론 모델의 토큰 생성량과 속도를 비교한 결과, 디코더 속도가 느린 Gemma가 실제 응답 속도 면에서 더 효율적이었습니다.
- 성능 비교 — Qwen의 MTP 기술이 토큰 생성 속도는 빠르지만, 추론 토큰량이 많아 전체 응답 시간은 Gemma가 20% 더 빠름
- 벤치마크 환경 — Ryzen 9600X와 7900 XTX 환경에서 ROCm 7.2.3 및 llama.cpp를 사용하여 테스트 진행
- 추론 효율성 — 추론 과정에서의 토큰 생성량이 응답 속도의 병목 현상을 유발하여 초당 토큰 수보다 전체 토큰 수가 중요함
- 활용 전략 — 배치 작업에는 Qwen을, 대화형 단일 요청에는 Gemma를 사용하는 것이 효율적임
내 Radeon 7900 XTX에서 Qwen3.6-35B-A3B랑 Gemma4-26B-A4B 공정하게 비교해 봤다. 둘 다 추론 기능 켜고 32K 예산 맞췄고, 출력 제한 없이 일반적인 실사용 프롬프트 6개(회의록, 사고 사후 분석, 로그 분류해서 JSON 만들기, 코드 리뷰, 빌드 vs 구매 결정, 창의적 글쓰기) 돌려봄.
세 줄 요약: 디코더 느린 놈이 실사용 속도는 더 빠름. Qwen의 MTP 덕분에 토큰 생성 속도는 1.65배 정도 빠르거든(130 vs 78 tok/s). 근데 똑같은 질문에 답할 때 토큰을 2배나 더 뱉어냄. 대부분 내부 추론에 다 써버린다는 소리지. 결과적으로 Gemma가 전체 작업 시간은 20% 정도 더 빠르더라. 6개 작업 합산 결과: Qwen 118.8초 vs Gemma 95.6초.
환경:
Ryzen 9600X, Sapphire NITRO+ 7900 XTX 24GB, 96GB DDR5-6800
ROCm 7.2.3, HIP gfx1100, llama.cpp build 9425, GGML_HIP=ON, ROCWMMA_FATTN=OFF
Qwen3.6-35B-A3B: IQ4_XS-Q8nextn hybrid MTP (~20GB), draft-n-max 3
Gemma4-26B-A4B: UD-Q4_K_XL (~17GB), MTP 없음
주요 발견:
Qwen은 6개 작업에서 총 14,811 토큰을 뱉었는데 Gemma는 7,386 토큰이었음. 거의 2배 차이지. 게다가 Qwen은 그중에서 생각하는 데 쓰는 비중도 더 높음(합산 74% vs 57%).
작업별 소요 시간:
meeting-notes: Qwen 12.2s vs Gemma 10.8s (Gemma 승)
incident-postmortem: Qwen 28.2s vs Gemma 21.6s (Gemma 승)
log-triage-json: Qwen 10.4s vs Gemma 9.0s (Gemma 승)
code-review: Qwen 20.6s vs Gemma 23.1s (Qwen 승 — 둘 다 추론을 제일 적게 한 작업)
build-vs-buy: Qwen 33.1s vs Gemma 21.5s (Gemma 승)
creative-spark: Qwen 14.4s vs Gemma 9.5s (Gemma 승)
MTP 관련: 순수 디코딩만 보면 MTP가 130 vs 78 tok/s로 압승이고, 수락률도 41~62%(전체 52.5%) 수준임. 근데 MTP는 토큰을 '얼마나 빨리 뱉느냐'만 도와주지, '얼마나 많이 뱉느냐'는 못 줄임. 추론 켜놓으면 토큰 수가 병목이라 디코딩 속도 이점은 거의 사라짐. 유용한 내용 글자 수/초로 따지면 둘이 거의 비슷함(~137 vs ~130).
품질: 진짜 막상막하인데 재밌는 차이가 있음. 코드 리뷰에서 Gemma는 Qwen이 놓친 파라미터 누락 TypeError를 잡아냄. 빌드 vs 구매 결정에서는 서로 반대 의견을 냈는데 둘 다 논리는 충분했음(Qwen: Algolia 관리형 써라; Gemma: 그냥 Postgres 써라, Elasticsearch 건드리지 마라). 엄격한 JSON 형식 작업에서는 Qwen은 "군더더기 없이" 딱 JSON만 뱉었는데, Gemma는 코드 블록으로 감싸서 뱉더라. 둘 다 환각은 없었음.
결론: 둘 다 써라. 처리량(Throughput)이 중요한 배치 작업은 Qwen 돌려(연속 요청이 많으면 디코딩 속도 차이가 누적되고, 출력 형식을 칼같이 지킴). 응답 속도가 중요한 단일 요청은 Gemma 써(디코더는 느려도 실사용 시간은 20% 더 빠름). 스펙 시트에는 안 나오는 핵심: 디코더 빠르다고 응답이 빠른 게 아님. 추론이 들어가면 '초당 토큰 수'보다 '답변까지 필요한 총 토큰 수'가 깡패임.
전체 벤치마크 상세 내용 및 원본 프롬프트/출력 쌍: Qwen3.6-35B vs Gemma4-26B: Real Workload Benchmarks on Radeon 7900 XTX · kmarble.dev 원시 데이터는 요청하면 줌.


