Qwen 3.6 35B가 내 테스트에서 Gemma 4 26B를 압도함
Qwen 3.6 35B crushes Gemma 4 26B on my tests
핵심 요약
Qwen 3.6 35B가 에이전트 코딩 테스트에서 Gemma 4 26B보다 더 높은 정확도와 효율성을 보임.
- 에이전트 성능 — Qwen 3.6이 코딩 및 에이전트 작업에서 Gemma 4보다 더 적은 토큰으로 더 많은 문제를 해결함.
- 효율성 비교 — Qwen은 Gemma 대비 1.74배 빠른 속도와 2.6배 높은 비용 효율성을 기록함.
- 모델 아키텍처 — Qwen의 구조가 에이전트 환경에서 일관된 프리필 속도를 유지하는 데 유리함.
- 이미지 처리 — Qwen이 Gemma보다 더 정확한 이미지-텍스트 합성 결과를 보여줌.
나는 개인적인 평가 도구를 가지고 있어: 약 3만 줄의 코드로 구성된 저장소로, LLM이 에이전트 설정을 통해 디버깅하고 해결해야 할 37개의 의도적인 문제가 포함되어 있지 (나는 OpenCode를 사용해).
이 도구의 일부는 LLM이 꽤 큰 PDF(40~60페이지)에서 핵심 정보를 추출하고, 요약하고, 결과를 평가하도록 테스트하기도 해.
요약하자면: 이 도구는 다음 LLM 속성들을 테스트해:
- 에이전트 능력
- 코딩
- 이미지-텍스트 합성
- 지시 이행
- 추론
공정한 기준을 위해 두 모델 모두 UD-Q4_K_XL 버전으로 최적의 샘플링 파라미터를 사용해 실행했어. Gemma 4의 GGUF는 구글의 최신 채팅 템플릿 수정 사항과 DRAM 폭주를 완화하기 위한 -cram, -ctkcp 플래그를 적용했지.
결과는 다음과 같아:
Qwen3.6 Gemma 4
┌──────────────┐ ┌──────────────┐
Tests Fixed │ 32 / 37 │ │ 28 / 37 │
Regressions │ 0 │ │ 8 │
Net Score │ 32 │ │ 20 │
Post-Run Failures │ 5 │ │ 17 │
Duration │ 49 min │ │ 85 min │
└──────────────┘ └──────────────┘
WINNER ✓
1. 테스트 결과
| Metric | Qwen3.6-35B-A3B | Gemma 4-26B-A4B |
| --------------------------------- | --------------- | --------------- |
| Baseline failures | 37 | 37 |
| **Tests fixed** | **32 (86.5%)** | 28 (75.7%) |
| **Regressions** | **0** | 8 |
| **Net score (fixed − regressed)** | **32** | 20 |
| Still failing (of original 37) | 5 | 9 |
| Post-run total failures | **5** | 17 |
| Guardrail violations | 0 | 0 |
Qwen은 남은 5개의 실패 사례를 식별했지만, 범위를 벗어났다고 판단하여 의도적으로 건너뛰었어. Gemma는 여러 번 재시도하다가 결국 포기했지.
2. 토큰 사용량
| Metric | Qwen3.6 | Gemma 4 | Ratio |
| ------------------------------ | ----------- | ------------- | ----------------------------- |
| Input tokens | 634,965 | 1,005,964 | Gemma 1.6x more |
| Output tokens | 39,476 | 89,750 | Gemma 2.3x more |
| **Grand total (I+O)** | **674,441** | **1,095,714** | **Gemma 1.6x more** |
| Cache read tokens | 4,241,502 | 3,530,520 | Qwen 1.2x more |
| Output/Input ratio | 1:16 | 1:11 | Gemma more verbose |
| **Tokens per fix** | **~21K** | **~39K** | **Gemma 1.9x more expensive** |
| **Tokens per net score point** | **~21K** | **~55K** | **Gemma 2.6x more expensive** |


