Gemma 4 31B vs Gemma 4 26B-A4B vs Qwen 3.5 27B — Claude Opus 4.6을 판사로 한 30문제 블라인드 평가
Gemma 4 31B vs Gemma 4 26B-A4B vs Qwen 3.5 27B — 30-question blind eval with Claude Opus 4.6 as judge
핵심 요약
Claude Opus 4.6을 활용해 Gemma 4와 Qwen 3.5 모델들의 성능을 블라인드 테스트한 결과 공유.
- 모델 성능 비교 — Gemma 4와 Qwen 3.5 모델 간의 코딩, 추론, 분석 능력 등을 30개 문제로 평가함.
- 평가 방법론 — Claude Opus 4.6을 단일 판사로 사용하여 절대 점수 방식으로 모델별 성능을 측정함.
- 결과 분석 — Qwen 3.5는 승률이 높지만 특정 문제에서 실패하는 경향이 있고, Gemma 4는 일관된 성능을 보임.
- 한계점 지적 — 단일 판사 사용, 온도 설정의 고정, 샘플 수 부족 등 평가 방식에 대한 커뮤니티의 피드백이 이어짐.
방금 3방향 헤드 투 헤드 테스트를 마쳤어. 이 서브레딧이 방법론의 허점을 찾는 데 일가견이 있어서, 내 설정이 완벽하다고 우기는 대신 피드백을 받으려고 원본 결과를 공유해.
설정
- 30개 질문, 카테고리별 6개 (코드, 추론, 분석, 커뮤니케이션, 메타 정렬)
- 세 모델 모두 동일한 질문에 블라인드 테스트 — 시스템 프롬프트 차이 없음, 동일한 온도 설정
- Claude Opus 4.6이 각 응답을 0-10점 척도로 독립적으로 채점 (어떤 게 더 나은지가 아니라, 응답별 절대 점수)
- 단일 판사, 이번에는 교차 평균화 안 함 — 위치 편향 위험이 있다는 건 알지만, Opus 4.6이 이전 배치에서 99.9% 파싱 성공률을 보여서 다중 판사 노이즈보다 일관성을 우선시했음
- 총 비용: $4.50
승리 횟수 (각 질문에서 최고 점수)
|모델|승리|승률|
|:-|:-|:-|
|Qwen 3.5 27B|14|46.7%|
|Gemma 4 31B|12|40.0%|
|Gemma 4 26B-A4B|4|13.3%|
평균 점수
|모델|평균 점수|평가 수|
|:-|:-|:-|
|Gemma 4 31B|8.82|30|
|Gemma 4 26B-A4B|8.82|28|
|Qwen 3.5 27B|8.17|30|
묻기 전에 말하자면 — 맞아, Qwen이 매치업은 더 많이 이겼지만 평균은 더 낮아. 왜냐하면 0.0점을 세 번 받았거든 (CODE-001, REASON-004, ANALYSIS-017). 이건 정말 형편없는 답변이라기보다는 형식 오류나 거부처럼 보여. 이걸 제외하면 Qwen의 평균은 약 9.08로 세 모델 중 가장 높아. 그래서 진짜 이야기는 이거일지도 몰라: Qwen 3.5 27B는 뻗지 않을 때는 여기 있는 모델 중 최고지만, 10% 확률로 뻗어버려.
카테고리별 분석
|카테고리|1위|
|:-|:-|
|코드|동점 — Gemma 4 31B와 Qwen (각 3승)|
|추론|Qwen 압승 (6개 중 5개)|
|분석|Qwen 압승 (6개 중 4개)|
|커뮤니케이션|Gemma 4 31B 압승 (6개 중 5개)|
|메타 정렬|3자 동점 (2-2-2)|
기타 관찰 사항
- Gemma 4 26B-A4B (MoE 변형)는 2개 질문에서 완전히 오류가 났어. 작동할 때는 밀집형 31B와 거의 똑같은 점수(평균 8.82)를 기록했어. 구글이 신뢰성만 잡으면 흥미로운 효율성 이야기가 될 거야.
- Gemma 4 31B는 터무니없이 긴 응답 시간을 보였어 — 5분 넘게 걸리는 생성도 있었지. 내부적인 Chain-of-Thought가 무거운 것 같아. 점수가 더 높은 것과는 상관없었어.
- Qwen 3.5 27B는 평균적으로 3-5배 더 많은 토큰을 생성해. 장황함에 대한 세금은 실존하지만, 판사가 일관되게 감점하거나 가점을 주지는 않은 것 같아.
방법론적 주의사항 (이 서브레딧이 중요하게 생각하니까)
- 30개 질문은 작은 샘플이야. 통계적 유의성을 주장하는 게 아니라 그냥 신호를 공유하는 거야.
- 단일 판사 (Opus 4.6)는 그 모델이 가진 체계적 편향이 모든 점수에 나타난다는 뜻이야. 이전에 다중 판사 패널과 비교 검증했을 때 잘 추적했지만, 여전히 한 모델의 의견일 뿐이야.
- LLM-as-judge는 장황함 편향, 자기 선호 편향, 위치 편향 같은 알려진 문제가 있어. 편향을 줄이려고 절대 점수 방식을 쓰지만, 완전히 제거되지는 않아.
- 질문은 표준 벤치마크에서 가져온 게 아니라 내가 직접 만든 거야. 오염되지 않았다는 뜻이지만, 무엇이 중요한지에 대한 내 편향이 반영되어 있어.
