Qwen3.8-27B는 가정용 하드웨어에서 돌릴 수 있는 최고의 코딩 성능을 가졌지만, 기본값인 xhigh 설정은 비용이 너무 큼
Qwen3.8-27B has the best coding ceiling you can run at home on consumer hardware, it ships with reasoning_effort defaulting to xhigh - I measured what that costs
핵심 요약
Qwen3.8-27B의 추론 설정(xhigh)이 성능 대비 토큰과 시간을 과도하게 소모한다는 분석 결과입니다.
- 추론 설정 분석 — xhigh는 low/medium 대비 8배의 토큰과 11배의 시간을 소모함
- 성능 차이 미미 — xhigh 설정이 코드 품질 향상보다는 시각적 요소에만 치중함
- 설정 효율성 문제 — low와 medium 설정이 사실상 동일하게 작동함
- 가정용 코딩 도구 — 소비자용 하드웨어에서 에이전트 기반 코딩이 가능함을 입증함
llm-bench.io
원문 사이트로 이동
채팅 템플릿에 이런 줄이 있더라:
{%- set resolved_reasoning_effort = reasoning_effort|default('xhigh') %}
xhigh는 세 가지 설정(low / medium / xhigh) 중에서 가장 비싼 놈임. 따로 설정을 안 건드리면 기본값이 이걸로 잡혀서 모든 답변이 이 모드로 돌아감. 이건 서버 옵션이 아니라 채팅 템플릿 변수라서 백엔드 어디에서도 따로 알려주지 않음.
M5 Max 하나 잡고 같은 양자화(oQ4e-mtp), 같은 프롬프트로 세 단계 다 돌려봤음. 코딩 시나리오는 브라우저용 벽돌 깨기 게임을 만들어달라는 거였음:
| Effort | Runs | Tokens | Time | Median | Range |
|---|---|---|---|---|---|
| low | 3 | 4,984 | 84s | 75.8 | 64.9–75.9 |
| medium | 4 | 4,792 | 77s | 78.2 | 64.7–84.2 |
| xhigh (default) | 17 | 36,188 | 869s | 78.8 | 54.1–89.2 |
돌려보고 두 가지가 좀 놀라웠음:
low랑 medium이랑 똑같은 설정임
토큰은 4,984개 vs 4,792개로 나옴. 템플릿을 보면 low랑 xhigh에만 지시사항이 붙는데, xhigh는 "신중하게 생각하고 가정을 검증해라"고 하고, low는 "생각을 짧게 유지해라"고 함. 근데 모델은 첫 번째 지시만 따르고 두 번째는 그냥 씹어버림. 그러니까 사실상 다이얼은 세 개가 아니라 두 개짜리인 셈임.
xhigh는 토큰은 8배, 시간은 11배나 처먹는데 점수는 중앙값 기준 0.5점 차이밖에 안 남
이 정도면 그냥 실행할 때마다 나오는 오차 범위 안임. 똑같은 설정으로 medium을 네 번 돌려봤는데 점수가 64.7 / 73.4 / 83.0 / 84.2 이렇게 널뛰기를 하거든.
xhigh가 유일하게 바꾼 건 편차임. 최고점(89.2)도 뽑아내고 최저점도 뽑아냄. 게임 결과물을 직접 보니까 xhigh는 예산(토큰)을 죄다 겉치레에 쏟아부었더라. 타이틀 화면, 키보드 조작법, 사운드 토글, 최고 점수 표시 같은 거 말이야. low랑 medium은 그냥 게임만 만들고 끝냈음. 벽돌 8x4 배열에 목숨 3개, 규칙도 똑같음. 더 나은 벽돌 깨기를 만든 게 아니라, 그냥 더 예쁜 걸 만든 거임.
미리 말해두는데, 짧은 설정으로 3~4번 돌린 거라 표본이 적고, 기기 하나에 양자화 하나만 쓴 거라 점수는 LLM이 평가한 거임. 비용 수치는 확실하지만, 품질 수치는 결과라기보다 테스트해 볼 만한 방향 정도로만 참고하셈.
스크린샷 나란히 비교해둔 전체 글이랑, 사고 예산 실험(12k로 제한 걸면 시간은 절반으로 줄고 잘리는 건 없음)은 여기 있음: https://llm-bench.io/guides/qwen3-8-27b-reasoning-effort
참고로 내 사이트임. 데이터는 커뮤니티 벤치마크 실행 결과에서 가져왔고, 직접 제출도 가능함 @ llmbench.io


