Qwen3.8-27B 추론 토큰 40% 절감 -- 3.8 'ThinkingCap' 벤치마크 결과!
Cut Qwen3.8-27B Reasoning Tokens by 40% -- 3.8 'ThinkingCap' benchmarked!
핵심 요약
Qwen3.8-27B의 과도한 추론 토큰 사용을 40% 줄인 'Swift-Qwen3.8-27B' 모델이 벤치마크를 통해 성능을 입증했습니다.
- 추론 토큰 절감 — 과도한 사고 과정을 줄여 토큰 사용량을 30~50% 감소시킴
- 성능 유지 — 기존 모델과 동등한 수준의 벤치마크 점수를 기록함
- 속도 향상 — 동일 작업 수행 시 처리 시간을 절반으로 단축함
- 독립적 검증 — Aider 벤치마크를 통해 모델의 효율성과 품질을 확인함
huggingface.co
원문 사이트로 이동
수정: 제목이 좀 헷갈리게 적혀 있어서 미안하다. 이 모델은 BottleCap AI의 3.6-ThinkingCap 새 버전이 아니라, UkisAI의 Swift-Qwen3.8-27B다. 훌륭한 파인튜닝 모델을 만들어준 UkisAI에게 모든 공을 돌리며, 그들의 노고를 기리기 위해 이 글을 썼다. 제목에 다른 모델을 언급해서 오해를 살 생각은 전혀 없었다.
나처럼 Qwen 모델 좋아하는 사람이 한둘은 아니겠지만, 쓸데없이 생각만 길게 하는 '오버싱킹(overthinking)' 때문에 시간 잡아먹는 게 진짜 골치 아프다. 3.6-27B 때도 심했는데 3.8은 더 심해졌더라. "그게 모델 크기 대비 성능을 뽑아내는 비결 아니냐"라고 하는 사람들도 있겠지만, 이제 그게 아니라는 확실한 증거가 나왔다. 바로 UkisAI의 Swift-Qwen3.8-27B다!
이 모델은 내가 3.8 시리즈로 넘어가기 전까지 데일리로 쓰던 Qwen3.6-27B ThinkingCap에서 영감을 받은 것 같다. 혹시 모르는 사람들을 위해 설명하자면, ThinkingCap은 27B 모델을 파인튜닝해서 원래 모델이랑 비슷한 성능과 벤치마크 점수를 뽑아내면서도 토큰은 40%나 덜 쓰는 미친 모델이다. 진짜 제대로 작동하는 몇 안 되는 파인튜닝 모델이지. 몇 달 동안 매일 썼는데 문제 하나 없었고, 덕분에 시간 엄청나게 아꼈다.
3.8도 성능은 좋은데 너무 느려 터져서, 누군가 비슷한 버전으로 만들어주길 간절히 바라고 있었는데 감감무소식이더라. 그런데 UkisAI도 그 모델을 좋게 봤는지 직접 후속작을 내놨다. 얘네가 "Qwen의 추론 과정에서 오버싱킹을 유발하는 추론 마커 토큰"을 찾아내서 RL로 페널티를 먹였더니, 오버싱킹 오류가 확 줄어들었다. 게다가 "BottleCap AI의 ThinkingCap-Qwen3.6-27B에서 파생된 전이 컴포넌트"까지 적용했단다. 결과적으로 여러 벤치마크에서 같은 퀄리티를 뽑아내면서도 추론 토큰을 평균 30~50%나 줄였다(자세한 건 모델 카드 확인해봐라).
이게 진짜 대단한 주장이라 내가 직접 검증해봤다. 내 사용 사례들이랑 Aider를 평가 도구로 써서 코딩 벤치마크까지 돌려봤는데(둘 다 Q8_0 기준):
| Metric | Swift-Qwen3.8-27B | Qwen3.8-27B |
|---|---|---|
| Pass1 (%) | 30.8 | 27.1 |
| Pass2 (%) | 75.7 | 77.6 |
| Well-formed diff (%) | 98.1 | 99.1 |
| Completion tokens | 7,301 | 12,547 |
| Seconds/case | 750 | 1,481 |
| Total tokens/solve | 12.1k | 19.3k |
보면 알겠지만, 얘네 말이 맞다. Swift는 절반 정도의 시간 만에 비슷한 성공률을 보여줬고, 토큰은 63%밖에 안 썼다! 3.8-27B 쓰는 사람들한테는 진짜 엄청난 희소식이다. 응답이 길어질수록 디코딩 속도가 점점 떨어지니까, 토큰은 3분의 2 정도인데 시간은 절반으로 줄어든 거다.
