ThinkingCap 3.8-27B vs. Swift 3.8-27B vs. Qwen 3.8-27B 벤치마크 비교
ThinkingCap 3.8-27B vs. Swift 3.8-27B vs. Qwen 3.8-27B Benchmarks
핵심 요약
ThinkingCap과 Swift 모델의 추론 토큰 절감 성능과 언어별 벤치마크 결과를 비교 분석함.
- 추론 토큰 절감 — 두 모델 모두 원본 대비 약 40%의 추론 토큰을 절감함.
- 언어별 성능 차이 — ThinkingCap은 JS/Python에, Swift는 C++에 강점을 보임.
- 벤치마크 결과 — ThinkingCap은 완벽한 diff 생성률을, Swift는 높은 첫 시도 통과율을 기록함.
- 모델 생태계 — 새로운 파생 모델들이 빠르게 등장하며 활발한 비교 연구가 진행됨.
ThinkingCap-Qwen3.8-27B가 나오길래, 원본 Qwen3.8-27B랑 이번에 새로 나온 ThinkingCap, 그리고 Swift-Qwen3.8-27B를 비교해 보면 재밌겠다 싶었음. 이미 리뷰했던 Swift나 이번 ThinkingCap이나 하는 짓은 똑같음. 3.8-27B 특유의 그 쓸데없이 긴 추론 루프를 줄여버리는 거거든. 사실 주장하는 내용도 거의 판박이임. 둘 다 성능 저하는 거의 없으면서 추론 토큰을 40% 정도 줄였다고 광고하더라고. 그래서 진짜 그런지 직접 테스트해 봄.
내가 평소에 쓰는 Aider 평가 스위트를 돌려봤는데, 이게 지금까지 20개 정도 모델 테스트해 본 결과 모델별로 변별력이 꽤 괜찮음. 참고로 여기서 90% 넘긴 모델은 Qwen3.8-Flash 딱 하나뿐임. 이 평가로 pass1/2, completion tokens, seconds/case, tokens/solve, 그리고 모델이 뱉은 diff가 얼마나 깔끔한지 같은 유용한 지표들을 잴 수 있음. 모델당 2번씩 돌린 결과고, 오차 범위는 최대 +/- 2~3% 수준임. 모델 3개 다 llama.cpp 0.5.0에서 Q8_0으로 돌렸음:
| model | First-try pass | Retry pass | well-formed diff | median tokens | sec/case | tok/solve |
|---|---|---|---|---|---|---|
| ThinkingCap-Qwen3.8-27B (xhigh) | 27.1% | 77.6% | 100.0% | 7436 | 777 | 12.8K |
| Qwen3.8-27B (xhigh) | 27.1% | 77.6% | 99.1% | 12547 | 1481 | 19.3K |
| Swift-Qwen3.8-27B (xhigh) | 30.8% | 75.7% | 98.1% | 7301 | 750 | 12.1K |
놀랍게도 ThinkingCap이랑 순정 27B 점수가 똑같이 나옴. 같은 모델을 두 번 돌려도 점수가 똑같이 나온 적은 한 번도 없었는데, 이건 그냥 완전 우연인 듯. 어쨌든 BottlecapAI가 주장한 대로 성능 저하가 거의 없다는 건 확실히 증명된 셈임. Swift는 다른 두 모델이랑 비교해도 오차 범위 내인 2% 정도 낮은 점수지만, 첫 시도 성공률(first-try pass rate)은 오히려 더 높음.
클로드 문구 좀 빌리자면, 진짜 핵심은 completion tokens임. 원본 모델이랑 비교했을 때 튜닝된 두 모델 모두 중간값이 거의 5k 토큰이나 줄었음. 모델 카드에서 주장하던 40% 감소랑 거의 정확하게 일치함. ThinkingCap이 해결당 토큰을 아주 조금 더 써서 Swift보다 시간이 살짝 더 걸리긴 하는데, 뭐 이것도 몇 퍼센트 차이라 도긴개긴임. 차트에는 안 나온 거 하나 짚고 넘어가자면, 중간값은 동점인데 평균 completion tokens로 보면 ThinkingCap이 8.5% 더 씀. 왜냐면 꼬리가 길거든. 즉, 여전히 과하게 생각하는 케이스가 좀 더 있다는 소리임. 반면에 Swift는 추론 토큰 사용량을 좀 더 균일하게 줄여줌. 또 다른 차이점은 둘 다 성공한 케이스보다 실패한 케이스에 토큰을 더 많이 쓴다는 건데, 이게 Swift(실패 시 13.2k vs 성공 시 5.9k)가 ThinkingCap(중간값 9.4k vs 중간값 6.8k)보다 훨씬 두드러짐. ThinkingCap은 좀 더 쉽게 포기하는 건가? 아니면 그냥 질 때를 아는 건가 싶기도 하고.


