Qwen3.8-27B 파인튜닝 모델 비교 및 프론티어 모델과의 벤치마크
Comparing Qwen3.8-27B fine-tunes and baselining vs. frontier
핵심 요약
Qwen3.8-27B 파인튜닝 모델들을 도메인별로 평가하고, 프론티어 모델과 성능 및 효율성을 비교 분석함.
- 성능 평가 — 469개의 도메인별 질문을 통해 모델별 정확도와 토큰 효율성을 측정함.
- 모델 비교 — Signal-3.8-27B-Terse-Coder가 로컬 모델 중 우수한 정확도와 속도를 기록함.
- 프론티어 모델 — Opus 5.5가 99.6%의 정확도로 가장 높은 성능을 보임.
- 평가 도구 — 사용자가 직접 모델을 테스트할 수 있는 tuieval 엔진을 공개함.
TL;DR:
-
내 사용 사례에서는 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M이 제일 괜찮았음. 도메인별 테스트 결과는 사람마다 다를 수 있으니 참고만 해라.
-
프론티어 모델이랑 비교하면 문제 푸는 속도가 진짜 처참함. 특히 나처럼 감자 PC 쓰는 놈들은 더 심함. 내가 지금 쓰는 모델이 전체 평가셋 돌릴 때 28배나 느리더라. 좋은 하드웨어 쓰는 형들은 시간 격차가 좀 덜할지도 모르겠네.
일주일 전쯤에 Qwen3.8-27B 파인튜닝 모델들 비교 테스트 결과를 올렸었는데, 그 뒤로 며칠 동안 469개 도메인 특화 평가셋으로 빡세게 돌려봤다.
전부 llama.cpp에 동일한 사고(thinking) 설정으로 돌렸고, Opus 5.5랑 Astra도 전체 평가셋 돌려보고 OpenRouter 통해서 Qwen3.8-Flash-Next도 일부 테스트해 봤음. 양자화 정보 공개하는 곳도 있고 아닌 곳도 있는데, OpenRouter에서 이거 의무화 좀 해줬으면 좋겠다.
이걸 PTA 지수라고 부르기로 했다. 모델, 평가 방식, 하드웨어에 따라 당연히 다르겠지만, 자기 발전 상황을 측정하는 지표로 쓰기엔 나쁘지 않을 듯.
-
Astra가 토큰 사용량은 제일 적었는데, 아무래도 추론 과정을 숨기는 것 같음.
-
100% 정확도 찍은 모델은 하나도 없었다. Opus 5.5가 99.6%로 제일 근접했음.
-
로컬 모델 중에서는 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M이 토큰도 적게 먹고 작업 완료 시간도 빠른데 정확도까지 높게 나왔다.
-
Q4_K_M 파인튜닝 모델이 다른 L이나 XL 모델보다 잘 나오는 건 꽤 의외네. 답변 잘린 것도 딱 한 번뿐이었고 다른 모델들보다 테스트 통과를 많이 함. 어디서 듣기로는 Signal-Terse-Coder가 AgentionAI의 Signal-3.8-27B랑 Shockem의 Terse-Coder LoRA를 합친 거라던데, 원리는 잘 모르겠지만 내부적으로 뭔가 마법을 부린 게 분명함.
-
OpenRouter 모델들의 TTFT(첫 토큰 생성 시간)는 너무 깊게 생각하지 마라. 캐싱 때문에 내가 어찌할 수 있는 부분이 아님.
중앙값 토큰이랑 더 자세한 정보는 아래에 있다. 각 모델이 답변을 너무 길게 뽑아서 잘린 횟수는 "Cut off" 열에 적어둠 (질문당 최대 16,384 토큰으로 설정함): Signal-Terse-Coder는 1번, Dirk는 4번, Unsloth도 4번 잘림.





