UkisAI Swift-Qwen3.8-27B / 사고 토큰 58.3% 감소, xhigh 정확도 유지하며 속도 1.95배 향상
UkisAI Swift-Qwen3.8-27B / -58.3% thinking, x1.95 speed while keeping the accuracy of xhigh
핵심 요약
Qwen 3.8 27B 모델의 불필요한 사고 과정을 최적화하여 정확도 손실 없이 추론 속도를 대폭 개선한 모델을 공개함.
- 모델 최적화 — 불필요한 사고 토큰을 제거하여 정확도 유지 및 속도 1.95배 향상함.
- 연구용 API — GPU 자원이 부족한 사용자를 위해 OpenAI 호환 무료 API 제공함.
- 오픈 소스 — GGUF 및 다양한 양자화 버전이 허깅페이스에 공개됨.
- 학습 방식 — 강제적인 길이 제한이 아닌 사고 과정 자체를 효율화하는 방식 채택함.

다들 안녕. 우리 Qwen 3.8 27B를 좀 더 효율적으로 쓰려고 사후 학습(post-training)을 좀 돌려봤어. 어떤 토큰들이 '과도한 생각(overthinking)'이랑 연결되는지 찾아내서, 추론 길이를 직접 건드리는 대신 해당 토큰들에 페널티를 먹이는 방식을 썼거든. 그러고 나서 비장의 무기(힌트: On-Policy Distillation)로 정확도까지 딱 잡았더니 결과가 아주 기가 막혀. (생각 토큰 -58% 감소, 속도 1.95배 향상, 정확도 손실 1% 미만) 그래서 오픈소스로 풀고 다들 어떻게 생각하는지 피드백 좀 받아보려고.
모델 링크는 여기: https://huggingface.co/ukisai/Swift-Qwen3.8-27b
Nvidia에서 GPU를 지원해 준 덕분에 연구용 무료 API(OpenAI 호환)도 제공하고 있어. 컴퓨팅 자원 부족해서 모델 못 돌리는 사람들은 이거 써봐. 분당 5회 요청(5RPM) 제한 걸려있어. https://ukisai.com/api/swift/v1/models
GGUF (Q1-Q8) 버전도 만들어놨고, 커뮤니티 능력자(Bartowski)가 만든 정밀도 조절 버전들도 몇 개 있어. Huggingface 가보면 커뮤니티에서 만든 끝내주는 NVFP4, W4A16, 그리고 Uncensored 버전들도 있으니까 확인해 봐.
중요: 우리 학습 방식은 기존의 추론 노력 설정(reasoning effort settings), 채팅 템플릿, 토큰 제한을 대체하는 게 아니라 상호 보완적인 거야. PTQ에서 흔히 보이던 '과도한 생각'이나 '불안 증세 같은' 추론 루프 문제를 해결하는 게 목적이지. 우리가 확인한 바로는 이 급의 LLM에서는 BF16에서도 이런 현상이 꽤 심하더라고. 다들 오해하는 거랑 다르게, 이런 특정 패턴들은 제대로 타겟팅만 하면 답변 품질에 아무런 도움도 안 돼. (우리 가설은 이거야: 추론 길이는 엄청 중요하니까 억지로 줄이면 안 되고, 최적화를 해야 한다.) 아래에 있는 xhigh vs medium effort 벤치마크 표를 보면 알겠지만, 불필요한 생각만 쳐내면서 xhigh의 정확도는 그대로 유지하는 게 우리 목표야.
우리가 어떤 과정을 거쳐서 연구하고 학습시켰는지, 벤치마크 결과는 어떤지 요약해 줄게.

