UkisAI Swift 시리즈 / 27B, Flash Next 및 Bonsai 2 + GSQ-RCO / 사고 토큰 63.4% 감소, 속도 1.95배 향상 및 고정밀도
UkisAI Swift Series / 27B, Flash Next and Bonsai 2 + GSQ-RCO / -63.4% thinking, x1.95 speed with xhigh accuracy
핵심 요약
UkisAI가 사고 토큰을 대폭 줄이고 속도와 정확도를 개선한 Swift 모델 시리즈와 새로운 양자화 버전을 공개했습니다.
- Swift 모델 시리즈 — 사고 토큰을 줄여 효율성을 극대화한 Qwen 기반 LLM 제품군임
- 성능 개선 — 사고 루프를 방지하여 토큰 사용량을 줄이고 에이전트 성능을 향상함
- 다양한 양자화 — GGUF, NVFP4, MLX 등 다양한 환경을 위한 양자화 버전을 제공함
- 향후 계획 — 커뮤니티 피드백을 반영하여 9B 모델 등 추가 변형 모델을 개발 중임

다들 안녕,
UkisAI의 Jovan이야! 오늘은 Qwen 기반의 효율적인 추론 LLM 제품군인 Swift를 소개하려고 해. 이 모델들은 병적인 과잉 사고 패턴과 관련된 토큰에 페널티를 주고 RL (GSPO)와 OPD를 통해 정확도를 복구하는 방식으로 학습됐어.
Swift Qwen 3.8 27B 모델이 13일 만에 350k+ 다운로드라는 엄청난 반응을 얻어서, 이번에 전체 모델 제품군과 다들 그렇게 찾던 27B 및 Flash-Next용 GSQ-RCO 양자화 버전을 전부 공개하기로 했어.
이번 릴리스 구성은 다음과 같아:
Swift1.5 27B: 이전 모델의 개선판이야. 토큰 사용량은 더 줄였고, 버그 수정에 에이전트 성능까지 챙겼어. 생각 토큰은 -58.5% 줄이면서 점수는 0.35% 더 높게 나왔고, Terminal Bench 2.1에서는 "과잉 사고 오류" 루프에 빠지지 않아서 베이스 모델보다 더 나은 성능을 보여줘.
Swift Flash Next: 생각 토큰은 63.4% 줄었고 속도는 1.8배 빨라졌어. xhigh 기준 베이스 모델 대비 -0.2% 점수야.
Swift Bonsai 2: 생각 토큰은 39.8% 줄었고 점수는 0.19% 더 높아 (아직 실험적인 단계라는 건 참고해 줘).
우리 벤치마크는 Base 모델과 Swift 모델을 대상으로 5번씩 돌렸고, 일반(GPQA, AIME26), 코딩(LiveCodeBench), 비전(ERQA), 에이전트(Terminal Bench 2.1) 등 다양한 도메인에서 5개 시드 평균을 낸 결과야.
한 가지 짚고 넘어갈 건, Swift1.5 27B의 Terminal Bench 2.1 점수가 처음 보면 낮아 보일 수 있다는 거야. 이건 버그가 아니라 Swift 모델이 과잉 사고 루프에 빠져서 작업을 망치는 대신 끝까지 물고 늘어지기 때문에 생기는 현상이야. 그래서 평균 토큰 사용량이 더 높게 잡히는 거지. 제대로 비교해보면 토큰 감소 폭은 여전히 -38.7% 범위 내에 있어.


