Swift1.5-Qwen3.8-Flash-Next는 기본 3.8-Flash 모델보다 압도적이다!
Swift1.5-Qwen3.8-Flash-Next is phenomenal vs. base 3.8-Flash!
핵심 요약
Swift Flash 모델은 기본 모델과 대등한 성능을 유지하면서도 토큰 사용량과 처리 시간을 40% 수준으로 대폭 줄여 효율성을 극대화했습니다.
- 성능 효율성 — 기본 모델 대비 토큰 사용량과 처리 시간을 40% 수준으로 절감함
- 추론 최적화 — 불필요한 과도한 사고 과정을 줄여 실질적인 작업 속도를 개선함
- 벤치마크 결과 — Aider 코딩 벤치마크에서 기본 모델과 통계적으로 대등한 품질을 입증함
- 라이선스 논란 — Apache/MIT 라이선스가 아닌 점에 대해 커뮤니티 내 자유도 우려가 존재함
TL;DR - Swift Flash는 불필요한 추론 과정을 엄청나게 줄여주는 씹사기 모델임. 꼭 써봐라!
내 이전 비교 게시물을 본 사람들은 알겠지만, 난 Swift Qwen3.8 모델의 광팬이다. 27B 나오자마자 계속 쓰고 있는데, 성능이랑 퀄리티 진짜 미쳤음(v1.5는 더 좋더라). 쓸데없는 고민을 줄여준 게 진짜 신의 한 수고, 실사용이나 벤치마크상으로도 퀄리티는 거의 똑같음. 시간 절약되는 게 장난 아니다.
UkisAI가 Swift Flash 모델 낸다고 했을 때 진짜 개흥분했음. 이게 내 데일리 모델인데, 로컬에서 써본 것 중 최고거든. 근데 어려운 문제 풀 때는 3.8-27B보다도 더 고민을 많이 하는 경향이 있었음. 그래서 Unsloth의 Q5_K_XL 베이스(이것도 Q8_0 engrams)랑 비교하려고 Q5_K_L(Q8_0 engrams 포함)을 다운받았다. SSD engrams랑 262k 컨텍스트 써서 128GB 램에 안정적으로 들어가는 최고 퀄리티 세팅이고, 이 정도면 공정한 비교라고 본다.
늘 하던 대로 모든 모델에 돌리는 Aider 에이전트 코딩 벤치마크를 똑같이 돌려봤다. 첫 시도 성공률, 재시도 성공률, 중앙값 토큰 사용량, 실제 소요 시간, 해결당 토큰 수, diff 형식 준수율 같은 알짜배기 데이터들을 뽑았음. 차트는 여기 있다:
| model | First-try pass | Retry pass | tokens/case | sec/case | tok/solve | well-formed diff |
|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next (xhigh) | 40.2% | 90.7% | 17646 | 1542 | 24.8K | 98.1% |
| Swift-1.5-Qwen3.8-Flash-Next (xhigh) | 41.1% | 86.9% | 6991 | 608 | 10.5K | 100.0% |
보면 알겠지만 Swift는 베이스 모델이랑 거의 똑같은 성능을 보여줌. 벤치마크 결과에 섞인 노이즈를 감안하면 이 정도 데이터셋에서 통계적으로 유의미한 차이는 안 난다. 현실적으로 ~5% 차이면 유의미하다고 보는데, 여기선 4%도 안 됨. 첫 시도 성공률을 보면 Swift가 쉬운 건 베이스랑 똑같이 잘 풀고, 두 번째 시도가 필요한 제일 어려운 문제에서만 살짝 밀림. 재시도가 필요한 케이스에서 베이스는 84%를 복구하는데, Swift는 78% 정도임.
토큰 사용량이나 소요 시간은 비교 자체가 안 된다. Swift는 UkisAI가 광고한 대로 정확히 작동함. 중앙값 기준 토큰을 40%만 쓰고, 시간도 40%밖에 안 걸리는데 퀄리티는 거의 그대로임. 진짜 미친 수준이고, 얘네 RL/OPD 작업이 얼마나 대단한지 보여주는 증거지.
특히 중요한 인사이트 하나: 베이스 모델은 가끔 혼자 뇌절하면서 똑같은 추론을 몇 번씩 반복하는데, Swift는 그런 짓을 거의 안 함. 베이스 모델이 토큰을 제일 많이 잡아먹은 20개 케이스를 보면, Swift는 토큰을 29%만 쓰고도 20개 중 16개를 해결함(베이스는 17/20). 베이스가 제일 끙끙대던 어려운 문제에서도 퀄리티를 거의 다 유지한다는 소리임. Swift가 제일 많이 쓴 토큰이 44k인데, 베이스는 203k까지 썼음.


