Qwen3.8 Flash Next - 템플릿 비교
Qwen3.8 Flash Next - Templates Comparison
핵심 요약
Qwen3.8 Flash Next에서 Stock, Fixed, Sharp 템플릿의 성능과 효율성을 SWE-bench로 비교 분석한 결과입니다.
- 성능 비교 — Stock 템플릿이 xhigh 설정에서 가장 높은 정확도를 보임
- 효율성 분석 — Sharp 템플릿은 medium 설정에서 속도와 성능의 균형이 가장 좋음
- 추론 노력 — xhigh 설정 시 모든 템플릿의 시간과 토큰 비용이 크게 증가함
- 결론 도출 — 고성능은 Stock, 효율적인 작업은 medium 설정의 Sharp가 적합함
Fixed template이랑 Sharp template이 기본 템플릿보다 훨씬 낫다는 글이 하도 많이 보여서 직접 테스트해 봤다.
논문 수준의 정밀한 분석까진 아니어도 각 템플릿이 어떤 느낌인지는 확실히 알 수 있을 거다.
테스트 환경
SWE-bench Verified를 사용했고, mini-SWE-agent 2.4.6으로 슬라이스 0:100 구간(모든 실행에 동일한 100개 작업 적용)을 돌렸다.
하드웨어
-
CPU: Ryzen 9 9900X
-
RAM: 128 GB DDR5-5600
-
GPU: RTX PRO 6000 WS
런타임
jpezzulli/sglang-rtxpro6000을 컨테이너화해서 CUDA 13.3 환경에서 RadixArk/Qwen3.8-Flash-Next-NVFP4로 Flash Next를 돌렸다.
-
전체 262K 컨텍스트
-
BF16 KV
-
51.2 GB FP8 n-gram 임베딩 테이블 (RAM에 고정)
-
32 GB HiCache (RAM에 고정)
모든 템플릿은 medium과 xhigh 추론 강도(reasoning effort)로 각각 테스트했다.
결과
| Metric | Stock (medium) | Stock (xhigh) | Stock Δ | Fixed (medium) | Fixed (xhigh) | Fixed Δ | Sharp (medium) | Sharp (xhigh) | Sharp Δ |
|---|---|---|---|---|---|---|---|---|---|
| Resolved | 91 | 99 | +8 |





