Qwen3.6 35B-A3B 및 27B 모델의 속도 향상을 위한 GBNF 문법 최적화
GBNF grammar tweak for faster Qwen3.6 35B-A3B and Qwen3.6 27B
핵심 요약
GBNF 문법을 조정하여 Qwen3.6 모델의 추론 속도를 획기적으로 개선하고 벤치마크 성능을 높인 사례입니다.
- GBNF 문법 최적화 — GBNF 문법을 수정하여 Qwen3.6 모델의 불필요한 토큰 생성을 줄이고 추론 속도를 대폭 향상함.
- 성능 개선 수치 — 35B-A3B 모델의 경우 퍼즐 해결 시간이 92% 단축되고 벤치마크 처리량이 19% 증가함.
- 추론 효율성 — 단순한 'Hi' 프롬프트부터 복잡한 논리 퍼즐까지 모델의 응답 속도와 정확도가 크게 개선됨.
- 실제 환경 테스트 — RTX 5090 환경에서 Rust/Next.js 벤치마크를 통해 실제 프로덕션 수준의 성능 향상을 검증함.
여러분 안녕하세요,
코딩 및 일반적인 용도로 최적화된 Qwen3.6 35B-A3B 및 Qwen3.6 27B 모델을 즐겨보세요. 퍼즐을 더 정확하게 해결할 수 있게 되었습니다.
처음에는 35B-A3B 추론 과정을 최적화하려 했습니다. 제 5090 환경에서 가장 효율적이라 프로덕션 환경에서 llama.cpp로 병렬 작업을 수행할 수 있기 때문입니다.
27B 모델의 일관성은 마음에 들지만, 긴 작업 시 발생하는 prefill churn은 고통스럽더군요.
GBNF를 수정하고 제 커스텀 Rust/Next.js 벤치마크에 기본 프롬프트를 테스트해 본 결과, 35B-A3B 모델에서 가장 큰 성능 향상을 확인했습니다.
단순한 "Hi" 프롬프트, 퍼즐, 그리고 제 커스텀 Rust/Next.js 벤치마크(60개 작업 세트)를 테스트했습니다.
아이러니하게도 35B-A3B 모델의 단순 작업 시 추론 지연에 대한 커뮤니티의 불만이 정당했기에 "Hi" 프롬프트를 사용했습니다.
테스트 사양
- RTX 5090
- Fedora 43
- llama.cpp mainline 4월 24일 버전
- Qwen3.6-35B-A3B-APEX-I-Balanced.gguf (-c 216k)
- Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-Q6_K_P.gguf (-c 114k)
- kv f16
- -b & -ub 256
- 추론+코딩을 위한 Qwen 샘플링
|모델|테스트|문법 적용 전|문법 적용 후|개선율|
|:-|:-|:-|:-|:-|
|Qwen3.6 27B|Hi 토큰|248|42|83.1% 감소, 5.90배 적음|
|Qwen3.6 27B|퍼즐 토큰|40,101|7,376|81.6% 감소, 5.44배 적음|
|Qwen3.6 27B|퍼즐 시간|13분 36초|2분 27초|82.0% 빠름, 5.55배 속도 향상|
|Qwen3.6 27B|벤치 점수|4620|4620|동일 점수|
|Qwen3.6 27B|벤치 시간|29분 54초|22분 20초|25.3% 빠름, 1.34배 속도 향상|
|Qwen3.6 27B|벤치 처리량|1067 t/s|1193 t/s|+11.8%, +126 t/s|
|Qwen3.6 35B-A3B|Hi 토큰|200|12|94.0% 감소, 16.67배 적음|
|Qwen3.6 35B-A3B|퍼즐 토큰|30,096|2,592|91.4% 감소, 11.61배 적음|
|Qwen3.6 35B-A3B|퍼즐 시간|2분 32초|12초|92.1% 빠름, 12.67배 속도 향상|
|Qwen3.6 35B-A3B|벤치 점수|4620|4740|+2.6%, +120점|
|Qwen3.6 35B-A3B|벤치 시간|33분 52초|11분 04초|67.3% 빠름, 3.06배 속도 향상|
|Qwen3.6 35B-A3B|벤치 처리량|1844 t/s|2195 t/s|+19.0%, +351 t/s|
Qwen3.6 35B-A3B는 X6에서 X1으로 올라서며 차트 리더가 되었고, 엄청난 시간 단축과 점수 상승을 보여주었습니다.


