vLLM, Qwen 3.5+용 TurboQuant 수정 사항 병합 완료
vLLM Just Merged TurboQuant Fix for Qwen 3.5+
핵심 요약
vLLM에서 Qwen 3.5/3.6 모델 사용 시 발생하던 TurboQuant 관련 'Not Implemented' 오류가 수정되었습니다.
- TurboQuant 수정 — vLLM에서 Qwen 3.5/3.6 모델 사용 시 발생하던 KV 캐시 관련 오류가 해결됨.
- 사용법 공유 — --kv-cache-dtype 옵션을 통해 다양한 양자화 모드를 지원함.
- 성능 최적화 — --max-num-batched-tokens 설정을 통해 청크 프리필 오류를 방지할 수 있음.
- 하드웨어 테스트 — 5090 및 3090 환경에서 다양한 INT4/INT8 모델을 테스트하여 호환성을 확인함.
이전에는 Mamba 레이어 때문에 'Not Implemented' 오류가 발생했었음. 지금 테스트하러 감!
https://github.com/vllm-project/vllm/pull/39931
수정: Qwen 3.6, 27B 모델로 테스트 완료.
다음 인자를 사용할 수 있음;
--kv-cache-dtype turboquant_4bit_nc
사용 가능한 다른 옵션들;
- turboquant_k8v4
- turboquant_4bit_nc
- turboquant_k3v4_nc
- turboquant_3bit_nc
--enable-chunked-prefill로 실행할 때 mamba 정렬 관련 오류가 발생하면, 오류 메시지에 나오는 값보다 더 많은 배치 토큰을 설정하면 됨. 난 4096으로 설정해서 해결함. --max-num-batched-tokens 4096

