Qwen 3.6 35B A3B Q4_K_M 양자화 평가 결과
Qwen 3.6 35B A3B Q4_K_M quant evaluation
핵심 요약
Qwen 3.6 35B A3B 모델을 CPU 환경에서 Q4_K_M으로 양자화하여 벤치마크 성능을 테스트함.
- 모델 사양 — 35B 총 파라미터, 3B 활성 파라미터의 MoE 아키텍처임.
- 평가 환경 — GPU 없이 32 vCPU와 125GB RAM 환경에서 테스트함.
- 벤치마크 결과 — HumanEval 47.56%, HellaSwag 74.30%, BFCL 46.00%를 기록함.
- 성능 평가 — CPU에서 초당 22 토큰 속도로 구동되며 상식 추론에서 준수한 성능을 보임.
모델 정보:
35B 총 파라미터, 3B 활성 파라미터(A3B)의 전문가 혼합(MoE) 아키텍처.
평가 방식:
Unsloth에서 Q4_K_M 양자화 GGUF를 가져왔습니다. llama-cpp-python을 통해 CPU에서 실행했으며 세 가지 표준 벤치마크로 테스트했습니다:
- HumanEval (코드 생성),
- HellaSwag (상식 추론),
- BFCL (함수 호출).
총 1,264개 샘플.
평가 결과:
- HumanEval: 47.56% (78/164)
- HellaSwag: 74.30% (743/1000)
- BFCL: 46.00% (46/100)
하드웨어:
32 vCPU, 125GB RAM. GPU 없음.
이 결과의 의미는?
Q4_K_M 양자화 버전은 CPU에서 초당 22 토큰으로 실행되어 준수한 속도를 제공하며, 상식 추론에서 74%로 가장 좋은 성능을 보입니다. 코드 생성과 함수 호출은 이 버전에 더 어려운 작업으로, 40% 중반대의 성능을 기록했습니다.
전반적으로 CPU에서 양자화되어 실행되는 활성 3B MoE 모델로서는 견고한 결과입니다.
이 전체 평가는 Neo AI Engineer를 사용하여 수행되었습니다. 사용 가능한 CPU 시스템에서 실행할 수 있는 다양한 양자화 버전을 조사하고, 올바른 채팅 템플릿을 사용하여 3개 벤치마크에 대한 통합 평가 하네스를 구축한 뒤 철저한 검토를 거쳐 최종 결과를 보고했습니다.
