Qwen3.8 27B IQ3_XXS (10.18GiB)와 Bonsai Ternary PQ2 (6.42GiB)를 테스트해 봄
I tested Qwen3.8 27B IQ3_XXS (10.18GiB) vs Bonsai Ternary PQ2 (6.42GiB)
핵심 요약
Qwen3.8 27B IQ3_XXS와 Bonsai Ternary PQ2 모델의 성능을 비교한 결과, Qwen 모델이 속도와 효율성 면에서 더 우수한 것으로 나타남.
- 성능 비교 — Qwen 모델이 Bonsai보다 3배 이상 빠르고 토큰 효율도 좋음.
- 하드웨어 제약 — 16GB VRAM 환경에서 컨텍스트 확보를 위해 저용량 양자화 모델을 사용함.
- 양자화 품질 — Q3 수준의 양자화도 최적화 방식에 따라 충분히 실사용 가능한 성능을 보여줌.
- 모델 평가 — Bonsai 모델은 속도가 느리고 토큰 소모가 많아 실사용 측면에서 아쉬움이 있음.
요즘 핫한 Qwen3.8 양자화 모델이랑 내 16GB VRAM에 겨우 들어가는 제일 큰 양자화 모델이랑 간단하게 비교 테스트 좀 해봤다. 결과가 꽤 흥미롭네.
당연히 용량 작은 게 결과물은 더 구리긴 한데, 생각보다 차이가 그렇게 크진 않음. 근데 문제는 Bonsai 모델이 토큰을 훨씬 더 많이 처먹어서 생성 속도가 개느리다는 거임.
눈으로 보기엔 IQ3_XXS 결과물이 더 나은 것 같은데, 직접 보고 판단해봐.
이 테스트가 뭐 과학적으로 엄밀한 건 아니고, 그냥 같은 하드웨어에서 UI 생성 작업 몇 개 돌려본 거임. 그리고 llama.cpp는 MTP 돌렸는데 Bonsai 모델은 MTP 지원을 안 하는 것 같아서 더 느린 것도 있음.
https://github.com/Danmoreng/qwen3-8-27b-iq3-xxs-vs-bonsai/blob/main/RESULTS.md#aggregate

