Bonsai 모델은 그냥 거품임: Bonsai-8B는 Gemma-4-E2B보다 훨씬 멍청함
Bonsai models are pure hype: Bonsai-8B is MUCH dumber than Gemma-4-E2B
핵심 요약
Bonsai-8B 모델의 성능이 Gemma-4-E2B보다 현저히 떨어지며, 양자화 과정에 대한 과장된 홍보가 실망스럽다는 내용.
- 성능 비교 — Bonsai-8B가 Gemma-4-E2B보다 훨씬 낮은 지능을 보임.
- 양자화 논란 — PrismML의 양자화 방식이 모델 성능을 저하시켰다는 의혹 제기.
- 개념 증명 — Bonsai 모델이 실제 프로덕션용보다는 기술적 개념 증명 수준에 머물러 있음.
- 평가 기준 — 모델 크기와 양자화 방식이 달라 직접 비교가 어렵다는 의견 존재.
나는 Bonsai용으로 https://github.com/PrismML-Eng/llama.cpp 포크를 사용하고 있고, Gemma용으로는 일반 llama.cpp를 사용 중임.
임베딩 파라미터를 제외하면:
Gemma 4는 2.3B, 4.8 bpw (Q4_K_M) = 1104 MB
Bonsai-8B는 6.95B, 1.125 bpw (Q1_0) = 782 MB (겨우 29% 더 작음)
Gemma 4를 더 낮은 양자화로 돌릴 수도 있었겠지만, 작은 모델을 Q4_K_M 이상으로 밀어붙이지 않는 게 일반적인 통념임.
나중에 그들의 3진법(ternary) 모델도 시도해 볼 생각이지만, 별로 기대는 안 됨...
[업데이트]
1.58비트/3진법 모델(https://huggingface.co/prism-ml/Ternary-Bonsai-8B-mlx-2bit)을 시도해 봤는데, 답변이 1비트 모델보다 더 엉망이었음. 6.95B 파라미터에 2.125 bpw로 1477 MB인데, Gemma보다 33% 더 큼!
최신 버전 oMLX에서 테스트함: https://i.imgur.com/NsNNwzj.png


