Bonsai 문서가 보여주는 헤드라인의 과장된 수치들
bonsai's document reveal how much cherry picked their headlines are
핵심 요약
Bonsai 27B 모델이 홍보하는 성능 수치가 실제 문서와 다르며, 실사용 측면에서도 성능이 매우 떨어진다는 비판이 제기되었습니다.
- 성능 과장 논란 — 모델이 홍보한 지능 유지율 98.2%가 실제 문서 수치와 괴리가 있음
- 실사용 성능 부족 — 지시 이행 능력이 떨어지고 코딩 작업에 부적합하다는 평가가 지배적임
- 홍보 방식 비판 — 투명하지 않은 마케팅 방식이 사용자들에게 불쾌감을 주고 있음
- 대안 모델 존재 — 이미 더 나은 성능을 보여주는 기존 모델들이 많아 굳이 사용할 이유가 없음
Bonsai 측은 지능의 98.2%를 유지했다고 주장하는데, 정작 자기들 문서 까보면 Ternary Bonsai 2 27B는 각각 52.8점, 60.8점을 기록해서 Qwen3.5-27B의 69.7점, 80.6점 대비 벤치마크 성능의 대략 4분의 3 정도만 유지하고 있음.
Qwen3.5라고 쓴 건 오타인 듯. 저 수치들은 Qwen3.8 기준이거든. Qwen3.5 수치는 대충 이럼:
-
bonsai_2/q3.5 52.8 / 41.6 = 126.9%
-
bonsai_2/q3.5 60.8 / 72.4 = 84.0%
긴 문맥 및 코딩 성능. 이번 릴리스는 초기 Bonsai 27B 릴리스 [2]에서 제시했던 로드맵을 이행한 결과임. 당시 우리는 긴 호흡의 도구 기반 소프트웨어 엔지니어링을 다음으로 개선해야 할 주요 역량으로 꼽았거든. Ternary Bonsai 2 27B를 통해 그 발전상이 에이전트 성능에서 직접적으로 드러나고 있음. Terminal-Bench 2.1과 SWE-bench Verified에서 처음으로 평가받은 Ternary Bonsai 2 27B는 각각 52.8점과 60.8점을 기록했는데, 이는 Qwen3.5-27B의 69.7점, 80.6점과 비교했을 때 두 벤치마크 모두에서 풀 정밀도 성능의 대략 4분의 3 정도를 유지하는 수준임.
그리고 3.8 35b Qwen은 언제 나옴? 제발 좀 알려줘.



