PrismML의 새로운 Ternary Qwen3.6 27B, 10GB 메모리에서 fp16에 가까운 성능 발휘!!!
PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
핵심 요약
PrismML이 공개한 27B 규모의 Ternary 모델 Bonsai가 10GB 메모리에서 구동되며 주목받고 있으나, 과장된 마케팅 용어 사용으로 비판받고 있습니다.
- Bonsai 27B 공개 — Qwen3.6 27B 기반의 Ternary 모델로 낮은 메모리 점유율을 자랑함
- 메모리 효율성 — 10GB 메모리에서 구동 가능하여 에이전트 및 일반 작업에 실용적임
- 마케팅 논란 — 'fp16 정밀도' 및 'AGI' 같은 과장된 용어 사용으로 커뮤니티의 반발을 삼
- 기술적 한계 — Q4 양자화 모델보다는 지능이 떨어지며 환각 현상 등이 보고됨
수정: "fp16 정밀도 근사치"라고 한 건 벤치마크나 결과물 측면에서의 성능을 말한 거였음. 당연히 1, 0, -1이 fp16일 순 없지. 단어 선택이 좀 구렸네. :)
수정 2: 더 많은 사람들이 테스트해보고 후기 남겨준 거랑, 내가 문서/검색 작업에서 직접 돌려본 결과 종합해보면, 이건 Q2보다는 확실히 낫지만 Q4_K_XL보다는 분명히 떨어짐. 환각도 좀 더 심하고 툴 호출 루프 같은 것도 생김(Pi 하네스 사용 시). 진짜 핵심은 이 정도 퀄리티에 메모리 점유율이 낮다는 건데, 이건 여전히 괜찮음. 제목이 좀 오버했네, 신나서 그만 ㅋㅋ. 이 정정 내용 포함해서 글은 그대로 둘게.
다들 안녕,
AnythingLLM의 팀이야. 오늘 PrismML에서 Bonsai 27B를 내놨어. Bonsai 8B랑 이미지 모델에 적용했던 BitNet/Ternary 모델 개념을 그대로 가져와서, 폰에서도 엄청난 정확도랑 성능으로 돌아가는 걸 Qwen3.6 27B에 적용한 건데, 이건 진짜 똑똑한 모델임.
드디어 8B를 넘어서는, 이 새로운 방법론을 제대로 활용하는 모델이 나온 거지!
아직 벤치마크 말고 내 개인적인 워크플로우나 실사용 케이스에서 거친 부분들 찾아보는 중인데, 위에 영상 보면 OpenComputer에서 잘 돌아가는 거 보이지? 컴퓨터 사용(computer-use) 그 자체야. 지금까지는 확실히 적은 메모리로 잘 돌아가긴 하는데, Q4나 Q8 수준의 지능을 이기는 건 아님.
Qwen3.6 27B는 원래 괴물인데, 이걸 Ternary GGUF랑 걔네 llama.cpp 포크 써서 돌리니까 메모리를 10GB 정도밖에 안 먹더라(@ M4 Pro 48GB에서 32K 컨텍스트 기준). 이 모델은 Qwen3.6 27B를 2bit 양자화한 거랑 비교하면 100% 훨씬, 더 똑똑함. 어차피 그게 핵심이니까. 뭔가 특별한 게 일어나고 있는 건 확실해. 뭔지는 잘 모르겠지만.

