Bonsai 27B 모델, 아이폰에서 구동 성공 - 27B 모델을 3.9GB로 압축
Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
핵심 요약
PrismML이 Qwen2.6-27B를 1비트로 양자화하여 아이폰에서 구동 가능한 3.9GB 크기로 압축했습니다.
- 1비트 양자화 — 27B 모델을 3.9GB로 압축하여 모바일 기기에서 구동함
- 성능 유지 — 벤치마크 점수의 약 90%를 유지하며 수학적 추론 능력은 높게 유지됨
- 기술적 특징 — 임베딩과 LM 헤드까지 포함한 완전한 바이너리 양자화 적용
- 실제 구동 — 아이폰 15 프로 맥스에서 Atomic Chat 앱을 통해 실행 가능
PrismML은 Qwen2.6-27B를 기반으로 가중치를 1비트로 양자화하여 Bonsai를 구축했습니다. 이를 통해 모델 크기를 약 54GB에서 3.9GB로 줄여 폰에서 실행 가능하게 만들었으며, 벤치마크 점수의 약 90%를 유지했습니다.
이것은 진정한 바이너리 양자화("binary g128")입니다. 모든 가중치는 단일 부호 비트이며, 128개 그룹마다 하나의 FP16 스케일을 공유하므로 고정밀 탈출구 없이 가중치당 약 1.125비트가 됩니다. 놀라운 점은 임베딩, 어텐션/MLP 프로젝션, LM 헤드까지 모두 바이너리라는 것입니다. 대부분의 1비트 방식은 일부 레이어를 더 높은 정밀도로 유지하곤 합니다.
15개의 벤치마크에서 FP16 모델이 85.1점을 기록한 반면, 이 모델은 평균 76.1점(약 89.5%)을 기록했습니다. 수학 능력은 가장 잘 유지(91.7)되었으나, 지식과 추론 능력은 가장 큰 타격(83.2 대비 73.4)을 입었는데, 이는 세부적인 디테일이 생략되는 부분에서 정확히 나타나는 현상입니다. 메모리 사용량도 준수하여 4K 컨텍스트에서 약 5.2GB, 4비트 KV 캐시를 사용한 100K 컨텍스트에서 약 6.8GB를 유지합니다.
모델에 대한 모든 공은 PrismML에 돌립니다: https://huggingface.co/prism-ml/Bonsai-27B-mlx-1bit
아이폰 15 프로 맥스(8GB RAM)에서 Atomic Chat을 통해 실행 중입니다(저는 Atomic 팀 소속이며, 질문 환영합니다).

