Bonsai 27B: 커스텀 WebGPU 커널을 사용해 브라우저에서 로컬로 실행되는 1비트 dense LLM
Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
핵심 요약
PrismML 팀이 1비트 양자화로 성능 손실을 최소화한 Bonsai 27B 모델을 공개하며 로컬 LLM의 새로운 가능성을 제시했습니다.
- 1비트 양자화 — 모델 크기를 54GB에서 3.8GB로 93% 압축하면서 지능은 90% 유지함
- WebGPU 기술 — 브라우저 환경에서 로컬로 LLM을 구동하는 커스텀 커널을 활용함
- 성능 테스트 — 8GB VRAM 환경에서 200k 컨텍스트까지 안정적인 속도를 보여줌
- 향후 기대감 — 1비트 양자화 기술이 더 큰 파라미터 모델이나 MoE 구조로 확장되길 기대함
Very impressive release by the PrismML team. 1-bit quantization shrinks it from 54GB to just 3.8GB (-93%), while retaining 90% of its intelligence.
- Collection on Hugging Face: https://huggingface.co/collections/prism-ml/bonsai-27b
- Demo link: https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels


