커스텀 WebGPU 커널을 사용해 브라우저에서 1,400 tok/s로 구동되는 LFM2.5 230M
LFM2.5 230M running in-browser at 1,400 tok/s using custom WebGPU kernels
핵심 요약
WebGPU 커널을 활용해 브라우저에서 초고속으로 구동되는 230M 소형 모델의 성능과 활용 가능성에 대한 논의입니다.
- WebGPU 최적화 — 커스텀 커널을 통해 브라우저 환경에서 1,400 tok/s의 놀라운 속도 구현함
- 모델 성능 평가 — 230M 크기임에도 수학 및 이메일 작성 등 특정 작업에서 준수한 성능을 보임
- SLM 활용성 — RAG를 대체할 잠재력이 있으며 분류 및 라우팅 작업에 최적화됨
- 기술적 한계 — 컨텍스트가 찰수록 처리 속도가 저하될 가능성이 제기됨
모든 것은 Fable 5(서비스 종료 전)와 Opus 4.8이 작성한 커스텀 WebGPU 커널을 사용하여 브라우저에서 로컬로 실행됩니다. 영상은 제 M4 Max에서 녹화되었습니다.
모델: LiquidAI/LFM2.5-230M (GGUF)
데모: https://huggingface.co/spaces/webml-community/lfm2-webgpu-kernels


