Liquid AI의 600M 파라미터 모델 'omni-d1', WebGPU를 통해 브라우저에서 구동
omni-d1 600M by Liquid AI running in the browser using WebGPU
핵심 요약
Liquid AI의 600M 모델을 WebGPU 기반 라이브러리 'runntime'으로 브라우저에서 효율적으로 구동한 사례입니다.
- 기술적 특징 — WASM이나 복잡한 내보내기 과정 없이 순수 TypeScript와 TypeGPU로 구현됨
- 성능 지표 — 댓글 1개당 4가지 질문을 처리하는 데 약 180ms 소요
- 향후 계획 — 커널 디스패치 최적화 및 퓨전 기술을 통해 성능 개선 예정
- 활용 사례 — 실시간 댓글 모더레이션 및 향후 단순 컴퓨터 제어 작업 가능성 탐색

Liquid에서 방금 d1-omni-600M을 내놨는데, 이거 완전 의사결정 모델이네!
내가 지금 만들고 있는 WebGPU 추론 라이브러리인 runntime으로 포팅해 봤어. WASM 같은 거 하나도 안 쓰고, 복잡한 내보내기 과정도 거의 없이 TypeGPU 위에서 돌아가는 순수 TypeScript야. 모델은 우리 핵심 연산(matmul, attention, norms, 그리고 몇 가지 elementwise 비트)으로 직접 짰고, 가중치는 HF safetensors에서 바로 불러와.
영상에 있는 데모는 가짜 댓글 피드를 실시간으로 검열하는 거야. 댓글 하나당 질문 4개를 던져: 유해한가? 스팸인가? 뭘 물어보는 건가? 전체적인 어조는 어떤가? 유해하거나 스팸인 건 바로 삭제해 버리지.
댓글 하나당 질문 4개 처리하는 데 180ms 정도 걸리고, 질문 하나당 45ms 정도 나와. 이 모델에 맞춰서 엔진 좀 튜닝하면 성능은 훨씬 더 좋아질 듯.
뱀 게임(snake)도 시켜보려고 했는데, 결과는 뭐... 처참했어 ㅋㅋ.
d1 포트는 아직 npm 릴리즈에는 안 올라갔어. 나머지 runntime 기능들(객체 탐지, 세그멘테이션, 음성 인식, 임베딩 등)은 다 올라가 있고. 문서랑 라이브 데모는 여기 있어: https://docs.swmansion.com/runntime
포팅 관련 질문이나 WebGPU 전반에 대해 궁금한 거 있으면 뭐든 물어봐.


