EmbeddingGemma 2 비전 타워를 활용한 브라우저 기반 WebGPU 이미지-텍스트 검색
Image-text retrieval with EmbeddingGemma 2's vision tower, running in the browser on WebGPU
핵심 요약
EmbeddingGemma 2를 브라우저 WebGPU 환경에서 구동하여 이미지-텍스트 검색을 구현한 사례입니다.
- EmbeddingGemma 2 — 이미지와 텍스트를 768차원 공간에 매핑하여 검색 가능하게 함
- ruNNtime 라이브러리 — TypeScript 기반의 WebGPU 추론 라이브러리로 브라우저에서 모델 구동 지원
- transformers.js 비교 — ruNNtime은 추론 전용 코어와 모델 구현체인 zoo로 구성되어 향후 transformers.js의 추론 공급자로 통합 예정

이번 주에 EmbeddingGemma 2가 나왔음. 이미지랑 텍스트를 768차원 공간 하나로 매핑해줘서, 사진을 말로 설명해서 검색할 수 있게 해줌. 이거 텍스트랑 비전 타워를 TypeScript 기반 WebGPU 추론 라이브러리인 ruNNtime으로 포팅했고, 브라우저 GPU에서 검색이 100% 돌아가는 작은 사진 갤러리도 하나 만들어봤음.
ruNNtime은 다른 비전 모델들도 많이 지원하니까, 인터랙티브 문서에서 직접 가지고 놀아보셈.

