EmbeddingGemma 2 출시: 네이티브 멀티모달 임베딩을 위한 동급 최강 오픈 모델 | 구글
Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
핵심 요약
구글이 텍스트, 이미지, 영상, 오디오를 통합 처리하는 740M 파라미터 규모의 멀티모달 임베딩 모델 EmbeddingGemma 2를 공개함.
- 멀티모달 임베딩 — 텍스트와 이미지, 영상, 오디오를 768차원 벡터 공간으로 통합함.
- 경량화 설계 — 모바일 및 노트북 등 소비자용 하드웨어에서 구동 가능하도록 최적화됨.
- 활용 분야 — 검색, RAG, 분류, 클러스터링 등 온디바이스 애플리케이션에 적합함.
- 오픈 모델 — Jina와 달리 비상업적 제한이 없는 오픈 모델로서의 가치가 높음.
blog.google
원문 사이트로 이동
https://huggingface.co/google/embeddinggemma-2
EmbeddingGemma 2는 구글 딥마인드에서 만든 오픈 멀티모달 임베딩 모델이야. 텍스트(코드 포함), 이미지, 비디오, 오디오 입력값이나 이들을 조합한 데이터를 768차원의 단일 통합 벡터 공간으로 매핑해주지. 이 모델은 총 7억 4천만 개의 파라미터로 구성되어 있는데, 2억 7천만 개의 파라미터를 가진 텍스트 모델에 모듈형 비전(1억 7천만)과 오디오(3억) 인코더를 합친 거야.
모바일 기기나 노트북 같은 일반 소비자용 하드웨어에서 돌아가도록 설계됐어. 그래서 검색, RAG(검색 증강 생성), 분류, 클러스터링 같은 온디바이스 애플리케이션에서 지연 시간 없이 빠르게 의미론적 표현을 뽑아낼 수 있지.

