google/embeddinggemma-2 · 허깅페이스
google/embeddinggemma-2 · Hugging Face
핵심 요약
구글이 텍스트, 이미지, 영상, 오디오를 통합 처리하는 멀티모달 임베딩 모델 'EmbeddingGemma 2'를 공개했습니다.
- 통합 멀티모달 — 텍스트, 이미지, 영상, 오디오를 768차원 벡터 공간으로 통합 처리함
- 경량화 설계 — 모바일 및 노트북 등 소비자용 하드웨어에서 구동 가능하도록 최적화됨
- Matryoshka 학습 — 임베딩 차원 축소를 지원하여 저장 비용을 최대 6배 절감함
- 유연한 모듈 — 텍스트 기반에 비전과 오디오 인코더를 선택적으로 로드하여 사용 가능함
huggingface.co
원문 사이트로 이동
EmbeddingGemma 2는 구글 딥마인드에서 만든 오픈 멀티모달 임베딩 모델이야. 텍스트(코드 포함), 이미지, 비디오, 오디오 입력값들을 전부 768차원의 단일 벡터 공간으로 때려 박아주는 놈이지. 파라미터는 총 7억 4천만 개고, 2억 7천만 개의 텍스트 모델에 모듈식 비전(1억 7천만)이랑 오디오(3억) 인코더를 합친 구조야.
모바일이나 노트북 같은 일반 소비자용 하드웨어에서도 잘 돌아가게 설계됐어. 검색, RAG(검색 증강 생성), 분류, 클러스터링 같은 온디바이스 애플리케이션에서 지연 시간 짧게 시맨틱 표현을 뽑아낼 수 있지.
EmbeddingGemma 2는 Gemma 4의 아키텍처와 성능을 그대로 이어받아서 다음과 같은 핵심 기능들을 제공해:
-
네이티브 멀티모달: 텍스트, 이미지, 비디오, 오디오 4가지 모달리티를 768차원의 공유 임베딩 공간 하나로 통합했어.
-
다국어 및 코드 지원: 100개 이상의 언어를 알아먹고, 코드 작업 성능은 이전 모델보다 14% 정도 더 좋아졌어.
-
유연한 리소스 활용: 2억 7천만 파라미터의 텍스트 백본(1억 3천만 트랜스포머 + 1억 4천만 임베더)에 비전(1억 7천만)이랑 오디오(3억) 인코더를 선택적으로 불러올 수 있어. 개발자가 필요한 모달리티만 골라서 쓸 수 있다는 소리지.
-
Matryoshka Representation Learning (MRL): 128d, 256d, 512d, 768d로 임베딩을 잘라 쓰는 걸 기본으로 지원해. 덕분에 성능 저하는 최소화하면서 벡터 저장 비용을 최대 6배까지 줄일 수 있어.
-
컨텍스트 길이: 8K 토큰 컨텍스트 윈도우를 지원해서 몇 분짜리 오디오나 비디오도 처리가 가능해.
-
태스크별 표현 최적화: 가벼운 텍스트 지시어 접두사를 써서 검색, 분류, 클러스터링, 의미 유사도 등 각 작업에 맞게 임베딩을 최적화할 수 있어.
llama.cpp 지원 https://github.com/ggml-org/llama.cpp/pull/30054
GG가 만든 GGUF: https://huggingface.co/ggml-org/embeddinggemma-2-GGUF
Unsloth가 만든 GGUF: https://huggingface.co/unsloth/embeddinggemma-2-GGUF


