google/gemma-4-12B · 허깅페이스
google/gemma-4-12B · Hugging Face
핵심 요약
구글의 최신 오픈 모델 Gemma 4 시리즈가 공개됨. 12B 모델을 포함해 다양한 크기와 아키텍처로 멀티모달 및 추론 성능이 강화됨.
- Gemma 4 출시 — 텍스트와 이미지 처리가 가능한 멀티모달 오픈 모델 시리즈가 공개됨.
- 다양한 아키텍처 — Dense 및 MoE 구조를 채택하여 고성능부터 온디바이스까지 폭넓게 지원함.
- 향상된 성능 — 최대 256K 컨텍스트 윈도우와 강화된 추론 및 코딩 능력을 갖춤.
- 온디바이스 최적화 — 노트북이나 모바일 기기에서도 효율적으로 실행 가능한 소형 모델을 포함함.
huggingface.co
원문 사이트로 이동
Gemma는 구글 딥마인드(Google DeepMind)에서 만든 오픈 모델 시리즈야. Gemma 4 모델들은 멀티모달이라 텍스트랑 이미지 입력을 처리할 수 있고(E2B, E4B, 12B 모델은 오디오도 지원함), 텍스트를 출력해. 이번 릴리즈에는 사전 학습된 모델이랑 인스트럭션 튜닝된 모델 둘 다 포함돼 있어. Gemma 4는 최대 256K 토큰의 컨텍스트 윈도우를 지원하고, 140개 이상의 언어를 아우르는 다국어 지원 능력도 그대로 유지했어.
Dense 아키텍처랑 Mixture-of-Experts(MoE) 아키텍처를 둘 다 써서, Gemma 4는 텍스트 생성, 코딩, 추론 같은 작업에 아주 최적화돼 있어. 모델 사이즈는 E2B, E4B, 12B, 26B A4B, 31B 이렇게 다섯 가지로 나와. 사이즈가 다양해서 고성능 폰부터 노트북, 서버까지 어디든 돌릴 수 있고, 덕분에 누구나 최첨단 AI를 쉽게 쓸 수 있게 됐지.
Gemma 4에서 새로워진 핵심 기능이랑 아키텍처는 다음과 같아:
-
추론(Reasoning) – 모든 모델이 추론 능력이 엄청나게 뛰어나게 설계됐고, 생각하는 모드도 입맛대로 설정할 수 있어.
-
확장된 멀티모달(Extended Multimodalities) – 텍스트, 이미지(가변 종횡비랑 해상도 지원, 전 모델 공통), 비디오, 오디오(E2B, E4B, 12B 모델에서 기본 지원)까지 다 처리해.
-
다양하고 효율적인 아키텍처(Diverse & Efficient Architectures) – 확장 가능한 배포를 위해 다양한 사이즈의 Dense 및 Mixture-of-Experts(MoE) 모델을 제공해.
-
온디바이스 최적화(Optimized for On-Device) – 작은 모델들은 노트북이나 모바일 기기에서 로컬로 쌩쌩 돌아가게끔 특별히 설계됐어.
-
컨텍스트 윈도우 확장(Increased Context Window) – 작은 모델은 128K, 중간 모델은 256K 컨텍스트 윈도우를 지원해.
-
코딩 및 에이전트 능력 강화(Enhanced Coding & Agentic Capabilities) – 코딩 벤치마크 점수가 확 올랐고, 함수 호출(function-calling)도 기본으로 지원해서 성능 좋은 자율 에이전트를 만들 수 있어.
-
네이티브 시스템 프롬프트 지원(Native System Prompt Support) – Gemma 4는 시스템 역할을 기본으로 지원해서, 훨씬 체계적이고 제어하기 쉬운 대화가 가능해.
https://developers.googleblog.com/gemma-4-12b-the-developer-guide/
니 감자(컴퓨터)한테 밥이나 줘라!!!
