nvidia/diffusiongemma-26B-A4B-it-NVFP4 · 허깅페이스
nvidia/diffusiongemma-26B-A4B-it-NVFP4 · Hugging Face
핵심 요약
구글 딥마인드의 멀티모달 모델 DiffusionGemma 26B가 엔비디아 최적화 버전으로 공개되었습니다.
- 모델 아키텍처 — 26B 파라미터의 MoE 구조로 텍스트, 이미지, 비디오 처리 가능
- 고속 추론 — H100 환경에서 초당 1,100 토큰 이상의 생성 속도 지원
- 멀티모달 기능 — 256K 컨텍스트 윈도우와 네이티브 함수 호출 지원
- 상업적 사용 — 상업적 및 비상업적 용도로 모두 활용 가능
huggingface.co
원문 사이트로 이동
모델 개요
DiffusionGemma 26B A4B IT는 구글 딥마인드에서 개발한 오픈 웨이트 멀티모달 생성 모델로, 이산 확산(discrete diffusion)을 통해 텍스트, 이미지, 비디오 입력을 처리하여 텍스트 출력을 생성합니다. 총 252억 개의 파라미터와 38억 개의 활성 파라미터를 가진 Gemma 4 26B A4B 전문가 혼합(MoE) 아키텍처를 기반으로 하며, 양방향 어텐션을 갖춘 인코더-디코더 설계를 채택했습니다. 이 모델은 256 토큰 블록을 병렬로 생성하여 NVIDIA Hopper H100(FP8)에서 낮은 배치 사이즈로 초당 1,100 토큰을 초과하는 고속 생성을 가능하게 합니다. DiffusionGemma 26B A4B IT는 256K 토큰 컨텍스트 윈도우, 구성 가능한 사고(추론) 모드, 네이티브 함수 호출, 35개 이상의 언어에 걸친 다국어 추론을 지원합니다. NVIDIA DiffusionGemma 26B A4B IT NVFP4 모델은 Model Optimizer로 양자화되었습니다.
이 모델은 상업적 및 비상업적 용도로 사용할 수 있습니다.
사용 사례:
사용 사례: DiffusionGemma 26B A4B IT는 고속 멀티모달 텍스트 생성이 필요한 개발자, 연구원 및 기업을 위해 설계되었습니다. 지원되는 사용 사례로는 대화형 AI 및 챗봇, 텍스트 요약, 코드 생성 및 단계별 추론, 이미지 및 문서 이해(OCR, 차트 이해, PDF 파싱, 화면 및 UI 파싱), 비디오 콘텐츠 분석, 네이티브 함수 호출을 통한 에이전트 워크플로우, 35개 이상의 언어에 걸친 다국어 NLP 작업 등이 있습니다.

