Kwai-Keye/Keye-VL-2.0-30B-A3B-GGUF · 허깅페이스
Kwai-Keye/Keye-VL-2.0-30B-A3B-GGUF · Hugging Face
핵심 요약
긴 영상 이해와 에이전트 기능을 갖춘 30B급 멀티모달 모델 Keye-VL-2.0-30B-A3B가 공개되었습니다.
- 영상 이해 성능 — 오픈소스 경쟁 모델을 앞서며 Gemini-3-Flash와 대등한 수준의 시간적 위치 파악 능력 제공
- 긴 문맥 아키텍처 — 희소 어텐션(Sparse Attention)을 활용해 효율적인 연산으로 1시간 분량의 영상 이해 가능
- 에이전트 기능 — 코드 실행, 도구 사용, 웹 검색 및 시각적 자기 교정 워크플로우 지원
- 최적화된 추론 — DSA 및 이종 ViT-LM 병렬 처리 등을 통해 긴 시퀀스 처리 비용 절감 및 학습 효율 향상
huggingface.co
원문 사이트로 이동
Keye-VL-2.0-30B-A3B를 소개한다. Keye 시리즈의 최신 30B급 플래그십 베이스 모델로, 긴 영상 이해의 한계를 돌파하고 Keye 패밀리 최초로 에이전트 기능을 탑재하려고 작정하고 만든 놈이다.
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B-GGUF#highlights주요 특징
- 압도적인 영상 이해 및 시간적 위치 파악: 5개 영상 벤치마크에서 오픈소스 경쟁 모델들을 다 씹어먹고, 시간적 그라운딩(temporal grounding) 능력은 Gemini-3-Flash와 비비거나 오히려 앞선다.
- DSA 기반의 긴 문맥 아키텍처: Sparse attention과 타겟팅된 특징 집계(feature aggregation)를 써서 효율적인 연산으로 1시간짜리 영상도 정확하게 이해한다.
- 고효율 추론 및 학습 스택: DSA(DeepSeek Sparse Attention), ExtraIO, 이기종 ViT-LM 병렬 처리, 활성화 최적화, 커스텀 커널을 때려 박아서 긴 시퀀스 프리필 비용은 줄이고 학습 처리량은 확 끌어올렸다.
- 데이터 중심의 멀티모달 사전 학습: 꼼꼼하게 큐레이션한 데이터 파이프라인, Keye-VL-1.5 비전 인코더, 합성 CoT 데이터를 써서 인식, OCR/차트/표 이해, 추론 연속성을 싹 다 강화했다.
- 신뢰할 수 있는 추론을 위한 강력한 사후 학습: MOPD, 버킷 어드밴티지 스케일링, Context-RL, 고SNR 데이터 필터링으로 크로스 모달 전문가 병합을 개선하고, 환각 현상을 줄이며 긴 문맥에서의 판단력을 안정화했다.
- 에이전트 준비 완료된 멀티모달 기능: 코드, 도구, 검색 에이전트 기능이 내장돼 있어서 리포지토리 작업, API 스타일의 도구 사용, 웹 기반 검색, 시각적 자가 수정 워크플로우까지 다 지원한다.
DSA를 프로덕션 환경에 적용한 최초의 멀티모달 모델로서, Keye-VL-2.0-30B-A3B는 256K 초장문 문맥에서도 거의 손실 없는 추론 성능을 보여준다. 이 체급에서 영상 이해 벤치마크 1등을 찍었고, 세밀한 시간적 인식 능력은 최상위권 폐쇄형 모델들과 비비거나 아예 발라버린다. 더 중요한 건, 이게 에이전트 협업 메커니즘을 기본으로 탑재하고 나온 첫 번째 Keye 베이스 모델이라는 점이다. 검색, 도구, 코드 시나리오에서 확실한 시스템 수준의 오케스트레이션 능력을 보여준다.

