AIDC-AI/Ovis2.6-80B-A3B · Hugging Face
핵심 요약
Ovis2.6-80B-A3B는 MoE 아키텍처를 도입해 추론 비용은 낮추고 멀티모달 성능은 극대화한 최신 모델입니다.
- MoE 아키텍처 — 80B 파라미터 규모로 지식을 습득하면서도 3B 활성 파라미터만 사용하여 추론 비용을 획기적으로 절감함.
- 고해상도 처리 — 64K 컨텍스트 윈도우와 2880x2880 해상도를 지원하여 긴 문서와 복잡한 시각 정보를 효과적으로 이해함.
- 이미지 사고 능력 — 'Think with Image' 기능을 통해 시각 도구를 능동적으로 활용하여 복잡한 시각적 추론을 수행함.
- OCR 및 차트 분석 — 문서와 차트에서 정보를 추출하는 것을 넘어, 추출된 내용을 바탕으로 논리적인 추론까지 수행함.
Ovis 시리즈 멀티모달 대규모 언어 모델(MLLM)의 최신 발전 모델인 Ovis2.6-80B-A3B를 소개합니다. Ovis2.5의 탄탄한 기반 위에 구축된 Ovis2.6은 LLM 백본을 Mixture-of-Experts(MoE) 아키텍처로 업그레이드하여, 훨씬 낮은 서빙 비용으로 뛰어난 멀티모달 성능을 제공합니다. 또한 긴 문맥 이해와 고해상도 이해, 능동적 이미지 분석을 통한 시각적 추론, 정보 밀도가 높은 문서 이해 능력에서 큰 향상을 이루었습니다.
주요 특징
- MoE 아키텍처: 낮은 서빙 비용으로 뛰어난 성능 LLM 백본이 Mixture-of-Experts(MoE) 아키텍처로 업그레이드되었습니다. 이를 통해 Ovis2.6은 총 80B 파라미터까지 확장하여 방대한 지식과 미묘한 차이를 포착할 수 있습니다. 결정적으로, 추론 시에는 약 3B의 활성 파라미터만 사용하여 낮은 서빙 비용과 높은 처리량을 보장합니다.
- 향상된 긴 시퀀스 및 고해상도 처리 Ovis2.6은 컨텍스트 윈도우를 64K 토큰으로 확장하고 최대 2880×2880의 이미지 해상도를 지원하여, 고해상도 및 정보 밀도가 높은 시각적 입력을 처리하는 능력을 크게 향상시켰습니다. 이러한 개선 사항은 모델이 여러 페이지에 흩어진 단서를 수집하고 종합하여 정답을 도출해야 하는 긴 문서 질의응답 작업에 특히 효과적입니다.
- 이미지를 통한 사고(Think with Image) 시각적 입력을 수동적인 데이터에서 능동적인 인지 작업 공간으로 변환하는 "Think with Image" 기능을 도입했습니다. 추론 과정에서 모델은 시각 도구(예: 자르기 및 회전)를 능동적으로 호출하여 Chain-of-Thought 내에서 이미지 영역을 재검토하고 분석할 수 있으며, 이를 통해 복잡한 작업에서 더 높은 정확도를 위해 다단계의 자기 성찰적 추론이 가능해집니다.
- 강화된 OCR, 문서 및 차트 기능 정보 밀도가 높은 시각적 작업에 계속 집중하면서, 광학 문자 인식(OCR), 문서 이해, 차트/다이어그램 분석 분야에서 모델의 기능을 더욱 강화했습니다. Ovis2.6은 시각 데이터에서 구조화된 정보를 정확하게 추출할 뿐만 아니라, 추출된 내용을 바탕으로 추론하는 데에도 탁월합니다.
이전에는 Marco-Mini-Instruct, Marco-Nano-Instruct, Marco-DeepResearch-8B, Ovis2.6-30B-A3B 등을 출시했습니다.
