CohereLabs/North-Micro-Vision-Instruct · 허깅페이스
CohereLabs/North-Micro-Vision-Instruct · Hugging Face
핵심 요약
CohereLabs에서 Apache 2.0 라이선스로 공개한 2.4B 파라미터 규모의 경량 비전-언어 모델(VLM)입니다.
- 경량 모델 — 2.4B 파라미터로 프로토타이핑 및 미세 조정에 최적화됨
- 비전 성능 — 네이티브 해상도 처리 및 VQA, OCR 등 다양한 작업 지원
- 오픈 라이선스 — Apache 2.0 라이선스로 배포되어 자유로운 활용 가능
- 멀티모달 지원 — 다국어 및 다중 이미지 입력 처리가 가능함
huggingface.co
원문 사이트로 이동
North Micro Vision Instruct는 2.4B 파라미터 규모의 오픈 웨이트 비전-언어 모델이야. 이미지 원본 해상도를 그대로 지원하고, Apache 2.0 라이선스로 풀렸어. 프로토타이핑이나 특정 작업용 파인튜닝, 그리고 특수 목적의 멀티모달 애플리케이션을 만들기 위한 가벼운 기반 모델로 설계됐지.
주요 특징
- 이미지 비율이랑 세밀한 디테일을 그대로 살리는 원본 해상도 이미지 처리.
- VQA, 캡셔닝, 그라운딩, OCR, 차트, 문서 해석 등 전반적인 이미지 이해 능력.
- 다국어 및 다중 이미지 지원.
- 커스텀이나 배포 테스트에 딱 맞는 2.4B 파라미터의 가벼운 규모.
- Apache 2.0 라이선스 모델 웨이트.
모델 상세 정보
| Property | Value |
|---|---|
| Model ID | CohereLabs/North-Micro-Vision-Instruct |
| Total parameters | 2.4B |
| Language model | 2B parameters |
| Vision encoder | 400M parameters; custom-trained starting from SigLIP 2 SO400M |
| Inputs | Interleaved text and images |
| Output | Text |
| Languages | English, German, French, Spanish, Italian, Portuguese, Hindi, Japanese, Korean, Chinese, Arabic, and more |
| Tokenizer vocabulary size | 262,144 |
| LM Backbone context window | 128K tokens |
| Multimodal training context | 8K tokens |
| Checkpoint precision | bfloat16 |
| License | Apache 2.0 |
언어 백본은 128K 토큰 컨텍스트 윈도우를 지원하긴 하는데, 멀티모달 프롬프트에서 검증된 작동 범위는 8K 토큰까지야. 그보다 긴 멀티모달 컨텍스트는 외삽(extrapolation)에 의존해야 하고, 벤치마크 테스트도 안 해봤어.
사용 목적
North Micro Vision Instruct는 다음과 같은 연구 및 개발 용도로 쓰려고 만든 거야.
- 프로토타이핑 및 특정 작업용 파인튜닝.
- 일반적인 시각적 질의응답(VQA) 및 이미지 캡셔닝.
- 다국어 및 다중 이미지 이해.
- 시각적 그라운딩 및 공간 이해.
- OCR, 차트 및 문서 이해, 구조화된 정보 추출.


