NuExtract3 출시: 마크다운, OCR, 구조화된 데이터 추출을 위한 오픈 웨이트 4B VLM (자체 호스팅 가능)
NuExtract3 released: open-weight 4B VLM for Markdown, OCR and structured extraction (self-hostable)
핵심 요약
문서 이미지에서 마크다운 및 구조화된 데이터를 추출하는 4B 규모의 오픈 웨이트 VLM 모델 NuExtract3가 공개되었습니다.
- 오픈 웨이트 모델 — Qwen3.5-4B 기반으로 Apache-2.0 라이선스 하에 공개됨.
- 다양한 문서 처리 — PDF, 스크린샷, 표, 인보이스 등 복잡한 문서 구조를 마크다운으로 변환함.
- 자체 호스팅 최적화 — 4GB VRAM 환경에서도 구동 가능하며 다양한 양자화 포맷을 지원함.
- 구조화된 데이터 추출 — 타겟 JSON 템플릿을 사용하여 문서에서 필요한 정보를 정확하게 추출함.
면책 조항: 저는 이 오픈 웨이트 모델을 만든 회사인 Numind에서 일합니다.
세 줄 요약: 이미지/텍스트를 마크다운으로 :-)
Qwen3.5-4B를 기반으로 한 4B 모델을 Apache-2.0 라이선스로 방금 출시했습니다. 목표는 PDF, 스크린샷, 양식, 표, 영수증, 인보이스, 다중 페이지 문서 및 기타 시각적으로 구조화된 입력 등 복잡한 문서에서 정보를 추출하는 작업을 오픈 모델로 더 실용적으로 만드는 것입니다.
NuMarkdown https://huggingface.co/numind/NuMarkdown-8B-Thinking을 사용해보셨다면, 이게 그 후속작입니다!
한번 써보세요. 완전히 무료인 허깅페이스 스페이스가 있습니다(가입할 필요도 없습니다): https://huggingface.co/spaces/numind/NuExtract3
NuMarkdown을 사용해보셨다면, NuExtract3가 그 후속작입니다.
가이드가 될 몇 가지 예시가 있습니다. 어떤 작업이든 자유롭게 이 모델을 재사용하세요.
설계된 목적은 다음과 같습니다:
- 문서 이미지를 마크다운으로 변환
- 타겟 JSON 템플릿을 사용하여 문서에서 구조화된 데이터 추출
- 표, 양식 및 레이아웃이 복잡한 페이지 처리
- 텍스트 및 시각적 문서 입력 모두 작업
- 문서 추출 파이프라인을 위한 로컬/오픈 웨이트 대안으로 활용
최대한 많은 컨텍스트를 학습시키기 위해 8xH100 노드에서 3일 동안 학습했으므로 긴 문서에서도 꽤 잘 작동할 것입니다. 마크다운의 경우, 병렬 처리가 더 효율적이므로 최상의 결과와 추론 속도를 위해 페이지 단위로 처리하는 것을 권장합니다.
꽤 광범위한 문서와 Safetensors, GGUF, MLX 가중치를 제공하므로 자체 호스팅이 매우 쉽습니다. 4GB VRAM만 있어도 충분히 실행할 수 있습니다. 다양한 양자화(GPTQ, W8A8, FP8, Q4, Q6...)를 제공하므로 어디서든 실행할 수 있을 것입니다.
주로 vLLM, SGLang, llama.cpp로 테스트했습니다. Ollama 지원도 좋겠지만, 저는 그들의 채팅 템플릿 엔진을 별로 좋아하지 않습니다.
블로그 포스트와 꽤 괜찮은 모델 카드가 있습니다:

