nvidia/NVIDIA-Nemotron-Parse-2.0 · 허깅페이스
nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face
핵심 요약
NVIDIA의 문서 파싱 모델인 Nemotron Parse 2.0이 공개되어 문서 이해 및 데이터 추출 기능을 제공함.
- 구조화된 데이터 추출 — 문서 이미지를 텍스트, 레이아웃, 표 등 기계가 읽기 쉬운 형식으로 변환함.
- 기능 개선 — 다국어 지원 확대, 차트 인식 및 표 변환, 필기체 추출 성능 향상.
- 상업적 활용 가능 — 상업적/비상업적 용도로 모두 사용 가능한 모델임.
- 다양한 활용 분야 — RAG, 데이터 추출, 문서 인텔리전스 등 다양한 AI 애플리케이션에 적합함.
huggingface.co
원문 사이트로 이동
NVIDIA Nemotron Parse 2.0은 문서 이미지를 텍스트, 레이아웃 클래스, 바운딩 박스, 읽기 순서 정보가 포함된 구조화된 기계 판독 가능 형식으로 변환합니다. RGB 문서 이미지와 작업 프롬프트를 입력하면, 모델은 제목, 단락, 캡션, 표, 차트, 페이지 헤더/푸터, 각주, 사진, 참고문헌 항목과 같은 문서 요소에 대한 서식 지정된 텍스트와 공간 주석을 생성합니다. NVIDIA Nemotron Parse v1.2와 비교하여, Nemotron Parse 2.0은 더 효율적인 다국어 지원을 위해 약 2만 개의 토큰 어휘 확장을 추가했고, <class_Chart> 클래스 토큰을 통한 차트 인식 문서 파싱, 그리고 차트/표가 많은 문서에 대한 학습 범위를 업데이트했습니다. NVIDIA Nemotron Parse 2.0은 문서 이해, 정보 검색, 데이터 추출 및 멀티모달 데이터 큐레이션 워크플로우를 위해 설계되었습니다.
이 모델은 상업적 또는 비상업적 용도로 사용할 수 있습니다.
사용 사례:
NVIDIA Nemotron Parse 2.0은 문서 인텔리전스, 검색 증강 생성(RAG), 큐레이터, 추출기 및 에이전트 AI 애플리케이션을 구축하는 개발자와 팀을 위해 설계되었습니다. 스캔하거나 렌더링된 PDF, 프레젠테이션 슬라이드, 양식, 보고서, 표 및 혼합 콘텐츠 문서 페이지를 다운스트림 인덱싱, 검색, 분석, 모델 학습 데이터 생성 및 인간 개입 검토를 위한 구조화된 출력으로 변환하는 데 사용할 수 있습니다.
https://huggingface.co/nvidia/NVIDIA-Nemotron-Parse-2.0#capability-highlights-주요 기능:
- 확장된 다국어 OCR 지원, CJK(중/일/한) 및 인도어 스크립트 문서 텍스트에서 상당한 성능 향상.
- 비공식적, 필기체 또는 메모 형태의 콘텐츠가 포함된 문서 페이지에 대한 필기 텍스트 추출 개선.
- 차트 영역을 식별하고 가시적인 차트 정보를 다운스트림 사용을 위한 구조화된 텍스트로 변환할 수 있는 차트-투-테이블(Chart-to-table) 파싱.
- 표가 많은 문서에 대한 더 강력한 표 탐지, 구조 복구 및 텍스트 추출을 포함한 향상된 표 처리.

