apple/LensVLM-9B · 허깅페이스
apple/LensVLM-9B · Hugging Face
핵심 요약
애플이 Qwen 기반으로 개발한 텍스트 압축 및 선택적 확장 VLM 모델인 LensVLM-9B가 공개되었습니다.
- 모델 기능 — 압축된 텍스트 이미지를 스캔한 뒤 관련 페이지를 선택적으로 확장하여 분석함
- 기술 기반 — Qwen 9B 모델을 파인튜닝하여 개발된 비전 언어 모델임
- 라이선스 — 애플 머신러닝 연구 모델 라이선스 하에 배포됨
- 활용 분야 — 다량의 문서 이미지에서 특정 정보를 효율적으로 탐색하는 데 적합함
huggingface.co
원문 사이트로 이동
https://huggingface.co/bartowski/LensVLM-9B-GGUF
https://huggingface.co/apple/LensVLM-9B#lensvlm-9bLensVLM-9B
LensVLM은 텍스트가 포함된 압축 이미지를 스캔한 뒤, 학습된 도구를 사용해 필요한 페이지만 골라서 압축을 푸는 9B 규모의 시각 언어 모델(VLM)임.
https://huggingface.co/apple/LensVLM-9B#licenseLicense
이 저장소에 있는 모든 ML 모델 파일은 Apple이 Qwen 모델을 수정한 내용을 포함하며, Apple Machine Learning Research Model License 약관에 따라 제공됨.
이 모델과 함께 제공되는 소스 코드는 별도로 배포되며, Apple Sample Code License 약관을 따름.


