SenseNova-Vision: 태스크별 헤드 없이 분할, 깊이, 탐지, OCR, 3D 재구성을 수행하는 7B 오픈 모델
SenseNova-Vision: a 7B open model that does segmentation, depth, detection, OCR, and 3D reconstruction with no task-specific heads
핵심 요약
태스크별 헤드 없이 단일 모델로 다양한 컴퓨터 비전 작업을 수행하는 7B 오픈 모델인 SenseNova-Vision 소개.
- 통합 비전 모델 — 태스크별 헤드 없이 단일 모델로 다양한 비전 작업 수행
- 다양한 기능 — 객체 탐지, OCR, 3D 재구성 등 폭넓은 작업 지원
- 높은 하드웨어 요구 — 7B 모델임에도 원활한 구동을 위해 80GB GPU 권장
- 오픈 소스 공개 — Apache 2.0 라이선스로 가중치 및 학습 파이프라인 공개
이번에 새로 나온 비전 모델인 SenseNova-Vision을 발견했는데, 이거 7B MoT 모델이고 Apache 2.0 라이선스라 꽤 괜찮네. 핵심 아이디어는 컴퓨터 비전 관련 작업을 전부 그냥 하나의 생성 문제로 처리한다는 거야. 그러니까 탐지, 세그멘테이션, 깊이 추정 같은 거 하려고 모델 여러 개 돌릴 필요 없이, 이거 하나로 다 끝낸다는 거지.
그냥 자연어로 지시사항 주고 시각적 힌트 좀 던져주면, 텍스트나 이미지, 아니면 둘 다 뱉어내. 텍스트 쪽은 카테고리 분류, 바운딩 박스, OCR, 키포인트, 카메라 앵글 같은 거 다 되고, 이미지 쪽은 세그멘테이션 마스크, 깊이 맵, 표면 법선, 심지어 다중 시점 포인트 맵까지 뽑아내. 복잡한 작업은 이것저것 섞어서 시킬 수도 있고.
따로 예측 헤드나 디코더 같은 거 안 쓰는 게 좀 신박하더라. 그냥 가중치 하나로 다 돌아가고, 프롬프트로 뭘 할지 지시하는 방식이야.
그래서 객체 탐지, 키포인트, OCR, 온갖 세그멘테이션(이진, 인스턴스, 시맨틱), 깊이 및 표면 법선 추정 같은 기본기는 다 돼. 근데 내가 보기에 진짜 흥미로운 건 다중 시점 3D 재구성이랑 카메라 포즈 추정 쪽이야.
이번 업데이트에서 아예 그거 전용 벤치마크까지 추가했더라고. 원래 이런 다중 시점 재구성은 COLMAP 같은 전문 툴 써야 하는데, 이 모델은 프롬프트 하나로 끝내버리니까. 이게 진짜 잘 작동하면 대박이지.
데이터셋도 엄청나게 갈아 넣었는데, 온갖 CV 주석 데이터 긁어모아서 5천만 개의 지시-응답 쌍으로 학습시켰대. 기존 멀티모달 모델 기반으로 만든 거라 구조가 완전히 새로울 건 없지만.
직접 만져보고 싶으면 웹 데모도 있고, 가중치도 Hugging Face에 올라와 있어.
근데 너무 기대하기 전에 미리 알아둬야 할 게 있어. 웹 데모 풀버전 돌리려면 1x80GB 같은 빵빵한 GPU가 필요해. 벤치마크 돌릴 때는 8x80GB를 요구하고. 그러니까 일반적인 소비자용 그래픽카드로는 어림도 없다는 거지. 7월 8일에 막 나온 거라 아직 좀 불안정할 수도 있고. 아, 학습 파이프라인이랑 데이터 준비하는 코드도 다 공개했으니까 직접 학습시키거나 파인튜닝 해볼 사람은 참고해.
GitHub: https://github.com/OpenSenseNova/SenseNova-Vision
솔직히 다중 시점 재구성 기능을 자기 이미지 데이터셋으로 직접 돌려본 사람 있는지 진짜 궁금하네. 내가 제일 테스트해보고 싶은 부분이거든.


