DeepSeek, 'Thinking-with-Visual-Primitives' 프레임워크 공개
DeepSeek released 'Thinking-with-Visual-Primitives' framework
핵심 요약
DeepSeek이 좌표와 바운딩 박스를 사고의 최소 단위로 활용하는 새로운 멀티모달 추론 프레임워크를 공개함.
- 멀티모달 추론 — 좌표와 바운딩 박스를 사고 과정에 직접 삽입하여 모델이 이미지 내 특정 위치를 가리키며 생각하도록 설계됨.
- 오픈소스 공개 — DeepSeek이 북경대, 칭화대와 협력하여 관련 논문과 저장소를 오픈소스로 배포함.
DeepSeek은 북경대학교, 칭화대학교와 협력하여 새로운 멀티모달 추론 프레임워크를 소개하는 논문 "Thinking with Visual Primitives"와 오픈소스 저장소를 공개했습니다. 이 프레임워크의 핵심 접근 방식은 공간 토큰(구체적으로 좌표점과 바운딩 박스)을 모델의 사고 연쇄(chain-of-thought) 내에서 "사고의 최소 단위"로 격상시키는 것입니다. 이러한 토큰들은 추론 과정 중에 직접 삽입되어, 모델이 "생각"하는 동안 이미지 내의 특정 위치를 "가리킬" 수 있게 합니다.
https://github.com/deepseek-ai/Thinking-with-Visual-Primitives


