internlm/Intern-Decision 4B 및 0.8B 모델 공개
internlm/Intern-Decision 4B and 0.8B
핵심 요약
구조화된 의사결정을 위해 텍스트 생성 없이 로짓을 직접 읽어 결과를 도출하는 멀티모달 모델 Intern-Decision이 공개되었습니다.
- 구조화된 의사결정 — 텍스트 생성 없이 로짓을 읽어 한 번의 forward pass로 질문들에 대한 답을 도출함
- 효율적인 추론 — 0.8B 모델의 경우 CPU에서도 즉각적인 응답이 가능할 정도로 가벼움
- 멀티모달 지원 — 상태 정보, 질문 스키마, 이미지 입력을 받아 JSON 형식으로 결과를 반환함
- Qwen3.5 기반 — Qwen3.5-4B를 파인튜닝하여 의사결정 작업에 최적화함
huggingface.co
원문 사이트로 이동
https://huggingface.co/internlm/Intern-Decision-0.8B
업데이트: https://huggingface.co/internlm/Intern-Decision-2B
Intern-Decision-4B
Intern-Decision-4B는 Qwen3.5-4B를 기반으로 파인튜닝한 멀티모달 구조화 의사결정 모델이야. 공유 상태(shared state), 질문 스키마, 그리고 선택적인 이미지를 입력받아서, 모델을 딱 한 번만 돌리면 모든 질문에 대한 답변 분포를 바로 뱉어내지.
https://huggingface.co/internlm/Intern-Decision-4B#how-inference-worksHow 추론 방식
-
질문과 선택지 순서를 그대로 유지하고, 각 선택지를
A,B, …,Z,a, …,z,0, …,9같은 단일 토큰 기호로 매핑해. -
시스템 프롬프트, 상태, 의사결정 스키마, 그리고 각 필드마다
<decision>자리표시자가 포함된 완성된 어시스턴트 JSON 스켈레톤을 렌더링해. 이때 체크포인트의 챗 템플릿과 빈 사고 블록(thinking block)은 그대로 둬야 해. -
Hugging Face의 인과적(causal) 포워드 패스를 한 번 실행해. 마스크된 다음 토큰 예측(masked-next-token decision) 목표를 위해, 각 자리표시자 바로 직전 위치의 로짓(logits) 값을 읽어와.
-
해당 필드에서 허용된 후보 기호 로짓에 대해서만 소프트맥스(softmax)를 취한 다음, 체크포인트의 확률 보정(probability calibration)을 적용해.
-
기호를 다시 원래 선택지 값으로 매핑해서 타입이 지정된 JSON 답변을 반환해.
이 API는 구조화된 후보 점수 매기기 방식으로 작동해. generate()를 호출하거나 자유 형식의 텍스트를 생성하지 않아. 한 번의 요청에 여러 필드가 포함될 수 있고, 프롬프트에 정답(gold answers)을 따로 넣을 필요도 없어. 추론 컴파일러는 오직 , , 그리고 선택적인 만 사용해.


