internlm/Intern-S2-Preview · 허깅페이스
internlm/Intern-S2-Preview · Hugging Face
핵심 요약
35B 파라미터로 과학적 작업 성능을 극대화한 멀티모달 모델 Intern-S2-Preview 소개.
- 과학적 태스크 스케일링 — 사전 학습부터 강화 학습까지 전 과정을 아우르는 전문 과학 작업 수행.
- 효율적인 모델 구조 — 35B 파라미터로 기존 대규모 모델에 필적하는 성능 달성.
- 강화된 에이전트 능력 — 과학적 워크플로우를 위한 에이전트 성능 대폭 개선.
- 추론 효율 최적화 — MTP 및 CoT 압축 기술을 통해 응답 속도와 성능 동시 확보.
소개
우리는 효율적인 35B 과학 멀티모달 파운데이션 모델인 Intern-S2-Preview를 소개합니다. 기존의 파라미터 및 데이터 스케일링을 넘어, Intern-S2-Preview는 **태스크 스케일링(task scaling)**을 탐구합니다. 이는 과학적 작업의 난이도, 다양성, 범위를 확장하여 모델의 잠재력을 더욱 끌어올리는 방식입니다.
전문적인 과학 작업을 사전 학습부터 강화 학습까지 이어지는 전체 체인 학습 파이프라인으로 확장함으로써, Intern-S2-Preview는 **35B 파라미터(Qwen3.5에서 계속 사전 학습됨)**만 사용하고도 여러 핵심 전문 과학 작업에서 조 단위 규모의 Intern-S1-Pro와 대등한 성능을 달성합니다. 동시에 강력한 일반 추론, 멀티모달 이해, 에이전트 능력을 유지합니다.
특징
- 전체 체인 학습을 통한 과학적 태스크 스케일링. Intern-S2-Preview는 사전 학습부터 강화 학습까지 수백 개의 전문 과학 작업을 확장하여 35B 파라미터만으로 여러 전문 분야에서 강력한 성능을 발휘합니다. 또한 소분자 구조에 대한 공간 모델링을 강화하고 실수 기반 예측 모듈을 도입하여, 재료 결정 구조 생성 능력과 강력한 일반 능력을 모두 갖춘 최초의 오픈 소스 모델이 되었습니다.
- 과학적 워크플로우를 위한 향상된 에이전트 능력. Intern-S2-Preview는 이전 세대보다 에이전트 능력을 크게 향상시켜 여러 과학 에이전트 벤치마크에서 강력한 결과를 달성했습니다.
- MTP 및 CoT 압축을 통한 효율적인 RL 추론. 강화 학습 중 Intern-S2-Preview는 학습과 추론 동작 간의 불일치를 줄이기 위해 가중치 공유 MTP와 KL 손실을 채택하여, MTP 수락률과 토큰 생성 속도를 크게 향상시켰습니다. 또한 강력한 추론 능력을 유지하면서 응답을 단축하는 CoT 압축 기술을 도입하여 성능과 효율성 모두에서 개선을 이루었습니다.

