swiss-ai/Apertus-v1.5 70B/8B 모델 공개
swiss-ai/Apertus-v1.5 70B/8B
핵심 요약
다국어 및 멀티모달을 지원하는 완전 오픈 소스 AI 모델 Apertus 1.5가 공개되었습니다.
- 완전 오픈 소스 — 가중치, 데이터, 학습 레시피까지 모두 공개됨
- 멀티모달 지원 — 텍스트뿐만 아니라 이미지와 오디오 입력 처리 가능
- 추론 모드 — 'thinking mode'를 통해 복잡한 추론 작업 성능 향상
- 긴 컨텍스트 — 기본 262,144 토큰의 컨텍스트 길이 지원
https://huggingface.co/swiss-ai/Apertus-v1.5-70B
https://huggingface.co/swiss-ai/Apertus-v1.5-8B
Apertus 1.5는 다국어, 멀티모달, 완전 오픈 소스, 투명한 AI 기술의 발전을 목표로 설계된 8B 및 70B 파라미터 언어 모델 시리즈야. 이 모델들은 다양한 언어를 지원하고 최대 262,144 토큰의 컨텍스트를 처리할 수 있어. 게다가 100% 오픈된 학습 데이터만 사용하면서도 비슷한 규모의 다른 모델들과 맞먹는 성능을 보여주지.
이번에 나온 모델들은 Apertus 1.0을 계속해서 사전 학습시킨 결과물이야. 8B 모델에는 4T 토큰, 70B 모델에는 2T 토큰 규모의 멀티모달 데이터를 추가로 때려 박았거든. 그래서 Apertus 1.5는 기존과 동일한 아키텍처를 사용해. xIELU 활성화 함수를 쓴 디코더 전용 트랜스포머 구조고, AdEMAMix 옵티마이저로 학습시켰어. 이번에 개선된 사후 학습 레시피 덕분에 지시 이행 능력과 도구 사용 능력이 훨씬 좋아졌고, 처음으로 '생각 모드(thinking mode)'를 켜서 추론 작업 성능을 끌어올릴 수 있게 됐어.
Apertus 시리즈 최초로 Apertus 1.5 모델은 멀티모달 입력을 지원해. 이미지, 오디오, 텍스트를 입력받아서 텍스트를 출력하는 방식이지. 덕분에 개발자들이 활용할 수 있는 흥미로운 사용 사례가 엄청나게 늘어날 거야.
https://huggingface.co/swiss-ai/Apertus-v1.5-8B#key-features주요 특징
- 완전 오픈 모델: 모델 가중치 공개는 기본이고, 데이터랑 학습 레시피를 포함한 모든 학습 상세 내역까지 다 까버림.
- 압도적인 다국어 지원: 엄청나게 다양한 언어를 지원함.
- 책임감 있는 개발: 데이터 소유자의 거부 의사를 최대한 존중해서 학습시켰고(소급 적용까지 함), 학습 데이터가 그대로 암기되는 걸 막는 방법도 적용했음.
- 네이티브 오디오 및 이미지 이해: Apertus 1.5부터는 오디오랑 이미지 입력을 처리하는 멀티모달 기능을 넣어서, 텍스트를 넘어 훨씬 직관적이고 다재다능한 상호작용이 가능함.
- 추론 능력: *생각 모드(thinking mode)*를 켜면 모델이 답변을 내놓기 전에 입력값을 먼저 깊게 고민함.
- 긴 컨텍스트: Apertus 1.5는 기본적으로 262,144 토큰까지 컨텍스트를 지원해. 처음 나왔던 Apertus 1.0보다 4배나 늘어난 수치임.
- 개선된 지시 이행: 사용자가 시키는 대로 하는 능력이 확 좋아져서, 훨씬 예측 가능하고 정확한 답변을 받을 수 있음.
- 향상된 도구 사용: 외부 도구나 API를 더 잘 써먹을 수 있게 학습시켜서 연동성이 훨씬 좋아짐.
벤치마크 결과, 학습 파이프라인, 중간 체크포인트 같은 자세한 내용이 담긴 기술 보고서는 몇 주 안에 공개할 예정이야.

