DWARF-55M-Base 모델 소개
Introducing DWARF-55M-Base
핵심 요약
거의 모든 레이어가 희소(sparse)한 DWARF 아키텍처 기반의 55M 파라미터 모델이 공개되었습니다.
- DWARF 아키텍처 — 9개의 DSQG 레이어와 1개의 전역 혼합 레이어를 사용하는 희소 어텐션 구조임
- 효율적인 연산 — 전체 기록을 스캔하지 않고 고정된 오프셋만 참조하여 KV 캐시 대역폭을 O(1) 수준으로 유지함
- 연구용 프로토타입 — 10B 토큰의 Dolma3 데이터셋으로 학습되었으며 Apache 2.0 라이선스로 공개됨
- 향후 계획 — 더 긴 컨텍스트 확장과 인스트럭션 튜닝 모델이 준비 중임
수개월간의 연구 끝에 드디어 DWARF 아키텍처로 만들어진 첫 번째 모델을 여러분이 직접 확인하고 실험해 볼 수 있게 되었습니다!
DWARF는 거의 모든 레이어가 희소(sparse)한 어텐션 아키텍처로, 전송을 위한 백본으로 9개의 DSQG(Dynamic Sparse Query-Gather) 레이어를 사용하고, 레이어 깊이 25% 지점에 단 하나의 완전한 인과적 어텐션 레이어를 배치합니다. 예를 들어 모델에 32개의 레이어가 있다면, L7 지점에 전역 믹서로서 단 하나의 완전한 인과적 어텐션 레이어만 있으면 되며, 학습된 컨텍스트인 2048까지 일관되게 안정적인 검색 성능을 달성합니다.
초기 결과에 따르면 N=2048에서만 학습해도 학습된 N의 3배(이 경우 N=6144)까지 일관되게 안정적인 검색 성능을 보이지만, 이를 확실히 확인하기 위한 철저한 테스트는 아직 진행 중입니다.
DSQG는 전체 어텐션을 고정된 인과적 근거리 및 원거리 토큰 오프셋 세트로 대체하므로, 각 토큰은 이전의 모든 토큰을 참조하는 대신 과거의 작은 다중 스케일 샘플을 참조합니다. 그런 다음 쿼리/키 프로브 신호를 사용하여 어떤 샘플링 위치가 중요한지 학습하고 그 값을 조절함으로써, 훨씬 낮은 어텐션 비용으로 유용한 콘텐츠 중심 통신을 보존하는 것을 목표로 합니다.
DSQG는 전체 기록을 스캔하는 대신 각 새 토큰에 대해 고정된 수의 오프셋만 디코딩하므로, 토큰당 KV 캐시 대역폭과 어텐션 작업은 컨텍스트 길이에 대해 거의 완전히 O(1)입니다.
이 모델은 Dolma3 Mix 150B의 10B 토큰으로 학습된 연구용 프로토타입 베이스 모델이며, ChatML이 수정된 OLMo1 Base 토크나이저(50282 토큰)를 사용합니다.
Github의 코드를 통해 L3의 완전한 어텐션을 대체하는 HISA 경로를 실험해 볼 수 있습니다. 이는 완전한 어텐션 하이브리드와 경쟁력 있는 성능을 제공하면서도 본질적으로는 순수하게 희소합니다. HISA 경로는 현재 실험 단계이며 아직 완전히 다듬어지지 않았습니다.
편집: 깜빡하고 언급 안 했는데, 모델과 레포 모두 Apache 2.0 라이선스입니다!


