Agens Volundr 32B 프리뷰: 하이브리드 아키텍처 기반의 첫 모델 공개 (72개 레이어 중 18개만 KV 캐시 사용, Apache-2.0)
Agens Volundr 32B Preview: our small team's first model on our own hybrid architecture. Only 18 of 72 layers keep a KV cache (Apache-2.0)
핵심 요약
KV 캐시 사용을 최소화하여 긴 컨텍스트에서도 효율적인 추론이 가능한 32B 하이브리드 아키텍처 모델입니다.
- 하이브리드 아키텍처 — 72개 레이어 중 18개만 KV 캐시를 사용하여 메모리 효율 극대화함
- 긴 컨텍스트 지원 — 262K 컨텍스트 윈도우를 지원하며 긴 문맥 처리에 최적화됨
- 추론 성능 — BF16 및 INT4 환경에서 안정적인 토큰 처리 속도를 제공함
- 오픈 소스 공개 — Apache-2.0 라이선스로 배포되며 피드백을 적극 수용 중임

안녕 r/LocalLLaMA 형들. 홍콩에 있는 작은 팀인 Blockway에서 왔어 (참고로 이거 우리 모델임). 오늘 우리가 자체 하이브리드 아키텍처로 만든 첫 모델인 Agens Volundr 32B Preview를 공개했어. 컴퓨팅 자원이 넉넉하지 않은 상태에서 훈련시킨 거라 완벽하진 않아. 그래서 어디가 부족한지 미리 솔직하게 말하고 시작할게.
왜 이걸 만들었냐고?
우리 고객들은 자기네 장비에서 모델을 돌리거든. 컨텍스트가 길어지면 모델 가중치보다 KV 캐시가 메모리를 다 잡아먹어. 그래서 우리는 대부분의 레이어에서 KV 캐시를 안 쓰는 방식으로 모델을 설계했어.
아키텍처 (72개 레이어, 32B 밀집 모델, 모든 레이어가 모든 토큰에서 작동)
-
54 KDA (Kimi Delta Attention) 레이어: 고정 크기 순환 상태를 사용하는 선형 어텐션, KV 캐시 없음
-
17 BCSA 레이어 (우리가 만든 압축 희소 어텐션): 최근 4,096 토큰에 대해 정확한 윈도우 적용; 오래된 컨텍스트는 4:1로 블록 풀링하고, 학습된 인덱서가 상위 512개 블록을 읽음
-
1개 풀 어텐션 레이어 (72번 레이어)
-
Engram: 호스트 RAM에 저장되는 해시된 n-gram 메모리, 72개 레이어 중 2개에 부착
-
mHC: 1개가 아닌 4개의 잔차 스트림(residual stream) 사용
결국 72개 레이어 중 18개만 KV 캐시를 유지해. 컨텍스트 윈도우는 262K야.
속도 (단일 사용자, 우리 sglang 빌드 기준)
-
BF16 (48GB GPU 2개), 디코딩: 1K에서 25.1 tok/s, 8K에서 24.1, 32K에서 24.1, 64K에서 24.0, 128K에서 23.9
-
BF16 프리필: 2,122 / 2,180 / 1,916 / 1,679 / 1,297 tok/s (1K부터 128K까지)
-
INT4 (31.7 GiB, 48GB GPU 1개), 디코딩: 1K에서 31.0 tok/s, 8K에서 29.3, 32K에서 29.1
-
전체 처리량: 8명 동시 접속 시 127 tok/s, 16명 시 130 (BF16); 8명 시 117 (INT4)
-
DFlash2 drafter (별도 저장소), 단일 사용자, 서버 켜고 껐을 때 비교: JSON/툴 출력 시 최대 3.6배, 코드 작성 시 2.0배, 생각 모드에서 약 1.6배 빨라짐. 대략 8명 이상 동시 접속하면 쓸모없음.
벤치마크 (비교 모델 포함 전부 같은 환경에서 우리가 직접 돌림. 전체 표랑 각주는 모델 카드에 있음)
-
LiveCodeBench v6 (+4.2), HumanEval (+4.3), AIME 2025 (+2.9), MATH-500 (+1.6)에서 Qwen3.8-27B보다 앞섬


