Prefill-as-a-Service: 차세대 모델의 KV 캐시를 데이터센터 간에 공유할 수 있게 됨
Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
핵심 요약
Kimi/Moonshot이 데이터센터 간 KV 캐시 전송을 최적화하여 비용 절감과 성능 향상을 달성한 기술을 공개함.
- 기술적 돌파구 — Kimi Linear 모델을 통해 KV 캐시 크기를 줄여 데이터센터 간 전송 효율을 극대화함.
- 성능 개선 — 20배 규모의 모델에서 처리량 1.54배 증가 및 P90 TTFT 64% 감소를 검증함.
- 비용 절감 — Prefill과 Decode 과정을 분리하여 토큰당 비용을 획기적으로 낮춤.
^(그냥 공유해 봅니다. 로컬 모델에 적합하거나 유용한지는 잘 모르겠네요.)
^(Kimi/Moonshot에서 발표한 내용입니다.) ^(소스 트윗)
우리는 Prefill/Decode 분리를 단일 클러스터를 넘어 데이터센터 간 및 이기종 하드웨어 환경으로 확장하여, 토큰당 비용을 획기적으로 낮출 수 있는 잠재력을 열었습니다.
이는 이전까지 KV 캐시 전송 오버헤드 때문에 불가능했던 일입니다. 핵심 동력은 KV 캐시 크기를 줄여 데이터센터 간 PD(Prefill-Decode)를 실용적으로 만든 하이브리드 모델(Kimi Linear)입니다.
20배 규모로 확장된 Kimi Linear 모델에서 검증된 결과:
✅ 1.54× 처리량
✅ 64% ↓ P90 TTFT
→ 토큰당 비용 절감으로 직결됨.
더 자세한 내용은 Prefill-as-a-Service에서 확인하세요: arxiv.org/html/2604.15039v1

