FlashMemory-DeepSeek-V4: Lookahead Sparse Attention을 통한 초장문 컨텍스트 인덱싱
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
핵심 요약
DeepSeek-V4 기반의 Lookahead Sparse Attention으로 KV 캐시 메모리 사용량을 90% 이상 절감한 기술 보고서입니다.
- Lookahead Sparse Attention — 미래 컨텍스트 수요를 예측하여 중요 KV 청크만 GPU 메모리에 유지함
- 효율적인 메모리 관리 — 500K 컨텍스트에서 KV 캐시 오버헤드를 90% 이상 억제함
- 성능 유지 및 향상 — 전체 컨텍스트 대비 13.5% 수준의 메모리만 사용하면서도 정확도는 오히려 소폭 상승함
- 독립적 학습 전략 — 거대 모델을 GPU에 올리지 않고도 표준 검색 학습 프레임워크로 인덱서 학습 가능
기존 LLM은 디코딩 과정에서 전체 KV 캐시를 로드 상태로 유지하기 때문에, 초장문 컨텍스트를 처리할 때 심각한 GPU 메모리 병목 현상이 발생합니다. 본 보고서에서는 DeepSeek-V4 아키텍처를 기반으로 구축된 신경 메모리 인덱서(Neural Memory Indexer)를 활용한 새로운 추론 패러다임인 Lookahead Sparse Attention(LSA)을 제안합니다. LSA는 과거의 모든 토큰을 수동적으로 참조하는 대신, 미래의 컨텍스트 수요를 사전에 예측하여 쿼리에 결정적인 KV 청크만 GPU 메모리에 보존합니다. 중요한 점은, 이 아키텍처를 백본이 필요 없는 분리형 학습 전략으로 구현했다는 것입니다. 인덱서를 표준 듀얼 인코더 아키텍처로 구성함으로써, 거대한 백본 모델을 GPU 메모리에 올릴 필요 없이 표준 검색 학습 프레임워크를 사용하여 독립적으로 학습시킵니다.
우리는 이 "less is more" 패러다임이 장기적인 글로벌 메모리에 의존하는 작업에서 효과적인 어텐션 노이즈 제거기 역할을 수행함과 동시에 서빙 효율성을 극대화함을 입증했습니다. 주요 장문 컨텍스트 평가 제품군(예: LongBench-v2, LongMemEval, RULER) 전반에서 FM-DS-V4는 물리적 KV 캐시 점유율을 전체 컨텍스트 기준의 13.5% 수준으로 압축하면서도, 다운스트림 정확도를 일관되게 유지하거나 소폭 향상(평균 +0.6% 절대 마진)시켰습니다. 특히 500K라는 극한의 규모에서 FlashMemory는 백본의 핵심 추론 능력을 저하시키지 않으면서 물리적 KV 캐시 오버헤드를 90% 이상 억제했습니다.


