24GB VRAM에서 17GB 모델로 1M 컨텍스트 구현: "처음으로 거의 1M 토큰의 컨텍스트를 로드하고 텍스트 곳곳에서 7개의 바늘을 추출할 수 있었다"
1M context with 17 GB model in 24 GB VRAM: "for the first time I was able to load a context of almost 1M tokens and extract 7 needles from various parts of the text"
핵심 요약
24GB VRAM 환경에서 KVarN 양자화를 활용해 1M 토큰 컨텍스트를 성공적으로 구동한 사례를 공유합니다.
- BeeLlama.cpp 활용 — KVarN 4비트 양자화를 통해 1M 컨텍스트를 단일 RTX 3090에서 구동함.
- KVarN 기술 — 화웨이에서 개발한 분산 정규화 KV 캐시 양자화로 기존 방식보다 정밀도가 높음.
- 성능 검증 — 1M 토큰 컨텍스트에서 7개의 니들(needle)을 정확히 추출하며 안정성을 입증함.
- AMD GPU 이슈 — 일부 사용자가 ROCm 환경에서 VRAM 누수 문제를 보고하며 해결책을 모색 중임.
매우 흥미로운 사용자 보고를 공유하고 싶습니다. manu69x라는 흥미로운 이름을 가진 분이 단일 RTX 3090에서 1M 컨텍스트를 구동하는 데 성공했습니다. 사용된 모델은 Qwen 3.5 35B A3B 기반으로, 모델만 17GB의 VRAM을 차지했습니다. 여기서 "구동"했다는 것은 단순히 "서버가 죽지 않았다"는 뜻이 아니라, 컨텍스트가 엉망이 되지 않아 텍스트 곳곳에 배치된 7개의 바늘을 추출할 수 있었다는 의미입니다.
이들은 제 BeeLlama.cpp 포크의 v0.4.3 프리뷰 빌드를 사용하여 K와 V 모두에 KVarN 4비트를 적용했습니다. KVarN은 화웨이의 분산 정규화 KV 캐시 양자화 기술로, 원본 논문과 제 KLD 벤치마크 모두에서 표준 양자화보다 더 나은 정밀도를 보여줍니다.
솔직히 누군가 한계를 밀어붙이는 모습을 보는 건 정말 멋진 일입니다. 그들의 표현으로 보아 q4 양자화로는 같은 결과를 낼 수 없었던 것 같으니, KVarN이 실제로 더 나은 정밀도를 보여주며 저비트 KV 캐시 양자화에 대한 기대를 바꿔놓고 있는 것 같습니다.

