R9V 업데이트: Qwen3.8 Flash Next를 위한 Deepseek V4.1 Flash + HySparse2/MiMo-V3 기반 KVA 프로젝터 적용
R9V Update: Created and adopted KVA projections based on Deepseek V4.1 Flash + HySparse2/MiMo-V3 for Qwen3.8 Flash Next. This is a game changer for models that don't natively implement it. 1.45-1.85x speedup in prefill to 3k+ at a small deficit to perplexity. [2x R9700, 128GB DDR5]
핵심 요약
Qwen3.8 Flash Next 모델의 추론 속도를 획기적으로 높이는 새로운 KVA 프로젝터 구현 및 배포 소식입니다.
- 추론 속도 향상 — 레이어별 KVA 프로젝터 적용으로 Prefill 속도를 최대 1.85배 가속함
- 기술적 차별점 — Tikhonov 정규화와 Ridge 회귀를 사용하여 정확도를 높이고 유연한 레이어 선택 지원
- 하드웨어 요구사항 — 2x R9700 및 128GB DDR5 RAM 환경에 최적화되어 있으며 약 50GB의 RAM 사용
- 오픈 소스 공유 — HuggingFace를 통해 V1/V2 프로젝터와 모델을 공개하고 커뮤니티 협업 독려
github.com
원문 사이트로 이동
QFN 모델에 적용한 KVA 프로젝터 첫 번째 구현 버전이다 (일단 검열 없는 모델만 올림).
각 레이어별로 프로젝터를 썼을 때 나오는 핵심 결과는 대충 이렇다:
12 레이어부터 시작하면 프롬프트 처리 속도가 1.85배 빨라짐 [1700 t/s -> 3150 t/s]. 대신 퍼플렉시티(perplexity)가 총 +8% 증가함.
16 레이어부터는 1.7배 빨라짐 [1700 t/s -> 2900 t/s]. 대신 퍼플렉시티가 총 +5% 증가함.
24 레이어부터는 1.45배 빨라짐 [1700 t/s -> 2500 t/s]. 대신 퍼플렉시티가 총 +2.6% 증가함.
이 방식이 내가 본 다른 KVA 프로젝터들이랑 다른 점은 다음과 같다:
내 방식은 레이어당 전체 맵 하나를 쓰면서 Tikhonov regularization/ridge regression을 사용한다. 반면에 다른 방식들은 4개 스트림에 적용되는 레이어별 학습 보정 헤드를 쓴 다음 평균을 내는 식이다. 내 방식은 VRAM을 좀 더 먹긴 하지만(다른 건 400MB 정도인데 내 건 1.5GB쯤 됨) 정확도가 더 높고 퍼플렉시티도 덜 오른다. 다른 방식들은 나중 레이어의 키, 값, 입력을 직접 예측하는데, 내 방식은 나중 레이어의 입력값만 딱 예측하고 키/값 계산은 모델의 실제 가중치에 맡긴다. 마지막으로, 내가 본 다른 방식들은 어느 레이어부터 적용할지 정할 수 없는데(보통 24로 고정된 듯), 내 방식은 가변적이라서 퍼플렉시티 증가를 감수하고 속도를 얼마나 올릴지 본인이 직접 정할 수 있다.
초기 결과만 봐도 이 아이디어가 확장 가능성이 엄청나고 아주 유용해질 거라 확신한다. 좀 쉽게 말하자면, tg(text generation)가 아니라 pp(prompt processing)를 위한 MTP 같은 건데, 무손실은 아니다. 모델이 오차를 그대로 받아들이거든. DSV4.1이나 MiMo v3 같은 모델들은 애초에 이런 구현 방식이랑 같이 학습됐을 가능성이 높아서, 퍼플렉시티 증가를 이미 어느 정도 견딜 수 있을 거다. 반면에 QFN처럼 이런 거랑 같이 학습 안 된 모델들은 오차가 생길 때마다 퍼플렉시티가 계속 오를 거다.
BetterBench 결과 요약은 아래와 같다.
| Metric | Result | Detail |
|---|---|---|
| Prefill | 3,600 t/s | @ 64k tok |
| Decode | 74.7 t/s | Weighted combined |
| Concurrent | 70.3 t/s | @ 8 streams (48/48 ok) |
| TTFT (P50) | 338 ms | Single stream |
| Update (P99) | 51.5 ms | Stream stutter |
근데 이게 끝이 아니다! 두 번째 구현 버전도 있다.
HySparse2 논문을 보니까 걔네도 비슷한 방식을 쓰는데, 단일 레이어가 아니라 멀티 레이어로 하더라. 그래서 나도 초기 버전을 만들어 봤다. 예비 결과는 다음과 같다:
멀티 레이어 - 퍼플렉시티 +2%만 늘어나고 속도는 1.55배 빨라짐
이걸 쓰면 퍼플렉시티 증가율 1% 미만으로 전체 속도 1.5배 향상은 충분히 가능하다고 본다. 다른 엔진이나 모델에 적용해 보고 싶은 사람들은 참고해라. 학습을 더 시키는 건 거의 의미가 없더라. 내 생각엔 순수하게 아키텍처 레벨에서 건드려야 할 문제다. 지금은 아주 초기 테스트 단계다. R9V가 이 기능을 업데이트 중이고 프로젝터는 HF에 올라갈 건데, 아직 안정성은 보장 못 한다. KVA 프로젝터 V1은 안정적이다. V2 프로젝터는 설정 플래그(--ced quality) 뒤에 숨겨놨으니 원하면 골라서 써라.

