Krasis 업데이트: Qwen3.6-35B-A3B (Q4) 읽기 속도, 1x 8GB 3070 모바일 노트북 (32GB RAM)
Krasis update: Qwen3.6-35B-A3B (Q4) at reading speed, 1x 8GB 3070 Mobile laptop (32GB RAM)
핵심 요약
VRAM 부족 환경에서 LLM을 효율적으로 구동하는 런타임 Krasis의 최신 업데이트 및 벤치마크 결과 공유.
- Rust 기반 실행 — Python GIL 제거로 성능 향상 및 핫패스 최적화 완료
- 하드웨어 지원 확대 — RTX 3000 시리즈 지원 및 메모리 오버헤드 감소
- KV 캐시 최적화 — 4비트 및 6비트 KV 캐시 구현으로 정확도 유지
- 향후 로드맵 — Gemma, MiniMax 모델 지원 및 비전 기능 구현 예정
개요
Krasis는 VRAM 용량을 초과하는 모델을 돌릴 수 있게 해주는 LLM 런타임이다. 시스템 RAM에서 VRAM으로 모델을 효율적으로 스트리밍하고, 프리필(prefill)과 디코드(decode)를 각각 별도의 아키텍처와 최적화된 유스케이스로 처리한다.
최신 결과 (v1.0 릴리즈)
- 1x Laptop RTX 3070 Mobile 8GB, (35B param, Q4) Qwen3.6-35B-A3B (HQQ4, k4v4) : 222 pp, 12.48 tg
- 1x RTX 5080 16GB, (35B param, Q4) Qwen3.6-35B-A3B (HQQ4, k4v4) : 3,743 pp, 60 tg
- 1x RTX A4500 20GB, (35B param, Q4) Qwen3.6-35B-A3B (HQQ6, k6v6) : 2,235 pp, 51 tg
- 1x RTX A4500 20GB, (80B param, Q4) Qwen3-Coder-Next, (HQQ6, k4v4) : 1,569 pp, 34.7 tg
- 1x RTX 5090 32GB, (35B param, Q4) Qwen3.6-35B-A3B (HQQ4, k4v4) : 10,030 pp, 124.9 tg
- 1x RTX 5090 32GB, (80B param, Q4) Qwen3-Coder-Next, (HQQ8, k4v4) : 6,111 pp, 88.6 tg
- 1x RTX 5090 32GB, (122B param, Q4) Qwen3.5-122B-A10B : (HQQ6, k4v4) : 4,880 pp, 25.2 tg
(벤치마크 참고: Krasis는 프리필과 디코드 벤치마크 수치를 뽑을 때 여러 프롬프트 길이를 테스트함. 이 수치들은 벤치마크 중 얻은 최고 처리량을 나타내며, 모든 프롬프트 길이에 대한 평균값이 아님. 일반적으로 런타임이 그렇듯, 프리필 처리량은 입력이 클수록 대체로 늘어나고 디코드는 출력이 클수록 줄어드는 경향이 있음.)
최신 업데이트
Krasis를 처음 공개한 지 벌써 두어 달이 지났다.
금방 끝날 줄 알았던 작업들이 생각보다 훨씬 오래 걸렸지만, 이제 Krasis는 더 많은 모델을 지원하기 위한 탄탄한 기반을 갖췄다고 본다.
가장 큰 변화들은 다음과 같다:
- 전체 Rust 실행: 이제 Krasis는 핫 패스(hot path)에서 파이썬을 전혀 돌리지 않는다. 파이썬 GIL 때문에 굳이 없어도 될 병목 현상이나 속도 저하가 자주 생기는 게 거슬렸거든. 초기 전처리 단계에는 여전히 파이썬을 쓰지만, 모델이 돌아갈 때는 100% Rust로 작동해서 훨씬 빠르다.
- 속도: 모델 구동 속도가 빨라졌다. 프리필에서 가장 큰 성능 향상이 있었고, 디코드 속도도 개선됐다.
- Ampere 지원: RTX 3000 시리즈 카드를 완벽하게 지원한다. 나도 A4500 20GB를 쓰고 있는데, Qwen3.6-35B-A3B나 Qwen3-Coder-Next(80B 파라미터)처럼 GPU에 다 안 들어가는 덩치 큰 모델들도 아주 잘 돌아간다.
- 메모리 개선: 이제 시스템 RAM에 양자화된 모델 용량의 2배를 확보할 필요가 없다. 1배에 약간의 오버헤드만 있으면 충분하다.
- 새로운 4비트 및 6비트 KV 캐시: 4비트와 6비트 KV 캐시 구현을 추가했다. 둘 다 BF16 대비 정확도 테스트를 빡세게 거쳤고 결과도 좋다. TurboQuant 기반이었던 Polar4는 정확도가 영 별로라 뺐다. (참고로 TurboQuant는 작업 점수 보존을 기준으로 정확도를 주장하는데, Krasis는 다양한 프롬프트에서 양자화 모델과 BF16/레퍼런스 모델 간의 출력 일치 길이, top-k 포함도, 퍼플렉서티, 분포 변화 등을 기준으로 정확도를 측정함). 새로운 KV 캐시는 FP8 명령어가 필요 없어서 Ampere 카드와도 완벽 호환된다.
- 4, 6, 8비트 Sensitivity Aware HQQ 어텐션: 더 이상 AWQ 어텐션을 쓰지 않는다. AWQ는 템플릿을 생성하려면 BF16으로 모델을 돌려야 하는데, 사용자들이 이걸 직접 하기엔 VRAM이 부족한 경우가 많아서 더 나은 대안이 필요했다. 이제 Krasis는 4, 6, 8비트 HQQ 어텐션을 돌리고 정밀도를 섞어서 더 높은 정확도를 뽑아낸다. HQQ 에셋은 모델을 수학적으로 분석해서 만들기 때문에 미리 만들어진 템플릿이 필요 없다. 분석하는 동안 Krasis는 모델의 어느 부분이 가장... (이하 생략)


