ik_llama.cpp용 Qwen-27B-IQ4_KS 양자화 모델 (16GB VRAM NVIDIA GPU 최적화)
Qwen-27B-IQ4_KS for ik_llama.cpp, especially for NVIDIA with 16GB VRAM
핵심 요약
16GB VRAM 환경에서 105k 컨텍스트를 지원하는 Qwen-27B 최적화 양자화 모델을 공유함.
- VRAM 최적화 — 16GB NVIDIA GPU에서 원활하게 작동하도록 14.1GB 크기로 양자화함.
- 컨텍스트 성능 — ik_llama.cpp와 Q4_0 캐시를 활용해 105k 컨텍스트 윈도우를 지원함.
- 성능 향상 — 이전 버전 대비 속도가 1.5~1.75배 빠르고 빈 출력 문제도 해결함.
- 하드웨어 제약 — 현재 NVIDIA CUDA 및 CPU 환경에서만 사용 가능하며 AMD/Apple Silicon은 미지원함.
안녕하세요 여러분,
16GB VRAM NVIDIA GPU를 염두에 두고 특별히 제작한 Qwen-27B 모델의 새로운 양자화 버전을 소개합니다. 아쉽게도 아직 메인 스트림 llama.cpp에는 없는 양자화 방식을 사용했습니다. ikawrakow가 개발한 KS 및 KSS 양자화 방식입니다. 여러 번의 시도 끝에 14.1GB 모델을 만들었고, 테스트 결과 기존의 14.7GB IQ4_XS 양자화 모델과 매우 유사한 성능을 보여줍니다.
모델 링크: cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF
ik_llama.cpp 프로젝트: ikawrakow/ik_llama.cpp
안타깝게도 이 모델을 실행하는 데 필요한 ik_llama.cpp 프로젝트는 NVIDIA CUDA 및 CPU 전용입니다. 현재 AMD나 Apple Silicon(Metal)에서는 실행할 방법이 없습니다 :/
이 모델을 ik_llama.cpp 및 Q4_0 Hadamard KV 캐시와 함께 사용하면 105k 컨텍스트 윈도우를 확보할 수 있습니다.
벤치마크 결과 및 실사용 소감
이 모델은 며칠 동안 일상적인 프로덕션 워크플로우에서 집중적으로 테스트되었습니다. 이전 버전보다 훨씬 빠르고(1.5배~1.75배) 안정적으로 작동하며, '빈 출력(blank outputs)' 문제가 완전히 해결되었고 검색-대체(search-replace) 기능도 완벽하게 작동합니다.
- Qwen 벤치마크: qwen3-6-27b-benchmark.vercel.app에서 성능 평가를 성공적으로 통과했습니다.
- Needle In A Haystack: 100k 컨텍스트 윈도우 전체에서 만족스러운 결과로 평가를 마쳤습니다.
- 비교: 직접 테스트해 본 결과, 이 모델은 이전 버전인
Qwen3.6-27B-i1-IQ4_XS-GGUF보다 약간 더 나은 성능을 보여줍니다.
퍼플렉서티(PPL) 테스트
주요 사용 사례인 KV 캐시 양자화 설정(q4_0)에 초점을 맞춰 퍼플렉서티 평가를 진행했습니다:
wget https://www.gutenberg.org/files/2600/2600-0.txt -O pg19.txt
./llama-perplexity -m Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KSS.gguf -f pg19.txt -c 65536 --chunks 32 -ngl 99 -khad -vhad -ctk q4_0 -ctv q4_0 -fa 1 -b 512 -ub 512
테스트 로그 출력:
perplexity: calculating perplexity over 12 chunks, n_ctx=65536, batch_size=512, n_seq=1
perplexity: 71.10 seconds per pass - ETA 14.22 minutes
[1]6.6897,[2]7.0032,[3]7.1989,[4]7.3327,[5]7.4816,[6]7.3770,[7]7.4325,[8]7.4378,[9]7.4754,[10]7.5192,[11]7.5669,[12]7.4040,
Final estimate: PPL over 12 chunks for n_ctx=65536 = 7.4040 +/- 0.02773


