Qwen 3.6 27B 24GB VRAM 환경 설정: 백엔드 비교, 양자화 선택 및 설정 (llama.cpp, ik_llama.cpp, BeeLlama, vllm)
Qwen 3.6 27B on 24GB VRAM setup: backend comparisons, quant choice and settings (llama.cpp, ik_llama.cpp, BeeLlama, vllm)
핵심 요약
RTX 3090 24GB 환경에서 Qwen 3.6 27B 모델 구동 시 최적의 성능을 내는 백엔드와 설정값을 공유합니다.
- 최적의 백엔드 — ik_llama.cpp가 가장 뛰어난 프리필 및 디코드 성능과 VRAM 효율을 보여줌.
- 양자화 선택 — IQ4_KS가 품질 저하 없이 VRAM을 효율적으로 사용하여 고컨텍스트 처리에 유리함.
- 설정 최적화 — 156k 컨텍스트와 q8_0 KV 캐시를 활용하여 24GB VRAM 환경에서 안정적인 구동 가능.
- 성능 비교 — 다양한 백엔드 테스트 결과, ik_llama.cpp가 실제 워크로드에서 가장 우수한 속도를 기록함.
요약
- RTX 3090 24GB에서 테스트한 최고의 설정:
ik_llama.cpp+Qwen3.6-27B-MTP-IQ4_KS.gguf 156k컨텍스트,q8_0/q8_0KV, MTP, CPU 비전 처리~5.9k프롬프트 +1k출력 벤치마크 결과: 프리필 약1261 tok/s, 디코드72.9 tok/sllama.cpp는 좋은 시작점이었고 BeeLlama도 테스트해 볼 가치가 있지만,ik_llama.cpp가 가장 뛰어난 성능을 보임
테스트 항목
- 업스트림
llama.cpp: 쉬운 기준점이자 시작하기 좋은 곳 beellama.cpp: 이론상 유망하지만, 내 환경에서는 기대했던 속도를 재현할 수 없었음ik_llama.cpp: 최고의 디코드/프리필 성능, 최고의 VRAM 최적화
vLLM / club-3090도 시간을 들여 테스트했지만, 이번 배치에서 깔끔한 비교 데이터를 완성하지 못해 표에서는 제외했습니다. 응답 속도는 약 78 tok/s였으나, 고컨텍스트에서 발생하는 OOM 문제가 너무 불안정해서 수정될 때까지 보류했습니다. 최근에는 테스트하지 않았지만, 저장소에서는 여전히 단일 카드 고컨텍스트 이슈가 해결되지 않은 것으로 표시되어 있습니다.
벤치마크
원샷 챗 컴플리션 작업:
- 프롬프트 크기: 약
5.9k토큰 - 출력 크기:
1024토큰 - 작업 형태: 로컬 설정 파일에 대한 코드 리뷰 / 마이그레이션 노트
따라서 이 테스트는 다음을 주로 평가합니다:
- 중간 규모 이상의 실제 프롬프트에서의 프리필 속도
- 지속적인
1k토큰 생성 시의 디코드 속도
즉, 이론상 최고 속도가 아닌 실제 환경에 가까운 수치입니다.
채택한 설정
기본값으로 유지한 프로필입니다:
- 백엔드:
ikawrakow/ik_llama.cpp - 현재 테스트 빌드:
4507 (c35189d8) - 모델:
ubergarm/Qwen3.6-27B-GGUF - 모델 파일:
Qwen3.6-27B-MTP-IQ4_KS.gguf
