48GB VRAM + Qwen 3.6 27B 최적 설정 공유
Best Settings for 48GB VRAM + Qwen 3.6 27B
핵심 요약
RTX 4090과 3090 조합에서 Qwen 27B 모델을 구동하기 위한 llama.cpp 최적화 설정과 성능 공유.
- 하드웨어 구성 — RTX 4090과 3090을 조합한 48GB VRAM 환경
- llama.cpp 설정 — 250k 컨텍스트와 MTP 추론을 활용한 최적화
- 성능 지표 — 75-100t/s의 토큰 생성 속도 달성
- 사용자 피드백 — 병렬 요청 시 성능 저하 문제와 벤치마크 스크립트 논의
여러분, RTX 4090 + RTX 3090 조합(총 48GB VRAM)에서 llama.cpp의 tensor split을 사용해 Qwen3.6 27B (Q8_0)를 돌리고 있는데, 지금까지 제가 써본 설정 중 가장 잘 작동하는 걸 공유하려고 합니다. 더 좋은 설정 아시는 분 계신가요?
하드웨어: RTX 4090 (24GB) + RTX 3090 (24GB), 총 48GB VRAM
OS: Arch Linux (디스플레이 출력용으로 내장 그래픽 사용)
설정:
- Quant: Q8_0
- Split mode: tensor
- Layers on GPU: -ngl 999
- Context: 250k (-c 250000)
- Speculative decoding: --spec-type draft-mtp --spec-draft-n-max 4
- parallel requests: -np 3
- Unified KV cache: -kvu
- Chat template: --chat-template-kwargs '{"preserve_thinking": true}'
- Flags: --no-mmap -fa on --jinja -fit off --no-op-offload
- Vision: mmproj-F16 with --no-mmproj-offload
이렇게 하니 75-100t/s의 생성 속도와 1500 pp, 250k 비양자화 컨텍스트 + 비전 + MTP 성능이 나옵니다.


