9070 XT에서 Qwen 27B Q3 추론 성능 관련 질문
9070xt inference for q3 qwen 27B
핵심 요약
9070 XT 환경에서 Qwen 27B Q3 모델의 추론 속도(12 tok/s) 최적화 및 설정 방법 논의.
- 추론 속도 최적화 — 9070 XT에서 12 tok/s가 정상인지 확인하고 더 높은 속도를 내기 위한 설정값 조정 논의함.
- 모델 선택 논쟁 — Qwen 27B Q3와 35B Q4 중 어떤 모델이 성능과 효율성 면에서 우수한지에 대한 의견 대립함.
- VRAM 및 백엔드 설정 — 16GB VRAM 활용을 위한 KV Cache 설정 및 Vulkan vs HIP 드라이버 안정성 문제 다룸.
- llama.cpp 플래그 최적화 — ubatch, threads, fa on 등 구체적인 실행 옵션 공유를 통해 성능 향상 방안 제시함.
llamacpp에서 12tok/s가 나오는데, 이 수치가 맞게 나오는 건가요? 그리고 이 수치를 높이기 위해 제가 할 수 있는 게 있을까요 (가능하다면)?
cd ~/llama.cpp && ./build/bin/llama-server
-m models/qwen-3.6-27b-abliterated-q3.gguf
-ngl 999
-c 65536 (이게 꼭 필요합니다, 줄이는 건 선택지에 없어요)
-np 1
-b 512
--ubatch-size 128
-fa on
--cache-type-k q4_0
--cache-type-v q4_0
--threads 6
--jinja
--no-warmup
--host 0.0.0.0
--port 8080


