RTX 3060에서 Qwen 3.8 27B IQ3 XXS 모델 구동하기
Running qwen 3.8 27B iq3 xxs on RTX 3060.
핵심 요약
RTX 3060 12GB 환경에서 Qwen 27B 모델을 10~20 tps 속도로 구동하는 설정과 성능을 공유합니다.
- 성능 공유 — RTX 3060에서 27B 모델 구동 시 10~20 tps 속도 확인됨
- 상세 설정 — llama.cpp를 활용한 구체적인 파라미터 및 오프로드 설정 공유
- 모델 추천 — 3060 환경에서 더 나은 성능을 위한 모델 대안 논의
- 기술적 논쟁 — KV 캐시 양자화 방식 및 프롬프트 처리 속도에 대한 의견 교환
대충 10 - 20 tps 정도 나오네.
Thinking은 껐고. 4분에서 7분 정도 걸림.
"IQ3_S - 3.4375 bpw"로 돌리는 중.
37.03.960.932 I slot print_timing: id 0 | task 2665 | prompt processing, n_tokens = 12516, progress = 0.98, t = 37.08 s / 337.55 tokens per second
37.04.777.411 I slot print_timing: id 0 | task 2665 | prompt processing, n_tokens = 12768, progress = 1.00, t = 37.78 s / 337.94 tokens per second
37.13.746.606 I slot print_timing: id 0 | task 2665 | n_gen = 100, tg = 11.34 t/s, tg_3s = 11.45 t/s
37.16.955.263 I slot print_timing: id 0 | task 2665 | n_gen = 140, tg = 11.64 t/s, tg_3s = 12.47 t/s
37.20.166.770 I slot print_timing: id 0 | task 2665 | n_gen = 180, tg = 11.81 t/s, tg_3s = 12.46 t/s
37.23.366.284 I slot print_timing: id 0 | task 2665 | prompt eval time = 38241.22 ms / 12772 tokens ( 2.99 ms per token, 333.99 tokens per second)
37.23.366.290 I slot print_timing: id 0 | task 2665 | eval time = 18350.47 ms / 211 tokens ( 87.38 ms per token, 11.44 tokens per second)
37.23.366.291 I slot print_timing: id 0 | task 2665 | total time = 56591.69 ms / 12983 tokens
37.23.366.292 I slot print_timing: id 0 | task 2665 | graphs reused = 2342
37.23.366.296 I slot print_timing: id 0 | task 2665 | draft acceptance = 0.41250 ( 132 accepted / 320 generated), mean len = 2.65
37.23.366.758 I slot release: id 0 | task 2665 | stop processing: n_tokens = 12984, truncated = 0
내가 돌린 설정은 이거임.
~/sandbox/dcfr/third_party/llama.cpp/build-cuda/bin main* ❯ export LLAMA_GDN_TRANSACTIONAL_REPLAY=1 export GGML_OP_OFFLOAD_MIN_BATCH=2


