RTX 5090 + 3090 Ti 조합으로 Qwen3.6-27B Q8 모델에서 100+ t/s 달성 — tensor split 모드로 전환하니 70에서 100+로 상승
100+ t/s on Qwen3.6-27B Q8 across a 5090 + 3090 Ti — switching to tensor split-mode got me from 70 to 100+
핵심 요약
RTX 5090과 3090 Ti를 조합해 tensor split 모드를 활용하여 Qwen3.6-27B 모델에서 100 t/s 이상의 추론 속도를 구현한 설정 공유.
- 성능 최적화 — tensor split 모드 적용으로 추론 속도 대폭 향상
- 하드웨어 구성 — RTX 5090과 3090 Ti를 조합한 멀티 GPU 환경
- 전력 소모 — 고부하 작업 시 750W 이상의 전력을 소비하는 발열 문제
- 설정 공유 — llama.cpp 서버 구동을 위한 상세 파라미터 및 환경 설정
제게 아주 잘 작동하고 있는 설정을 공유하고 싶습니다. RTX 5090과 RTX 3090 Ti 두 개의 GPU에서 Qwen3.6-27B Q8_0 모델을 실행 중이며 약 100 t/s의 속도가 나옵니다.
가장 큰 성능 향상은 --split-mode를 tensor로 바꿨을 때 나타났습니다. 그전에는 layer split 모드에서 70 t/s 정도였거든요. Tensor split은 전체 레이어를 이리저리 넘기는 대신 두 카드 모두가 동일한 텐서 작업을 처리하게 만드는데, 저처럼 성능 차이가 나는 GPU 조합에서는 확실히 차이가 컸습니다. 연산 능력에 맞춰 70/30 비율로 텐서를 분할(5090에 더 많은 비중)하여 사용 중입니다.
주의할 점: 부하가 걸리면 이 시스템은 제대로 된 온열기(space heater)가 됩니다. 디코딩 중에는 두 GPU 모두 쉴 새 없이 돌아가며 카드에서만 750W 이상의 전력을 끌어다 씁니다.
처리량은 프롬프트에 따라 다르며, 어떤 경우에는 최대 130 t/s까지 나옵니다.
전체 llama.cpp 서버 실행 명령어:
llama-server \
-m Qwen3.6-27B-Q8_0.gguf \
-fa 1 \
--n-gpu-layers 99 \
--tensor-split 70,30 \
--fit off \
--main-gpu 0 \
--split-mode tensor \
--no-mmap \
--mlock \
--cpu-range 0-23 \
--cpu-range-batch 0-7 \
--ctx-size 196608 \
--parallel 2 \
--kv-unified \
--jinja --no-warmup --threads 24 --numa isolate \
--batch-size 2048 --ubatch-size 2048 --threads-batch 8 \
--chat-template-kwargs '{"preserve_thinking": false}' \
-cms 24000 \
-ctxcp 5 \
--alias qwen.3.6-27b.q8 \
--spec-type draft-mtp --spec-draft-n-max 3 \
--reasoning-budget 12288 \
--reasoning-budget-message "Wrap up your reasoning and give the final answer." \
--host 0.0.0.0 --port 8080
설정에 대해 궁금한 점이 있으면 언제든 물어봐 주세요.
추신: 텐서 분할이 어떻게 작동하는지 이해하고 싶다면, llama.cpp 문서에서 더 많은 정보를 확인할 수 있습니다: https://github.com/ggml-org/llama.cpp/blob/master/docs/multi-gpu.md

