400달러로 맞춘 Qwen 3.6-27B 환경: RTX 3060 듀얼 구성으로 30-50 t/s 달성
$400 Qwen 3.6-27B Setup - Dual RTX 3060 - 30-50 t/s
핵심 요약
400달러짜리 RTX 3060 듀얼 구성으로 Qwen 3.6-27B 모델에서 안정적인 30-50 t/s 성능을 구현한 테스트 후기.
- 가성비 구성 — 400달러 수준의 RTX 3060 듀얼 카드로 24GB VRAM 환경을 구축함.
- CUDA 안정성 — AMD 7900 XTX 대비 훨씬 안정적인 GPU 활용률과 일관된 성능을 보여줌.
- 성능 최적화 — MTP 설정과 텐서 병렬 처리를 통해 긴 컨텍스트에서도 준수한 속도를 유지함.
- 하드웨어 호환성 — 슬림한 3060 폼팩터 덕분에 일반적인 ATX/mATX 메인보드에 쉽게 장착 가능함.
이전에 7900 XTX를 샀는데 qwen3.6-27b는 잘 돌아가지만 제 취향은 아니었습니다. 연산 성능이 꽤 불안정하거든요. MTP를 쓰면 디코드 속도가 40-60 t/s까지 나오지만 프리필 속도가 너무 느립니다. ROCm이나 Vulkan을 써도 프리필 속도가 300t/s에서 500t/s 사이를 오가는데, 아주 긴 프롬프트를 써도 마찬가지였습니다.
RTX 3060 듀얼을 사용한 초저가 24GB 환경을 시도해보고 싶어서 근질거렸습니다. 며칠 전 합리적인 가격에 3060 하나를 더 구했습니다. 그래서 7900 XTX를 빼고 3060들을 설치한 뒤 테스트를 시작했습니다.
테스트 구성
- 테스트 플랫폼: i7 4770k + Gigabyte GA-Z87MX-D3H
- 10년 넘게 사용한 꽤 오래된 플랫폼입니다. 흥미롭게도 슬롯 두 개를 모두 사용할 때 PCIe 3.0 x16을 PCIe 3.0 x8 두 개로 나누어 SLI를 지원합니다. 최신 메인보드들은 이런 분할을 지원하지 않는 경우가 많지만, 많은 보드가 풀스피드 PCIe 5.0 x16 슬롯 하나와 PCIe 4.0 x4 슬롯 하나를 제공합니다. 아시다시피 PCIe 4.0 x4는 PCIe 3.0 x8과 동일합니다. 따라서 이 구형 플랫폼도 PCIe 병목 현상 측면에서는 최신 플랫폼과 대등합니다.
- 모니터는 iGPU를 사용하여 메인보드에 연결했습니다.
- OS: Kubuntu 24.04
- CUDA: 13.2
- 모델:
- unsloth/Qwen3.6-27B-MTP-GGUF
- unsloth/Qwen3.6-27B-GGUF
- 양자화: Qwen3.6-27B-Q4_K_S.gguf
- 소프트웨어: llama.cpp 5/25/2026 master, CUDA 지원으로 직접 컴파일 (공식 사전 컴파일된 Linux CUDA 바이너리는 다운로드 불가).
- 필수 설치:
sudo apt install nvidia-cuda-toolkit
- 필수 설치:
- 설정 (포스트 하단에 상세 설정):
- 텐서 병렬:
테스트 결과
2.16.262.271 I slot print_timing: id 0 | task 701 | prompt eval time = 3056.70 ms / 1394 tokens ( 2.19 ms per token, 456.05 tokens per second)
2.16.262.276 I slot print_timing: id 0 | task 701 | eval time = 22538.95 ms / 975 tokens ( 23.12 ms per token, 43.26 tokens per second)
2.16.262.277 I slot print_timing: id 0 | task 701 | total time = 25595.65 ms / 2369 tokens
2.16.262.291 I slot print_timing: id 0 | task 701 | graphs reused = 1016
2.16.262.292 I slot print_timing: id 0 | task 701 | draft acceptance = 0.77618 ( 593 accepted / 764 generated)
2.16.262.310 I statistics draft-mtp: #calls(b,g,a) = 10 1038 1038, #gen drafts = 1038, #acc drafts = 959, #gen tokens = 2076, #acc tokens = 1792, dur(b,g,a) = 0.018, 8380.839, 3.772 ms
2.16.263.267 I slot release: id 0 | task 701 | stop processing: n_tokens = 12343, truncated = 0

