2x R9700, 64GB DDR5로 구성한 vLLM Radiance / R9V 기반 Qwen 3.8 27b 및 Flash next 구동 머신
2x R9700, 64 GB DDR5 is an absolute beast machine with vLLM Radiance / R9V and Qwen 3.8 27b and Flash next
핵심 요약
RTX 5090보다 저렴한 비용으로 2개의 R9700을 활용해 고성능 로컬 LLM 추론 환경을 구축한 사례입니다.
- 가성비 구성 — RTX 5090 대비 1,000유로 이상 저렴하게 고성능 추론 머신 구축함
- 하드웨어 사양 — R9700 32GB 2개와 Ryzen 7500F, 64GB DDR5 조합으로 구성됨
- 벤치마크 결과 — Qwen 3.8 27B 모델에서 FP8 및 MXFP4 포맷으로 우수한 추론 성능 확인됨
- 향후 개선점 — 발열 제어를 위한 언더볼팅과 NVMe SSD를 통한 성능 최적화 예정임
올해 초에 Intel Arc B580이랑 32GB DDR5 램 쓰면서 로컬 LLM 좀 만져봤거든. 그러다 호기심을 못 참고 반년 전쯤에 첫 번째 R9700을 샀어. 4K 게이밍 환경도 업그레이드하고 싶었거든. 5090은 가격이 거의 3배라 나름 '가성비' 타협점을 찾은 셈이지. 지난 프라임 데이 때 X870E 메인보드를 정가보다 150유로 정도 싸게 건졌는데, 이걸로 게임이랑 로컬 추론용 머신을 제대로 맞춰보자는 생각이 들더라고.
어쨌든, 이번 주까지 해서 지금 내 세팅은 이래.
-
Ryzen 7500F
-
64 GB DDR5 CL40 6400 MT/s
-
Asus ProArt Creator X870E
-
2x R9700 32 GB, 각각 PCIe 5.0 x8로 구동 (Gigabyte)
-
현재는 예전 삼성 EVO 860 1TB 드라이브에 우분투 깔아서 쓰는 중인데, 이게 나중에 ngram / PLE 오프로드할 때 재밌어질 것 같아. 윈도우랑 게임 관련 파일은 Gen4 NVMe에 넣어뒀는데, 조만간 랜덤 읽기 속도 괜찮은 Gen 5 NVMe 하나 더 추가할 예정이야.
지금까지 딱 하나 문제라면 카드 하나가 좀 뜨겁다는 거? 그래서 210W로 전력 제한 걸고 언더볼팅 좀 살짝 해줄 생각이야. 다른 카드는 10~15도 정도 더 낮거든. 케이스는 퓨어베이스 501이고 팬 4개 달았어. 전면 흡기 2개, 후면이랑 상단 배기 각각 1개씩.
본론으로 들어가서, 하루 정도 만져본 Qwen 3.8 27b FP8이랑 MXFP4, 그리고 Qwen 3.8 flash next 결과 좀 공유할게. 진짜 흥미로웠던 건 Qwen 3.8 flash next 돌릴 때 SATA SSD가 생각보다 그렇게 구리진 않다는 거였어.
전체 빌드 비용이 4,000유로 정도인데, 32GB짜리 RTX 5090 하나 값보다 1,000유로 넘게 싸니까 가성비 면에서는 꽤 만족스러워. 다음 단계는 컨텍스트 저하랑 KV 양자화 테스트해보려고. 난 주로 딥 리서치, 요약, 이미지 생성, 간단한 코딩, 그리고 복잡한 데이터 분석용으로 로컬 추론을 돌리는 중이야.
다들 즐거운 컴퓨팅 해라.
Qwen3.8 benchmarks on 2× Radeon AI PRO R9700
Hardware: 2× AMD Radeon AI PRO R9700 32 GB, 61 GiB system RAM
Benchmark: BetterBench 0.2.2, corpus v1.0, single-stream, greedy decoding, 2 warm-ups + 10 measured runs per category, 8k benchmark context.
Model |Weight format |Runtime |Server context |Max sequences |Speculative decoding |Weighted decode median |ITL 1% low |TTFT p50 |Prefill ~2k |Prefill ~4k |Prefill ~7k
Qwen3.8-27B |Quark AWQ MXFP4 |vLLM Radiance, TP2 |131,072 |1 |MTP, up to 8 tokens |111.4 tok/s |77.9 tok/s |81 ms |4,224 tok/s |4,322 tok/s |4,410 tok/s
Qwen3.8-27B |Native block FP8 |vLLM Radiance, TP2 |16,384 |8 |MTP, up to 8 tokens |87.6 tok/s |61.9 tok/s |73 ms |4,134 tok/s |4,329 tok/s |4,305 tok/s
Qwen3.8-Flash-Next |UD-IQ4_XS GGUF |R9V/vLLM, TP2, tiered expert offload |131,072 |1 |MTP, 2 tokens, FP8 draft |35.4 tok/s |27.3 tok/s |290 ms |1,727 tok/s |1,986 tok/s |1,925 tok/s Notes

