2800달러짜리 8x Radeon Pro V620(256GB VRAM) 시스템 + 커스텀 vLLM 포크 = Qwen3.8-Flash-Next에서 60~100 t/s 디코드 및 3000+ t/s 프리필 달성
$2800 rig with 8x Radeon Pro V620 (256 GB VRAM) + custom vLLM fork = Qwen3.8-Flash-Next at 60 to 100 t/s decode and 3000+ t/s prefill
핵심 요약
Radeon Pro V620 8개를 활용한 가성비 고용량 VRAM 시스템을 구축하고 커스텀 vLLM으로 성능을 극대화했습니다.
- 시스템 구성 — Radeon Pro V620 8개와 커스텀 vLLM 포크를 사용하여 256GB VRAM 확보함
- 성능 최적화 — 기존 llama.cpp 대비 프리필 속도를 800% 향상시켜 3000+ t/s 달성함
- 하드웨어 세팅 — Supermicro 메인보드와 듀얼 Xeon Gold CPU를 사용하며 파이프라인 병렬 처리 적용함
- 전력 효율 — 추론 시 약 400W를 소비하며, 텐서 병렬 처리 시 최대 2000W까지 소모 가능함
글 제목이 좀 낚시 같긴 한데, 이제 개당 350달러에 구하는 건 무리일 거다. 그래도 이것저것 따져보면 여전히 꽤 싼 편임. 이건 Radeon Pro V620인데, 32GB VRAM 달린 구형 RDNA2 엔터프라이즈 클라우드 게이밍 카드임.
(옆에 있는 RTX 4090은 무시하셈. 걔는 그냥 이미지/비디오 생성 모델 돌릴 때 쓰는 거고 LLM용 아님)
암튼 몇 달 전에 푼돈으로 VRAM 빵빵하고 속도도 쓸만한 놈들로 구성할 수 있을까 싶어서 도박하는 셈 치고 이 카드들을 샀음.
llama.cpp로 한참 고생했는데, 프리필(prefill) 속도가 진짜 개판이었음(같은 모델로 평균 350~450 t/s 정도). vLLM은 아예 카드에서 돌아가지도 않았고. 게다가 llama.cpp는 동시성 처리 능력이 영 별로임.
내 용도에는 도저히 안 맞아서 최근에 카드들 다 팔아버릴까 생각 중이었는데, 혹시나 싶어서 (Claude한테) 이 카드들에서 돌아가면서 속도까지 잘 뽑아주는 vLLM 포크를 만들 수 있을지 테스트해 보기로 함. 커스텀 RDNA2 커널을 빌드하고 테스트하고 반복하게 시켰지.
문제 해결 완료! 예상보다 훨씬 잘 나옴. QFN으로 프리필 1000 t/s만 찍어도 감지덕지하겠다 싶었는데, llama.cpp보다 800%는 더 빨라진 듯.
결과물 보고 완전 대만족 중! GPU 팔려던 계획은 취소다 ㅋㅋ.
앞으로 계속 최적화 돌리면서 상황 지켜볼 생각임. DeepSeek랑 GLM-5.3-Flash도 잘 돌아가는지 확인해 봐야지.
아래는 llama-benchy 결과임. 동시성(concurrency) = 1, vLLM은 PP=4(텐서 병렬 처리 없음)로 설정했고, 내가 직접 양자화한 orcarouter의 검열 없는 QFN 모델을 썼음. 라우팅된 전문가(Routed experts)는 W4A16이고 나머지는 전부 BF16임. MTP 활성화했고 3 토큰 드래프팅 적용함.
MTP 끄면 디코드 속도 40~50 t/s 나옴.


