RTX 5000 PRO (48GB)를 구매했는데 기대 이상이네요.
The RTX 5000 PRO (48GB) arrived and it is better than I expected.
핵심 요약
RTX 5000 Pro를 구매해 LLM 환경을 구축한 사용자가 압도적인 프리필 성능과 전력 효율에 매우 만족한다는 후기입니다.
- 성능 만족도 — 27B 모델 FP8 및 200k 컨텍스트 처리에 최적화된 성능을 보여줌.
- 가성비 분석 — RTX 5090 대비 비싸지만 RTX 6000보다는 훨씬 저렴하여 합리적인 선택임.
- 전력 및 소음 — 서버급 성능을 유지하면서도 전력 소모와 소음이 매우 적음.
- 설치 경험 — 초보자도 LLM의 도움을 받아 리눅스 환경과 vLLM을 성공적으로 구축함.
며칠 전에 이 GPU 구매 관련해서 글을 올렸었습니다: https://www.reddit.com/r/LocalLLaMA/comments/1t2slmw/first_time_gpu_buyer_got_a_rtx_5000_pro_was_it_a/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button
구매 버튼을 누르기 전에는 Mac Studio 쪽으로 마음이 기울었었습니다. 하지만 읽어본 프롬프트 처리 속도 때문에 망설여졌죠. 예산은 5000~6000달러였는데, 256GB 모델은 예산 밖이었습니다.
결국 도박하는 셈 치고 RTX 5000 Pro를 샀습니다. PC 조립 경험도 없고 어떤 부품을 사야 하는지도 전혀 모르는 상태였지만, 좋은 거래였습니다. 세금을 포함해 GPU 가격으로 4300달러를 지불했고(댓글에 4700이라고 썼던 건 영수증 확인해보니 착각이었습니다), 나머지 부품까지 다 합쳐서 64GB RAM 구성으로 총 5600달러가 들었습니다.
완전 초보인 저에게 조립은 쉽지 않았지만, 다행히 LLM이 가이드를 잘 해줬습니다. 그다음엔 리눅스와 vLLM이 문제였는데... 솔직히 완전히 길을 잃었었습니다. Claude Code가 없었다면 불가능했을 겁니다. Qwen3.6-27B-FP8을 풀 정밀도 캐시로 돌리기 위한 설정도 문제였는데, 다행히 어떤 분이 Claude에게 무엇을 해야 할지 알려주는 데 필요한 모든 정보를 공유해주셨습니다: https://www.reddit.com/r/LocalLLaMA/comments/1t46klu/qwen36_27b_fp8_runs_with_200k_tokens_of_bf16_kv/
Claude Code Max 주간 사용량의 50%를 태워가며 설정한 끝에 이제는 잘 작동하고, 정말 옳은 선택이었다고 말하고 싶습니다. 이 녀석 끝내주네요.
TG(Token Generation) 속도는 최대 80 t/s(매우 큰 프롬프트의 경우 50~60 t/s 정도)가 나오는데 경이로운 수준입니다. 하지만 무엇보다 중요한 건 PP(Prefill) 속도가 초당 4400 토큰이나 나온다는 점입니다!
풀 정밀도 캐시는 200k 토큰까지만 들어가지만, 저에겐 충분합니다.
솔직히 왜 사람들이 이 GPU에 대해 더 많이 이야기하지 않는지 모르겠습니다. RTX 5090보다 겨우 1000달러 더 비싼데, 27B 모델을 8FP로 돌릴 수 있고 200k 컨텍스트를 풀 정밀도로 처리할 수 있습니다. 전력 소모도 절반 수준이고요. 물론 성능은 약간 떨어지지만, 제가 얻고 있는 수치는 기대 이상입니다. RTX 5090 두 개를 쓰면 확실히 이기겠지만, 훨씬 비싸고 엄청나게 시끄러울 것이며 전기 요금 폭탄을 맞았을 겁니다.


