RTX Pro 4500 Blackwell 성능 수치
RTX Pro 4500 Blackwell Performance Numbers
핵심 요약
RTX Pro 4500 Blackwell 32GB로 업그레이드한 후 RTX 5060 Ti와 비교한 성능 벤치마크를 공유합니다.
- 성능 비교 — RTX 5060 Ti 대비 32GB VRAM의 이점과 벤치마크 수치 제시
- 양자화 분석 — NVFP4와 MXFP4의 효율성 및 최적화된 양자화의 중요성 강조
- 전력 효율 — 5090 대비 낮은 전력 소모와 로컬 AI 환경에서의 적합성 논의
- 벤치마크 환경 — Llama.cpp b9007/b9234를 활용한 다양한 모델 테스트 결과
RTX Pro 4500 Blackwell
약 한 달 전, 저는 레딧의 훌륭한 분들께 다음 AI 서버를 어디로 업그레이드해야 할지 조언을 구했습니다.
AMD Ryzen 7 7700 CPU, Corsair Vengeance RGB DDR5 5600MHz 32GB (2x16), RTX 5060 Ti 16GB
처음에는 더 큰 MoE 모델을 돌리기 위해 시스템 RAM을 96GB로 업그레이드할까 고민했지만, 피드백은 "무조건 VRAM이 깡패"라는 의견이 지배적이었습니다. 솔직히 말해서 100B 범위의 모델 크기에서는 별다른 일이 일어나지 않기도 하고요.
그래서 GPU를 업그레이드하기로 결정했습니다. RTX Pro 4500 Blackwell 32GB로의 업그레이드는 확실히 옳은 선택이었습니다. 더 큰 컨텍스트와 KV 양자화 없이 모델 전체를 VRAM에 올릴 수 있다는 건 훨씬 더 쾌적한 경험이니까요.
이 카드는 전문적인 용도로 만들어진 탄탄한 제품인데, 레딧에서 이 카드에 대한 수치를 많이 보지 못했습니다. 그래서 이 카드에 관심이 있을 분들을 위해 성능 수치를 공유하고자 합니다.
RTX 5060 Ti 16GB vs RTX Pro 4500 Blackwell 32GB
저는 RTX 5060 Ti 16GB GPU에서 RTX Pro 4500 Blackwell 32GB GPU로 넘어가는 상황이라, 주로 이 둘을 비교할 것입니다.
사양을 비교해보면, RTX Pro 4500 32GB는 RTX 5060 Ti 16GB보다 약 2배 빠릅니다. 16GB VRAM 안에 들어가는 밀집(dense) 모델을 비교할 때도 프롬프트 처리 속도는 거의 2배 빠르고, 토큰 생성 속도는 약 1.6~1.8배 빠릅니다.
16GB VRAM에 들어가지 않는 MoE 모델에서는 차이가 더 큽니다. 이제 모델 전체가 32GB VRAM에 완전히 들어가기 때문에 토큰 생성을 위해 시스템 RAM에 접근할 필요가 없어 추가적인 성능 향상이 있습니다. 프롬프트 처리는 3~6배, 토큰 생성은 1.8~2.6배 더 빠릅니다.
이 성능 수치들은 두 GPU 모두 동일한 모델과 양자화를 사용한 결과입니다.
Model Size (GB) 5060Ti (pp512) 5060Ti (tg128) Pro 4500 Blackwell (pp512) Pro 4500 Blackwell (tg128) PP TG
qwen36 27B IQ4_XS 14.37 997.28 ± 14.35 25.13 ± 0.01 2022.54 ± 35.19 45.19 ± 0.50 2x 1.8x
qwen36 35B.A3B MXFP4 20.21 926.47 ± 88.11 70.94 ± 1.31 5507.10 ± 101.16 159.81 ± 1.10 5.95x 2.25x
gemma4 26B.A4B MXFP4 15.47 1307.35 ± 37.64 56.82 ± 0.26 7177.80 ± 103.91 144.74 ± 0.60 5.49x 2.55x
ernie45 21B.A3B MXFP4 11.52 5214.56 ± 8.01 130.61 ± 2.05 10051.74 ± 174.12 214.73 ± 0.81 1.93x 1.64x
Nemotron Cascade 2 30B.A3B MXFP4 18.65 1470.95 ± 14.16 63.22 ± 0.64 6709.37 ± 68.03 147.07 ± 2.46 4.56x 2.33x
Tesselate OmniCoder 9B Q8 8.86 3287.54 ± 44.43 45.68 ± 0.17 6288.52 ± 166.39 83.98 ± 0.35 1.91x 1.84
qwen35 4B Q4_K 2.70 4802.47 ± 217.58 107.94 ± 1.46 9113.67 ± 692.41 180.27 ± 0.14 1.90x 1.67x
qwen35 9B UD Q4_K_XL 5.55 3115.93 ± 93.61 68.33 ± 0.34 5990.62 ± 255.66 119.69 ± 1.61 1.92x 1.75x
GLM 4.7 Flash MXFP4 15.79 2063.49 ± 28.97 81.43 ± 1.23 6520.56 ± 120.91 149.59 ± 0.61 3.16x 1.84x
모든 테스트는 Llama.cpp b9007을 사용했고, 짧은 컨텍스트에서 llama bench를 사용한 "행복한" 수치입니다. 모델 양자화는 주로 가능한 경우 Unsloth를 사용했습니다. 예시는 다음과 같습니다.
./llama-bench -m /.../unsloth_Qwen3.6-27B-IQ4_XS.gguf -t 8 -p 512 -b 512 -ub 512 --flash-attn 1 -fitt 1024
./llama-bench -m /.../unsloth_Qwen3.6-35B-A3B-MXFP4_MOE.gguf -t 8 -p 512 -ub 512 -b 512 --flash-attn 1

