대역폭이 전부가 아니기에, 여기에서 주로 사용되는 주요 GPU/머신들의 모든 사양을 비교해 봤습니다. 다들 현실을 좀 직시할 필요가 있어요.
I compared all specs of the major GPUs/machines that are being used here, because bandwidth is not everything. Some of ya'll need a reality check.
핵심 요약
대역폭 외의 성능 지표를 고려하여 주요 GPU 및 머신들의 가성비를 비교 분석한 글입니다.
- GPU 사양 비교 — 대역폭뿐만 아니라 TFLOPS, VRAM, 전력 효율 등을 종합적으로 분석함
- 가성비 평가 — RTX 4060 Ti부터 고가 워크스테이션까지 가격 대비 성능을 수치화함
- 현실적인 조언 — Mac의 비효율성을 지적하고 LLM 입문용으로 P100 등 가성비 카드를 추천함
- 생산성 강조 — 단순 챗봇용이 아닌 실제 연구 및 실험을 위한 프리필 성능의 중요성을 역설함
설명: 이 게시물은 신규 회원/구매자들에게 구형 및 신형 Mac을 추천하는 관행을 바로잡기 위한 것이지, 현재 사용 중인 머신으로도 충분한 분들을 비하하려는 의도는 아닙니다.
수정: 아, 여러분 Pro 6k도 있다는 거 알아요. 아래에 표를 확장했습니다:
| Device | Price used | FP16 TFLOPS | VRAM | Bandwidth | $/TFLOP | $/GB | Power | W/TFLOP |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| RTX PRO 6000 Blackwell Max-Q WS* | ~$8,000 | ~380 | 96GB | 1792 GB/s | ~$21.1 | $83.3 | 300W | 0.79 |
| RTX PRO 6000 Blackwell WS* | $7,000 | ~460–500 | 96GB | 1792 GB/s | ~$14–15 | $72.9 | 600W | ~1.2–1.3 |
| Intel Arc Pro B70* | $949 | ~183.5 | 32GB | 608 GB/s | $5.2 | $29.7 | 290W | 1.58 |
| Radeon Instinct MI50 32GB | ~$535–560 used eBay | 26.5 | 32GB | 1000 GB/s | ~$20.2–21.1 | ~$16.7–17.5 | 300W | 11.32 |
| Radeon AI PRO R9700* | $1,299 | 191.0 | 32GB | 640 GB/s | $6.8 | $40.6 | 300W | 1.57 |
| RTX 4060 Ti 16GB* | $400 | ~88.3 | 16GB | 288 GB/s | $4.5 | $25.0 | 165W | 1.87 |
| RTX 5060 Ti 16GB* | ~$550 | ~94.9 | 16GB | 448 GB/s | ~$5.8 | ~$34.4 | 180W | 1.90 |
| RTX 5070 Ti 16GB* | $1,000 | ~175.8 | 16GB | 896 GB/s | $5.7 | $62.5 | 300W | 1.71 |
- 다시 말하지만, FP16/BF16 이하 정밀도를 지원하고 이를 사용했을 때 2~4배 더 빠른 GPU들입니다.
주관적인 의견:
- Mac Studio는 오버프라이스된 라즈베리 파이 같고, 사람들이 생각하는 것보다 훨씬 비효율적입니다(대부분의 Mac이 그렇습니다). M5 MBP는 "텐서" 행렬 MMA 덕분에 더 낫긴 하지만, 가성비 측면에서 그렇게까지 좋은 건 아닙니다.
- Spark는 3~4천 달러대일 땐 괜찮았습니다. Strix가 지금은 훨씬 낫죠.
- 3090은 단일 스트림 용도로는 완전히 과잉 스펙입니다. 저렴하게 구할 수 있다면 V100이 훨씬 가성비가 좋습니다. P40은 매우 니치하지만, 정확히 48GB VRAM이 필요하고 MoE를 돌리는데 MI50이나 V100을 살 돈이 없다면 괜찮은 선택입니다.
- P100은 저평가된 입문용 LLM GPU인데 충분히 언급되지 않고 있습니다. 200달러(듀얼 GPU)로 700GB/s 대역폭의 32GB 메모리와 M3 Ultra급 연산 성능을 얻는 건 미친 수준이죠.


