Strix Halo, RTX 3090, RTX 5070에서 동일 모델 벤치마크 직접 해봤습니다
Ran the same models across Strix Halo, RTX 3090, and RTX 5070 because I wanted my own numbers
핵심 요약
다양한 하드웨어에서 직접 AI 모델 추론 속도를 측정하고 비교한 결과입니다.
- 메모리 대역폭 — 디코드 성능을 결정짓는 핵심 요소로 작용함.
- 하드웨어 비교 — 3090과 5070, Strix Halo 간의 실제 추론 속도 차이를 확인함.
- 벤치마크 데이터 — 55번의 실행과 5가지 백엔드를 통해 얻은 상세한 수치를 공개함.
- 추론 최적화 — 양자화 수준과 추론 엔진 설정에 따른 성능 변화를 분석함.
모델들의 추론 속도에 대한 주장들을 계속 보게 되면서, 제가 가진 하드웨어로 직접 공정한 비교를 해보고 싶었습니다. 그래서 테스트 환경을 구축하고 모든 실행 결과를 YAML로 덤프하는 공개 페이지를 만들었습니다.
데이터셋: 55번의 실행, 3개의 장비, 5개의 백엔드(rocm, vulkan, cpu, cuda, vllm-cuda), 0.35B(LFM2.5)부터 35B-A3B(Qwen3.5 MoE)까지의 모델들. 워크로드: 짧은 프롬프트 채팅, 긴 컨텍스트 RAG, 코드 생성 긴 출력, 그리고 동시성 1 및 4에서의 에이전트 형태. 워밍업 1회 후 3회 반복 측정, 온도 0, 실행 전 VRAM 적합성 확인.
데이터에서 발견한 몇 가지 패턴:
메모리 대역폭이 디코드 성능을 결정합니다. RTX 5070(12 GiB GDDR7, Vulkan)은 12 GiB에 들어가는 모든 모델에서 RTX 3090(24 GiB GDDR6X, CUDA)을 이깁니다:
Gemma-3-4b chat: 5070 = 156.6 vs 3090 = 142.0 tok/s
Gemma-4-E4B chat: 5070 = 124.3 vs 3090 = 118.4 tok/s
LFM2-8B-A1B chat: 5070 = 336.1 vs 3090 = 318.7 tok/s
3090은 14-31B 대역에서 압도적으로 승리합니다. 모델이 24 GiB에는 들어가지만 12 GiB에는 들어가지 않는 경우입니다:
Gemma-4-26B-A4B chat: 3090 = 100.5 | Strix ROCm = 43.7 | Strix Vulkan = 47.7 tok/s
Qwen3.6-27B chat: 3090 = 21.1 | Strix ROCm = 11.2 | Strix Vulkan = 11.6 tok/s
Strix Vulkan은 같은 하드웨어/모델에서 Strix ROCm보다 종종 조금 더 빠릅니다. 제가 본 가장 큰 격차는 Gemma-4-26B-A4B에서 +9%(43.7 → 47.7)였습니다. 일부 모델은 거의 동일합니다. 아마도 번들된 ROCm 빌드의 gfx1151 커널 튜닝 차이일 것입니다. 자세히 파보지는 않았습니다.
3090에서 Qwen3.6-27B 채팅을 위한 양자화 비용:
Q2_K = 24.0 Q3_K_M = 20.5 Q4_K_M = 21.1 Q5_K_M = 18.6 Q6_K = 15.3 tok/s
Q2에서 Q6까지는 1.6배 범위입니다. Q4가 스위트 스팟입니다. Q2는 품질 저하를 대가로 Q4 대비 약 14%의 성능을 얻고, Q6는 품질 향상을 위해 약 28%의 비용이 듭니다. 곡선이 이렇게 완만할 줄은 몰랐습니다.
추론 모델은 출력 tok/s만 보면 실제보다 약 5배 느려 보입니다. Qwen3.5/3.6은 대부분의 출력을 디코드 속도에는 포함되지만 사용자에게 보이는 답변에는 포함되지 않는 숨겨진 reasoning_content 채널을 통해 스트리밍합니다. 코딩 어시스턴트를 선택할 때 알아두면 좋습니다.
Strix의 CPU도 무시할 수준은 아닙니다. Gemma-4-26B-A4B MoE는 통합 메모리 + 활성 파라미터 라우팅 덕분에 순수 CPU에서 약 5-9 tok/s로 실행됩니다. 빠르지는 않지만 GPU가 필요 없는 배치 작업에는 사용할 수 있습니다.
사이트에는 모든 실행 결과와 더 많은 모델 데이터가 있습니다: https://calebcoffie.com/benchmarks. 방법론 및 나머지 내용은 여기 있습니다: https://calebcoffie.com/blog/introducing-open-weight-model-benchmarks.


