AMD Radeon R9700 1장으로 Qwen3.8 27b NVFP4 구동 시 153 tok/s 달성, 8개 동시 요청 시 470 tok/s, 프리필 3,619 tok/s
153 tok/s on 1x AMD Radeon R9700 running Qwen3.8 27b NVFP4, 470 tok/s @ 8 conc requests, Prefill @ 3,619 tok/s
핵심 요약
AMD R9700 사용자들을 위한 최적화 업데이트로 성능이 2배 향상되어 고성능 GPU와 견줄만한 속도를 보여줌.
- 성능 최적화 — R9700 단일 카드 환경에서 디코드 및 프리필 속도가 2배가량 향상됨
- 벤치마크 결과 — Qwen3.8 27b 모델 기준 8개 동시 요청 시 470 tok/s의 처리량 기록
- 기술적 성과 — vllm-radiance를 활용하여 기존 llama.cpp 대비 압도적인 코드 생성 및 프리필 속도 달성
- 양자화 지원 — NVFP4 외에도 int5, FP8 등 다양한 양자화 옵션 및 6bit 양자화 추가 예정
댓글이랑 디스코드에서 자꾸 AMD 1xR9700 카드 하나만 쓰는 애들이 물어보길래, 드디어 시간 내서 1xR9700 유저들을 위한 최적화 좀 해봤다. 성능 그냥 2배로 뻥튀기됨. 시각적인 거 좋아하면 위에 있는 BetterBench 확인하고, 텍스트가 편하면 아래쪽 보면 된다.
이 결과는 Unsloth's Qwen3.8 27b NVFP4 돌려서 측정한 거임.
Decode
┌───────────────┬───────────────┬──────────────────┐
│ category │ update p50 ms │ decode t/s (med) │
├───────────────┼───────────────┼──────────────────┤
│ chat │ 42.3 │ 67.1 │
├───────────────┼───────────────┼──────────────────┤
│ code │ 42.5 │ 120.5 │
├───────────────┼───────────────┼──────────────────┤
│ file_edit │ 42.5 │ 138.0 │
├───────────────┼───────────────┼──────────────────┤
│ json │ 42.4 │ 153.1 │
├───────────────┼───────────────┼──────────────────┤
│ math │ 42.5 │ 140.0 │
├───────────────┼───────────────┼──────────────────┤
│ prose │ 42.3 │ 69.2 │
├───────────────┼───────────────┼──────────────────┤
│ reasoning │ 34.3 │ 123.9 │
├───────────────┼───────────────┼──────────────────┤
│ summarization │ 34.2 │ 141.7 │
└───────────────┴───────────────┴──────────────────┘


