Nvidia GB300 NVL72에서 초당 288k 토큰을 처리하는 Qwen 3.8 2.4T
Qwen 3.8 2.4T at 288k tokens/s on Nvidia GB300 NVL72
핵심 요약
Nvidia의 최신 하드웨어에서 Qwen 2.4T 모델의 압도적인 추론 성능을 다룬 기술 블로그 공유.
- 성능 지표 — GPU당 초당 4k 토큰 및 사용자당 초당 350 토큰 처리 가능함.
- 하드웨어 사양 — Nvidia GB300 NVL72 시스템을 활용한 대규모 모델 구동 사례임.
- 최적화 전망 — FP8 정밀도 기반이며 향후 NVFP4 등을 통해 추가 성능 향상 기대됨.
GPU 1개당 초당 4k 토큰, 총 72개 GPU 탑재. 사용자 1명당 초당 350 토큰.
"별도의 모델 튜닝 없이도, NVIDIA GB300 NVL72 환경에서 FP8 정밀도로 돌리면 출시 첫날부터 GPU 1개당 초당 4K 토큰 넘게 뽑아내고, 사용자 1명당 초당 350 토큰 이상 처리 가능함. 앞으로 NVFP4 정밀도 같은 최적화 더 들어가면 성능은 훨씬 더 올라갈 예정."


