Qwen3.8-Flash-Next로 4xR9700을 로컬 AI 파워하우스로! 최적화된 vLLM으로 단일 요청 시 120 t/s 생성 및 12k t/s 프리필 달성
Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
핵심 요약
4개의 R9700 GPU와 최적화된 vLLM 도커 이미지를 사용하여 Qwen3.8-Flash-Next 모델로 뛰어난 성능을 구현한 사례 공유.
- 성능 최적화 — 4개의 R9700 GPU와 vLLM을 활용해 12k t/s의 프리필 속도를 달성함.
- 도커 활용 — 복잡한 vLLM 설정을 간소화하기 위해 미리 패치된 도커 이미지를 사용함.
- 하드웨어 구성 — 4xR9700 환경에서 700k 토큰의 컨텍스트를 공유하며 안정적으로 구동됨.
- AMD 환경 — ROCm 환경에서도 이제는 공유된 도커 이미지를 통해 설정 난이도가 낮아짐.
R9700 4개를 가지고 있는데 이 모델이 제 성능을 내주기만을 기다리고 있었다면, 아주 좋은 소식이 있다!
tcclaviger's MXFP4-FP8 양자화 모델이랑 R9700에 최적화된 커스텀 vLLM 이미지인 docker.io/tcclaviger/vllm:DevQwenNextFlash를 쓰면, 단일 요청 기준으로 생성 속도는 80-120 tokens/second, 프리필(prefill) 속도는 12k token/second까지 뽑아준다.
이 설정에서 전체 컨텍스트(모든 병렬 요청 공유)는 700k 토큰이다.
전체 명령어는 아래와 같다:
podman run --rm -it \
--init \
--network host \
-v /models:/models:ro \
-v ~/.vllm-cache:/cache \
-e VLLM_PLE_CPU_OFFLOAD=1 \
-e VLLM_ROCM_USE_AITER=0 \
-e ROCR_VISIBLE_DEVICES=0,1,2,3 \
-e VLLM_CACHE_ROOT=/cache/vllm \
-e TORCHINDUCTOR_CACHE_DIR=/cache/inductor \
-e TRITON_CACHE_DIR=/cache/triton \
--device /dev/kfd \
--device /dev/dri \
--group-add keep-groups \
--annotation run.oci.keep_original_groups=1 \
--security-opt label=disable \
--security-opt seccomp=unconfined \
--shm-size 8g \
docker.io/tcclaviger/vllm:DevQwenNextFlash \
/models/tcclaviger/Qwen3.8-Flash-Next-MXFP4-FP8 \
--served-model-name Qwen3.8-Flash-Next \
--tensor-parallel-size 4 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice \
--max-num-seqs 16 \
--enable-prefix-caching \
--enable-chunked-prefill \
--kv-cache-dtype fp8 \
--max-num-batched-tokens 4096 \
--gpu-memory-utilization 0.96 \
--mm-processor-cache-gb 4.0 \
--override-generation-config '{"max_tokens": 65536, "temperature": 1.0, "top_p": 0.95, "top_k": 40, "presence_penalty": 1}' \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' \
--compilation-config '{"cudagraph_capture_sizes": [5,10,15,20,25,30,35,40], "max_cudagraph_capture_size": 40}' \
--host 0.0.0.0 \
--port 8080


