Qwen3.8-27B-NVFP4 1M 컨텍스트. 지금까지는 아주 좋음.
Qwen3.8-27B-NVFP4 1M context. So far so good.
핵심 요약
사용자가 4개의 RTX Pro 4000 GPU를 활용해 1M 컨텍스트 환경에서 Qwen 모델을 구동하며 성능을 테스트 중입니다.
- 하드웨어 구성 — 4개의 RTX Pro 4000(각 24GB)과 EpyC Milan CPU를 사용함.
- 컨텍스트 테스트 — 1M 컨텍스트 환경에서 모델의 안정성과 한계를 실험 중임.
- 성능 최적화 — vLLM 설정을 통해 KV 캐시와 텐서 병렬 처리 등을 조정함.
- 사용자 피드백 — 27B 모델의 경우 550k 컨텍스트 이상에서 품질 저하가 발생한다는 의견이 있음.
이제 막 시작한 초보인데, 세팅 제대로 맞추느라 시간 좀 걸렸네.
컨테이너 아니고 네이티브로 세팅했어. 제대로 한 건지, 아니면 더 손볼 데가 있는지 잘 모르겠네.
Environment=HF_HUB_OFFLINE=1 Environment=VLLM_LOGGING_LEVEL=INFO Environment=VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 Environment=PATH=/home/suryakiranc/vllm/.venv/bin:/usr/local/cuda/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin Environment=CUDA_HOME=/usr/local/cuda ExecStart=/home/suryakiranc/vllm/.venv/bin/vllm serve unsloth/Qwen3.8-27B-NVFP4 \ --served-model-name unsloth/Qwen3.8-27B-NVFP4 \ --safetensors_load_strategy prefetch \ --tensor-parallel-size 4 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_xml \ --enable-auto-tool-choice \ --gpu-memory-utilization 0.91 \ --kv-cache-dtype fp8 \ --max-num-batched-tokens 16384 \ --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}' \ --mm-encoder-tp-mode data \ --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' \ --max-model-len 1000000 \ --host 0.0.0.0 \ --port 8000


