Qwen3.8 Flash Next llama.cpp 설정 튜닝
Qwen3.8 Flash Next llama.cpp config tuning
핵심 요약
Qwen3.8 Flash Next 모델의 llama.cpp 성능 최적화를 위한 설정 공유 및 vLLM 대안 추천이 활발히 논의됨.
- 성능 최적화 — llama.cpp 설정 튜닝을 통해 추론 속도 개선 시도함
- vLLM 대안 — 더 빠른 속도를 위해 vLLM 기반의 특정 모델 배포판 추천됨
- 하드웨어 환경 — RTX 3090 듀얼 구성 등 사용자별 다양한 환경 공유됨
- 대시보드 도구 — 터미널 기반 모니터링을 위한 tmux, htop, nvtop 조합 언급됨
안녕 다들.
혹시 Qwen3.8 Flash Next 돌릴 때 쓰는 LLama.cpp 설정이랑 시스템 사양 좀 공유해 줄 사람 있냐?
모델이 워낙 커서 llama.cpp 옵션 이것저것 조합해 보느라 시간 다 잡아먹네. 다른 사람들은 어떻게 세팅해서 쓰는지 궁금하다. 내 현재 설정은 아래에 적어놨으니까, 더 개선할 부분 보이면 바로 좀 알려줘.
현재 내 최고 기록:
- PP(프롬프트 처리): 130~200 tps (이거 CPU 병목인가?)
- TG(토큰 생성): 14~22 tps (평균 15tps 정도)
하드웨어:
- Dual RTX 3090 (48GB VRAM)
- 128GB DDR4
- 이름 모를 구형 Xeon 40코어
- Proxmox VM, pcie passthrough, 단일 물리 CPU에 numa 바인딩
Llama.cpp 설정:
llama-server --port ${PORT}
--model /nvme/gguf/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf
--mmproj /nvme/gguf/mmproj-Qwen3.8-Flash-Next-F16.gguf
--load-mode none
--lazy-mode off
--parallel 1
--ctx-size 131072
--cache-type-k q8_0
--cache-type-v q8_0
--flash-attn on
--fit off
--temp 1.0
--min-p 0.0
--top-p 0.95
--top-k 20
--presence-penalty 0.0
--repeat-penalty 1.0
--batch-size 2048
--ubatch-size 512
--split-mode layer
-ts 26,10
-ngl 99
-ncmoe 26
--no-mmproj-offload
--override-tensor per_layer_token_embd=CPU
--chat-template-kwargs '{"reasoning_effort":"xhigh"}'
ngl, ncmoe, ts는 모델 안 뻗게 하려고 수동으로 조절함.
------------------------------------------
참고로 램 128GB 이상에 RTX3090 두 장 박은 형들은 이거 한번 써봐라:
https://huggingface.co/albucino/Qwen3.8-Flash-Next-W4A16-FP8PLE
- 프롬프트 처리 속도 300~600 tps까지 떡상함 (더 나올 수도 있음!)
- 토큰 생성 40~50 tps
- 에이전트 코딩 환경에서 256k 컨텍스트로 몇 시간씩 돌려도 개안정적임
- 집에서 프론티어급 모델 돌리는 느낌이라 지린다, 와!

