Tesla V100에서 Qwen3.6 27B 성능
Tesla V100 Qwen3.6 27B Performance
핵심 요약
Tesla V100 GPU 환경에서 Qwen3.6 27B 모델을 구동한 설정과 성능 결과를 공유함.
- 성능 공유 — Tesla V100 GPU 환경에서의 Qwen3.6 27B 모델 구동 설정 및 속도 공유함.
- llama.cpp 설정 — 128K 컨텍스트와 MTP를 활용한 최적화된 llama.cpp 프리셋 공개함.
- 엔진 논의 — vLLM 및 1CAT-VLLM 등 더 빠른 추론 엔진에 대한 사용자 간 의견 교환함.
- 하드웨어 가격 — 알리익스프레스 등에서 판매되는 V100 16GB와 32GB 모델 간의 가격 차이에 대해 논의함.
V100 사용자들의 설정과 성능 공유를 요청함.
GPU: Tesla V100 PCIE 32Gb
Qwen3.6 27B Q4_K_M + Q8_0 MTP
128K 컨텍스트 길이
Pi 코딩 에이전트
llama.cpp 모델 프리셋:
[*]
spec-default = 1
ctx-size = 131072
mmap = 1
kv-unified = 1
n-gpu-layers = 999
threads = 18
prio = 3
seed = 3407
image-min-tokens = 1024
batch-size = 4096
ubatch-size = 2048
parallel = 1
flash-attn = true
[Qwen3.6-27B]
model = /models/Qwen3.6/Qwen3.6-27B-Q4_K_M.gguf
mmproj = /models/mmproj/mmproj-Qwen3.6-27B-Q8_0.gguf
spec-draft-model = /models/mtp/mtp-Qwen3.6-27B-Q8_0.gguf
chat-template-file = /templates/froggeric_chat_template_v21-3.jinja
spec-type = draft-mtp
spec-draft-n-max = 1
temperature = 0.6
top-p = 0.95
top-k = 20
min-p = 0.05
presence-penalty = 0.0
repeat-penalty = 1.0
chat-template-kwargs = {"preserve_thinking": true}
그리고 성능 결과:
