Qwen3.8-27B 모델에서 초당 몇 토큰(t/s) 나오시나요?
How many tokens/second output are you getting with Qwen3.8-27B?
핵심 요약
사용자들이 다양한 하드웨어 환경에서 Qwen3.8-27B 모델의 토큰 생성 속도를 공유하고 최적화 설정을 논의함.
- 하드웨어 사양 — 사용자별 GPU 및 CPU 구성에 따른 성능 차이 공유됨.
- 추론 설정 — MTP, GGUF, Vulkan 등 다양한 추론 환경과 속도 측정.
- 컨텍스트 영향 — 컨텍스트 길이에 따른 토큰 생성 속도 변화 논의.
- 최적화 팁 — MTP draft 토큰 설정 및 ROCm vs Vulkan 성능 비교.
다들 어느 정도 나오는지 궁금해서 글 써봄. 본인 하드웨어랑 모델 뭐 쓰는지 좀 알려주면 개꿀일 듯.
내 사양은 이거임:
Model: Qwen3.8-27B-heretic-ara, Q5_K_M GGUF
T/s: ~30-32 t/sec (대충 이 정도 나오는 듯, 나중에 다시 확인해봄)
Hardware: 3090 GPU | 64 GBs DDR4 RAM | AMD 7950x CPU
Harness: Pi
Inference: llama.ccp

