3090Ti에서 Qwen 27B 성능이 레딧 벤치마크만큼 안 나옴
Can't replicate Reddit numbers with Qwen 27B on a 3090TI.
핵심 요약
3090Ti 환경에서 Qwen 27B 구동 시 다른 유저들의 벤치마크 성능이 나오지 않아 CPU 병목 현상인지 의문을 제기함.
- 성능 불일치 — 레딧에 공유된 벤치마크 수치와 실제 구동 성능 간의 큰 격차를 경험함.
- CPU 병목 의혹 — i9-9900K의 AVX-512 미지원으로 인한 SSM 연산 성능 저하 가능성을 분석함.
- 설정 최적화 — vLLM이나 특정 포크를 사용해 성능을 개선하려는 시도와 의견이 공유됨.
- 벤치마크 신뢰성 — 실제 에이전트 구동 시와 단순 벤치마크 간의 성능 차이가 존재한다는 지적이 나옴.
미칠 것 같음. 여기 사람들 3090에서 Qwen 3.6 27B 돌리면서 30~100+ tok/s(100+은 speculative decoding 사용 시) 나온다고 올리는 거 봄. 나도 똑같이 해보려고 하는데 성능이 전혀 안 나옴.
llama.cpp로 Unsloth의 Q4XL이랑 Q4_K_M GGUF 써봤음. 50k 컨텍스트에서 10 tok/s 정도 나옴. ik_llama.cpp로 더 작은 GGUF도 써봤는데: https://huggingface.co/sokann/Qwen3.6-27B-GGUF-5.076bpw (Unsloth GGUF보다 1GB 작음) 이 조합으로는 50k 컨텍스트에서 18~19 tok/s 나옴. (참고: 둘 다 VRAM에 다 올린 상태임)
ik_llama.cpp 로그를 Claude Sonnet 4.6에 넣어서 물어봤더니 이렇게 말함:
로그에 있는 두 개의 compute buffer를 보셈:
CUDA0 compute buffer size = 2020.00 MiB ← GPU
CUDA_Host compute buffer size = 552.05 MiB ← CPU
graph splits = 2
graph splits = 2라는 건 생성되는 모든 토큰마다 다음 과정을 거친다는 뜻임:
- CPU로 동기화 → CPU가 SSM recurrence state 업데이트를 계산함 (552 MiB의 CPU 작업)
- 다시 GPU로 동기화 → GPU가 마무리
CUDA_Host compute buffer는 데이터 전송용 메모리가 아니라, 토큰 단계마다 CPU가 연산을 실행하는 실제 compute buffer임. SSM state recurrence(ssm_d_state = 128,ssm_d_inner = 6144)는 수학적으로 정적 CUDA 그래프로 표현할 수 없어서 CPU 측에서 순차적으로 처리해야 함.
이게
HAVE_FANCY_SIMD가 중요한 이유임. 토큰당 552 MiB의 CPU 작업은 AVX-VNNI/AVX-512에서 훨씬 빠른 dequantization 커널(iq4_ks,q6_0)을 사용함. 이게 없으면 GPU가 아니라 CPU 쪽이 병목이 됨.
모델은 가중치 저장 측면에서는 "완전히 GPU에" 있지만, 생성 시점의 연산 측면에서는 "아님". 이건 Qwen3.6 하이브리드 SSM 아키텍처의 근본적인 특성이라 어떤 플래그나 배치 트릭으로도 고칠 수 없음.
너는 i9-9900K를 쓰고 있는데, 이건 Coffee Lake(2018) CPU임. AVX2랑 FMA는 지원하지만 AVX-512랑 AVX-VNNI는 지원 안 함(Ice Lake / Alder Lake 이후부터 나옴). 그래서 확인됨 — 네 CPU는 아키텍처상
HAVE_FANCY_SIMD경로를 실행할 수 없음.
네가 얻는 18~19 t/s가 이 CPU + SSM 하이브리드 모델 조합의 현실적인 한계치임.
이게 정확한 말인지, 아니면 나를 가스라이팅하는 건지 확인 좀 해줄 사람? 온라인에 보이는 수치들이 다 높은 건 그 사람들이 더 최신 CPU를 써서 그런 거임?

