RTX 4060 Ti 16GB에서 Qwen3.5-35B를 60 tok/s로 돌리는 설정 공유
Qwen3.5-35B running well on RTX4060 Ti 16GB at 60 tok/s
핵심 요약
RTX 4060 Ti 16GB 환경에서 Qwen3.5-35B 모델을 효율적으로 구동하기 위한 최적화 설정과 벤치마크 결과를 공유함.
- 최적화 설정 — 윈도우 환경에서 llama.cpp를 활용해 64k 컨텍스트로 초당 40~60 토큰의 속도를 확보함.
- 성능 데이터 — 다양한 토큰 생성 상황에서 실사용 가능한 수준의 처리량을 검증함.
- 설정 공유 — VRAM 압박을 줄이고 효율적인 파라미터 조정을 통해 하드웨어 한계를 극복하는 방법을 제시함.
- 커뮤니티 제안 — 하드웨어별 최적화 설정을 모아두는 'GPU 설정 저장소' 구축 필요성을 언급함.
Windows 11 환경(i7-13700F, 64GB RAM)의 RTX 4060 Ti 16GB에서 unsloth Qwen3.5-35B-A3B-UD-Q4_K_L 모델을 64k 컨텍스트로 원활하게 돌리기 위해 llama.cpp 튜닝에 많은 시간을 쏟았습니다. 이제 꽤 안정적인 상태가 되어 제가 사용하는 설정을 공유하고자 합니다.
models.ini 항목:
[qwen3.5-35b-64k]
model = Qwen3.5-35B-A3B-UD-Q4_K_L.gguf
ctx-size = 65536
threads = 6
threads-batch = 8
n-cpu-moe = 11
batch-size = 1024
ubatch-size = 512
parallel = 2
kv-unified = true
;also from defaults
ngl = 99
fa = on
ctk = q8_0
ctv = q8_0
prio = 3
jinja = true
mlock = true
reasoning = off
Router 실행 명령어
llama-server.exe --models-preset models.ini --models-max 1 --host 0.0.0.0 --webui-mcp-proxy --port 8080
현재 확인되는 성능
이 프리셋을 사용하면 Docker Desktop이 백그라운드에서 실행 중임에도 불구하고 많은 작업에서 안정적으로 40–60 tok/s를 얻고 있습니다.
로그에서 확인한 몇 가지 예시:
- 1050 토큰 생성 시 ~56.41 tok/s
- 1087 토큰 프롬프트 후 234 토큰 이어쓰기 시 ~46.84 tok/s
- 체크포인트 복원 후 259 토큰 이어쓰기 시 ~44.97 tok/s
- 1676 토큰 생성 시 ~41.21 tok/s
- 훨씬 긴 대화에서 1689 토큰 생성 시 ~42.71 tok/s
즉, "벤치마크상의 환상적인 숫자"는 아니지만, 4060 Ti 16GB에서 64k 컨텍스트로 실사용 가능한 처리량을 보여줍니다.
기타 관찰 사항
- 시작 로그가 "정상"으로 보여도 실제 런타임 형태가 생각과 다르면 처리량이 나쁠 수 있습니다.
- 다음 항목들을 확인하는 것이 단순히 명령줄만 보는 것보다 훨씬 유용했습니다:
n_parallelkv_unifiedn_ctx_seqn_ctx_slotn_batchn_ubatch
- VRAM 압박을 제어하는 것이 최고의 일회성 점수를 뽑아내는 것보다 더 중요했습니다.
다양한 그래픽카드에 대한 튜닝 설정 데이터베이스를 찾지 못했는데, 이런 것이 있으면 유용할 것 같습니다.


