club-5060ti: RTX 5060 Ti 로컬 LLM 실전 설정 및 기록
club-5060ti: practical RTX 5060 Ti local LLM notes and configs
핵심 요약
RTX 5060 Ti 16GB 듀얼 구성으로 로컬 LLM을 돌리기 위한 실전 설정과 테스트 기록을 공유하는 저장소입니다.
- 하드웨어 구성 — 리눅스 환경에서 RTX 5060 Ti 16GB 2개를 활용한 로컬 LLM 구동 환경을 구축함.
- 실전 테스트 — vLLM 및 llama.cpp를 사용하여 Qwen3.6 모델의 성능과 컨텍스트 길이를 검증함.
- 공유 저장소 — 설정값, 버전, KV 설정 등 재현 가능한 상세 데이터를 CSV 및 리포트 템플릿으로 제공함.
- 협업 요청 — 동일한 하드웨어 환경을 사용하는 사용자들의 이슈 제기 및 PR 참여를 환영함.
RTX 5060 Ti 16GB 로컬 LLM 설정을 위한 작은 공개 저장소를 만들었습니다.
club-3090 저장소에서 영감을 받았지만, 이번에는 5060 Ti 하드웨어에서 실제로 테스트한 내용을 문서화하여 설정 세부 정보를 공유하고 재현하기 쉽게 만드는 데 집중했습니다.
현재 기본 설정은 리눅스 환경에서 RTX 5060 Ti 16GB 2개를 사용하는 것이며, 다음 내용에 대한 기록이 포함되어 있습니다:
- vLLM을 이용한 Qwen3.6 27B NVFP4/MTP 서빙
- Qwen3.6 27B Q4/Q6을 위한 llama.cpp MTP GGUF 서빙
- 204800 직접 롱 컨텍스트 프리셋을 포함한 Q6 롱 컨텍스트 적합성 검사
- 추가 여유 공간을 위한 더 안전한 65536 llama.cpp 라우터 프리셋
- llama.cpp 및 vLLM에서의 초기 Qwen3.6 35B A3B 검사
- 정리된 실행 예시
- 모델 다운로드 및 llama.cpp 업데이트 도우미 스크립트
- 간단한 OpenAI 호환 스모크/벤치마크 스크립트
- CSV 결과 데이터 및 리포트 템플릿
목표는 모호한 토큰/초(tokens/sec) 주장보다는 정확한 설정, 버전, 컨텍스트 길이, KV 설정, 주의 사항 등 실용적인 정보를 유지하는 것입니다.
비슷한 5060 Ti 설정을 테스트 중인 분이 있다면, 결과를 재현할 수 있을 만큼 충분한 세부 정보를 포함하여 이슈나 PR을 자유롭게 남겨주세요.


