16GB VRAM + 64GB RAM 환경에서 어떤 모델을 돌리시나요?
What are you running on 16Gb VRAM + 64Gb Ram?
핵심 요약
16GB VRAM과 64GB RAM 환경에서 코딩 및 에이전트 워크플로우에 적합한 모델과 설정값을 공유하는 토론입니다.
- 추천 모델 — Qwen3.6 35B A3B 모델이 코딩 및 성능 면에서 높은 평가를 받음
- llama.cpp 설정 — GGUF 포맷과 적절한 퀀타이제이션(Q4_K_M 등)을 통한 최적화 방법 공유
- 성능 최적화 — TurboQuant+나 MTP 같은 포크를 사용하여 토큰 생성 속도 향상 가능
- 도구 추천 — 리눅스 환경에서 설정 자동화를 위해 OpenCode 사용 권장
이런 질문이 자주 올라오는 건 알지만, 몇 달 전 글들만 보여서 요즘 사람들은 어떻게 돌리고 있는지 궁금해서 물어봅니다.
RTX5080이랑 64GB DDR5 RAM을 쓰고 있어요. 코딩용으로 돌릴 수 있는 최상의 모델은 뭘까요? 에이전트 워크플로우용으로는요?
비슷한 사양을 쓰시는 분들이 있다면 어떤 모델의 어떤 퀀트 버전을 쓰시는지 알고 싶습니다. llama.cpp 실행 명령어랑 설정값도 같이 알려주시면 정말 좋을 것 같아요 :)


