개발자들 - VRAM 64GB 쓰는데 코딩용으로 어떤 모델 쓰시나요?
Devs - you have 64gb of VRAM - which model do you use for coding?
핵심 요약
64GB VRAM 환경에서 코딩용으로 Qwen 3.6 27B나 122B 모델을 활용하는 개발자들의 경험 공유.
- 모델 추천 — Qwen 3.6 27B 및 122B 모델이 코딩용으로 선호됨
- 컨텍스트 관리 — 200k 이상의 긴 컨텍스트 윈도우와 캐시 정밀도 설정이 중요함
- 실행 환경 — vllm과 llamacpp 간의 성능 및 속도 차이에 대한 논의가 활발함
- 코딩 전략 — 작은 모델 사용 시 작업을 세분화하여 효율을 높이는 방식이 권장됨
현재 저는 Qwen 3.5 122b-a10b 모델의 unsloth 버전(UD-IQ4_NL)을 사용 중입니다. 100k bf16 컨텍스트 윈도우를 사용하면서 몇 개의 레이어만 CPU/RAM에 로드하면 되는데, 초당 약 30 토큰 정도가 나와서 만족스럽게 쓰고 있습니다.
수많은 모델을 몇 시간 동안 테스트해 봤는데, 현재 이 모델에 깊은 인상을 받았습니다. 필요에 따라 Qwen 3.6 모델(둘 다)도 사용하지만, 이 덩치 큰 모델이 제 주력 모델이 될 것 같네요.
비슷한 VRAM 용량을 가진 다른 분들은 어떤 모델을 쓰시는지 궁금합니다.


