코딩 에이전트용 로컬 LLM 속도 개선 방법
Speeding up local LLM for usable coding agent
핵심 요약
로컬 LLM 구동 시 발생하는 속도 저하 문제를 해결하고, 코딩 에이전트 활용을 위한 최적화 방안을 모색함.
- 하드웨어 최적화 — VRAM 부족 시 발생하는 병목 현상을 해결하기 위해 GPU 오프로드 설정 및 배치 사이즈 조정이 필요함.
- 소프트웨어 환경 — LM Studio 대신 llama.cpp를 직접 사용하여 성능 향상 및 세밀한 파라미터 제어가 가능함.
- 모델 설정 — KV 캐시 양자화 및 전문가 모델(MoE)의 CPU 오프로드 활용을 통해 추론 속도를 개선할 수 있음.
- 성능 모니터링 — 프로세스 탐색기를 통해 GPU 사용률과 VRAM 점유 상태를 실시간으로 확인하여 병목 지점을 파악해야 함.
TL;DR: Qwen 3.6 35B-A3B (Q4_K_M) 모델이 72% 컨텍스트(36147 토큰)에서 약 9 t/s로 느리게 작동하며, 프리필과 토큰 생성을 포함한 총 응답 시간은 77초입니다. LM Studio(Windows)를 사용하여 5060 Ti(16GB VRAM) + 32GB RAM 환경에서 실행했습니다. 코딩 에이전트 용도로 쓰기엔 성능이 만족스럽지 않은데, 어떻게 속도를 높일 수 있을까요? 속도 개선이 어렵다면 제 하드웨어 사양에서 쓸만한 다른 LLM은 무엇이 있을까요?
안녕하세요! 클라우드 LLM 비용이 부담스러워지면서, 클라우드 LLM '종말' 사태에 대비하거나 민감한 소프트웨어를 다룰 때를 대비해 로컬 AI 코딩을 알아보고 있습니다(물론 AI 코딩 에이전트를 이런 작업에 100% 신뢰하면 안 된다는 점은 인지하고 있습니다).
저는 5060 Ti(16GB VRAM) + 32GB RAM을 사용 중입니다. 제 하드웨어가 경쟁력 있는 로컬 AI를 돌릴 수 있는지 테스트하기 위해 llama.cpp 백엔드를 사용하는 LM Studio에 Qwen 3.6 35B-A3B를 로드해봤습니다. 32K 컨텍스트 윈도우로 로드했을 때 간단한 "Hi" 프롬프트에는 17 t/s로 괜찮은 속도가 나왔습니다. 하지만 코딩 에이전트를 써보셨다면 아시겠지만, 코드 외에도 엄청난 양의 시스템 프롬프트가 컨텍스트 윈도우에 들어가기 때문에 높은 컨텍스트 부하 상태에서의 성능 테스트가 필요합니다.
KV 캐시에는 4비트 양자화를 사용했습니다. 왜냐하면 TurboQuant의 속도 이점이 4비트 KV 캐시 양자화와 크게 다르지 않다는 글을 온라인에서 봤기 때문입니다(공간 절약 효과는 확실하지만요). 그래서 LM Studio의 쉬운 설정을 이용해 먼저 테스트해봤습니다. 컨텍스트를 72%까지 채우기 위해 Frankenstein 텍스트 일부를 넣었더니 응답 생성에 77초가 걸렸고, 그중 상당 부분은 "Processing"(프리필 단계로 추정)이었습니다. 토큰 생성 속도는 9 t/s였습니다.
문제는 속도가 최적이 아니라는 점인데, 빠른 반복이 생명인 코딩 에이전트에는 좋지 않은 신호입니다. 에이전트의 한계를 파악하면서 더 잘 제어하려면, 성능이 낮은 에이전트로 빠르게 실패해보는 게 낫거든요.
이 모델의 속도를 높이는 방법이 있을지, 아니면 이 Qwen 버전이 제 하드웨어 사양을 벗어난 것인지 궁금합니다. 만약 제 사양을 벗어났다면, 제 하드웨어에서 쓸만한 코딩 LLM을 추천해주실 수 있을까요? "쓸만하다"는 기준이 모호할 수 있는데, 클라우드 에이전트 성능의 80~90% 정도를 내거나 최소한 제가 테스트한 Qwen 모델 정도의 성능은 내는 모델을 찾습니다.
제가 이 모델을 어떻게 실행하고 있는지에 대한 자세한 내용은 첨부한 이미지를 참고해주세요. 터미널 명령어가 아닌 LM Studio 설정입니다. LM Studio 프론트엔드 없이 llama.cpp 백엔드만 실행하는 게 더 빠르다면 알려주세요! Windows 환경입니다.


