OpenCode에서 로컬 메인 모델로 Qwen3.5-27B 구동하기
Running Qwen3.5-27B locally as the primary model in OpenCode
핵심 요약
RTX 4090 환경에서 Qwen3.5-27B를 활용해 로컬 에이전트 코딩 환경을 구축하고 테스트한 경험 공유.
- 로컬 모델 성능 — Qwen3.5-27B는 적절한 컨텍스트와 계획이 뒷받침되면 도구 호출 및 코드 작성에서 뛰어난 성능을 보임.
- 하드웨어 설정 — RTX 4090에서 llama.cpp를 통해 4비트 양자화 모델을 구동하며 22GB VRAM을 사용함.
- 보안 이슈 — OpenCode의 보안성에 대한 커뮤니티 내 우려가 제기되어 Nanocoder 같은 대안이 언급됨.
- 엔지니어링 원칙 — 모델의 크기와 상관없이 좋은 소프트웨어 엔지니어링 원칙을 따르는 것이 결과물 품질에 결정적임.
이번 주말에 OpenCode나 OpenAI Codex 같은 에이전트형 코딩 어시스턴트의 메인 모델로 로컬 LLM이 얼마나 잘 작동하는지 테스트해보고 싶었습니다. 최근 모델 크기 대비 성능으로 주목받는 하이브리드 아키텍처 모델인 Qwen3.5-27B를 선택해 로컬에 설정하고 OpenCode와 연동해 얼마나 활용 가능한지 확인해봤습니다.
저는 NVIDIA RTX4090(24GB) 워크스테이션에서 llama.cpp를 통해 모델을 구동했고, 맥북에서 OpenCode를 실행해 Tailscale로 연결했습니다.
설정:
- RTX 4090 워크스테이션 (llama.cpp 구동)
- 맥북 (OpenCode 구동)
- 4비트 양자화 모델, 64K 컨텍스트 사이즈, 약 22GB VRAM 사용
- 약 2,400 tok/s prefill, 약 40 tok/s generation
테스트 결과:
- 놀라울 정도로 잘 작동하며, 여러 개의 파이썬 스크립트 작성, 수정, 디버깅, 테스트 및 코드 실행과 같은 작업에서 정확한 도구 호출을 수행합니다.
- 에이전트 스킬을 사용하고 최신 문서를 가져오기 위해 Context7 MCP 서버를 추가했을 때 성능이 눈에 띄게 향상되었습니다.
- 다만, 대충 짠 프롬프트와 느슨한 컨텍스트로 '바이브 코딩'을 하기에는 최적의 설정은 아닙니다. 그 분야는 GPT-5.4나 Opus/Sonnet이 여전히 훨씬 앞서 있습니다.
- 하지만 제대로 계획을 세우고 올바른 컨텍스트를 제공한다면 충분히 좋은 성능을 냅니다.
- Codex보다 OpenCode로 설정하는 것이 훨씬 쉽습니다.
전체 워크플로우를 설정하는 것 자체가 훌륭한 학습 경험이었다고 생각합니다. 로컬 모델을 단순 채팅 어시스턴트로 사용하는 것과 에이전트형 코딩 어시스턴트와 함께 사용하는 것은 완전히 다른 차원의 일이며, 특히 올바른 에이전트 행동을 위한 도구 호출을 구현하는 것은 더욱 그렇습니다. 기기에 맞는 적절한 양자화, 해당 크기 카테고리에서 최고의 모델, 도구 호출을 위한 올바른 채팅 템플릿, 최적의 컨텍스트 사이즈 및 KV 캐시 설정 등 많은 결정을 내려야 합니다.
제가 겪은 모든 시행착오와 실용적인 팁을 포함하여 전체 설정 과정을 다룬 상세 블로그 글도 작성했습니다.
설정에 대해 궁금한 점이 있으시면 언제든 답변해 드리겠습니다.
블로그 포스트: https://aayushgarg.dev/posts/2026-03-29-local-llm-opencode/

