코딩용 로컬 모델, 실무 투입 가능한 수준에 도달하다
Local model on coding has reached a certain threshold to be feasible for real work
핵심 요약
27B-32B급 로컬 모델이 2025년 하반기 최상위 모델 수준의 코딩 성능을 기록하며 실무 활용 가능성을 입증함.
- 성능 벤치마크 — Terminal-Bench 2.0에서 38.2%를 기록하며 2025년 하반기 모델들과 대등한 성능을 보임.
- 실무 활용성 — 보안이 중요한 환경이나 오프라인 CI 등에서 로컬 모델을 실무에 도입할 수 있는 수준이 됨.
- 추론 속도 — MOE 모델이 추론 속도 면에서 여전히 큰 개선 여지를 남겨두고 있음.
- 기술적 격차 — 최신 모델 대비 약 6~8개월 정도의 성능 격차를 보이며 빠르게 추격 중임.
우리는 오픈 웨이트 27B–32B 모델들을 에이전트 하네스를 통해 Terminal-Bench 2.0(89개 작업, terminal-bench-2.git @ 69671fb)에서 실행했습니다. 가장 좋은 결과는 Qwen 3.6-27B가 기록한 **38.2%(34/89)**였으며, 이는 공개 리더보드와 동일한 기본 작업별 타임아웃 제약 조건 하에서 측정되었습니다(Qwen의 공식 게시물은 더 완화된 설정을 사용함: https://huggingface.co/Qwen/Qwen3.6-27B#:~:text=Terminal%2DBench%202.0%3A%20Harbor/Terminus). 우리는 검증된 리더보드와 동일한 조건에서 비교하기 위해 의도적으로 TB 공식 리더보드의 기본 설정을 사용했습니다.
한 가지 흥미로운 발견은 MOE 모델들이 추론 속도 측면에서 여전히 10배 정도 개선될 여지가 있다는 점입니다.
절대적인 수치인 38.2%가 중요한 것이 아닙니다. 현재 검증된 SOTA는 약 80%(GPT-5.5 / Opus 4.6 / Gemini 3.1 Pro) 수준이니까요. 흥미로운 점은 38.2%가 시간상으로 어느 지점에 해당하는가입니다.
검증된 리더보드 항목들의 모델 출시일을 기준으로 비교하면 다음과 같습니다:
- Terminus 2 + Claude Opus 4.1 (2025년 8월 출시): 38.0%
- Terminus 2 + GPT-5.1-Codex (2025년 11월 출시): 36.9%
- Claude Code + Sonnet 4.5 (2025년 9월 출시): 40.1%
- Codex CLI + GPT-5-Codex (2025년 9월 출시): 44.3%
즉, 오늘날 오프라인에서 실행 가능한 최고의 코딩 모델은 2025년 하반기 호스팅된 최상위 모델들과 비슷한 수준인 약 6~8개월 정도의 격차를 보이고 있습니다. 이는 실제 배포(규제 환경, 에어갭 환경, 온프레미스 CI, 배치 작업 등)를 고려할 때 처음으로 의미 있는 수준에 도달했음을 뜻합니다.

