에이전트 코드베이스의 자동 개선 루프를 구현하기 위한 로컬 제어 시스템을 구축했습니다
I built a local control system for agent failures, fixes, evals, and gates to make autoresearch-style self-improvement loops work in real agent codebases
핵심 요약
에이전트의 실패를 분석하고 자동으로 수정 및 검증하는 로컬 제어 시스템을 개발하여 실무 환경에 적용했습니다.
- 자동 개선 루프 — 에이전트 실행 추적을 통해 실패 패턴을 식별하고 수정을 제안함
- 로컬 제어 시스템 — SQLite 기반으로 추적, 이슈 관리, 수정 제안 및 검증을 로컬에서 수행함
- 게이트웨이 검증 — 수정 사항이 자동 적용되기 전 결정론적 검사와 평가를 거치도록 설계됨
- 실무 환경 최적화 — 인프라 구축을 통해 이론적인 자동 개선 루프를 실제 환경으로 이전함
에이전트를 위한 자동 연구(autoresearch) 스타일의 루프를 실험해 왔습니다: 에이전트를 실행하고, 추적(trace)을 검사하고, 무엇이 잘못되었는지 찾아내고, 수정안을 제안하고, 이를 반복하는 방식이죠.
아이디어는 좋습니다. 코딩 에이전트들은 이미 추적을 살펴보고, 실패 패턴을 찾아내고, 수정안을 제안할 능력이 있으니까요.
하지만 실제 에이전트 코드베이스에 이를 적용하려고 할수록 더 많은 난관에 부딪혔습니다. 진짜 어려움은 루프를 둘러싼 시스템을 구축하는 데 있었습니다:
- 어떤 실패가 실행 과정에서 반복적으로 발생하는지
- 각 이슈를 뒷받침하는 증거는 무엇인지
- 어떤 수정안이 제안되었는지
- 어떤 검사와 평가가 실행되었는지
- 무엇이 통과하고, 무엇이 실패하고, 무엇이 회귀(regression)했는지
- 무엇을 자동으로 변경할 수 있는지
- 무엇이 인간의 검토를 필요로 하는지
그래서 에이전트 개선 루프를 위한 완전한 로컬 제어 시스템을 구축했습니다. 이 시스템은 에이전트 실행을 캡처하고, 반복되는 실패를 찾아내고, 증거 기반의 이슈로 변환하며, Codex나 Claude Code가 수정안을 초안으로 작성하게 하고, 검사와 평가를 거친 후 게이트를 통해서만 변경 사항을 적용합니다.
워크플로우는 다음과 같습니다:
- 에이전트 실행/추적 캡처
- 실행 과정에서 반복되는 실패 탐색
- 증거를 포함한 검토 가능한 이슈로 변환
- Codex, Claude Code가 수정안 초안 작성
- 실패한 추적을 재실행하고, 결정론적 검사를 수행하며, 평가 결과 비교
- 게이트를 통과할 경우에만 수정 사항 적용, 그렇지 않으면 검토 대기열로 이동
모든 것은 기본적으로 로컬에서 작동합니다: SQLite 데이터베이스, 대시보드, 추적, 이슈, 제안, 평가까지 전부요. 분석 및 수정 초안 작성 단계에서는 이미 사용 중인 코딩 에이전트 CLI를 활용할 수 있으므로, 별도의 호스팅 서비스나 추가적인 모델 API 키가 필요하지 않습니다.
자기 개선 루프는 이론적으로는 멋지지만, 그 주변 인프라를 구축하지 않으면 실제 운영 환경으로 옮기기가 매우 어렵습니다.


