Claude가 하룻밤 만에 내 에이전트 하네스 성능을 40.7% 개선함
Claude improved my agent harness by 40.7% overnight
핵심 요약
Claude Code를 활용해 에이전트의 프롬프트와 하이퍼파라미터를 스스로 최적화하는 'Autoharness' 도구 개발 사례.
- Autoharness 개발 — Claude Code가 에이전트의 프롬프트와 하이퍼파라미터를 스스로 평가하고 개선하도록 설계함.
- 성능 대폭 향상 — 벤치마크 테스트에서 LLM 판정 도입 및 파라미터 최적화로 최대 40.7%의 성능 개선을 달성함.
- 자동화된 워크플로우 — 한 줄 설치 후 가이드 파일만 지정하면 에이전트가 스스로 최적의 설정을 찾아내도록 구현함.
- 기술적 논쟁 — 에이전트가 스스로 아키텍처를 수정하는 방식에 대해 혁신적이라는 평가와 회의적인 시각이 공존함.
Claude Code를 처음 썼을 때 기억나? 그와 같은 도약이 한 단계 더 높은 곳에서 일어나고 있어. 커뮤니티는 프롬프트 엔지니어링 → 컨텍스트 엔지니어링 → 에이전트 엔지니어링 → 하네스 엔지니어링으로 넘어갔지.
나는 스스로에게 물었어: 하네스보다 한 단계 위에 있는 건 뭘까? 하네스를 만드는 무언가겠지.
그래서 만들었어. Autoharness는 Claude Code가 하네스(프롬프트, 하이퍼파라미터, 런타임 컨텍스트, 스코어링 등)의 변경 사항을 탐색하고, 평가를 실행하며, 실제로 점수를 높이는 변경 사항만 유지하도록 해. Karpathy의 autoresearch에서 영감을 받았지. 내 에이전트에 적용하고 실행해 봤어. tau2-airline 벤치마크에서 자율적으로 다음을 찾아냈지:
- +40.7% 성능 향상: LLM 판정을 통한 best-of-N 스킬북 스코어링 추가
- +24.1% 성능 향상: 리플렉터 하이퍼파라미터(온도 + 최대 서브에이전트 호출 수) 조정
- +22.2% 성능 향상: 매 단계마다 런타임 컨텍스트(단계 예산, 최근 도구 호출, 최근 결과) 주입
작동 방식:
- 한 줄 설치
- Claude Code를
GUIDE.md에 연결 - 하네스 변경 사항을 제안하고, 각각 평가한 뒤, 성공한 것만 유지
- 더 나아진 에이전트와 함께 아침을 맞이함
오픈 소스 저장소: https://github.com/kayba-ai/autoharness


