GEPA를 활용한 CLAUDE.md 최적화로 Haiku 4.5 성능 65%에서 85%로 향상
Optimizing CLAUDE.md with GEPA to take Haiku 4.5 from 65% pass rate to 85%
핵심 요약
오픈소스 프롬프트 최적화 프레임워크인 GEPA를 사용해 CLAUDE.md를 개선하여 Claude Code의 문제 해결 성공률을 20%p 높인 사례.
- GEPA 프레임워크 — 프롬프트 최적화를 위해 실행 추적과 점수를 기반으로 반복적인 개선을 수행함.
- 성능 향상 — CLAUDE.md 최적화만으로 Haiku 4.5의 문제 해결 성공률을 65%에서 85%로 끌어올림.
- 평가 방식 — hone 프로젝트를 통해 실제 리포지토리 기반의 agentelo 챌린지로 에이전트 성능을 측정함.
- 구현 핵심 — 에이전트가 개선될 수 있도록 정교한 채점 스크립트와 실행 추적 데이터를 구성하는 것이 중요함.
GEPA는 오픈소스 프롬프트 최적화 프레임워크야. 개념은 아주 간단한데, karpathy의 autoresearch와 비슷해. 구조화된 실행 추적과 '점수'를 다른 LLM 호출에 프롬프트와 함께 전달할 수만 있다면, 그 프롬프트를 반복적으로 개선할 수 있어. 변이 에이전트(mutator agent)가 프롬프트나 텍스트 변경을 제안하고, 어떤 변형이 점수를 높이는지 확인하거나 실행 추적을 읽어서 이유를 파악하는 방식이지.
그러니까 우리가 CLAUDE.md를 GEPA에 주고, 점수와 실행 추적을 제공하면, 에이전트가 여러 번의 반복을 통해 더 나은 결과를 낼 때까지 CLAUDE.md를 반복적으로 개선할 수 있는 거야.
나는 이걸 내 프로젝트인 hone에 '코딩 에이전트 CLI를 사용해 CLAUDE.md를 최적화하세요'라는 간단한 형태로 래핑했어. 그리고 작은 개념 증명(PoC)을 실행해 봤는데, 20개의 agentelo 챌린지 훈련 데이터셋과 9개의 미공개 agentelo 챌린지 셋을 대상으로, Claude Code와 Haiku 4.5의 문제 해결 성공률이 최적화 전 65%에서 최적화 후 85%로 올라가는 걸 확인할 수 있었어. 모델과 하네스는 그대로 두고 CLAUDE.md만 바꾼 결과야.

