에이전트의 자기 개선을 위한 업계 모범 사례를 오픈소스로 공개합니다
I open-sourced industry best practice to self-improving agents
핵심 요약
에이전트의 오류를 분석하고 성능을 개선하는 오픈소스 도구 'Kyoko'를 소개합니다.
- Kyoko 오픈소스 — 에이전트 추적 데이터를 분석해 성능을 자동으로 개선하는 로컬 도구임
- 핵심 기능 — Open Telemetry 기반 추적, 로컬 분석, 성능 평가, 인간 승인 패널 제공
- 자기 개선 루프 — 에이전트의 과거 기록을 분석하여 오류와 비효율을 자동으로 감지함
- 인간 개입 — 자동화된 수정 사항을 개발자가 직접 검토하고 승인할 수 있는 패널 제공
모든 주요 AI 관측성(observability) 기업들은 과거 에이전트 추적 데이터를 분석하여 오류, 드리프트, 비효율성을 자동으로 감지하는 자기 개선 루프를 출시하고 있습니다.
정말 놀라운 제품들이지만, 문제는 도입하기 어렵고 페이월(paywall) 뒤에 숨겨져 있으며 엔터프라이즈급 고객이 아니면 데이터를 직접 소유할 수 없다는 점입니다.
내부적으로는 LLM 판사(judge)를 사용하는 솔루션들이라, 이미 Claude Code나 이 시스템을 구동할 수 있는 다른 에이전트 구독권이 있다면 누구나 자기 컴퓨터에서 이걸 돌릴 수 있지 않을까 생각했습니다.
그래서 전체 시스템을 구축하고 오픈소스로 공개했습니다. 구성 요소는 다음과 같습니다:
- Open Telemetry 기반의 완전한 로컬 추적 데이터 수집 및 저장
- 추적 데이터를 살펴보기 위해 로컬 CC 인스턴스를 생성하는 분석 호출
- 성능을 추적하기 위해 코드/LLM을 생성하고 실행하는 평가 하네스
- 발견된 증거를 바탕으로 에이전트와 하네스의 수정을 승인하는 인간 관측성 패널
Kyoko(엘리트 ex machina 참조)는 완전히 자체 호스팅되는 로컬 도구로, 대시보드를 통해 사람이 직접 운영하거나 CLI를 사용하는 에이전트가 운영하도록 설계되었습니다.
사진을 보시면 Sierra의 Tau2 벤치마크를 수행하는 에이전트의 분석 결과를 볼 수 있습니다. 해당 수정 사항을 적용한 후, 동일한 모델이 한 번의 루프 후에 24% 더 높은 정확도를 달성했습니다.
여기 계신 에이전트 빌더분들은 현재 에이전트 성능 개선을 위해 무엇을 사용하고 계신지 궁금합니다.
레포 링크: https://github.com/kayba-ai/Kyoko
세 줄 요약: 에이전트를 디버깅하고 개선하기 위한 도입하기 쉬운 도구가 없어서, 업계 모범 사례를 오픈소스로 공개하고 Claude 구독으로 구동되는 가벼운 자체 호스팅 버전을 만들었습니다.


