pi-warden: Pi의 에이전트를 제어하는 Jev 기반의 보조 감시 도구
pi-warden: a Jev-powered second pair of eyes for Pi that steers the agent
핵심 요약
Pi 에이전트의 도구 호출을 실시간으로 감시하고 규칙을 준수하도록 제어하는 Jev 기반 확장 프로그램 'pi-warden' 소개.
- Jev 모델 활용 — 250ms 내외의 빠른 판단 속도로 에이전트의 도구 호출을 실시간 검증함.
- 에이전트 감시 기능 — 도구 호출의 적절성, 규칙 위반, 불필요한 출력 등을 자동으로 판단하고 제어함.
- 학습 및 개선 — 사용자의 피드백을 라벨로 활용해 에이전트의 판단 정확도를 지속적으로 개선함.
- 오픈소스 공개 — 초기 버전(0.12.0)으로 깃허브를 통해 코드와 패키지를 공개함.
안녕, 이번에 처음으로 사람들한테 공유해보는 레포야.
pi-warden은 에이전트가 도구 호출하는 걸 감시하다가, 너 대신 에이전트한테 직접 말을 거는 Pi 확장 프로그램이야.
두 번째 모델인 Jev(typesafe의 빠른 판단 모델, ~250ms; 진짜 말도 안 되게 저렴함)가 네 프롬프트랑 에이전트가 마지막으로 한 말, 그리고 지금 하려는 호출을 읽고 간단한 질문들에 답을 해줘. 이게 되돌릴 수 없는 작업인지, 에이전트가 하겠다고 한 거랑 일치하는지, 작업 트리 밖에서도 영향이 보이는지 같은 것들 말이야. 이 답변은 다시 에이전트의 컨텍스트로 들어가.
같은 채널로 나머지 것들도 다 처리해. 매 쓰기 작업마다 마크다운 파일에 적힌 프로젝트 규칙을 대조하고, 스텁이나 주석 쓰레기, 무한 루프, 테스트도 안 돌리고 끝났다고 우기는 거, 중간에 끊긴 출력물, 디스크에 원본은 따로 저장하고 압축된 거대한 도구 출력물 같은 것들 말이지.
이거 스스로 채점도 해. 네가 각 홀드나 스티어 단계에서 뭘 선택하느냐(승인, 거절, 리다이렉트, 불만 제기)가 라벨이 되고, 스크립트가 네가 기록한 Pi 세션을 가드를 통해 다시 돌려봐. 내가 직접 1만 7천 번 호출해본 결과, 딴짓하는 홀드는 테스트에서 탈락해서 스티어로 강등됐어. 계획이랑 호출 대조하는 게 진짜 물건이더라. 방법이랑 수치는 README에 다 적어놨어.
https://github.com/DevMortimer/pi-warden
https://pi.dev/packages/pi-warden
이제 막 시작한 단계(0.12.0)야. Jev가 어제 막 공개된 거라(난 얼리 액세스로 써봄) 버그가 좀 있을 수도 있어. 그래도 나 지금 하루 넘게 실무에서 쓰고 있는데 꽤 괜찮아. PR이나 (특히) 불만 사항은 언제든 환영이야 :)
추신: 다들 Pi에 Jev를 어떻게 활용할지 궁금하네?

