디버깅 불가능한 수백 개의 API 호출 문제를 겪고 나서 LLM 에이전트용 오픈소스 observability 레이어를 만들었습니다
Built an open-source observability layer for LLM agents after my own project started making hundreds of API calls I couldn't debug
핵심 요약
수백 개의 API 호출을 추적하고 데이터 저장량을 85% 절감하는 LLM 에이전트용 오픈소스 observability 도구 0xtrace를 소개합니다.
- 0xtrace 개발 — OpenAI/Groq 클라이언트를 한 줄로 감싸 세션별 토큰 분석 및 프롬프트 변화를 추적함.
- 데이터 효율성 — 전체 프롬프트를 매번 저장하는 대신 keyframe + delta 방식을 사용해 DB 용량을 85% 절감함.
- 주요 기능 — 토큰 폭발 및 latency spikes 감지, 다른 모델로 호출을 재실행하는 replay engine 제공.
- 오픈소스 공개 — GitHub 레포와 데모 사이트를 통해 누구나 사용 및 피드백 가능함.
CodeAutopsy(GitHub 레포 분석기)를 돌리고 있었는데, API 레벨에서 무슨 일이 일어나는지 전혀 알 수가 없었습니다. 어떤 세션이 느린지, 컨텍스트가 어디서 커지는지, 루프가 돌고 있지는 않은지 말이죠.
그래서 0xtrace를 만들었습니다. OpenAI/Groq 클라이언트를 한 줄로 감싸기만 하면 세션별 token 분석, 단계별 프롬프트 진화 과정의 diff 뷰, token 폭발 및 latency spikes에 대한 이상 탐지, 그리고 다른 모델로 호출을 다시 실행해볼 수 있는 replay engine을 사용할 수 있습니다.
가장 자랑스러운 부분은 이겁니다. 대부분의 도구는 매 단계마다 전체 프롬프트 배열을 저장합니다. 10단계 에이전트라면 계속 커지는 데이터 덩어리 10개가 복사되는 셈이죠. DB에서 약 134K tokens 정도 됩니다. 0xtrace는 대신 keyframe + delta 방식을 사용하여 이를 약 770 tokens로 줄였고, 이는 약 85% 적은 수치입니다.
316 calls, 684K tokens, $0.32 total in my test run so far.
GitHub: github.com/Sidhant0707/0xtrace | 데모: 0xtrace-mu.vercel.app
무엇이 부족한지 궁금합니다.


