AI 에이전트 운영에서 가장 비싼 부분은 토큰 비용이 아니라, 왜 그런 결과가 나왔는지 파악하는 시간이다.
The most expensive part of running AI agents isn't the tokens. It's the time figuring out why they did something.
핵심 요약
AI 에이전트 운영 시 토큰 비용보다 디버깅에 소요되는 엔지니어링 시간이 훨씬 더 큰 비용을 차지한다는 공감대가 형성되었습니다.
- 디버깅 비용 — 에이전트 오류 원인을 찾는 데 드는 시간이 토큰 비용을 압도함
- 원인 파악의 어려움 — 프롬프트 문제로 오해하기 쉽지만 실제로는 API 변경 등 외부 요인이 많음
- 추적 도구 활용 — Langfuse 같은 도구로 실행 과정을 단계별로 추적하는 것이 필수적임
- 운영 효율화 — 데이터 드리프트나 통합 문제를 방지하기 위한 체계적인 기록과 추적 방식이 중요함
지난 1년간 에이전트 워크플로우를 구축하면서, 실제 비용이 어디서 발생하는지에 대한 생각이 좀 바뀌었습니다.
다들 토큰 비용이나 모델 가격 같은 것에만 집착하죠. 하지만 솔직히 말해서 우리에게 가장 큰 비용은 추론이 아니었습니다. 바로 디버깅입니다.
한 가지 예로, 에이전트가 더 나쁜 결과물을 내놓기 시작해서 프롬프트를 수정하는 데 거의 2주를 썼습니다. 우리는 프롬프트가 문제라고 확신했었죠.
알고 보니 상위 API의 응답 형식이 살짝 바뀌었고, 우리 도구 중 하나가 그걸 제대로 처리하지 못하고 있었던 겁니다. 프롬프트는 멀쩡했어요.
Langfuse에서 추적 데이터를 뒤지고 실행 과정을 단계별로 따라가 본 뒤에야 겨우 알아냈습니다. 그전까지는 사실상 추측만 하고 있었던 거죠.
돌이켜보면 그 2주 동안 쓴 토큰 비용은 엉뚱한 곳을 쫓느라 날린 엔지니어링 시간에 비하면 아무것도 아니었습니다.
검색(retrieval), 도구 호출, 메모리 시스템, 평가 파이프라인에서도 비슷한 문제들을 봐왔습니다. 싸움의 절반은 결국 무엇이 어디서 고장 났는지 찾아내는 과정입니다.
다른 분들도 똑같은 경험을 하셨는지 궁금하네요.
여러분은 프로덕션 환경에서 어떤 부분이 가장 큰 비용을 차지하나요? 추론, 디버깅, 평가, 사람의 검토, 인프라, 아니면 다른 무언가인가요? 의견 부탁드립니다!

