Responses API 사용 시 출력보다 컨텍스트 토큰 비용이 더 많이 발생함
Long Responses API runs are costing us more from context than the output itself
핵심 요약
Responses API 워크플로우에서 누적되는 컨텍스트와 도구 결과값으로 인한 비용 증가 문제를 해결하는 방법을 논의합니다.
- 비용 최적화 — 누적되는 컨텍스트와 불필요한 도구 결과값을 정리하여 토큰 비용 절감함
- 도구 결과 관리 — 원본 JSON 전체를 유지하지 말고 필요한 데이터만 추출하여 보관함
- 에이전트 활용 — 컨텍스트 압축 API나 에이전트 하네스를 사용하여 효율적으로 관리함
- 단계별 분석 — 토큰 사용량이 급증하는 지점을 파악하여 역으로 최적화 작업 수행함
Responses API 쓰는 워크플로우 중에 좀 긴 거 토큰 사용량 자세히 뜯어봤는데, 비용 많이 나가는 실행들 보면 정작 모델이 생성하는 토큰보다 다른 데서 나가는 게 훨씬 많네. 처음 몇 단계는 평범한데, 워크플로우가 툴 몇 개 거치면서 계속 돌아가다 보니 실행이 길어질수록 이전 컨텍스트랑 툴 결과값을 계속 끌고 가더라고. 그래서 나중 단계로 가면 모델은 정작 짧게 답변하는데도 입력 쪽 토큰이 엄청나게 불어나 있음.
더 짜증 나는 건 이게 딱히 실패한 실행도 아니라는 거야. 보통은 결과 잘 뽑아주거든. 근데 같은 워크플로우라도 결과 도출까지 몇 단계나 툴을 거치느냐에 따라 토큰 사용량이 천차만별임. 그래서 오래된 툴 결과값을 쳐내거나 컨텍스트 일부를 요약해버릴까 고민 중인데, 괜히 토큰 아끼려다 모델이 필요한 정보 까먹어서 재시도하게 만드는 상황은 또 싫단 말이지. 너네는 Responses API로 긴 워크플로우 돌릴 때 이거 어떻게 처리하냐? 실행 중에 컨텍스트를 가지치기하냐, 아니면 그냥 성공한 긴 실행은 비용이 훨씬 많이 나오는 걸 감수하고 쓰는 거냐?

