프로덕션에서 Claude Code 멀티 에이전트 워크플로우 돌리는 분 계신가요? 소리 없는 실패는 어떻게 잡고 계세요?
Anyone running multi-agent Claude Code workflows in production? How are you catching silent failures?
핵심 요약
Claude Code 멀티 에이전트 환경의 무한 루프와 비용 폭주 등 '소리 없는 실패'를 감지하고 제어하는 실전 노하우 공유.
- 무한 루프 감지 — 에이전트 간 순환 참조나 반복되는 호출을 실시간으로 차단하는 메커니즘이 필요함.
- 비용 및 토큰 관리 — API 호출 단위가 아닌 전체 오케스트레이션 단계별 누적 토큰 사용량을 추적해 이상 징후를 포착함.
- 구조화된 출력 — 모든 서브 에이전트가 JSON 형식을 지키게 하여 경계 단계에서 실패를 즉시 감지함.
- 가시성 확보 — 각 에이전트의 역할, 할당된 파일, 승인 상태 등을 사후 검토 가능하도록 상세 로그를 남김.
서브 에이전트와 MCP 서버를 활용해 Claude Code를 실행 중인데, 시스템이 아무런 에러도 던지지 않고 루프를 돌거나 잘못된 출력을 연쇄적으로 내뱉는 경우를 몇 번 겪었습니다. 트레이스는 멀쩡해 보이지만, 비용만 많이 나오고 결과는 틀려요. 다른 분들은 어떻게 하고 계신지 궁금합니다.
Claude Code의 내장 로그, 커스텀 콜백, 프레임워크 대시보드를 사용하시나요, 아니면 그냥 트랜스크립트를 일일이 읽으시나요?
그리고 실제로 조정 실패(루프, 걷잡을 수 없는 토큰 사용, 에이전트끼리 딴소리하기)를 겪어본 분 계신가요? 아니면 대부분의 사람들이 운영하는 규모에서는 별 문제가 안 되나요?



