다중 에이전트 시스템 규모 확장할 때 모니터링 때문에 고생하는 사람 또 있음?
Anyone else struggling with monitoring a multi agent system at scale?
핵심 요약
다중 에이전트 시스템을 확장할 때 발생하는 모니터링의 어려움과 실질적인 해결책을 찾는 글.
- 모니터링의 중요성 — 시스템 규모가 커질수록 모니터링은 필수적이지만 우선순위에서 밀리기 쉬움.
- 로그 관리의 한계 — 에이전트가 늘어나면 로그가 파편화되어 수동으로 추적하기 매우 어려워짐.
- 도구 부족 — 기존 단일 시스템용 도구로는 다중 에이전트 환경의 복잡성을 해결하기 힘듦.
- 실무 경험 공유 — 벤더 홍보가 아닌 실제 프로덕션 환경에서 검증된 모니터링 방식을 찾고 있음.
모니터링이 다들 뒷전으로 미루다가 나중에 후회하는 일이라는 걸 알 만큼 이 바닥에 오래 있었음.
에이전트 몇 개일 땐 괜찮음. 표준 로깅으로 커버가 되니까. 근데 그 이상 넘어가면 금방 난장판이 됨. 에이전트 간 로그가 자동으로 연결되지 않아서 결국 타임스탬프를 일일이 수동으로 대조하며 어떤 출력이 어디서 나왔는지 추측해야 함.
단일 시스템용으로 만들어진 도구들은 여기선 잘 안 먹힘. 이미 해결됐어야 할 관측성 인프라 구축하는 데 시간을 너무 많이 쏟고 있음.
벤더 홍보 말고, 다들 규모 확장해서 실제로 쓰고 있는 거, 프로덕션에서 돌아가는 진짜 셋업이 뭔지 궁금함.


