구글의 180개 에이전트 설정 테스트 결과: 멀티 에이전트가 성능을 70% 떨어뜨림
Google tested 180 agent setups. Multi-agent made things 70% worse. I've been telling clients this for 30+ builds.
핵심 요약
멀티 에이전트 시스템이 순차적 작업에서 성능을 저하시킨다는 구글의 연구 결과를 바탕으로, 단순한 단일 에이전트의 효율성을 강조함.
- 연구 결과 — 멀티 에이전트 시스템이 순차적 작업에서 성능을 70% 저하시키고 오류를 17배 증폭시킴
- 실무적 관점 — 대부분의 비즈니스 작업은 순차적이므로 단일 에이전트와 풍부한 맥락이 훨씬 효과적임
- 과대광고 비판 — 멀티 에이전트가 복잡성을 내세워 컨설팅 비용이나 도구 구독료를 정당화하는 수단으로 쓰임
- 적용 범위 — 멀티 에이전트는 독립적이고 병렬적인 작업에만 제한적으로 유용함
구글이 GPT, Gemini, Claude 전반에 걸쳐 180개의 에이전트 설정을 테스트한 연구 결과를 발표했음. 멀티 에이전트 과대광고를 단번에 끝장낼 만한 결과임. 멀티 에이전트 시스템은 순차적 작업에서 성능을 70%나 떨어뜨렸음. 독립적인 에이전트들은 오류를 17배나 증폭시켰음.
한 에이전트가 무언가를 조금 잘못하면, 다음 에이전트가 그걸 바로잡는 대신 그 오류를 기반으로 작업을 수행함. 4단계쯤 가면 겉보기엔 그럴듯하지만 실제로는 완전히 틀린 결과물이 나옴. 나는 이게 고객 프로젝트를 망치는 걸 직접 목격했음.
한 고객이 영업 파이프라인에 4개의 에이전트를 원했음. 조사, 점수 매기기, 이메일 작성, 후속 조치. 조사 에이전트가 회사 정보를 잘못 가져왔음. 점수 매기기 에이전트는 잘못된 데이터를 기반으로 점수를 매겼음. 이메일 에이전트는 잘못된 점수를 기반으로 개인화된 이메일을 작성했음. 결국 시스템은 잠재 고객에게 완전히 틀린 이메일을 자신 있게 보내고 있었음. 우리는 시스템 전체를 뜯어고쳤음. 적절한 맥락을 갖춘 단일 에이전트로 바꾸니 즉시 제대로 작동했음.
다른 고객은 고객 지원 티켓에 병렬 에이전트를 사용했음. 공유된 맥락이 없었음. 에이전트 A가 고객에게 한 가지를 말하면, 20분 뒤에 에이전트 B가 같은 티켓에서 그 내용을 반박했음. 시스템이 문제를 해결하기보다 더 빨리 문제를 만들어내고 있었음.
내가 30개 이상의 빌드를 거치며 배운 내용을 구글이 확인해 준 셈임.
대부분의 비즈니스 작업은 순차적임. 2단계가 제대로 되려면 1단계가 맞아야 함. 순차적 작업에 에이전트를 추가하는 건 속도가 아니라 실패 지점만 늘리는 것임. 풍부한 맥락을 갖춘 잘 프롬프팅된 에이전트 하나가 80%의 경우에서 멀티 에이전트 시스템을 이김. 멀티 에이전트가 작동할 수 없어서가 아니라, 대부분의 문제는 그럴 필요가 없기 때문임.
멀티 에이전트는 작업이 완전히 독립적이고 병렬적일 때 의미가 있음. 전체 사례의 10~20% 정도일 것임. 나머지는 집중된 단일 에이전트나 에이전트가 아예 없는 단순 자동화가 훨씬 나음.
업계가 멀티 에이전트를 밀어붙이는 이유는 복잡성이 돈이 되기 때문임. 강의는 497달러를 정당화하기 위해, 도구 회사는 구독료를 정당화하기 위해, 에이전시는 2만 달러짜리 빌드를 정당화하기 위해 멀티 에이전트가 필요함.
우리는 데모만 잘 나오고 3주 만에 죽는 시스템이 아니라, 6개월 뒤에도 실제 프로덕션에서 작동하는 버전을 만듦. 계속 고장 나는 멀티 에이전트 설정으로 고생하고 있거나, 이제 막 빌드를 시작하려는데 정말 필요한지 궁금하다면 내 프로필 링크를 확인하셈. 30개 이상의 빌드를 해본 결과, 답은 거의 항상 생각보다 훨씬 단순함.

