멀티 에이전트가 작성한 코드를 검증할 수 없어서 계속 포기하게 되는데, 다들 어떻게 해결하고 계신가요?
I keep abandoning multi-agent setups because I can't verify the code they ship. How are you handling this?
핵심 요약
멀티 에이전트 시스템의 코드 검증 문제를 해결하기 위해 QA 에이전트 도입이나 단계별 검증 전략을 논의하는 글입니다.
- 검증의 어려움 — 에이전트가 생성한 다수의 PR을 일일이 확인하기 힘듦
- QA 에이전트 도입 — 브라우저 기반 자동 테스트로 PR을 검증하는 방식
- 계층적 검증 — 타입 체크, 린트, 통합 테스트 등 단계별 방어 체계 구축
- 검증 아티팩트 — 에이전트가 코드와 함께 검증 근거를 제출하도록 유도
Conductor 같은 에이전트 오케스트레이터를 써봤지만, 검증 없이 엄청난 양의 작업을 수행하는 방식이라 장기적으로는 계속 쓰지 못했음. 결국 항상 Claude Code를 사용하는 1인 에이전트 워크플로우로 돌아오게 되는데, 뭔가 놓치고 있는 것 같은 기분이 듦.
내가 겪은 상황:
- 3~5개의 에이전트가 동시에 작업을 시작하고, 각각 PR을 생성함
- CI는 통과하고, diff도 합리적으로 보임
- 아침까지 모든 미리보기 화면을 일일이 클릭해 볼 수는 없음
- diff와 CI 신호만 보고 머지함
- 다음 날 프로덕션에서 뭔가 깨짐. 에이전트는 내가 시킨 대로 했지만, 기능이 실제로 작동하지 않는 거임
CI가 통과했다고 해서 버튼을 눌렀을 때 실제로 작동하는지 알 수 있는 건 아님. 병렬로 에이전트를 많이 돌릴수록 검증 없이 머지하는 PR만 늘어남.
다들 어떻게 해결하고 있음?
- 미리보기 화면을 일일이 수동으로 클릭? (아침마다 2~3시간 걸림)
- 미리보기 배포를 구동하는 QA 에이전트?
- 모든 UI 흐름을 커버하는 머지 전 통합 테스트? (웃기지)
- 그냥 머지하고 프로덕션 깨지면 롤백?
난 이 분야에서 개발 중임. 각 PR의 미리보기 배포를 가져와서 Browserbase를 통해 실제 브라우저에서 열고, 기능을 클릭해 보고, 작동하지 않으면 PR을 실패시키는 두 번째 AI 에이전트를 만들었음. 검증이 알아서 돌아가니까 내가 직접 QA 단계를 거칠 필요가 없음.
실패하면 빌드 에이전트가 보고서를 받고 최대 3번까지 반복함.
나한테는 이게 빠진 퍼즐이었음. 이게 없었을 때는 에이전트 5개를 돌려도 PR을 머지하기가 너무 무서웠음. 지금은 QA 보고서만 검토하고 통과한 것들만 머지함.
혹시 이 문제 해결한 사람 있음? 아니면 다들 확인도 안 하고 머지하고 있는 거임?


