세 명의 모델 리뷰어가 계획을 승인했지만, 한 명의 사람이 문장 하나에서 오류를 잡아냈다
three model reviewers approved the plan. the human in one seat caught it in a sentence
핵심 요약
LLM 리뷰 체인에서 모델 간의 의견 일치는 결국 동일한 맥락 공유로 인한 맹점일 뿐이며, 외부 맥락을 가진 사람이나 도구가 필수적이라는 경험담입니다.
- 모델 리뷰 한계 — 동일한 맥락을 공유하는 모델들은 같은 맹점을 가져 오류를 잡아내지 못함
- 맥락의 중요성 — 모델의 지능보다 서로 다른 정보와 맥락을 가진 리뷰어의 참여가 훨씬 효과적임
- 하이브리드 리뷰 모델 — 모델은 보조 역할로 두고, 인간 전문가와 도구를 결합한 검토 체계가 필요함
- 의견 일치의 함정 — 모델들만으로 구성된 리뷰 체인은 결국 비싼 비용의 에코 체임버가 될 위험이 있음
LangGraph에 리뷰 체인을 설정해뒀었음: 계획이 실행되기 전에 세 개의 서로 다른 모델이 각각 검토하게 해서, 하나가 틀려도 나머지 둘이 잡아내게 하려는 의도였지. 잘 작동하다가 어느 순간 안 되더라고. 마이그레이션 계획이 하나 올라왔는데, 세 리뷰어 모두 승인했어. 근데 알고 보니 야간 빌링 작업에서 여전히 읽고 있던 컬럼을 삭제해버린 거였지. 아무도 그걸 지적하지 않았어.
이유를 알아내는 데 한참 걸렸어. 세 모델이 딱히 의견이 갈린 게 아니었어. 내가 준 똑같은 맥락을 가지고 추론했기 때문에 똑같은 맹점을 공유했던 거지. 네 번째 모델을 추가했어도 소용없었을 거야. 똑같은 프레임으로 네 번 읽는 것뿐이니까. 문제는 '모델이 틀렸다'가 아니라 '루프 안에 있는 그 누구도 빌링 작업이 존재하는지 몰랐다'는 거였어.
실제로 해결한 방법은 아주 뻔했어. 빌링 담당자가 계획을 10초 보더니 "그 컬럼, 야간 작업에서 읽는 건데"라고 말한 거야. 더 똑똑한 모델이 아니라, 다른 맥락을 가진 다른 사람의 머리가 필요했던 거지.
그래서 내가 원하던 걸 만들었어. 팀원들이 실시간 세션에서 각자 자리를 맡고 계획을 짜는 거야(DBA는 스키마, 빌링 담당자는 빌링). 모델들은 아무도 앉지 않은 자리를 채우고 인간이 내린 결정을 이중으로 확인하는 거지. 팀 내에 아무도 답을 모를 때는 검증된 외부 전문가를 데려와서 자리를 하나 내주는 거야. 모델들은 여전히 거기 있지만, 전체 리뷰 패널이 아니라 빈틈을 채우고 두 번째로 읽어주는 역할만 하는 거지. 그렇게 해서 나오는 결과물은 인간과 모델의 논거가 모두 담긴 버전 관리된 계획이야.
아직 거칠고 개인 프로젝트 수준이지만, 이제 확신하는 패턴이 하나 있어. 모델로만 구성된 리뷰 체인은 결국 똑같은 프레임에 수렴한다는 거야. 가장 저렴한 해결책은 같은 자리에 모델을 하나 더 넣는 게 아니라, 너와는 다른 맥락을 가진 사람이 앉을 자리를 만드는 거지.
혹시 여기 사람들 중에 인간이나 도구가 강제로 다른 맥락을 주입하지 않고도 다중 모델 리뷰 체인에서 진짜 의견 충돌을 끌어낸 사람 있는지 궁금해. 내가 시도할 때마다 걔들은 그냥 수렴해버리거든.


