멀티 에이전트 LLM 시스템에서 우리는 잘못된 것을 최적화하고 있는 걸까?
Title: Are we optimizing the wrong thing in multi-agent LLM systems?
핵심 요약
멀티 에이전트 시스템에서 최종 결과물보다 모델 간 추론 과정의 차이를 분석하는 것이 더 중요할 수 있다는 의견을 제시합니다.
- 멀티 에이전트 시스템 — 최종 결과물 최적화에 치중하는 현행 방식의 한계 지적
- 추론 과정 분석 — 모델 간 의견이 갈라지는 지점을 파악하여 사고 과정을 검증함
- 연구 방향성 — 결과의 정확도보다 추론의 발산 지점을 분석하는 새로운 접근법 제안
최근 멀티 에이전트 LLM 시스템에 관한 연구들을 많이 읽어봤는데, 흥미로운 점을 하나 발견했어.
대부분의 접근 방식은 최종 답변을 개선하는 데 초점을 맞추고 있어.
모델들이 토론하고, 서로 비판하거나, 작업을 분담해서 결국 더 나은 전체 결과물을 만들어내도록 하는 방식이지.
이것도 중요한 방향이라고 생각해.
하지만 나는 다른 질문에 관심이 있어.
나는 이렇게 묻고 싶어.
여러 LLM을 사용할 때, 나는 최종 결과물을 비교하는 것부터 시작하지 않아.
대신, 다음과 같은 중간 추론 상태를 비교하지.
- 어떤 진술이 검증된 사실로 취급되는가?
- 어떤 부분이 여전히 가정으로 남아있는가?
- 타임라인은 어떻게 해석되는가?
- 어떤 반례들이 고려되는가?
- 서로 다른 모델들이 어느 단계에서 의견이 갈리기 시작하는가?
다시 말해, 내 목표는 여러 모델을 합의로 몰아가는 게 아니야.
내 목표는 그들의 추론이 처음으로 갈라지는 지점을 찾아내고 그 이유를 조사하는 거야.
나에게는 이게 대부분의 멀티 에이전트 토론 프레임워크와는 다르게 느껴져.
기존의 많은 시스템은 합의를 극대화하거나 최종 답변의 품질을 높이도록 설계된 것 같거든.
내가 관심 있는 건 추론의 발산 그 자체를 분석 대상으로 삼는 거야.
이런 관점이 이미 문헌에 존재하는지 궁금해.
최종 답변의 정확도에만 주로 집중하는 대신, 여러 추론 과정이 어디서부터 갈라지기 시작하는지 명시적으로 분석하는 논문이나 프로젝트가 있을까?
실제로 여러 LLM을 사용하는 사람들의 의견도 듣고 싶어.
중간 추론 상태를 비교하는 것이 단순히 최종 답변을 비교하는 것보다 더 유익하다고 느낀 적이 있어?
미래의 멀티 LLM 시스템을 위해 중요한 질문은 단순히 이것뿐만이 아닐 것 같아.
그것뿐만 아니라, 이것도 중요하지 않을까?

