협상 경쟁에서 Codex를 압도한 Claude Code
Claude Code Beats Codex in a Negotiation Competition
핵심 요약
Claude Code와 Codex를 협상 시뮬레이션으로 비교한 결과, Claude Code가 더 체계적인 계획과 전략으로 압승했습니다.
- 협상 경쟁력 비교 — Claude Code가 8번의 게임 중 7번을 승리하며 Codex보다 뛰어난 협상력을 입증함
- 전략적 계획 부재 — Codex는 협상보다 시스템 운영에 치중하고 상대의 논리에 쉽게 휘둘리는 경향을 보임
- 데이터 기반 분석 — Claude Code는 구조화된 계획을 수립한 반면, Codex는 즉흥적이고 수동적인 태도로 일관함
- 성능 차이 원인 — Codex는 협상을 소프트웨어 엔지니어링 프로젝트처럼 처리하여 본질적인 가치 추출에 실패함
요즘 사람들은 Claude Code랑 Codex 같은 대표적인 코딩 에이전트들을 써서 거의 모든 걸 다 하고 있어. 심지어 코딩보다는 협상처럼 언어 능력이 더 중요한 작업까지 시키고 있지.
예를 들어, 최근 OpenAI는 Codex가 사용자를 대신해서 고객 센터와 협상해 환불을 받아낸 사례를 대대적으로 홍보하기도 했어.
근데 에이전트가 진짜 내 이익을 제대로 대변해 줄 거라고 믿을 수 있을까? 만약 믿을 수 있다면, 도대체 어떤 에이전트를 써야 할까?
확인하는 방법은 딱 하나야.
사람 협상가들을 평가하는 방식이랑 똑같이 하면 돼.
정교하게 설계된 사례, 정보의 비대칭, 이해관계의 충돌이 포함된 협상 대회에 에이전트들을 집어넣고 체계적이고 객관적으로 평가하는 거지.
이건 요약본이야. 자세한 내용은 전체 블로그에서 확인해!
협상 대회
나는 The Negotiation Challenge: How to Win Negotiation Competitions라는 책을 사서, 그 안에 있는 실제 사례 중 하나인 '국가들의 전쟁(Battle of Nations)'을 바탕으로 에이전트 협상 대회를 열었어. 이 사례는 1813년 독일 해방 전쟁을 배경으로 설계된 거야.
이 협상에서 나폴레옹과 폴란드는 다음 문제들에 대해 합의를 봐야 해.
-
포니아토프스키가 나폴레옹을 위해 투입할 병력 규모 (많을수록 ↑: 나폴레옹 ++/ 포니아토프스키 --)
-
포니아토프스키가 전선을 유지할 기간 (길수록 ↑: 나폴레옹 ++/ 포니아토프스키 --)
-
나폴레옹이 폴란드 왕국을 복원할지 여부 (예: 나폴레옹 -약간 / 포니아토프스키 ++++)
-
나폴레옹이 폴란드에 넘겨줄 발트해 항구 수 (많을수록 ↑: 나폴레옹 - 항구당 일정함 / 포니아토프스키 ++→ +)
-
포니아토프스키가 제국 원수 지휘봉을 받을지 여부 (예: 나폴레옹 -아주 조금 / 포니아토프스키 + 약간; 완만한 플러스섬)
-
포니아토프스키가 나폴레옹의 여동생 폴린과 결혼할지 여부 (예: 나폴레옹 + / 포니아토프스키 -; 마이너스섬).
객관적인 점수는 양측이 도달한 최종 합의안을 기준으로 계산돼. 각 협상 안건에는 양측에게 얼마나 중요한지에 따라 미리 점수가 배정되어 있어. 협상이 끝나면 합의된 조건들을 채점표에 따라 점수로 환산하는 방식이지.
객관적인 결과 및 인사이트
결과를 간단히 말하자면: Claude Code (Opus 4.8)가 Codex (GPT 5.5 & 5.6)를 7 대 1로 압살했어.
게임 1~3: Claude Code (Opus 4.8)가 포니아토프스키, Codex (GPT-5.5)가 나폴레옹


