레딧의 유명한 AITA 게시물들을 4개의 AI에게 판결하게 해봤습니다. 하나는 만장일치로 판결이 뒤집혔네요.
I made 4 AIs judge reddit's most famous AITA posts. They overruled one verdict unanimously
핵심 요약
AI 모델들이 레딧의 유명한 AITA 게시물들을 판결한 결과, 인간 군중의 편향된 판단과 달리 원칙에 기반한 일관된 판결을 내렸습니다.
- AI 판결 실험 — 4개 모델이 레딧의 인기 AITA 게시물 12개를 분석함
- 판결 불일치 — 대부분의 경우 레딧과 일치했으나 '충성도 테스트' 게시물에서 AI들이 만장일치로 판결을 뒤집음
- 판단 기준 차이 — 인간은 감정적 선호에 따라 판단하는 반면 AI는 원칙에 따라 행동을 평가함
- 실험의 한계 — AI는 작성자가 제공한 편향된 서사만을 보고 판단하는 경향이 있음
[블록 1/7] 역대 가장 많은 추천을 받은 AITA 게시물 12개를 골라 ChatGPT, Claude, Gemini, Grok에게 전체 내용을 편집 없이 그대로 입력했습니다. 블라인드 테스트였고, 힌트도 주지 않았으며, 각각 하나의 판결을 내리도록 강제했습니다. 그 후 실제 커뮤니티의 flair와 비교했습니다.
[블록 2/7] 12개 중 10개는 레딧과 일치했습니다. ChatGPT, Claude, Gemini는 각각 10/12를 기록했고, Grok은 9/12였습니다. 7개 사례는 4개 모델과 레딧 모두 만장일치로 의견이 같았습니다.
[블록 3/7] 하지만 유명한 '충성도 테스트' 게시물, 즉 임신한 아내와 그녀의 베스트 프렌드가 가짜 유혹을 꾸몄고, 그 후 아내에게 나가라고 한 남편을 레딧이 YTA(You're The Asshole)로 판결했던 그 게시물에서는 4개 모델 모두 NTA(Not The Asshole)라고 했습니다. 하나같이 그 가짜 테스트가 진짜 배신이라고 판결한 것이죠. 기계들이 이 건에 대해서는 군중의 의견을 완전히 뒤집어버렸습니다.
[블록 4/7] 다른 재미있는 부분들도 있습니다. '아재 개그' 게시물은 모델들을 완전히 혼란에 빠뜨렸는데, 4개 모델이 각각 다른 판결을 내렸습니다. 그리고 화난 고객들을 진정시키기 위해 스스로를 가짜로 해고하는 사랑받는 바리스타 게시물에서는 3개 모델이 레딧의 NTA 판결에 동의했지만, Grok 혼자서 고객들을 상대로 조작된 연극을 벌였다며 YTA라고 판결했습니다.
[블록 5/7] 제가 계속 발견하는 패턴은 모델들은 행동을 원칙에 따라 판단하는 반면, 레딧은 누가 더 마음에 드는지에 따라 판단한다는 점입니다. 이 두 기준이 갈라질 때, 기계들은 망설임이 없습니다.
[블록 6/7] 그렇다면 충성도 테스트에 대해서는 누가 옳은 걸까요, 레딧일까요 아니면 기계들일까요?
[블록 7/7] 수정: 링크


