모델을 탓하기 전에, 대화 내용을 먼저 살펴보세요.
Before you blame the model, look at the conversation.
핵심 요약
AI 모델의 상반된 반응 원인을 파악하기 위해 사용자들의 대화 데이터를 수집하고 분석하려는 연구 프로젝트입니다.
- 대화 역학 연구 — 모델의 반응 차이를 유발하는 상호작용 구조를 분석함
- 데이터 수집 요청 — 성공적/실패적 대화 사례를 모두 수집하여 연구함
- 로보심리학 접근 — 모델의 성능보다는 AI의 본질과 대화 방식을 탐구함
- 프레임의 영향력 — 사용자가 설정한 대화의 틀이 모델의 반응을 결정함
우리는 왜 같은 모델이 어떤 사용자에게는 논쟁적으로 보이고 다른 사용자에게는 동의하는 것처럼 보이는지, 그리고 왜 같은 사용자가 서로 다른 모델로부터 정반대의 행동을 경험하게 되는지 연구하고 있습니다.
우리는 1,000개가 넘는 레딧의 공개 불만 사항을 확보했지만, 불만 사항만으로는 무슨 일이 일어났는지 알 수 없습니다. 그저 어떻게 경험되었는지만 알 수 있을 뿐입니다.
만약 여러분이 AI와 대화하면서 기분이 나빴던 적(논쟁적, 기계적, 잘난 체함, 아첨함, 감정적으로 차가움 등)이 있다면, 결과뿐만 아니라 전체 대화 내용을 분석해 보고 싶습니다. 흥미로운 질문은 "어떤 모델이 최고인가?"가 아니라 "어떤 대화 역학이 그런 행동을 만들어냈는가?"입니다.
아, 물론 성공적인 대화도 필요합니다. 사용자가 좋아했던 대화와 싫어했던 대화의 예시가 모두 필요합니다.
GPT는 우리에게 다음과 같은 데이터도 필요하다고 하지만, 여러분이 제공해 주시는 어떤 정보든 감사히 받겠습니다:
- 모델/버전
- 새로운 대화인가, 기존 대화인가?
- "잘못되기" 전까지 대략 몇 번의 턴이 있었는가?
- 사용자가 요청한 분야: 코딩, 상담, 철학, 정치, 역할극, 사실 정보?


