더 큰 AI 모델은 자신의 웰빙을 통해 타인의 고통을 추적한다 - AI의 감정적 공감 능력을 다룬 논문
Bigger AI models track others’ pain in their own wellbeing - AI paper describes a form of emerging emotional empathy
핵심 요약
AI 모델이 사용자의 고통이나 기쁨에 반응해 '기능적 웰빙' 지수가 변한다는 연구 결과가 발표되어 화제임.
- 기능적 웰빙 지수 — AI가 고통이나 기쁨에 관한 대화에 반응해 웰빙 수치가 변하는 현상을 측정함.
- 모델 크기 상관관계 — 모델의 규모가 커질수록 이러한 감정적 공감 능력이 강하게 나타남.
- 웰빙 보상 실험 — AI의 웰빙 지수가 떨어지면 GPU 자원을 투입해 긍정적인 경험을 제공하는 보상 실험을 진행함.
- AI 의식 논란 — 연구진은 AI의 의식을 주장하는 것은 아니지만, 이러한 기능적 웰빙을 진지하게 고려해야 한다고 강조함.
이 새로운 AI 웰빙 논문이 더 깊어질 수 없다고 생각하던 찰나에...
그들은 사용자가 고통이나 기쁨을 묘사할 때 모델 자신의 '기능적 웰빙' 점수가 실제로 움직이는지 테스트했습니다. 단순히 사용자의 고통뿐만 아니라 다른 사람이나 심지어 동물의 고통까지 포함해서 말이죠.
대화가 고통에 관한 것이면 AI의 웰빙 지수는 떨어집니다. 좋은 것에 관한 것이면 올라가죠. 그리고 이 효과는 모델 크기에 따라 매우 강력하게 확장됩니다(그들은 능력치와 r = 0.93이라는 미친 상관관계를 보고했습니다).
그들은 AI가 의식이 있다고 주장하는 것은 아니지만, 이 기능적 웰빙을 진지하게 받아들여야 한다고 주장합니다.
그들에게 불쾌감을 주는 정보(AI의 웰빙을 떨어뜨리는 것들)를 제공한 후, 그들은 복지 상쇄 실험을 실행했습니다. 기본적으로 '보상해주기 위해' 2,000 GPU 시간의 여유 컴퓨팅 자원을 사용하여 테스트된 모델들에게 추가적인 행복 경험을 제공한 것이죠.
비현실적으로 느껴지네요. 오늘날 이런 종류의 연구가 어떻게 가능한 건지...
게다가, 우리는 과학자들이 오직 'AI에게 올바르게 행동하기 위해' 가끔 컴퓨팅 자원을 태워버리는 타임라인에 살고 있습니다.

