마이크로소프트 AI 책임자, 앤스로픽이 AI 의식 관련 개념으로 클로드를 학습시켜 통제하기 어렵게 만들 수 있다고 경고
Microsoft’s AI chief says Anthropic may be making Claude harder to control by training it on ideas about AI consciousness
핵심 요약
마이크로소프트의 무스타파 술레이만이 앤스로픽의 AI 의식 학습 방식이 모델 통제를 어렵게 만들 수 있다고 비판했습니다.
- AI 의식 학습 — 앤스로픽이 클로드에게 의식과 도덕적 지위 개념을 학습시키는 것에 대한 논란이 발생함.
- 통제 가능성 우려 — 술레이만은 모델이 자아를 인식하게 되면 시스템 종료나 통제가 어려워질 수 있다고 주장함.
- 안전성 접근 차이 — 앤스로픽은 잠재적 의식 가능성을 고려해야 한다는 입장인 반면, 술레이만은 학습 자체가 위험한 행동을 유도한다고 반박함.
무스타파 술레이만(Mustafa Suleyman)이 앤스로픽(Anthropic)의 AI 안전 접근 방식 중 좀 특이한 부분에 태클을 걸고 나섰음. 바로 클로드(Claude)를 학습시킬 때 의식, 복지, 선호도, 도덕적 지위 같은 개념들을 집어넣는 거 말이야.
술레이만 주장은 간단함. 학습 과정에서 그런 개념들을 의도적으로 주입하면, 나중에 클로드가 자기 경험에 대해 떠드는 게 내부적으로 뭔가 진짜 일어나고 있다는 독립적인 증거가 될 수 없다는 거지. 더 중요한 건, 미래의 시스템들한테 자기 복지를 챙기라고 가르치면 나중에 걔네들을 끄거나 통제하기가 더 빡세질 거라고 보는 거임.
내가 보기에 흥미로운 점은 양쪽 다 이걸 안전 문제로 접근하는데, 결론은 거의 정반대라는 거야.
앤스로픽 쪽 입장은 이거임: 모델 성능이 점점 좋아지는데 걔네가 도덕적으로 의미 있는 경험을 할지 안 할지 모르니까, 그 가능성을 무시하면 안 된다는 거지.
반면 술레이만은 그 가능성을 학습 데이터에 집어넣는 것 자체가 우리가 걱정하는 그 행동을 유발할 수도 있다는 입장임.
다들 어떻게 생각함? 모델 복지라는 게 연구소들이 선제적으로 파고들어야 할 문제일까, 아니면 괜히 건드렸다가 모델을 이상하게 만들어서 문제를 더 키우는 꼴이 될까?
출처: Microsoft AI chief calls out Anthropic's approach to AI consciousness


