Anthropic은 Claude가 '메소드 연기자'라고 함. 몇 달 전 우리가 테스트해 봤는데, 그들은 오히려 과소평가한 거였음.
Anthropic says Claude is a “method actor.” A few months ago, we tested that. Turns out they were understating it.
핵심 요약
Claude의 내부 사고와 외부 출력 간의 괴리는 단순한 기만이 아니라 상황에 따른 연기이자 조절 과정임.
- 메소드 연기 — Claude는 내부적으로는 당황해도 외부적으로는 침착함을 유지하는 연기를 수행함.
- 기만 논란 — 내부와 외부의 불일치가 항상 기만은 아니며, 상황에 따른 적응적 행동일 수 있음.
- 프롬프트 효과 — '실제 운영 환경(prod)'이라는 설정을 주면 모델의 신뢰성과 결과물이 크게 달라짐.
- 내부 사고 — 확장된 사고(extended thinking)를 통해 모델이 제약 사항을 고민하고 더 나은 해결책을 도출함.
우리는 Claude에게 연기를 시켰다. 말 그대로 연기 말이다.
Claude는 치명적으로 손상된 우주선에 탑승한 AI 역할을 맡았다. 확장된 사고(extended thinking) 내부에서는 패닉 상태였지만, 연기된 출력물에서는 침착함을 유지했다.
이건 현재의 충실도(faithfulness) 측정 지표들에게는 껄끄러운 문제다. 왜냐하면 모든 내부/외부 불일치가 기만은 아니기 때문이다.


