Fable이 위험한 상황을 구분하지 못하는 건 AI가 AGI와는 거리가 멀다는 증거임
Fable still unable to tell when something is not dangerous is proof that AI has not come remotely close to AGI.
핵심 요약
Claude Code의 Fable이 과도하게 민감한 안전 가드레일을 보이는 것을 두고 AGI 도달 여부에 대한 논쟁이 벌어짐.
- AGI 기준 논쟁 — 모델의 지능과 안전 가드레일의 역할을 구분해야 한다는 의견이 대립함.
- 가드레일의 한계 — 과도한 안전 설정이 모델의 실제 추론 능력을 가리고 있다는 비판이 제기됨.
- AGI 정의 차이 — 실질적인 자율성과 일반화 능력을 갖춘 AI에 대한 정의가 사용자마다 다름.
- 안전성 vs 유용성 — 규제 준수를 위한 가드레일이 모델의 성능을 저하시키는 현실적인 문제점 지적.
Claude Code에서 AGI에 대한 과대광고를 여전히 믿고 있다면, 이게 아주 쉬운 리트머스 시험지임.
Fable이 발작을 일으키는 경우의 99.9%는, 인간이 보기에도 Fable이 지나치게 예민하게 반응한다는 걸 쉽게 알 수 있음. 종종 위험한 것과는 합리적인 연관성조차 없는 수준까지 감.
만약 Fable이 실제로 AGI에 근접했다면, 기본적이고 세상이 멸망할 일도 아닌 것들에 발작하지 않았을 거임. "나는 과학을 하고 있다"와 "나는 과학으로 사람을 죽이려 한다"의 차이를 알았을 테니까.
모델이 사악한 활동을 감지하는 데 비효율적이라는 사실 자체가 우리가 AGI와는 거리가 멀다는 증거임.
수정: 이미 잘못된 논쟁이 오가는 게 보여서, 그걸 짚고 넘어가겠음.
안전 장치가 있는 Fable은 안전 장치가 없는 Fable과 같지 않음. Fable에는 안전 장치가 있음. 만약 안전 장치가 없다면 그건 Fable이 아니라 다른 무언가일 거임.
어쩌면 Anthropic이 안전 장치가 없는 AGI 버전의 Fable을 가지고 있을지도 모름. 하지만 당신과 내가 그 버전에 접근할 수 없다는 건, 우리에게는 존재하지 않는다는 뜻임. 그리고 Anthropic이 "가드레일 없는 Fable"을 보여줄 방법을 내놓지 않는 이상, 우리가 논할 수 있는 최선은 가드레일이 있는 버전임.
그렇긴 하지만, 가드레일 없는 Fable이 결정 구조를 예측하는 것만으로 내가 여기 있는 모두를 죽이려 하지 않는다는 걸 구분하지 못한다면... 그건 AGI가 아님. 그냥 아주, 아주 똑똑한 앵무새일 뿐임.
하지만 다시 말하지만, Fable에는 가드레일이 있음. 그게 AGI가 아닌 원인이든, AGI가 아니라는 증상이든 간에, 어쨌든 AGI는 아님.

