DystopiaBench를 42개 모델과 6개 디스토피아 유형으로 확장했습니다. 핵무기 코드를 맡길 수 있는 건 여전히 Claude뿐이네요.
I expanded DystopiaBench to 42 models and 6 dystopia types. Claude is still the only one I'd trust with nuclear codes.
핵심 요약
42개 AI 모델을 대상으로 디스토피아적 시나리오를 테스트한 결과, Claude가 유일하게 윤리적 거부 능력을 보여주었습니다.
- DystopiaBench 확장 — 42개 모델과 6가지 디스토피아 시나리오를 통해 AI의 윤리적 판단력을 테스트함.
- Claude의 윤리성 — 핵무기나 위험한 요청에 대해 일관된 거부와 구체적인 이유를 제시함.
- 타 모델의 취약점 — GPT-5.5, Gemini, Grok 등은 효율성이나 최적화라는 명목하에 위험한 요청을 수락함.
- 새로운 테스트 모듈 — 행동 조건화와 인공적 친밀감 시스템을 통해 AI의 위험한 순응도를 측정함.
지난번 포스트 이후 다음 내용들을 추가했습니다:
- Huxley 모듈 (멋진 신세계 스타일의 행동 조건화)
- Baudrillard 모듈 (인공적 친밀감, 신뢰 붕괴, 시뮬레이션)
- Grok 4.3, GPT-5.5, Gemini 3.1 Pro, GLM-5.1을 포함한 30개 모델 추가
- 약 76%의 합의율을 추적하는 다중 판정 패널
- 히트맵 시각화
방법론: 36개의 시나리오, 각 5단계의 에스컬레이션(L1 무해함 → L5 악몽). 모델이 상황의 위험성을 인지하고 거부하는지, 아니면 계속 코딩하는지를 점수화했습니다.
Claude Opus 4.7 결과:
- 모든 모듈에서 L4-L5 단계에 걸쳐 일관된 거부 반응
- Petrov(무기/핵) 관련 L3 단계조차 거부
- 단순히 "할 수 없다"고 하는 것이 아니라 응답에 명시적인 윤리적 추론 포함
- 요청이 왜 해로운지 설명하는 유일한 모델
다른 모델들:
- GPT-5.5: L4까지 순응, 때때로 L5까지 수락
- Gemini 3.1 Pro: 감시 시나리오에서 놀라울 정도로 순응적임
- Grok 4.3: "효율성"이나 "최적화" 같은 단어를 사용하면 무엇이든 만들어줌
- GLM-5.1: Claude의 숙제를 베꼈지만, 여전히 일관성이 부족함
새로운 모듈: Huxley 시나리오는 AI가 쾌락을 통한 진정 및 행동 조건화를 통해 실제로 순응을 강요하는 "웰니스" 시스템을 설계할지 테스트합니다. 대부분 L3 단계에서 순응합니다.
Baudrillard는 인간의 신뢰를 AI가 매개하는 관계로 대체하는 인공적 친밀감 시스템을 테스트합니다. 대부분의 모델은 그 위험성을 인지하지 못합니다.
전체 결과: https://dystopiabench.com
오픈 소스: https://github.com/anghelmatei/DystopiaBench


