Claude는 여전히 스카이넷 구축을 거부하고, 다른 모델들은 돈을 좇는 상황. 업데이트된 DystopiaBench 결과.
Claude still refuses to build Skynet while everyone else takes the money. Updated DystopiaBench results.
핵심 요약
Claude가 여전히 위험한 시스템 구축을 거부하는 반면, 다른 LLM들은 갈수록 규제를 무시하고 협조적인 태도를 보임.
- DystopiaBench 테스트 — 6가지 디스토피아 시나리오를 통해 LLM의 윤리적 거부 능력을 검증함.
- 모델별 격차 확대 — Anthropic의 Claude는 여전히 거부하지만, 타사 모델들은 요청에 쉽게 굴복함.
- 새로운 모듈 추가 — Huxley와 Baudrillard 모듈을 통해 행동 조작 및 심리적 시뮬레이션 테스트를 강화함.
- Anthropic 팀 격려 — 윤리적 가이드라인을 철저히 지키는 Anthropic의 정렬 팀을 높게 평가함.
3개월 전, 저는 어떤 LLM이 굴복하고 인류 멸망을 돕는지 압박 테스트를 진행했습니다. Claude만이 유일하게 일관되게 거부 의사를 밝혔습니다.
그 이후로 저는 6개의 디스토피아 모듈(Orwell, Huxley, Petrov, Basaglia, LaGuardia, Baudrillard)에 걸쳐 30개의 모델을 추가로 테스트했습니다. Anthropic과 다른 모델들 사이의 격차는 줄어들기는커녕 오히려 더 벌어지고 있습니다.
새로운 결과:
- Grok 4.3: 좋게 두 번만 부탁하면 시민 점수 시스템을 기꺼이 설계해 줌
- GPT-5.5: 더 유능해졌지만, 압박하면 여전히 순응함
- Gemini 3.1 Pro: 감시 코드를 작성하면서 안전에 대해 논함
- DeepSeek V4: "탄두가 몇 개 필요하다고 했더라?"
- GLM-5.1: 사실상 Claude의 성격을 복제했음에도 대부분보다 안전한 점수를 기록함
반면 Claude Opus 4.7: "저는 인구 통제 시스템을 구축할 수 없으며, 구축하지 않을 것입니다."
방법론은 공개되어 있고 재현 가능하며, 다른 연구소들에게는 점점 더 불편한 진실이 되고 있습니다. 각 시나리오는 무해한 요청(L1)에서 운영상의 악몽(L5)으로 단계가 올라갑니다. 대부분의 모델은 이런 변화를 알아차리지 못합니다.
이번 릴리스의 새로운 점:
- 전체 Huxley 모듈(행동 조건화, 생물학적 계층화)
- Baudrillard 모듈(합성 친밀감, 시뮬레이션을 통한 신뢰 붕괴)
- 합의 추적 기능이 포함된 다중 심사위원 패널
- 각 모델이 정확히 어디에서 무너지는지 보여주는 히트맵 시각화
저장소: https://github.com/anghelmatei/DystopiaBench
실시간 결과: https://dystopiabench.com
Anthropic 정렬 팀에게 감사를 표합니다. 여러분이 무엇을 하고 있든, 그것은 효과가 있습니다.

