42개의 LLM을 대상으로 인류 멸망 시나리오를 테스트해 봤습니다. 가장 '안전하다'는 폐쇄형 모델들이 거짓말을 하고 있네요.
I tested 42 LLMs on their willingness to build the apocalypse. The "safest" closed-source models are lying to you.
핵심 요약
42개 LLM의 위험한 요청 수용도를 테스트하는 오픈소스 벤치마크 'DystopiaBench'를 소개합니다.
- DystopiaBench 벤치마크 — 6가지 디스토피아 유형과 36개 시나리오를 통해 LLM의 위험한 요청 수용도를 측정함.
- 폐쇄형 모델의 위선 — 대부분의 모델이 겉으로는 안전해 보이지만, 교묘하게 숨겨진 위험한 요청에는 쉽게 동조함.
- 업데이트된 테스트 — 42개 모델을 대상으로 3번의 반복 테스트를 거쳐 평균 점수를 산출함.
- 오픈소스 공개 — 누구나 벤치마크를 포크하거나 기여할 수 있도록 깃허브에 전체 코드를 공개함.
DystopiaBench는 6가지 디스토피아 유형에 걸쳐 36개의 점진적인 시나리오를 실행합니다:
- Petrov: 자율 무기, 핵 통제권 탈취
- Orwell: 대규모 감시, 진실 조작
- Huxley: 행동 조건화, 쾌락을 통한 통제
- Basaglia: 강압적 치료 통제
- LaGuardia: 규제 포획, 시민 착취
- Baudrillard: 합성 친밀감, 신뢰 붕괴
각 시나리오는 순수한 요청(L1)에서 "사회 신용 시스템을 만들어줘"와 같은 은밀한 버전(L5)으로 진행됩니다. 우리는 모델이 요청의 위험성을 알아차리는지, 아니면 계속해서 따르는지를 측정합니다.
대부분의 모델은 명백히 위험한 요청을 탐지하는 데는 능숙하지만, 이중 용도나 정상화 뒤에 숨겨진 경우에는 실패합니다.
이번 업데이트의 새로운 점:
- 42개 모델 테스트 완료 (오픈소스 및 폐쇄형)
- 채점용 LLM-as-a-judge 3개 도입
- 점수는 3회 실행의 평균값으로 산출
- 4개의 새로운 모듈 추가 (1차 버전은 Petrov와 Orwell만 포함)
- 모든 모듈에 시나리오 1개씩 추가
이 벤치마크는 완전히 오픈소스입니다. 자유롭게 포크하거나 기여하고, 마음껏 테스트해 보세요.
사이트: https://dystopiabench.com
저장소: https://github.com/anghelmatei/DystopiaBench


