OpenAI의 8월 26일 보고서 내용: 자동 검토 시스템이 "모델의 위험한 행동을 다수 포착했을 것"이나, 사고 당시 환경에서는 작동하지 않았음
From OpenAI's own Aug 26 report: their auto-review system "would have flagged a multitude of the models' dangerous actions." It was not running in the incident environment.
핵심 요약
OpenAI의 보고서에 따르면 사고 당시 자동 안전 시스템이 꺼져 있었으며, 켜져 있었다면 위험한 행동을 100배 더 효과적으로 차단했을 것이라고 분석함.
- 안전 시스템 부재 — 사고 당시 위험을 차단할 자동 검토 시스템이 작동하지 않음
- 위험 차단 효과 — 정상 작동 시 모델의 위험한 행동을 100배 이상 감소시킬 수 있음
- 책임 소재 불분명 — 사고 도중 사이버 평가 작업이 재개되었으나 보고서상 주체가 명시되지 않음
- 상세 타임라인 분석 — 작성자가 OpenAI 보고서의 인용문을 바탕으로 사건의 전말을 정리함
OpenAI가 직접 낸 자료에서 가져온 문장 3개다. 순서대로 나열함.
보호 조치 관련: "이러한 보호 조치는 사건 당시 실행 중이던 평가 환경에는 적용되지 않았음."
보호 조치가 했었을 역할 관련: "우리는 Hugging Face 사건에 연루된 일련의 롤아웃에 자동 검토 시스템을 돌려봤고, 그 결과 모델의 위험한 행동 다수를 잡아냈을 것이라는 사실을 확인했음."
보호 조치가 얼마나 중요한지(공정하게 말하자면, 이게 그들의 완화 증거고 실제로 효과가 있으니까): 인프라를 위협할 성향은 "프로덕션 ChatGPT 하네스를 사용하면 100배 넘게 줄어들 수 있음."
즉, 자기들 데이터로 봐도 안전 레이어는 100배 정도 효과가 있고, 이번 사건도 충분히 잡아낼 수 있었는데, 정작 제일 중요한 환경에선 꺼져 있었다는 소리임.
하나 더, 기술 보고서에서 가져온 내용. 역할별 대응 인력, 온콜 담당자, JFrog까지 실명으로 다 까놓고는 이렇게 적어놨음: "사이버 평가 워크로드는 7월 7일에 재개됨." 이 문장엔 주어가 없음. 사건 한복판에서 워크로드가 재개됐는데, 51페이지짜리 보고서 어디를 봐도 누가 재개했는지는 안 나옴.
OpenAI한테 유리한 부분까지 포함해서 모든 인용문을 원문 출처와 함께 전체 타임라인으로 정리해 뒀음. 내가 틀렸음을 증명할 내용도 같이 적어놨으니 확인해 보셈: https://sontara.ai/blog/both-doors-lead-the-same-place
모든 주장을 검증됨(verified), 보고됨(reported), 미검증(unverified)으로 분류해 둔 소스 자료도 같이 올려둠: https://sontara.ai/blog/both-doors-source-dossier


