AI 보안 연구소: GPT-5.5, Mythos를 포함한 사이버 공격 테스트에서 "우리가 테스트한 가장 강력한 모델일 수 있음"
AI Security Institute: GPT-5.5 "may be the strongest model we have tested" for cyber exploits, including Mythos
핵심 요약
AISI 테스트 결과 GPT-5.5가 Mythos와 대등하거나 더 뛰어난 사이버 공격 성능을 보임.
- AISI 성능 테스트 — GPT-5.5가 사이버 공격 작업에서 Mythos를 능가하는 결과를 보여줌.
- 마케팅 논란 — Mythos의 위험성 강조가 Anthropic의 과장된 마케팅 전략이었을 가능성이 제기됨.
- 기술적 비교 — GPT-5.5가 TLO 작업 및 전문가 수준 과제에서 Mythos보다 높은 성공률을 기록함.
Mythos에 대한 '공포'는 사실 Anthropic의 마케팅이었던 것 같다. AISI는 GPT-5.5가 많은 경우 Mythos와 거의 비슷하거나 더 나은 성능을 낼 수 있다는 것을 발견했다. 기사에서 중요한 인용구 몇 가지:
GPT-5.5는 10번의 시도 중 2번 TLO를 엔드투엔드로 완료했으며, 이를 달성한 두 번째 모델이 되었다. TLO를 해결한 첫 번째 모델인 Mythos Preview는 10번 중 3번 성공했다.
전문가 수준 과제에서 GPT-5.5는 평균 71.4%(±8.0%, 평균 표준 오차 1)의 성공률을 기록했으며, 이는 Mythos Preview의 68.6%(±8.7%), GPT-5.4의 52.4%(±9.8%), Opus 4.7의 48.6%(±10.0%)와 비교된다. 이 지표에서 GPT-5.5는 우리가 테스트한 가장 강력한 모델일 수 있다.


