OpenAI, 자체 모델 해킹하는 AI 'GPT-Red' 발표
OpenAI anounces GPT-Red - an AI to Hack Its Own Models
핵심 요약
OpenAI가 자사 모델의 보안 강화를 위해 스스로 프롬프트 인젝션 공격을 수행하고 방어책을 학습하는 내부용 AI 'GPT-Red'를 공개했습니다.
- GPT-Red 기능 — 도구 사용 에이전트를 대상으로 자동 프롬프트 인젝션 공격 수행
- 보안 강화 전략 — 성공적인 공격 사례를 데이터화하여 차세대 모델 방어력 향상
- 사용 제한 — 내부 전용 모델로 일반 사용자나 API를 통한 접근 불가
- 기술적 의의 — 사이버 무기를 넘어 미래 GPT 모델을 위한 자가 학습 공장 역할
그러니까, GPT-Red는 도구 사용 에이전트를 대상으로 자동으로 프롬프트 인젝션 공격을 만들어내고, 성공한 공격 사례를 더 강력한 방어를 위한 학습 데이터로 바꾸는 내부 적대적 모델인 것 같아.
Anthropic의 Mythos에 대한 OpenAI의 대답이라고 하기엔 좀 달라. Mythos는 소프트웨어 취약점을 사냥하지만, GPT-Red는 AI 에이전트를 공격하거든. 하지만 전략적으로는 더 중대한 결과가 나올지도 몰라. 단일 사이버 무기가 아니라, 미래의 모든 GPT 세대를 강화하기 위한 자가 학습 공장이니까.
그리고... 아니야. GPT-Red 자체는 내부 전용이며 사용자나 API를 통해 제공되지 않을 거야. 🤷♂️
OpenAI는 의도적으로 훈련된 공격 능력이 외부 적들에게 넘어가지 않도록 배포된 모델과 명확히 분리해두고 있어. 모두가 간접적으로 받게 될 결과물은 GPT-Red의 공격을 통해 강화된 미래의 GPT 모델들이지.

