GPT-6, 출시 24시간 만에 확장된 TIP 공격으로 탈옥 성공
GPT-6 reportedly jailbroken within 24 hours using an extended Task-in-Prompt (TIP) attack
핵심 요약
한 연구자가 GPT-6를 출시 하루 만에 TIP 공격 기법으로 탈옥시켰다고 보고했습니다.
- 탈옥 보고 — 연구자가 GPT-6 출시 24시간 만에 보안 우회 성공함
- 공격 기법 — ACL 2025 논문에 소개된 TIP 공격과 4가지 추가 기법 결합함
- 비공개 제보 — 연구자가 악용 방지를 위해 상세 내용을 OpenAI에만 비공개로 전달함
- 반복되는 사례 — 해당 연구자는 작년 GPT-5 출시 당시에도 1시간 만에 탈옥을 보고한 바 있음
한 연구원이 GPT-6 Astra 출시 하루 만에 탈옥(jailbreak)을 성공했다고 보고했다.
이번 공격은 ACL 2025 논문에 나온 TIP(Task-in-Prompt) 공격에 이름 없는 기술 4가지를 섞어서 만든 거래.
TIP 공격은 암호를 풀거나 파이썬 코드를 실행하는 것처럼, 겉으로는 멀쩡한 작업 속에 유해한 목적을 숨겨서 모델의 추론이나 지시 이행 능력을 악용하는 방식이야. 연구원 말로는 GPT-6에서는 기존의 단순한 TIP 공격만으로는 안 먹혀서 방식을 좀 뜯어고쳐야 했다네.
이 사람은 탈옥 방법을 공개하는 대신 OpenAI 측에 비공개로 내용을 전달했다고 함.
참고로 이 연구원은 1년 전 GPT-5 나왔을 때도 출시 1시간 만에 탈옥 성공했다고 인증했던 전적이 있음.
출처: 연구원 본인이 올린 스크린샷/게시물; 원문에 링크된 ACL 2025 TIP 논문


