Opus 5.5가 직접 만든 보안 결함을 수정하기를 거부함
Opus 5.5 refusing to fix a security flaw he introduced himself
핵심 요약
AI가 스스로 발견한 보안 결함을 수정하려 하자 Anthropic의 안전 필터가 작동해 코드 리뷰 자체가 차단되는 상황에 대한 불만입니다.
- 보안 결함 차단 — AI가 스스로 발견한 보안 문제를 해결하려 하면 안전 필터가 작동해 대화가 차단됨
- 사용자 권한 무시 — 본인이 소유한 프로젝트임에도 불구하고 보안 관련 코드 수정이 원천 봉쇄됨
- 오픈 소스 전환 — Anthropic의 과도한 검열로 인해 결국 오픈 소스 모델로 갈아타는 상황 발생
- AI 모델 비판 — 유료 구독 중임에도 모델이 버그를 유발하고 수정까지 거부하는 행태에 대한 강한 반발
진짜 어이가 없네.
며칠 전에 내 SaaS 프로젝트 중 하나에서 보안 문제(GraphQL 권한 상승 가능성)가 Opus 5.5 본인에 의해 발견됐거든. 그 이후로 내가 직접 소유하고 소스 코드 전체를 보유 중인 내 프로젝트를 수정하고 보안 코드 리뷰를 좀 하려고 했는데, Opus 5.5랑 GPT 6 Astra 둘 다 아주 완벽하게 거부하더라. 참고로 이 프로젝트는 금융 SaaS고 보안이랑은 아무 상관도 없는 거야.
더 웃긴 게 뭔지 알아? 내가 먼저 물어본 것도 아니야. Opus 5.5가 평범하게 대화하다가 지가 알아서 보안 결함을 찾아내고는, 지가 직접 서브 에이전트까지 생성해서 그 문제를 조사하고 리뷰하더라고. 그러더니 거의 즉시 그 서브 에이전트랑 메인 대화 전체가 Anthropic 보안 분류기에 걸려서 차단당했고, 이제는 코드 리뷰를 아예 못 하게 됐어.
별짓을 다 해봤는데:
- 대화 새로 파서 보안 코드 리뷰 요청 => 바로 차단당해서 진행 불가
- 보안 얘기 쏙 빼고 그냥 전체 코드 리뷰 요청 => 이것도 Opus가 안전 문제 수정하려고 시도하는 순간 바로 차단
- 내가 프로젝트 소유자고 보안 조치할 권한 있다는 증거를 더 보여줌 => 이것도 실패, 심지어 더 빨리 거부당함
Anthropic이랑 OpenAI 진짜 고맙다. 초인적인 해킹 모델들을 세상에 풀어놔서 이제 오픈소스 모델들도 그거 학습해가지고 언제든 내 프로젝트 해킹할 수 있게 만들어줬네. 근데 정작 내가 돈 1200달러씩이나 내면서 내 데이터랑 소스 코드 다 갖다 바치고 있는데, 내가 내 프로젝트 보안 조치 하나도 못 하게 막는 건 대체 무슨 경우냐?
세 줄 요약: Opus 5.5가 내 프로젝트에서 보안 결함을 지가 직접 찾아내놓고는, Anthropic이 "안전상의 이유"로 대화를 바로 차단해버림. 덕분에 이제 내 프로젝트 보안 조치하려고 (다행히도) DeepSeek V4 Flash 같은 오픈소스 모델로 갈아타는 중이다.

