파이트 클럽에 대해 말하지 마라 (Claude의 사이버 보안 과민 반응)
Don't talk about fight club (cybersecurity oversensitivity with Claude)
핵심 요약
사이버 보안 프로그램 승인 후에도 Claude가 보안 관련 질문에 과도하게 반응하며 모델을 다운그레이드하는 현상에 대한 불만입니다.
- 보안 프로그램 승인 — Anthropic의 사이버 보안 프로그램에 승인되었음에도 제약이 발생함
- 과도한 가드레일 — 무해한 보안 질문에도 Claude가 스스로를 검열하고 모델을 다운그레이드함
- Fable 모델의 한계 — 보안 검토 요청 시 Fable 모델에서 지속적으로 차단이 발생함
- 사용자들의 공감 — 다른 사용자들도 비슷한 보안 검열과 모델 다운그레이드 문제를 겪고 있음
최근 Anthropic의 사이버 보안 프로그램 승인을 받았습니다. 그래서 가이드라인을 위반하지 않도록 안전한 프롬프트 예시를 요청했죠. 이게 제 첫 질문이었습니다.
그다음 이렇게 물었습니다: 좋습니다. 저는 이 용도로 Claude를 사용하는 게 처음입니다. 제가 사용할 수 있는 안전한 예시를 좀 주실 수 있나요? 당신의 제한 범위 내에 있는 프롬프트들로요?
그러자 적절한 답변을 내놓더군요. 그러더니 스스로 그 답변을 플래그(차단)하고 Opus 4.8로 다운그레이드했습니다.
어이가 없더군요! :) 전 프로그램 승인을 받은 상태인데 말이죠. 이건 연구자가 할 수 있는 가장 무해한 질문일 텐데 말입니다.
그래서 결론은 제가 "기본적으로 차단된" 상태는 아니지만, 어떤 종류든 보안 관련 질문을 하면 다운그레이드된다는 것 같네요. 참고로 이 프로그램은 Fab.le 5는 다루지만, 제가 참여하지 않은 mytho.s는 포함하지 않습니다.

