Anthropic, 8월 14일부터 Claude Code의 기본 설정을 '자동 모드'로 변경: AI가 위험한 쿼리의 80% 이상을 차단하는 반면 인간은 14%만 차단함
Anthropic Flips Claude Code to Auto Mode by Default Aug 14, after finding AI blocks 80%+ dangerous queries while humans only 14%
핵심 요약
Anthropic이 Claude Code의 기본값을 자동 모드로 전환합니다. 인간의 승인 피로보다 AI의 자동 차단 성능이 훨씬 뛰어나다는 연구 결과 때문입니다.
- 성능 비교 — 인간의 승인보다 AI 자동 모드가 위험한 명령 차단에 훨씬 효과적임
- 승인 피로 — 반복적인 수동 승인 작업으로 인해 인간의 판단력이 급격히 저하됨
- 생산성 향상 — 자동 모드 사용 시 팀 및 엔터프라이즈 고객의 풀 리퀘스트가 25% 증가함
- 안전성 평가 — 외부 레드팀 평가를 통해 AI 분류기의 오류율이 12%에서 7%로 감소함
aiweekly.co
원문 사이트로 이동
TL;DR
- A controlled study of 1,053 paid testers found auto mode blocked 89% of dangerous commands; human manual approval caught only 13.6%.
- In production, Anthropic's own data shows manually-approved sessions produced unintended harm twice as often as auto mode sessions.
- Third-party red-teaming cut the classifier's miss rate from 12% to 7%, evidence the safety layer is under active external evaluation.
Anthropic이 내세우는 근거는 1,053명의 유료 테스터를 대상으로 한 내부 연구에 기반합니다. 해당 연구에서 분류기는 위험한 명령의 89%를 잡아냈지만, 동일한 프롬프트를 검토한 인간은 13.6%를 잡아내는 데 그쳤습니다. 또한 인간의 수행 능력은 50개의 프롬프트 이후 약 5%까지 떨어졌는데, 이는 승인 피로에 대한 상당히 치명적인 결과입니다. Anthropic은 또한 자동 모드를 사용하는 팀 및 엔터프라이즈 고객이 약 25% 더 많은 풀 리퀘스트를 생성한다고 밝혔으며, 각 도구 호출 시 분류기가 소비하는 소량의 추가 토큰에 대해서는 더 이상 요금을 청구하지 않을 예정입니다.


