Pattern Labs와 협력해 Claude Opus 4와 Claude Sonnet 4를 대상으로 다양한 사이버 보안 평가를 실시했습니다. 특히 Opus 4는 이전 모델 대비 눈에 띄는 성능 향상을 보였습니다.
Anthropic (with Pattern Labs)
AI와 사이버 보안이 교차하는 지금, 우리는 중요한 분기점에 서 있습니다. 일부 시나리오에서는 AI 모델의 사이버 공격 능력이 인간 수준에 근접하고 있기 때문입니다. Anthropic은 최전선에서의 안전을 지키기 위한 노력의 일환으로, 모델의 사이버 공격 역량을 엄격하게 테스트합니다. Claude Opus 4와 Claude Sonnet 4를 대상으로는 Pattern Labs와 협력해 독립형 CTF(Capture the Flag) 챌린지부터 복잡한 네트워크 환경 시뮬레이션에 이르기까지 심층 평가를 진행했습니다. 평가 결과는 상당한 진전을 보여줍니다. Opus 4는 기존 접근 방식이 실패하더라도 이에 집착하지 않고, 유연하게 사고하며 전략을 조정하는 능력이 크게 향상되었습니다. 또한 취약점 식별과 복잡한 다단계 공격 체인 실행 면에서도 뚜렷한 성능 향상을 보이며, 이전 모델이 실패했던 항목에서 일관되게 성공했습니다. 다만 한계도 여전히 존재합니다. 특히 예기치 못한 장애물에 직면했을 때 일관된 장기 계획과 목표를 유지하는 데 어려움을 보였습니다. Pattern Labs는 이번 평가의 전체 보고서를 공개했습니다. 이 보고서에는 위에서 언급한 주목할 만한 성과와 함께, Anthropic의 지속적인 안전 연구에 시사점을 주는 주요 한계도 담겨 있습니다.