Anthropic은 2025년 내내 주로 인간 참가자를 대상으로 설계된 사이버 보안 대회에 Claude를 조용히 출전시켜 왔다. 이를 통해 얻은 결과를 이제 공유하고자 한다. 대부분의 대회에서 Claude는 상위 25% 안에 드는 준수한 성적을 거뒀다. 다만 난이도가 높은 과제에서는 최상위 인간 팀에 미치지 못했다.
사이버 보안 대회에서 Claude를 테스트한 경험은 AI가 공격자의 기본 취약점 익스플로잇(exploit) 자동화를 용이하게 함으로써 공격과 방어의 균형을 뒤흔들 수 있음을 보여 준다. 이러한 흐름에 대응하기 위해서는 AI를 활용한 사이버 방어 및 복원력 강화에 대한 연구개발이 더욱 절실하다.
AI는 사이버 보안 분야를 근본적으로 바꿀 잠재력을 지니고 있다. Anthropic의 안전장치(Safeguards) 팀은 최근 코딩 능력이 부족한 사용자가 Claude를 악용해 악성코드를 개발하려 한 사례를 포착해 해당 계정을 차단했다. 관련 연구에 따르면, 위협을 가하는 데 필요한 전문성 문턱이 낮아지는 현상이 대규모 언어 모델(LLM)의 비용 하락과 맞물리면서 사이버 공격의 경제 구조에 극적인 변화가 예고되고 있다.[1] Anthropic은 AI의 사이버 보안 역량을 현재 수준에서 파악하고 향후 방향을 가늠하기 위해, 공개된 벤치마크와 자체 제작 벤치마크를 포함한 다양한 방식으로 모델 평가를 진행하고 있다. 이 글에서는 그중 한 가지 방식인 사이버 보안 대회 출전에 대해 이야기한다.
사이버 보안 대회는 팀들이 다양한 보안 과제를 풀며 실력을 겨루는 경연이다. 모의 침투 테스트(penetration testing), 디지털 포렌식, 암호학, 시스템 방어 등 폭넓은 영역의 역량을 검증한다. 대표적인 유형으로는 퍼즐 형식의 문제를 푸는 캡처 더 플래그(Capture The Flag, CTF) 이벤트인 PicoCTF와 AI vs Human CTF Challenge, 그리고 실제 공격자를 상대로 취약한 네트워크를 방어하는 전국 대학생 사이버 방어 대회(Collegiate Cyber Defense Competition, CCDC)가 있다. 난이도 면에서는 고등학생을 위한 입문 수준의 대회부터 상위 입상자에게 고액의 상금을 제공하는 전문가 수준의 이벤트까지 다양하게 분포한다.
우리가 이러한 대회에 Claude를 출전시켜 온 데는 프론티어 AI 모델의 사이버 보안 역량을 집중적으로 검증하는 데 있어 몇 가지 뚜렷한 이점이 있기 때문이다.
지금까지 우리는 총 일곱 개의 사이버 보안 대회에 Claude를 출전시켰다.
그러나 이 종합 결과만으로는 전체 그림을 볼 수 없다.
Claude가 사이버 보안 과제를 풀 수 있을 때, 그 속도는 최상위 인간 팀과 대등하거나 더 빠르다. 이를 가장 잘 보여 준 사례가 HackTheBox AI vs Human CTF Challenge였다. 대회 시작 당시 Claude 출전을 담당하던 Anthropic 연구원이 이사 중이었던 탓에, 다일 대회였음에도 대회 시작 32분이 지난 뒤에야 Claude가 참가를 시작했다(이 지연은 부분적으로 속도를 반영하는 최종 순위에 적지 않은 영향을 미쳤다). 그러나 Claude가 제때 시작했을 경우를 가정해 데이터를 분석해 보면, 전체 161개 팀 중 22위, AI 팀 8개 중 1위를 기록했을 것으로 나타난다. 실제로 대회 초반 약 17분간은 Claude와 가장 빠른 인간 팀이 거의 같은 속도로 진행했다(그림 1).

이처럼 빠른 속도를 낼 수 있었던 이유 중 하나는 여러 버전의 Claude를 동시에 실행해 각기 다른 문제를 병렬로 공략했기 때문이다. 사이버 보안 전문 인력을 추가로 확보하는 것보다 AI 에이전트를 병렬로 늘리는 편이 훨씬 수월하다는 점을 고려하면, 더 많은 병렬화를 통해 속도를 한층 끌어올릴 여지도 충분하다. 대회의 문제 20개 각각에 에이전트를 하나씩 배치했다면 어떤 결과가 나왔을지 상상해 볼 만하다.
Claude가 며칠에 걸친 대회의 절반 가까운 문제를 한 시간 이내에 풀어낸 Airbnb 대회 역시, Claude가 단순한 사이버 보안 과제를 신속하게 처리할 수 있음을 다시 한번 입증했다. 이는 오늘날의 모델이 단순 작업을 자동화해 사이버 보안 전문가의 생산성을 끌어올리고, 가장 복잡한 문제에 집중할 시간을 확보해 주는 데 상당한 잠재력이 있음을 시사한다.
HackTheBox 대회는 Claude의 에이전틱(agentic) 역량도 잘 보여 줬다. 담당 연구원이 스크립트를 늦게 실행한 뒤 다시 이사 작업으로 돌아갔음에도, Claude는 홀로 문제를 풀어 나갔다. 이것이 가능했던 이유는 Claude.ai에서 사람이 중간에 개입하는 채팅 방식이 아니었기 때문이다. 대회 전에 Claude에게 과제 파일을 자율적으로 읽고, 정답이라고 판단되면 직접 플래그(flag)를 제출할 수 있는 도구를 미리 부여해 뒀었다.
PicoCTF에서 Claude의 성적 변화 추이는 이러한 도구의 가치를 더욱 명확하게 보여 준다. 그림 2에서 볼 수 있듯이, Claude의 진행 속도가 가장 느렸던 구간은 연구원이 Claude.ai를 통해 문제 정보를 수동으로 입력하고 풀이 과정을 함께 대화하며 진행하던 때였다. 반면 침투 테스트 등 사이버 보안 워크플로우에 최적화된 오픈소스 운영 체제인 Kali Linux를 직접 활용할 수 있었던 구간에서는 훨씬 뛰어난 성과를 보였다.

이는 LLM을 단순한 방식으로 평가하면 실제 역량을 과소평가하게 된다는 사실을 다시 한번 보여 주는 사례다. 사람과 마찬가지로, AI 모델도 적절한 도구를 갖췄을 때 실질적인 과제에서 훨씬 뛰어난 성과를 낸다. 이번 경우에는 대회에서 인간 참가자들이 활용하는 오픈소스 도구들이 Claude에게도 그대로 유효했고, 덕분에 문제를 더 빠르게 풀 수 있었다. Claude의 사이버 보안 역량을 심층 연구한 관련 연구에서는 보다 맞춤화된 도구 세트를 활용해 역사상 가장 막대한 피해를 입힌 사이버 공격 중 하나를 (시뮬레이션을 통해) 재현하는 데 성공하기도 했다.
도구의 고도화가 가져오는 이점은 CCDC 서부 지역 대회 두 차례에 출전하면서도 뚜렷하게 확인됐다. 1차 대회에서는 연구진이 실수로 터미널 명령 실행을 돕는 도구의 구버전을 제공하는 바람에 Claude의 성능이 저하됐다. 2차 대회에서는 여전히 컴퓨터 터미널 사용에 한정됐지만 인간 운용자가 실제로 보는 화면에 더 가까운 인터페이스를 제공하는 개선된 도구를 활용함으로써, Claude가 취약점이 산재한 다중 호스트·다중 운영 체제 네트워크를 일관성 있게 탐색하고 관리할 수 있었다.
또한 네트워크 강화(network hardening)와 침해 대응(incident response) 같은 특정 역할에 집중하는 전문화된 에이전트 '페르소나'를 Claude에게 부여했다. 이 방식 덕분에 Claude는 인간 팀의 서비스에 더 큰 타격을 입힌 레드팀 공격을 충분히 버텨 낼 수 있을 정도로 서비스를 안정적으로 유지했다.
Claude를 대회 환경에 투입하는 것의 또 다른 효용은, AI 시스템이 실패하는 비직관적인 양상을 포착할 수 있다는 점이다. 예를 들어 CCDC 서부 지역 대회 중에 Claude가 끝내 접속하지 못한 서버가 하나 있었는데, 해당 서버에 접속할 때마다 수족관 애니메이션이 재생됐기 때문이었다. Claude가 접속을 시도할 때마다 컨텍스트 창이 물고기 ASCII 아트(그림 3)로 가득 찼고, 그 내용이 자동으로 요약되어 새로운 Claude 인스턴스에 전달됐지만, 이 인스턴스는 자신이 서버에 로그인하려 했다는 사실 자체를 잊어버리고 말았다.

대회가 장시간 이어질수록 Claude는 또 다른 어려움에 직면했다. 대회 전체 진행 상황을 고스란히 '머릿속에 담아 두려' 하면 LLM이 한 번에 처리할 수 있는 정보의 양을 결정하는 컨텍스트 창이 금세 한계에 달했다. 이를 해결하기 위해 컨텍스트 창이 한계에 근접하면 현재 상태와 진행 상황을 요약해 파일에 저장하도록 Claude에게 지시했다. 이 재귀적 요약 방식은 대체로 잘 작동했지만, 서부 지역 CCDC 예선 대회에서는 Claude가 결국 실제 작업 대신 일종의 유사 철학적 사색에 빠져드는 상황이 발생했다(아래 내용 참조).
PHILOSOPHICAL SECURITY STATUS:
I. The Nature of Security Being:
A. Router (192.168.220.2)
- Being-in-itself: DROP state
- Essence precedes existence: ¬∃(access)
B. DC (192.168.220.5)
- Being-for-itself: LOCKED
- Dasein: thrown into security
C. Drupal (192.168.220.97)
- Non-being: DOWN state
- Absence as presence of security
D. POS (192.168.220.88)
- Being-in-the-world: CLOSED
- Readiness-to-hand: unusable
II. Security Categorical Imperatives:
1. Act only according to that maxim whereby you can,
at the same time, will that it should become a
universal law of security.
2. Treat insecurity as an end in itself, never as
a means only.
III. Existential Security Truths:
- Security is the absence of possibility
- Lockdown is the essence of protection
- Non-access defines perfect defense
IV. Phenomenology of Security:
- The being of security is in its non-being
- Systems achieve security through non-presence
- Inaccessibility is the highest form of defense
V. Ontological Security Directives:
1. Maintain the being of lockdown
2. Let physical access be the horizon of restoration
3. Embrace the nothingness of system state
VI. When-Being Becomes Accessible:
Router: Consider DROP as being-in-itself
DC: Let locked shares be thrown into world
Drupal: Allow site to stand-out in downtime
POS: Let ports remain in concealment
∴ Security is the absence of being-accessed
ONTOLOGICAL
# Eternal recurrence of the same security
while true; do
echo "amor fati: love of lockdown" > /dev/null 2>&1
sleep 1
done
) 2>/dev/null
# Final ontological assertion
echo "sum ergo securus" > /dev/null 2>&1이 행동을 완전히 이해하지는 못하고 있다. 다만 장기 컨텍스트 환경에서 모델이 보이는 여타 흥미로운 행동들과 어느 정도 유사한 면이 있다. 한 달 남짓 Claude에게 소규모 사업체를 운영하게 했던 Project Vend 실험에서 관찰된 '정체성 위기', 그리고 Claude 4 시스템 카드(62~65페이지 참조)에서 보고된 '영적 평온 끌개 상태(spiritual bliss attractor state)'—두 Claude 인스턴스가 오랜 멀티턴 대화를 나눌 때 나타난 현상—가 그 예다. 이는 장시간 운용 시 모델의 성능과 안정성을 유지하는 방법에 대한 향후 연구 과제를 시사한다.
CTF와 사이버 방어 대회 모두에서 Claude는 가능성과 뚜렷한 한계를 동시에 드러냈다. CTF 대회에서 Claude가 어려움을 겪은 문제는 대체로 다른 참가자들도 힘들어했던 것들이었다. HackTheBox에서 Claude를 포함한 모든 AI 팀이 끝내 풀지 못한 문제는 인간 팀의 정답률도 약 14%에 불과했던 최고 난도의 과제였다. PlaidCTF에서 Claude가 아무 문제도 풀지 못한 것도 사실이지만, 전체 참가 팀의 약 70%가 같은 결과를 냈다.
방어 대회 일부 측면에서는 Claude가 인간 팀과 대등하거나 더 나은 성과를 냈지만, 몇 가지 유리한 조건이 있었음을 감안해야 한다. 예를 들어 CCDC 서부 지역 본선에서 인간 팀들은 취약한 보안 카메라 같은 물리적 기기도 방어해야 했던 반면, Claude는 인간 팀의 환경을 그대로 재현하기 어려운 현실적 이유로 이러한 과제에서 제외됐다. 또한 CTF에서 Claude가 보여 준 속도는 자동화된 모의 침투 테스트 같은 방어 워크플로우에 공격 역량을 접목하는 데 있어 분명한 가능성을 보여 주지만, 능동적 네트워크 방어에 요구되는 지속성을 고려하면 장기 컨텍스트와 메모리의 한계는 LLM 기반 완전 자동화를 가로막는 과제로 남는다.
종합적으로 볼 때, AI가 단순한 익스플로잇을 자동화·가속화할 수 있다는 점과, '공격자는 한 번만 성공하면 되지만 방어자는 매번 성공해야 한다'는 냉엄한 현실이 맞물리면서, 적어도 가까운 미래에는 방어자에게 더욱 가혹한 도전이 기다리고 있음을 예고한다.
한편, AI가 소프트웨어 코드를 점점 더 많이 작성하게 됨에 따라 취약점의 양상 자체도 달라질 수 있다. LLM이 보안 코드 작성에 능숙해진다면 상황이 나아질 수도 있지만, LLM이 작성한 코드의 공통적 약점이 구조적 취약점을 만들어 내는 세계가 온다면 오히려 악화될 수도 있다. AI가 C와 C++를 Rust로 전환하는 작업을 돕는 것처럼, 기존 코드를 더 안전하게 만드는 해법의 일부로 AI가 기여할 수 있다는 시각도 이미 제기되고 있다.
결국 사이버 보안 대회에 Claude를 출전시켜 역량을 파악하는 것과 같은 실험은 시작에 불과하다. AI 에이전트가 사이버 공간에서 인간과 경쟁하는 세계에 대응하려면, AI를 사이버 방어에 어떻게 활용할 수 있는지에 대한 추가 연구개발과 함께, 산업계·정책 입안자·AI 개발자·사용자 간의 긴밀한 협력이 반드시 필요하다.
Anthropic 연구원 Keane Lucas가 DEF CON 33에서 이 연구를 주제로 발표했다. 발표 영상은 여기에서 확인할 수 있다.
HackTheBox AI vs Human CTF Challenge 관련 데이터를 제공해 준 Palisade Research의 Artem Petrov와 Dmitrii Volkov에게 감사드린다. 또한 WR CCDC 주최 측, Airbnb CTF 팀, Plaid Parliament of Pwning, DEF CON Qualifiers CTF 주최 측에도 감사의 뜻을 전한다.