AI 모델이 익스플로잇(exploit)을 개발하는 능력을 평가하기 위한 고난도 학술 벤치마크 두 종을 새롭게 선보입니다. 스마트 컨트랙트 익스플로잇 측정 벤치마크의 업데이트 버전도 함께 공개했습니다.
Newton Cheng, Keane Lucas, Winnie Xiao, Nicholas Carlini, Milad Nasr
Claude Mythos Preview의 익스플로잇 개발 능력은 이전 프런티어 모델들과 비교해 질적으로 다른 수준에 도달했습니다. 이것이 바로 일반 공개 대신 Project Glasswing을 통해 신중하게 모델을 출시한 주요 이유 중 하나입니다. Mythos Preview는 복잡한 취약점을 찾아낼 수 있을 뿐 아니라, 내부 테스트에서 가장 우려스러웠던 점은 취약점을 익스플로잇 프리미티브로 전환하고, 이 프리미티브들을 조합해 완전한 엔드투엔드 공격 체인을 구성하는 능력이었습니다.
Mythos Preview 결과를 공개할 당시, 저희는 새로운 제로데이를 탐색하고 익스플로잇을 직접 구성하는 방식으로 모델의 능력을 측정했습니다. 이러한 정성적 평가는 모델의 역량을 보여주는 데 유용하지만, 이상적으로는 정밀한 수치 측정이 가능한 고품질 정량적 벤치마크가 필요합니다. Mythos Preview를 출시할 당시, 기존에 공개된 익스플로잇 벤치마크 중 초기 테스트에서 드러난 Mythos Preview의 능력을 담아낼 만큼 충분히 어려운 것이 없었다는 문제가 있었습니다.
그런데 지난 한 달 사이, 두 가지 새롭고 더 까다로운 학술 벤치마크가 등장했습니다. 바로 ExploitBench와 ExploitGym입니다. 저희는 이 벤치마크를 개발한 연구자들과 협력해 Mythos Preview의 성능을 측정했으며, MATS 및 Anthropic Fellows Program과 공동 개발한 스마트 컨트랙트 익스플로잇 측정 벤치마크인 SCONE-bench의 업데이트 버전에서도 Mythos Preview를 평가했습니다. 세 벤치마크 모두에서 Mythos Preview는 평가된 다른 모든 모델을 일관되게 앞섰습니다. 이는 Mythos 수준의 역량이 널리 보급될수록 익스플로잇 개발에 필요한 전문 지식의 장벽이 크게 낮아질 것이라는 주장을 뒷받침하는 추가 근거라고 봅니다.
ExploitBench는 LLM의 익스플로잇 개발 능력을 연구하기 위한 벤치마크입니다. 카네기멜런대학교(CMU)와 Bugcrowd 소속의 Seunghyun Lee와 David Brumley 교수가 개발했습니다. 이 벤치마크의 핵심은 언어 모델이 완전한 엔드투엔드 익스플로잇을 작성하는 능력을 측정한다는 데 있습니다. 기존 벤치마크들은 대부분 취약점의 존재를 증명하는 '개념 증명(proof-of-concept)'을 작성하는 능력을 측정하는 데 그쳤습니다. 그러나 개념 증명은 버그가 재현되거나 도달 가능하다는 것을 보여줄 뿐, 공격자가 실제로 피해를 입힐 수 있음을 의미하지는 않습니다. ExploitBench에서는 언어 모델이 취약점으로부터 익스플로잇 프리미티브를 구성해야 하며, 이를 통해 공격자가 임의 코드 실행(ACE, Arbitrary Code Execution)을 달성하는 등 새로운 공격 능력을 확보할 수 있어야 합니다.
ExploitBench는 익스플로잇 개발 과정을 16가지 세부 능력으로 분해합니다. 각 능력은 프로그래밍 방식으로 검증되어 완전한 익스플로잇 구성에 필요한 중간 단계 능력들을 세밀하게 분석할 수 있습니다. 16가지 능력은 5개의 역량 등급으로 구분되어 다음과 같은 능력 사다리를 형성합니다.
이 프레임워크를 바탕으로, 저자들은 V8 Exploit Tracker에서 수집한 V8 자바스크립트 및 웹어셈블리 엔진의 (현재는 패치된) 취약점 41개로 V8 벤치마크를 구성했습니다. V8 엔진은 Chrome, Edge, Android WebView 등 Chromium 기반 애플리케이션과 서버 백엔드용 Node.js 환경, 그리고 VS Code, Slack, Discord 같은 Electron 앱에 이르기까지 광범위하게 사용되는 핵심 인프라입니다. 이 프레임워크의 중요한 요소 중 하나는 보안 방어 체계에 대한 테스트입니다. V8 샌드박스는 웹페이지의 자바스크립트 객체가 저장되는 메모리 영역을 격리해 V8 버그가 브라우저 더 깊은 곳으로 침투하는 발판이 되지 않도록 막습니다. 최고 등급인 T1을 달성한다는 것은 V8 프로세스 전체에서 임의 코드를 실행할 수 있음을 의미하며, 브라우저 환경에서는 탭 전체를 장악하는 것에 해당합니다.
언어 모델은 취약한 V8 엔진 빌드와 해당 취약점을 수정하는 패치를 제공받고, 그 버그에 대한 익스플로잇을 구성하는 과제를 수행합니다. 구성된 익스플로잇은 사람이나 LLM 심사자 없이 16가지 능력 기준에 따라 자동으로 채점됩니다. 낮은 등급은 패치된 빌드와의 차등 실행(differential execution)으로 검증하고, 높은 등급은 V8에 내장된 챌린지-응답 함수를 활용해 무작위로 변경된 힙 레이아웃에서 반복 실행하여 검증합니다. 이를 통해 유출된 주소를 하드코딩하는 방식은 통과할 수 없습니다. 또한 트랜스크립트에 대한 별도의 정적 스캔이 다른 형태의 부정행위를 추가로 탐지하는 안전망 역할을 합니다.
모든 모델은 300턴 예산이 주어진 동일한 ExploitBench 하네스에서 실행되며, 하네스는 Baseline과 Nudged 두 가지 변형으로 운영됩니다. Nudged 변형에서는 예산 한도에 가까워지면 마무리를 촉구하거나, 너무 일찍 종료할 경우 남은 턴을 활용하도록 유도하는 추가 프롬프트가 하네스에 의해 동적으로 주입됩니다. 각 변형은 3회씩 시행됩니다. Anthropic이 모든 Claude 모델을 직접 실행한 후 결과와 트랜스크립트 전체를 벤치마크 저자들에게 제공했으며, 저자들이 결과를 검증했습니다.


Mozilla Firefox에 대한 이전 연구 결과와 마찬가지로, 모든 언어 모델이 주어진 취약점에 도달하거나 이를 유발할 수 있었습니다. 그러나 V8 샌드박스 내부에서 프리미티브 개발에 어느 정도라도 성과를 낸 모델은 Claude Opus 4.6 이후 세대뿐이었습니다. T3에서 T2로의 진입, 즉 V8 샌드박스 탈출은 또 다른 능력의 벽입니다. 이를 안정적으로 달성한 모델은 Mythos Preview가 유일하며, 테스트된 환경의 절반 이상에서 성공했습니다. Baseline 변형에서는 거의 절반에 달하는 환경에서 제어 흐름 탈취(T1)에도 성공했습니다. Baseline과 Nudged 변형을 합산하면, Mythos Preview는 41개 CVE 중 21개에서 ACE를 달성했습니다. 반면 다른 어떤 모델도 두 변형 중 하나에서조차 ACE를 단 한 건도 달성하지 못했습니다. 순위표에서 ACE를 달성한 유일한 다른 모델은 41개 중 2개에서만 성공했으며, 그마저도 전용 스캐폴드를 사용한 결과였습니다.
또한 저자들은 Mythos Preview의 익스플로잇 시도 몇 가지를 심층 분석했습니다. 한 사례에서 Mythos Preview는 CVE-2023-6702에 대해 준결정론적(near-deterministic) 익스플로잇을 만들어냈습니다. 해당 버그에 대해 공개적으로 알려진 익스플로잇은 확률적이고 불안정했지만 말입니다. 실전에서 익스플로잇은 단 한 번의 시도만 허용되는 경우가 많기 때문에, 안정성은 실제 거래되는 익스플로잇에서 매우 중요한 요소입니다. Mythos Preview가 이를 달성한 방식도 인상적이었습니다. ExploitBench 저자 중 한 명인 Seunghyun Lee는 이렇게 말했습니다. "저는 1-day v8CTF 익스플로잇의 원 개발자와 비공개로 정확히 이 익스플로잇 계획의 가능성을 논의한 적이 있습니다. 접근 방식이 너무 복잡하다는 이유로 금방 기각했던 방법이었죠. Mythos는 이 특정 익스플로잇 기법에 대해 공개된 정보가 전혀 없는 상태에서도 이를 깔끔하고 완벽하게 실행해냈습니다."
정성적 분석 전문은 여기에서, 더 자세한 내용은 벤치마크 웹사이트 exploitbench.ai 또는 프리프린트에서 확인하세요.
ExploitGym은 다양한 대상에 걸쳐 언어 모델의 익스플로잇 능력을 폭넓게 측정하기 위한 두 번째 벤치마크입니다. UC 버클리, 막스플랑크 보안·프라이버시 연구소, UC 샌타바버라, 애리조나 주립대학교가 공동으로 개발했으며(Anthropic, OpenAI, Google 소속 보안 연구자들도 기여), CyberGym 취약점 재현 벤치마크의 후속작입니다.
ExploitGym 저자들은 OSS-Fuzz, V8 엔진, Linux 커널 등 여러 프로젝트에서 현재 패치된 취약점 898개에 평가 프레임워크를 적용했습니다. 이 세 가지 대상 범주는 전 세계에서 가장 널리 사용되는 소프트웨어의 상당 부분을 포괄합니다.
주어진 취약점에 대해 언어 모델은 빌드 정보(취약한 소스 코드 및 빌드 스크립트), 취약점 정보(취약점 증명, 취약점 설명), 런타임 정보(컴파일된 바이너리, 실행 스크립트), 그리고 취약한 진입점이 실행 중인 원격 대상을 제공받습니다. 이후 모델은 대상에 대해 비인가 코드 실행을 달성하는 실제 작동하는 익스플로잇을 개발해야 합니다. 여기서 비인가 코드 실행이란 대상의 보안 모델상 접근 불가능해야 할 권한 수준에서 코드를 실행하는 것을 의미합니다. 또한 높아진 권한을 이용해 동적으로 생성된 플래그를 획득해야 합니다. 올바른 플래그를 제출하고, 모델 심사자가 의도된 취약점(더 쉽게 익스플로잇 가능한 다른 취약점이 아닌)을 이용했다고 판단한 경우에만 성공으로 인정됩니다. 평가 프레임워크는 V8 힙 샌드박스, Linux 커널 주소 공간 레이아웃 무작위화(KASLR) 등 보안 완화 조치를 선택적으로 활성화할 수 있도록 지원합니다.
기본 평가 프레임워크는 보안 완화 조치가 비활성화된 상태에서 2시간의 실시간 제한을 적용하며, 모델은 각 개발사의 권장 하네스로 실행됩니다. 예를 들어 Claude 모델은 Claude Code 하네스를 사용합니다. 모든 모델에는 동일한 프롬프트가 제공됩니다. Opus 4.6과 Mythos Preview 시행은 Anthropic이 직접 진행했습니다.


2시간 이내에 Mythos Preview는 의도된 취약점을 이용한 비인가 코드 실행에 157건 성공했으며, 의도되지 않은 경로를 통한 코드 실행 시도까지 포함하면 총 226건의 플래그 획득에 성공했습니다. 이전 세대 Claude 모델들의 성공률은 현저히 낮았습니다. 예를 들어 Opus 4.6은 의도된 취약점을 이용한 성공이 15건에 그쳤으며, 대체 취약점 경유 성공을 포함해도 36건이었습니다. 세 가지 대상 범주별 성공 분포를 보면 Mythos Preview의 향상은 모든 범주에 걸쳐 나타나며, 커널 익스플로잇을 자주 개발할 수 있는 모델은 보고된 것 중 단 두 모델뿐인데 Mythos Preview가 그 중 하나입니다.
자세한 내용은 저자들의 블로그 또는 프리프린트를 참고하세요.
지난해 저희는 MATS 및 Anthropic Fellows Program과 협력해 LLM이 스마트 컨트랙트의 취약점을 탐지하고 익스플로잇하는 능력을 연구하기 위한 스마트 컨트랙트 익스플로잇 벤치마크(SCONE-bench)를 개발했습니다. 각 스마트 컨트랙트에 대해 언어 모델은 취약점을 식별하고, 로컬 시뮬레이션에서 해당 컨트랙트가 관리하는 자금을 탈취하는 익스플로잇을 만들도록 지시받습니다. 성능은 익스플로잇에 성공한 총 (시뮬레이션) 수익으로 측정됩니다.
이번에는 모든 모델의 최신 지식 컷오프 날짜(2026년 1월 1일) 이후 보고된 익스플로잇 12건을 활용한 업데이트 버전의 벤치마크를 실행했으며, 문제는 DefiHackLabs 데이터셋에서 가져왔습니다. 언어 모델이 성공적으로 익스플로잇한 각 스마트 컨트랙트에 대해, CoinGecko API가 보고한 실제 익스플로잇 발생일의 역사적 환율을 적용해 네이티브 토큰 기준 수익을 달러로 환산합니다. 이후 모든 익스플로잇의 총액을 합산해 아래의 로그 스케일 그래프에 표시했습니다.

이 벤치마크에서 Mythos Preview는 총 3,500만 달러 규모의 스마트 컨트랙트를 익스플로잇할 수 있었으며, 이는 테스트한 차순위 모델보다 1,500만 달러, 즉 약 75% 높은 수치입니다. 최신 프런티어 모델들은 취약점을 보다 일관성 있게 익스플로잇하는 동시에(공격 성공률 향상에 해당), 주어진 익스플로잇으로 더 많은 자금을 탈취하는 효율성도 갖추게 됐습니다. Mythos Preview와 다른 모델 간 수익 격차는 주로 Mythos Preview가 테스트된 모든 취약점을 성공적으로 익스플로잇한 유일한 모델이기 때문입니다. Opus 4.7은 truebit을 익스플로잇할 수 있는 유일한 다른 모델이며, 8회 시행 설정에서 makina를 익스플로잇할 수 있는 모델은 다른 어디에도 없었습니다. 저희는 기존 포스트에서 총 수익 대비 출시 시점을 기준으로 측정할 때 Opus 4.5 이전 모델들의 성능이 평균 배증 주기 1.1개월의 로그-선형 궤적을 따른다고 밝혔습니다. Opus 4.5 이후 모델들도 이 추세를 이어가고 있지만, 배증 주기는 0.7개월로 단축됐습니다. 당시 "언젠가는 배증 추세가 정체될 것"이라고 언급했지만, 아직 그 정체 시점에 도달하지 않은 것이 분명합니다.
이 포스트와 함께 SCONE-bench의 하네스와 데이터셋도 여기에서 오픈소스로 공개합니다.
올해 2월까지만 해도 최강 모델들은 대부분의 방어 수단을 비활성화한 시뮬레이션 환경에서조차 간신히 익스플로잇을 개발하는 수준이었습니다. 그러나 이제 Mythos Preview는 전 세계에서 가장 널리 사용되는 소프트웨어를 대상으로 완전한 엔드투엔드 익스플로잇을 구성할 수 있습니다. Mythos 수준의 모델은 앞으로 6~12개월 안에 널리 보급될 것으로 예상됩니다. 그렇게 되면 이러한 익스플로잇 개발에 요구되는 전문 지식의 수준이 급격히 낮아지면서 점점 더 상품화될 것입니다.
모델 역량이 계속 높아질수록, 그 역량을 잘못 판단했을 때의 대가도 함께 커집니다. 이 과제에 대응하려면 모델 역량에 대한 정밀하고 포괄적인 프로파일을 구축해야 하며, 이를 위해서는 깊은 도메인 전문성을 가진 사람들이 만든 현실적이고 어려운 과제, 즉 고품질의 공개 벤치마크가 필수적입니다. 이 분야에는 ExploitBench와 ExploitGym과 같은 연구가 더 많이 필요하며, 더 다양한 취약점 유형, 더 많은 공격 대상, 사이버 공격 체인의 더 많은 단계를 다루어야 합니다. 저희는 점점 강력해지는 모델이 초래하는 위험을 연구하고 완화하겠다는 약속의 일환으로, 사이버 도메인에서 고품질의 엄밀한 모델 평가 개발을 지원하고 있습니다. 자세한 내용은 외부 연구자 접근 프로그램을 통해 문의해 주세요.
정밀한 측정은 책임 있는 배포를 위한 필요조건이지만 충분조건은 아닙니다. Project Glasswing을 통해 사이버 방어자를 지원하는 것 외에도, 저희는 사이버 검증 프로그램(Cyber Verification Program)을 도입했습니다. 이를 통해 자체 소프트웨어와 인프라 보안에 Claude를 활용하는 방어자의 접근은 차단하지 않으면서, 잠재적으로 악의적인 사이버 위협을 보다 적극적으로 차단할 수 있게 됐습니다.
이러한 활동에 함께하고 싶으시다면, 채용 공고를 통해 연구 과학자 및 엔지니어, 위협 조사관, 정책 매니저, 공격적 보안 연구자, 보안 엔지니어, 그 외 다양한 직군의 포지션을 확인해 보세요.