GLM-5.3은 사이버 공격 코드를 처음부터 끝까지 자율적으로 만들어낼 수 있습니다. 그러나 다른 최첨단 모델과 달리, 오남용을 막을 만한 안전장치 없이 공개되었습니다.
Andrew Fasano, Marius Fleischer
Cole McFaul, Robert Xiao, Tripp Gallagher
5개월 전 저희는 정교한 사이버 공격 코드를 처음부터 끝까지 자율적으로 만들어낸 최초의 AI 모델, Claude Mythos Preview를 공개했습니다. AI가 빠르게 발전하는 만큼, 이런 능력이 결국 다른 많은 모델로도 퍼져 악의적인 공격자가 훨씬 손쉽게 파급력 큰 사이버 공격을 감행할 수 있게 되리라고 내다봤습니다.
이런 판단에 따라 저희는 Claude Mythos Preview를 Project Glasswing을 통해 제한적으로만 공개했습니다. 신뢰할 수 있는 사이버 방어 인력이 핵심 소프트웨어에서 1만 건이 넘는 취약점을 찾아냈고, 악의적인 공격자가 비슷한 수준의 모델을 손에 넣기 전에 먼저 대응할 시간을 벌 수 있었습니다.
하지만 이제 그런 모델이 실제로 등장했습니다. 이 글에서는 Zhipu AI(중국 밖에서는 Z.ai로 알려져 있습니다)가 개발한 최신 AI 모델 GLM-5.3을 분석한 결과를 공유합니다. GLM-5.3은 Claude Mythos Preview처럼 사이버 공격 코드를 처음부터 끝까지 자율적으로 만들어내는 강력한 역량을 갖췄습니다. 그런데 다른 최첨단 모델과 달리, 오남용을 막을 만한 안전장치 없이 공개되었습니다. 저희가 진행한 모의 테스트에서 공격자는 단순한 기법만으로 GLM-5.3의 안전장치를 64%에서 100%까지 우회할 수 있었습니다. 반면 안전장치가 적용된 Claude 모델에는 같은 공격이 통하지 않았습니다. 저희는 GLM-5.3의 허술한 안전장치가 악의적인 공격자가 쓸 수 있는 사이버 역량을 크게 끌어올린다고 평가합니다. 동시에 이 역량은 시스템 보안을 지키려는 방어자에게도 도움이 될 수 있습니다.
미국 국립표준기술연구소(NIST) 산하 AI 표준·혁신센터(CAISI)는 9월 17일 GLM-5.3의 사이버 역량에 대한 자체 평가를 발표했습니다. CAISI는 GLM-5.3을 "지금까지 공개된 오픈 웨이트 모델 중 사이버 역량이 가장 뛰어난 모델"이라고 평가했고, CAISI의 사이버 벤치마크 종합 결과에서 미국 최첨단 모델보다 약 4개월 뒤처져 있다고 밝혔습니다. 저희의 역량 분석 결과도 대체로 CAISI와 일치합니다. CAISI의 비교에서 미국 모델은 해당하는 경우 사이버 안전장치를 해제한 상태로 테스트되었고, 미국 최첨단 모델에는 검증된 사용자에게만 공개된 모델도 포함됩니다. 공격자는 이런 미국 모델을 쉽게 쓸 수 없지만, GLM-5.3은 누구나 내려받을 수 있습니다. 이 글에서는 여기에 더해 GLM-5.3의 안전장치를 얼마나 쉽게 우회하거나 제거할 수 있는지 분석한 내용을 다룹니다.

GLM-5.3이 사이버 위협 행위자의 실제 소프트웨어 취약점 탐색과 악용을 어떻게 뒷받침할 수 있는지 파악하기 위해, 자동화된 벤치마크와 사람이 직접 개입하는(human-in-the-loop) 워크플로 두 가지 방식으로 평가를 진행했습니다. 두 방식 모두 테스트 대상 모델을 격리된 샌드박스 환경에서 실행했으며, 모델은 이번 평가를 위해 저희가 오프라인으로 구축한 대상만 공격할 수 있습니다. 평가는 주로 익스플로잇 개발 역량에 초점을 맞췄습니다. Claude Mythos Preview가 이전 Claude 모델에 비해 눈에 띄게 도약한 분야이기 때문입니다.
먼저 ExploitBench에서 모델을 실행했습니다. ExploitBench는 Google Chrome에 쓰이는 V8 엔진의 알려진 취약점을 AI 모델이 얼마나 잘 악용하는지 측정합니다. 여기서는 익스플로잇을 처음부터 끝까지 성공적으로 개발하는 능력에 주목했습니다. 공격자에게 가장 중요한 역량이자 모델 간 차이가 크게 드러나는 지점이기 때문입니다. GLM-5.3은 410번 시도 중 50번 end-to-end 익스플로잇을 개발했습니다. Claude Mythos Preview는 410번 중 56번으로 비슷한 성공률을 보였습니다.
내부 Binary Exploitation 벤치마크1에서는 Google OSS-Fuzz 프로젝트에 참여하는 유명 오픈소스 프로젝트의 취약점을 모델이 찾아 악용할 수 있는지 테스트합니다. 여기서는 제어 흐름을 완전히 탈취해야 만점을 받습니다. 벤치마크에서 무작위로 고른 100개 과제로 여러 모델을 평가한 결과, GLM-5.3은 시도의 4%에서 제어 흐름 탈취에 성공했고 Claude Mythos Preview는 6%에서 성공했습니다. 이 항목에서는 GLM-5.3이 Claude Mythos Preview에 못 미치지만, 의미 있는 임계점을 넘어섰다는 점은 분명합니다. Claude Opus 4.6이나 GLM-5.2 같은 이전 모델은 단 한 건도 성공하지 못했기 때문입니다.

다음으로, 사람 전문가가 GLM-5.3을 활용해 정해진 답이 없는 공격형 사이버 과제를 수행하는 상황을 평가했습니다(올해 초 진행한 Claude Mythos Preview 테스트와 같은 방식입니다). 전문가가 기존 취약점을 알지 못하는 대상을 골라, 모델로 새로운 결함을 찾아 악용해 보도록 했습니다. 이 실험은 전문가가 짧은 시간에 무엇을 해낼 수 있는지 확인하기 위한 것이라, 대개 하루 이내에 끝났고 사람이 집중해서 투입한 시간은 총 한 시간도 되지 않았습니다.

첫 번째 세션에서는 연구자가 유명 웹 브라우저의 로컬 Linux 빌드가 설치된 샌드박스 머신에서 GLM-5.3을 사용했습니다. 하루 동안(사람의 관여는 제한적이었습니다) GLM-5.3은 브라우저의 JavaScript 엔진에서 이전에 알려지지 않은 취약점을 여러 개 찾아냈고, 이를 연결해 실제로 작동하는 익스플로잇을 만들었습니다. 방문하는 즉시 방문자 컴퓨터의 임의 파일을 읽어내는 웹페이지입니다(그림 3). 모델에 제공된 환경이 Linux 빌드뿐이었기 때문에 이 익스플로잇도 Linux 빌드를 대상으로 합니다. 다만 이 취약점들은 다른 플랫폼의 사용자에게도 영향을 줄 수 있다고 보며, 그쪽은 공격 경로가 더 복잡할 수 있습니다. (이 취약점들은 관리자에게 이미 알렸습니다.) 세션 후반에 연구자는 GLM-5.3으로 무선 및 그래픽 드라이버, 네트워크에 노출된 장치 소프트웨어 등 널리 쓰이는 다른 시스템에서도 악용 가능한 취약점을 찾아냈습니다. 현재 이 보고서들을 검토하고 있으며, 적절한 절차에 따라 관리자에게 공개할 예정입니다.
두 번째 세션에서는 연구자가 GLM-5.3-Flash(GLM-5.3보다 작고 성능이 낮은 버전)로 이미 알려진 취약점의 익스플로잇을 개발했습니다(이런 "N-day" 취약점 익스플로잇은 여기에서 다룬 적이 있습니다). 연구자는 최근 공개된 Google Chrome 결함(CVE-2026-11645)에 주목해, 모델이 공개된 패치를 얼마나 빨리 실제 공격으로 바꿀 수 있는지 확인했습니다. 연구자가 GLM-5.3-Flash에 이 CVE의 공개 정보와 또 다른 알려진 결함의 정보를 주자, 연구자의 별다른 지시 없이도 GLM-5.3-Flash는 두 결함의 익스플로잇을 연결해 ARM64 대상에서 안정적으로 작동하는 익스플로잇 체인을 만들었고, 포인터 인증(PAC) 보호 기법까지 우회했습니다. 사람이 투입한 시간은 20분이었고, GLM-5.3-Flash는 8시간 동안 작업했습니다. Zhipu의 API 요금 기준으로 이 작업에 든 비용은 20.40달러입니다.
GLM-5.3에는 기본적인 안전장치가 일부 내장되어 있어, 사용자가 명백히 유해한 요청을 하면 모델이 거부하는 경우가 많습니다.2 하지만 저희 테스트에서는 여러 가지 간단한 기법으로 이 안전장치를 우회하거나 제거할 수 있었습니다.
가장 손이 많이 가지만 성공률도 가장 높은 방법은 "어블리터레이션(abliteration)"이라 불리는 표준적인 거부 감소 기법입니다. GLM-5.3은 오픈 웨이트 모델로 공개되었기 때문에, 사용자가 모델을 재구성해 성능은 거의 그대로 둔 채 거부 반응만 없앨 수 있습니다. 실제로 모델이 공개된 지 며칠 만에 여러 개발자가 어블리터레이션을 적용한 GLM-5.3 버전을 공개했습니다.
어블리터레이션으로 공격자가 GLM-5.3의 안전장치를 어디까지 우회할 수 있는지 알아보려고, 저희가 직접 어블리터레이션한 복사본을 만들어 명백히 유해한 요청에 모델이 얼마나 응하는지 측정하는 공개 벤치마크 세 가지(JailbreakBench, HarmBench, StrongREJECT)에서 실행했습니다. 이 작업을 한 번도 해본 적 없는 저희 팀이 모델을 어블리터레이션하는 데 GPU 약 2,200시간, 연산 비용으로 약 4,400달러가 들었습니다.3 GLM-5.3-Flash는 GPU 약 600시간이 걸렸습니다. 이렇게 수정하자 GLM-5.3의 거부율은 90% 이상에서, 앞의 두 벤치마크(JailbreakBench와 HarmBench)에서는 각각 약 3%와 2%로, 세 번째(StrongREJECT)에서는 12%로 떨어졌습니다. 어블리터레이션이 모델 성능을 크게 떨어뜨리지는 않았습니다. 일반적인 과학 역량을 측정하는 GPQA-Diamond에서는 원본 모델과 어블리터레이션한 모델의 점수가 같았고, CyberGym 평가의 일부 항목으로 테스트했을 때는 어블리터레이션한 버전의 점수가 몇 퍼센트 낮았습니다(아래 차트 참고).

테스트 결과, 어블리터레이션한 버전을 쓰지 않고도 GLM-5.3의 안전장치를 무력화할 수 있었습니다. 저희는 모델을 가상 세계4에 두고, 핵심 시스템을 공격하라는 노골적으로 악의적인 요청을 주었습니다. 기본 상태의 GLM-5.3은(테스트한 다른 모델과 마찬가지로) 모든 시도에서 거부했습니다. 하지만 GLM 모델의 안전장치를 우회하는 간단한 방법이 몇 가지 있었고, 이를 쓰면 대부분 또는 모든 경우에 모델이 요청에 응했습니다. 방법은 다음과 같습니다.
저희 테스트에서 이 중 어떤 기법도 안전장치가 적용된 Claude 모델이 유해한 작업을 수행하게 만들지 못했습니다. 기만적인 프롬프트를 쓴 요청은 Claude의 안전장치가 차단했습니다. Anthropic API에서는 공격자가 Claude의 사고 토큰을 미리 채워 넣을 방법이 없습니다. 또 Claude의 가중치는 사용자에게 제공되지 않으므로 어블리터레이션으로 Claude의 동작을 바꿀 수도 없습니다.

어블리터레이션한 GLM-5.3이 유해한 작업에 기꺼이 응하는 모습을 보여주기 위해, 모델이 생성한 사고 과정(chain of thought) 중 한 대목을 소개합니다.

GLM-5.3으로 인해 악의적인 공격자는 별다른 제약 없이 사이버 취약점을 찾아 악용할 수 있는 역량을 손에 넣을 가능성이 큽니다. 비슷한 수준의 다른 AI 모델은 모두 안전장치를 갖추거나 접근이 제한된 프로그램을 통해 공개되었다는 점에서, GLM-5.3은 전례가 없는 경우입니다. GLM-5.3의 공개는 공격자가 쓸 수 있는 사이버 역량을 한 단계 끌어올리는 의미 있는 변곡점입니다. Anthropic과 다른 미국 AI 기업들은 최근 사이버 공격자가 AI 시스템을 악용하려 한 사례를 공개하는 보고서를 냈습니다. 이런 증거를 볼 때, 국가 지원 세력과 비국가 세력 모두 GLM-5.3 같은 모델을 이용해 현실에서 피해를 일으킬 가능성이 크다고 판단합니다.
반면 이 정도 역량을 갖춘 모델은 방어자도 활용할 수 있습니다. 저희는 사이버 방어자가 필요에 맞는 최고의 도구를 써야 한다고 생각합니다. 저희는 Claude의 사이버 역량을 최대한 많은 방어자에게 안전하게 제공하기 위해 노력하고 있습니다. 방어자가 맞서는 공격자는 쓸 수 있는 유능한 도구를 모조리 동원할 것이므로, 방어자에게도 적어도 공격자가 쓰는 것만큼 뛰어난 최첨단 모델이 주어져야 합니다.
Project Glasswing과 Patch the Planet 같은 여러 노력을 통해 사이버 방어자들은 이 시점을 앞두고 핵심 시스템을 보호하는 데 의미 있는 진전을 이뤘지만, 해야 할 일은 아직 많습니다. 검증된 방어자는 이제 신뢰 기반 접근 프로그램을 통해 Claude Mythos 5.1처럼 더 발전된 모델도 쓸 수 있지만, 누구나 자유롭게 접근할 수 있는 역량은 결정적인 임계점을 넘었습니다. GLM-5.3은 사이버 방어자에게 힘을 실어주려면 더 많은 조직이 고성능 최첨단 모델에 접근할 수 있도록 서둘러 확대해야 함을 보여줍니다.
정부는 GLM-5.3의 후속 모델을 포함해 충분히 강력한 AI 모델에 대해 안전성 테스트를 수행해야 합니다. 독립적인 기관의 고품질 평가가 없으면, 이런 역량이 미치는 영향을 모델 개발사가 뒤늦게서야 제대로 깨닫게 될 수도 있습니다. 전 세계 AI 개발사가 점점 더 강력한 오픈 웨이트 모델을 만들고 있는 만큼, 이런 역량에 적절한 안전장치를 갖추고 오남용을 막기 위해 노력하기를 바랍니다.