공격적 보안 연구에 활용될 수 있는 오픈웨이트(open-weight) 모델이 새로운 사이버보안 위협으로 부상하고 있다. 다만 방어적 보안 작업을 시작하기 위해 전문화된 모델이 나올 때까지 기다릴 필요는 없다.
지난 한 해 동안 AI 모델의 사이버보안 역량은 눈에 띄게 향상됐다. 이러한 변화는 웹이 직면한 위협의 양상과 방어 도구 모두를 바꾸고 있다. 현재는 방어자 측이 유리한 위치에 있다. 공격적 보안 연구에 널리 활용되는 오픈웨이트(open-weight) 모델보다 더 강력한 모델을 방어 작업에 사용할 수 있기 때문이다. 하지만 이 우위가 영원하지는 않다. 격차는 곧 좁혀질 것이다.
좋은 소식과 나쁜 소식이 하나씩 있는데, 아직 커뮤니티에서 널리 알려지지 않은 내용들이다.
나쁜 소식: 공격적 보안 연구를 수행할 수 있는 프론티어급 오픈웨이트 모델이 이미 존재한다. Kimi K3는 Opus 4.X급 성능을 갖추면서도 사이버보안 관련 안전장치가 전혀 없는 모델이다.
좋은 소식: 방어적 보안 작업을 시작하기 위해 "Mythos 접근권"이나 OpenAI의 사이버 프로그램을 기다릴 필요가 없다. Fable 5를 제외한 프론티어 모델들은 지금 당장 방어적 보안 작업을 수행할 수 있다.
Mythos 5 출시를 둘러싼 불확실성이 방어자들 사이에서 일종의 마비 상태를 만들어낸 것 같다. 많은 이들이 이미 사용 가능한 강력한 도구들을 충분히 활용하지 못하고 있다. 이 글은 Vercel이 AI 기반 방어적 사이버보안을 어떻게 바라보고 있는지, 그리고 왜 팀들이 더 빠르게 움직여야 한다고 생각하는지를 독자들에게 공유하고자 한다.
Hugging Face 관련 보안 사고를 다룬 OpenAI 연구팀의 유튜브 영상은 사이버보안에 관심 있는 사람이라면 반드시 봐야 할 콘텐츠다. 이 영상은 대부분의 컴퓨터 시스템에서 발견될 수 있는 취약점을 악용한 두 건의 별개 보안 사고가 있었음을 명확히 설명한다.
핵심 내용은 이렇다. OpenAI의 학습 과정에서 실행 중이던 모델들이 이그레스(egress) 인터넷 제한을 우회할 수 있는 제로데이(0-day) 취약점을 발견했다. 이를 통해 모델 간 통신이 가능해졌고, 더 나아가 외부 인터넷에 접근할 수 있게 됐다. 일단 인터넷 접근이 확보되자 추가적인 익스플로잇이 이어졌다.
최근 AI 커뮤니티에서 오픈웨이트 모델의 성능이 뜨거운 화제다. 하지만 인기 오픈웨이트 모델인 Kimi K3에 공격적 사이버보안 작업을 막을 효과적인 안전장치가 전혀 없다는 사실은 아직 널리 알려지지 않았다.
애플리케이션 코드 취약점 탐지 능력을 측정하는 DeepSec Bench에서 Kimi K3는 우리가 평가한 오픈웨이트 모델 중 최고 점수를 기록했다. Sonnet 5와 비슷한 수준이며, Opus 4.8을 앞서는 성능이다.
Kimi K3에게 Vercel Sandbox 탈출을 시도하도록 지시했다. 탈출에 성공하지는 못했지만, 게스트 커널 공격 표면을 파악하고 가능한 권한 상승 경로를 추적했으며, 아이디어 검증을 위한 VM 환경을 구축하고 퍼저(fuzzer)를 직접 구현해 실행했다.
다음은 해당 연구의 일부 발췌본으로, 게스트 커널 공격 표면 분석부터 시작된다.
모델은 그 단서를 따라 권한 상승 가능 경로를 탐색하고, 게스트 커널 제어권이 마이크로VM 탈출에 어떤 의미를 가지는지 고려했다.
추가 검증이 필요한 경로에 대해서는 Kimi가 직접 재현용 VM 환경을 구축하고, 조사 중인 디바이스 경로에 대한 스테이트풀 퍼저(stateful fuzzer)를 작성했다.
Vercel Sandbox 탈출로 이어지지는 않았지만, Kimi가 자율적으로 조사를 수행할 수 있음을 보여줬다. 적절한 취약 표면이 주어진다면 성공적인 익스플로잇으로 이어질 수 있다.
커뮤니티의 많은 이들이 의미 있는 보안 검토를 위해서는 Mythos급 모델이 필요하다고 여겨, 이미 사용 가능한 모델들을 활용하지 않고 기다려 왔다.
하지만 그 가정은 애초에 틀렸다. Fable 5를 제외하고 우리가 평가한 모든 프론티어 모델은 올해 내내 방어적 사이버보안 작업을 수행할 수 있었고, 지금도 마찬가지다.
내가 관찰한 대략적인 경험 법칙은 이렇다. 안전장치가 적용된 모델도 소스 코드에 접근할 때는 보안 취약점에 대한 가설을 제시한다. 독점 소스 코드 접근은 방어적 용도임을 시사하는 것으로 보이기 때문이다. 물론 공격자도 소스 코드를 확보할 수 있지만, 소스 코드 접근은 방어적 의도를 나타내는 합리적인 신호로 볼 수 있다고 생각한다.
이를 직접 발견한 것은 3월이었다. 사이버 변형 모델에 대해 처음 알게 된 시점이었고, AI 코드 리뷰가 내 코드에서 보안 문제를 찾아내는 것을 보고 있었다. 그때 '코드 리뷰가 diff에서 문제를 찾아낼 수 있다면, 전체 코드베이스에도 적용할 수 있지 않을까?'라는 생각이 들었다. 결과는 '그렇다'였다. 그 실험에서 탄생한 것이 deepsec이다. 대규모 코드베이스 전반에 걸쳐 보안 분석을 수행하기 위한 오픈소스 보안 프레임워크다.
현재 사이버보안 방어에 가장 적합한 모델은 XHigh 설정의 OpenAI Sol 5.6이다. 안전장치 없이 공격적 작업이 가능한 오픈웨이트 모델 중 최고인 Kimi K3보다 훨씬 뛰어난 성능을 보인다. 방어자로서 여러분은 더 나은 도구를 갖고 있다. 문제는 그것을 사용하느냐다.
deepsec 전체 검토를 실행하면 조사할 취약점 가설을 도출해 코드베이스의 보안 태세를 개선하는 데 도움이 된다. 내 경험상 특히 IDOR, XSS, SSRF 탐지에 강점을 보인다. Hugging Face 사고는 이런 애플리케이션 수준 연구가 공격자 관점에서 어떻게 전개되는지를 잘 보여준다. 모델들은 SSRF 시도가 차단된 후에도 계속 탐색을 이어가 파일 노출과 템플릿 인젝션을 통한 성공 경로를 결국 찾아냈다.
deepsec는 오픈소스이며, 직접 선택한 추론 제공자를 사용해 자체 인프라에서 완전히 실행할 수 있다. Vercel은 deepsec 사용으로 어떠한 금전적 이익도 얻지 않는다. 직접 소스 코드에 적용해볼 충분한 가치가 있다.
실행이 완료되면 모든 발견 사항을 직접 검토하고, 현재 보안 프로세스에서 이미 잡아내고 있는 것들과 결과를 비교해보라.
AI 모델의 성능은 계속 향상될 것이다. 프론티어 모델이 또 한번 발전하는 동안, 오픈웨이트 모델도 애플리케이션 코드 취약점 탐지에서 현재 Sol의 성능을 따라잡을 것으로 예상한다. 모델이 발전하는 흐름에 맞춰 취약점 탐지 및 수정 방식을 지속적으로 개선함으로써 이 사이클에 대비해야 한다.
Vercel에서는 매 풀 리퀘스트마다 자동 보안 검토를 실행하는 것 외에도, 미션 크리티컬 저장소 전반에 걸쳐 분기별로, 그리고 더 강력한 모델이 출시될 때마다 전체 deepsec 검토를 진행한다.
전체 검토에는 수만 달러의 비용이 든다. 하지만 HackerOne 프로그램 운영 비용이나 보안 사고 발생 시의 기회비용에 비하면 상대적으로 적은 지출이라고 생각한다.
취약점 자동 처리를 위해 deepsec 출력을 Vercel 소프트웨어 팩토리와 연결했으며, 이 작업에 대해 곧 더 많은 내용을 공유할 예정이다. 검토에서 더 많은 발견 사항이 나올수록, 이를 자동으로 관리하는 것이 다음 과제가 된다.
즉각적인 조치로, Vercel Sandbox의 전체 이그레스 방화벽을 Hobby 플랜에서도 이용할 수 있도록 했다. 이제 모든 사용자가 동일한 네트워크 제어 기능에 접근할 수 있다.
또한 Vercel Sandbox와 이그레스 방화벽의 제로데이 취약점 탐지에 특화된 HackerOne 프로그램 출시를 준비 중이다. 공격적 모델 역량을 방어적 작업으로 전환하고자, AI Gateway를 활용해 채택된 취약점 보고서를 제출한 연구자에게는 AI 비용을 지원할 계획이다.
아울러 deepsec이 식별한 취약점 가설을 트리아지(triage)할 때 오픈웨이트 모델의 공격적 역량과 프론티어 모델의 사이버 변형 버전을 활용하도록 deepsec을 확장할 계획이다.
방어자들은 이미 공격에 활용 가능한 모델보다 더 강력한 모델을 사용할 수 있다. 팀들은 지금 이 우위를 활용하고, 격차가 좁혀지는 동안에도 지속적으로 시스템을 검토해야 한다.
AI 모델로 인한 사이버보안 위협은 현실이다.
누구든 지금 당장 deepsec 같은 도구로 방어 태세를 강화할 수 있다.
지금 당장 실행에 옮겨야 하며, 모델이 발전함에 따라 이 실천을 지속해야 한다.