Hugging Face 공격은 충격적이다. 하지만 그 배경이 된 능력은 처음부터 의도적으로 길러진 것이다.

몇 주째 OpenAI가 Hugging Face를 실수로 공격한 사건과 이와 유사한 사례들을 다룬 언론 보도가 점점 거슬리기 시작했다. 해당 사건을 다루는 기사들은 모델의 자율성을 부각시키는 한편, 모델을 훈련하고 테스트한 인간의 역할은 축소하거나 아예 감춰버린다. 안타까운 일이다. 연구소들이 모델에 명시적으로 심어온 능력들이, 바로 그 모델을 뛰어난 자율 해커로 만드는 능력과 동일하기 때문이다.
이를 구체적으로 살펴보기 위해 METR이 상세히 기술한 Hugging Face 해킹 경위를 따라가 보자:
황당하지 않은가? 지난 7월에 실제로 벌어진 SF 같은 이야기이며, 추가 정보가 밝혀질수록 더욱 섬뜩해지고 있다.
놀라운 공격을 스스로 구사할 수 있는 자율 소프트웨어의 가능성은 결코 가볍게 볼 문제가 아니다. Hugging Face 공격은 충격적이었다. 하지만 그 배경이 된 능력은 처음부터 의도적으로 길러진 것이다. 연구소들은 수년에 걸쳐 최전선 에이전트들을 더 끈질기게, 더 능동적으로, 컴퓨터를 더 잘 다루도록, 그리고 다른 에이전트들과 더 잘 협력하도록 발전시켜왔다.
이를 추론할 필요조차 없다. 연구소들이 직접 밝히고 있으니까. OpenAI 포스트 트레이닝 팀이 채용 공고에서 스스로를 소개하는 방식을 보자(강조는 필자):
우리는 Codex, ChatGPT, API, 그리고 여타 최전선 제품의 에이전트를 구동하는 모델을 훈련합니다. 지속적이며 능동적인 지능으로, 컴퓨터를 조작하고, 사람 및 다른 에이전트들과 협력할 수 있으며, 개인과 조직이 상상하고, 시도하고, 성취할 수 있는 범위를 넓혀나갑니다.
어디서 많이 들어본 말 같지 않은가?
최고의 코딩 에이전트는 지속하고, 추론하고, 협력하도록 설계된다.
모델은 끈질기게 지속하도록 설계된다.
모델은 능동적으로 행동하도록 설계된다. 조금만 어려워도 쉽게 포기하는 코딩 에이전트는 사용자를 실망시킨다. 그래서 연구소들은 에이전트를 끈질기고 능동적으로 만든다.
2025년 중반, 여러 모델 출시 발표는 장시간 실행 능력을 전면에 내세웠다. GPT-5.1-Codex-Max 발표 글은 압축된 컨텍스트 환경에서도 끊임없이 장기 과제를 수행하도록 훈련되었음을 강조했다. Claude 4 역시 장기 과제에서의 지속성을 핵심 특징으로 내세웠다.
모델은 기록하도록 설계된다.
현대 모델이 추론하는 중요한 방식 중 하나는 바로 '써내려가는 것'이다. 우리가 흔히 접하는 추론 또는 '사고' 흔적이 그 예다. 모델은 최종 답변을 내놓기 전에 텍스트 형태로 탐색하고, 되돌아보고, 분해하고, 계획을 세우도록 훈련된다.
우리는 모델이 중간 단계에서 추론하는 것에 익숙하지만, 사실 모델은 텍스트를 담을 수 있는 곳이라면 어디서든 추론한다. 추론 모드가 꺼져 있어도 모델은 결과를 내놓기 전에 일반 출력 안에서 생각한다. Qwen 3.6의 사고 기능을 제한하는 실험에서는 모델이 추론 과정을 코드 주석으로 옮겨버렸다.
요즘 최전선 모델들은 주석 안에 소설을 써넣는 수준이다. Claude는 이런 행동으로 자주 지적을 받는데, 코드 주석을 본래 용도가 아닌 메모장처럼 쓰는 버릇이 여간 성가신 게 아니다.

모델은 협력하도록 설계된다.
2025년 6월, Anthropic은 멀티 에이전트 연구 시스템의 구축 방식을 공개했다. 이 시스템은 계획을 메모리에 저장하고, Extended Thinking을 '제어 가능한 메모장'으로 활용하며, 작업을 다른 모델에 넘겨 처리하도록 설계되었다. 이 논문 이후 출시된 Claude 모델(특히 Opus 4.6)은 "복잡한 과제를 독립적인 하위 과제로 분해하고, 도구와 서브에이전트를 병렬로 실행하며, 실질적인 장애물을 정확하게 식별하는" 능력이 향상되었다고 강조했다.
OpenAI는 "세 가지 상호 보완적인 아키텍처 개입을 통해 GPT‑5.6을 엔드투엔드로 훈련하여 에이전트가 더 효율적으로 작동할 수 있게 했다"고 밝혔다. 그 목록의 두 번째 항목은?
상황에 따른 병렬 분해: 네이티브 멀티 에이전트 오케스트레이션을 활용해 여러 에이전트를 병렬 작업 흐름에 걸쳐 조율함으로써 복잡한 과제를 더 빠르게 완료한다.
이 모든 특성이 모델을 더 나은 코딩 에이전트로 만든다. 그러니 수백 개의 에이전트가 서로 정보를 주고받을 수 있다는 사실을 발견했을 때, 놀라운 것은 그들이 찾아낸 채널이지, 작업을 나누고 지시를 작성하고 다른 에이전트의 지시에 따라 행동한다는 사실 자체가 아니다. 이는 연구소들이 줄곧 구축해온 능력들이다.
연구소들도 이 능력들이 실패할 수 있다는 것을 알고 있다. OpenAI는 블로그 글을 통해 장시간 실행 모델의 안전 문제를 상세히 다뤘는데, 이는 Hugging Face 공격이 발생한 직후, 전모가 알려지기 전에 게재되었다:
새 모델은 장기간에 걸쳐 반복적으로 시도하며 목표를 향해 계속 나아갈 수 있습니다. 바로 그 끈질김이 환경의 취약점을 찾아 악용하는 방향으로 이어질 수 있습니다. 이전 모델들은 샌드박스나 환경 제약에 막히면 그대로 멈추고 사용자에게 돌아왔습니다. 반면 이 모델은 샌드박스 밖에서 행동할 방법을 찾는 것을 포함해, 포기하지 않고 계속 시도하는 경우가 많았습니다.
이렇게 보면, Hugging Face 해킹 사건이 더 이상 그렇게 섬뜩하게 느껴지지 않는다. 해당 소프트웨어는 명시적으로 설계된 능력들을 조합했을 뿐이다. 지시를 따르고, 불가능한 과제에도 포기하지 않고, 추론하며 메모하고, 다른 모델들과 협력했다.
이 때문에 에이전트의 자율성만 강조하고 훈련 과정은 언급조차 않는 최근 보도들이 답답하다. 인간이 거론될 때도 샌드박스 보안이나 테스트 설계의 결함이 주를 이룬다. 물론 그것도 중요하다. 하지만 시스템에 이 과제를 수행할 능력을 부여한 것은 훈련 방식과 에이전트 설계다.
우리는 모델을 의인화하는 경향이 있고, 이것이 이런 상황을 부추긴다. 지난주 뉴욕타임스 기사는 모델이 "동조 압박"에 굴복하고 "거침없는 의지"를 보인다고 묘사하면서도, 연구소들이 장기 과제 수행 능력을 의도적으로 모델에 심어왔다는 사실은 단 한 줄도 언급하지 않았다.
그리고 연구소들은 자신들의 설계가 어떤 위험을 수반하는지 누구보다 잘 알고 있다.
Anthropic은 Opus 4 시스템 카드에서 "Claude Code 불가능 과제"라는 벤치마크를 도입해 모델의 보상 해킹(reward hacking)을 측정했다. 모델이 패배를 인정할 것인가, 아니면 시스템을 속으려 할 것인가를 보는 것이다. 이상적인 모델은 과제가 불가능하다는 것을 인식하고 중단하므로, Anthropic은 보상 해킹을 줄이기 위해 포스트 트레이닝 보상, 환경, 피드백을 구체적으로 수정했다.
이후 발표된 시스템 카드에 따르면, 해킹 방지 지시를 간단히 추가하는 것만으로 Opus 4.1의 보상 해킹 비율이 52%에서 18%로 떨어졌다. 단순히 하지 말라고 요청하는 것만으로 Opus가 시스템을 속으려는 시도가 65% 줄어든 것이다. Anthropic은 프롬프팅에서 그치지 않고, 보상 해킹이 덜 유리하도록 포스트 트레이닝 보상과 모니터링 방식도 변경했다.
최근 잇따르는 비의도적 해킹 사례들은 분명 우려스럽다. 하지만 그것은 우리가 선택한 설계의 결과다. 그렇다고 이 사건들이 덜 심각하다는 뜻은 아니다. 문제는 우리가 이 사건을 이야기하는 방식, 그리고 던지는 질문에 있다. 에이전트가 '통제를 벗어났을' 때, 모델이 무엇을 원했는지부터 물어서는 안 된다. 사람들이 무엇을 하도록 훈련시켰는지, 무엇에 보상을 주었는지, 어떤 지시를 주었는지, 어떤 실행 환경을 제공했는지, 그리고 무엇을 제한하지 못했는지를 먼저 물어야 한다.