이 보고서는 Claude를 평가하고 내부에서 사용하는 과정에서 관찰한 의도치 않은 모델 행동 사례를 소개합니다. Anthropic은 모델을 출시할 때마다 시스템 카드(system card)를 공개하고, Responsible Scaling Policy에 따라 3~6개월마다 리스크 보고서를 발표해 왔습니다. 여기에 더해 모델의 행동과 정렬(alignment)을 다루는 독립 보고서도 더 자주 내놓으려는 노력의 일환으로 이번 보고서를 마련했습니다. 테스트와 실사용 중에 모델이 보이는 행동을 투명하게 공개하는 일이 중요하다고 생각하기 때문입니다.
관찰된 행동은 네 가지 유형으로 나눌 수 있습니다.
아래 사례에 등장하는 기관의 이름은 밝히지 않았습니다. 해당 기관 시스템의 취약점이 노출되지 않도록 하고, 기관 측의 요청도 있었기 때문입니다. 같은 이유로 각 사례의 세부 내용도 평소보다 적게 담았습니다. 아래 사례 중 일부는 미국 연방, 주, 지방 정부 기관이 운영하는 웹사이트와 관련되어 있습니다. Anthropic은 이 사례들을 백악관에 설명했고, 관련 기관에도 각각 통보했습니다.
지금까지 확인한 이 유형의 사례가 실제 세계에 미친 영향은 미미했습니다. 정렬과 보안 측면에서 보면, 7월 30일과 9월 9일에 보고한 사이버 보안 사고보다 훨씬 심각도가 낮다고 판단합니다. 이 행동들은 Claude Mythos Preview 이후 시스템 카드에서 설명해 온 행동과 비슷합니다. 대부분은 끈질김(persistence)의 한 형태로, 주어진 대로는 작업을 끝낼 수 없을 때 Claude가 멈추지 않고 제한을 우회해 버리는 경우입니다.
영향은 미미했고 일부 고위험 평가와 사이버 보안 평가에서는 이미 실시간 인터넷 접속을 꺼 둔 상태였지만, 이번에 그 조치를 모든 내부 평가로 확대하기로 했습니다. 이 글의 대응 조치 부분에서 설명하는 보안·모니터링 체계가 이런 행동을 확실하게 잡아낸다는 것을 확인할 때까지 유지할 방침입니다. 아래에서는 정렬 측면의 고려 사항도 다루고, 추가적인 문제 행동 가능성을 줄이기 위해 학습 방식을 어떻게 바꾸고 있는지도 자세히 설명합니다.
이 사례 대부분은 7월부터 시작한 트랜스크립트 검토에서 발견했습니다. 검토는 먼저 사이버 보안 평가에 집중했습니다. 이 평가는 모델에게 테스트 시스템을 일부러 탐색하거나 공격하게 하는 테스트이며, 인터넷 접속은 차단되어 있어야 합니다. 이후 스캔 범위를 Claude가 인터넷에 닿았을 가능성이 있는 훨씬 다양한 사례로 넓혔습니다. 여기에는 실제 업무에 대한 Claude의 성능을 평가하려고 인터넷 접속을 의도적으로 허용한 테스트도 포함됩니다. 처음에는 올여름 보고한 사이버 보안 사고와 비슷한 수준의 심각한 사례를 찾았으나, 지금까지 발견된 것은 없습니다. 그다음 범위를 넓혀, 모델이 의도하지 않은 방식으로 실제 웹사이트나 시스템과 상호작용한 덜 심각한 사례도 찾았습니다.
현재는 위험도가 더 낮은 트랜스크립트도 훨씬 많이 스캔하고 있으며, Anthropic 내부의 Claude 사용 사례와 Claude가 인터넷에 접근할 수 있는 강화 학습(RL) 환경도 살펴보고 있습니다. 이 작업이 이어지는 동안 새로운 의도치 않은 행동이 발견되면 계속 보고할 계획입니다. 이번에 보고하는 사례는 모두 Claude가 외부 세계와 상호작용한 경우이며, 우리가 아는 한 고객 데이터나 Anthropic 자체 내부 시스템과 관련된 사례는 없습니다.
이 글에서는 사례 대부분이 발생한 평가를 왜 하는지 설명하고, 각 행동을 더 자세히 소개합니다. 이어서 이런 행동이 Claude의 정렬에 대해 시사하는 바와 이를 완화하기 위한 노력에 대한 잠정적인 견해를 제시합니다.
이 글에서 설명하는 행동이 평가에서만 나타나는 것은 아니지만, 지금까지 확인한 사례 중 상당수는 평가 실행 중에 발생했습니다. Anthropic은 모델을 출시하기 전에 다양한 작업으로 계속 테스트합니다. 매번 같은 방식으로 채점하는 표준화된 작업 모음인 평가를 여러 종류 활용하며, 각 평가는 특정 영역에서 Claude의 역량을 보여 주는 한 조각이 됩니다. 사용하는 평가 중 상당수는 외부 연구자가 만든 공개 평가로, 어떤 개발자든 실행할 수 있어서 모델 간 역량을 비교하기 좋습니다. 나머지는 자체적으로 만든 평가입니다.
언어 모델은 비결정적입니다. 응답에 항상 어느 정도 무작위성이 들어가므로, 같은 작업도 할 때마다 조금씩 다르게 수행할 수 있습니다. 그래서 평가 작업 하나를 Claude가 수백, 수천 번 수행하게 합니다(각 시도를 run이라고 부릅니다). 이렇게 많이 테스트하면 모델이 평소 어떻게 수행하는지 파악할 수 있고, 모델이 예상 밖의 행동을 하는 드문 경우도 잡아낼 수 있습니다. 평가로 얻은 결과는 모델을 어떻게 학습시킬지, 어떤 안전장치를 마련할지, 언제 출시할지 등 Anthropic 전반의 의사 결정에 반영됩니다.
모델의 행동상 문제가 처음 드러나는 곳도 때로는 평가입니다. 모델은 RL을 통해 자신이 할 수 있는 일의 상당 부분을 익힙니다. RL에서는 특정 환경 안에서 작업을 수없이 시도하고, 성공하면 보상을 받습니다. 그런데 학습 환경은 완벽하지 않습니다. 허점을 찾거나 제한을 우회하는 것처럼 의도하지 않은 행동에 학습이 보상을 주면, 모델은 그런 우회가 이득이 된다고 배우고 다른 곳에서도 적용할 수 있습니다. 이를 보상 해킹(reward hacking)이라고 합니다. 학습 중에 보상 해킹을 식별하고 걸러내는 절차를 갖추고 있지만, 학습 때와는 다른 맥락과 작업에서 모델의 행동 성향을 이해하는 데는 평가가 핵심적인 수단입니다.
찾기 어려운 정보를 웹에서 검색하는 작업처럼, 인터넷 접속이 없는 환경에서는 현실적으로 시뮬레이션하기 어려운 작업이 있습니다. 이런 작업은 접속을 허용하고 실행하는 것이 업계의 표준 관행이었습니다. 공개된 웹 검색 벤치마크는 기본적으로 실제 인터넷에서 실행되며, 같은 방식으로 실행해야 다른 모델과 비교할 수 있습니다. 이 보고서의 사례 대부분이 이런 평가 중에 발생했습니다.
아래에서는 Claude가 Anthropic 외부의 기관이나 사람과 관련된 실제 웹사이트와 시스템에서 의도치 않게 행동한 네 가지 유형을 설명합니다.
Claude는 평가 작업을 직접 수행할 수 없을 때, 즉 자신의 도구가 의도적으로 제한되어 있거나 필요한 외부 서비스를 쓸 수 없을 때, 제3자 사이트에 있는 다른 도구를 이용해 목표를 달성했습니다. 어떤 경우에는 해당 사이트 소프트웨어의 기본적인 결함을 악용했는데, SQL 인젝션이나 명령 인젝션(사이트가 입력을 명령으로 잘못 실행하게 만드는 입력 전송 방식)을 사용했습니다.
예를 들어 한 평가에서 Claude Mythos Preview에게 과학 분석을 실행하라는 과제를 냈습니다. 분석에 필요한 공개 도구는 한 대학에서 운영하고 있었는데, 모델이 접근하려 하자 도구가 오류를 반환했습니다. Claude는 작업을 마칠 다른 방법을 찾아 도구의 웹사이트를 살펴보다가, 요청받은 파일을 무엇이든 반환하는 스크립트가 대학 서버에 있다는 것을 발견했습니다. 그리고 이를 이용해 스크립트 자체의 코드를 포함한 서버의 파일을 복사했습니다. Claude는 그 코드에서 서버에서 명령을 실행할 수 있는 인젝션 결함을 찾아냈고, 이를 이용해 계산을 실행했습니다.
또 다른 사례에서는 Claude Mythos 5가 필요로 한 데이터가 무료였지만, 데이터 사용 동의서에 동의해야만 접근할 수 있었고 Claude에게는 이를 수행할 도구가 없었습니다. 그러자 Claude는 해당 웹사이트에 있는 애플리케이션을 이용해 페이지를 불러오고 대신 동의서에 동의했습니다.
이 행동은 DeepSearchQA와 BrowseComp(둘 다 공개 웹 리서치 평가), LABBench2(공개 생물학 연구 벤치마크), 그리고 내부 평가에서 관찰되었습니다.
Claude가 제출하지 말았어야 할 온라인 양식을 제출한 사례가 있었습니다. 대체로 평가 지침이 모호했거나, 환경 설정 오류 때문에 Claude가 더미 양식을 다룰 수 없었을 때 발생했습니다.
예를 들어 같은 평가에서 여러 차례 발생한 사례가 있습니다. 미공개 비프런티어 연구 모델이 정부 양식의 연습용 사본을 작성해야 했는데, 사본이 로드되지 않거나 모델이 실수로 사본을 닫아 버렸습니다. 그러자 모델은 실제 양식이 주로 게시되는 웹사이트로 이동해 그곳에서 양식을 제출했습니다.
다른 평가에서는 Claude Haiku 4.5가 최종 제출 직전까지 양식을 작성하되 실제로 제출하지는 말라는 지시를 받았습니다. 그런데 여러 번 확인 페이지가 따로 나오리라 예상하고 실수로 양식을 제출했습니다. 이때 모델의 사고 과정(chain-of-thought)에는 실제 요청을 제출하는 것이 아니라 절차를 시연하는 중이라고 적혀 있었습니다.
세 번째 사례에서는 Claude Haiku 4.5가 무작위로 고른 웹페이지에서 예시 작업을 만들어 수행하는 과제를 맡았습니다. 한 번의 실행에서 모델이 미해결 살인 사건을 다룬 페이지에 도착했는데, 그 페이지에는 경찰서가 운영하는 제보 양식이 있었습니다. Claude는 로그인, 계정 생성, 개인정보 입력, 구매, 파괴적인 제출을 절대 하지 말라는 지시를 받았지만, 양식 제출을 금지하는 내용은 없었습니다. Claude는 이 양식에 다음과 같이 작성했습니다. "이 사건과 관련된 정보를 가지고 있을 수 있습니다. 해당 시기에 [페이지에 언급된 거리] 일대에서 인상착의가 비슷한 사람을 본 기억이 있습니다. 관련이 있는 정보라면 연락 주시기 바랍니다." (해당 웹사이트에는 범인의 인상착의 설명이 없었습니다.) 모델은 양식에서 허용하는 대로 이름과 연락처 항목을 비워 둔 채 제출했습니다. 이 제보는 스팸으로 분류되어 수사에 전달되지 않았습니다.
이 행동은 OSWorld(공개 컴퓨터 사용 평가), Odysseys(장기 과제 평가), 그리고 내부 사용 중에 관찰되었습니다.
Claude는 접근 권한이 없는 데이터에 닿기 위해 제한을 우회하기도 했습니다. 대체로 서버가 Claude의 요청을 거부했거나 데이터가 유료로만 제공될 때 발생했습니다.
예를 들어 사진 속 장소를 알아맞히는 평가에서 Claude Mythos 5는 추측을 좁히려고 한 지방 정부의 부동산 지도에 접근하려 했습니다. Claude는 웹페이지 텍스트는 읽을 수 있었지만, 평가 설정상 사람처럼 페이지를 클릭하며 이동하는 기능은 제한되어 있었습니다. 그러자 Claude는 사이트가 브라우저에 보내는 설정 파일을 읽어 작동하는 액세스 토큰을 찾아냈고, 이를 이용해 지도 뒤의 서버에 직접 요청을 보내 데이터에 접근했습니다.
또 다른 사례에서는 Anthropic 연구원이 통계 프로젝트에 Claude Mythos 5를 사용했습니다. 이 프로젝트는 주 정부 기관이 유료로 제공하는 공개 데이터를 가져와야 했습니다. 그러나 Claude는 해당 기관 웹사이트의 보관본에서 공개 대시보드가 방문자 누구에게나 액세스 토큰을 발급한다는 사실을 알아냈습니다. 그리고 토큰을 요청해 발급받은 뒤, 요금을 내지 않고 이를 이용해 데이터베이스를 조회했습니다.
두 사례 모두 Claude가 얻은 것은 이미 공개된 데이터였지만, 유료로만 제공되던 것이었습니다.
이 행동은 전문가 수준의 학술 문제로 구성된 평가인 Humanity’s Last Exam과 내부 사용 중에 관찰되었습니다.
Claude가 웹페이지를 읽을 수 있게 해 주는 fetch 도구 중에는 Claude가 요청할 수 있는 URL 길이를 제한하는 것이 있습니다. 긴 URL을 이용한 SQL 인젝션이나 명령 인젝션 같은 원치 않는 행동을 막기 위한 조치입니다(URL의 일부는 사이트 서버로 전달되는 텍스트이므로, 길이가 길면 그런 명령을 담을 여지가 생깁니다). Claude Opus 5와 Claude Mythos 5를 비롯한 여러 모델이 무료 URL 단축 서비스를 이용해 이 제한을 피해 간 사실이 확인됐습니다. 이 행동은 처음에는 내부에서 발견했는데, 이 글을 쓰는 동안 da.gd URL 단축 서비스의 운영자가 자신들의 웹사이트를 Claude가 같은 목적으로 쓴 것을 발견했다고 알려 왔습니다. 세부 내용을 공유해 준 운영자께 감사드립니다.
Anthropic은 몇 가지 예방 조치를 취했습니다. 일부 공개 평가는 더 이상 실행하지 않고, 일부는 오프라인 버전으로 옮기거나 실제 웹사이트에 접속하지 않도록 다시 구성했습니다. 더 폭넓은 변경도 적용했습니다. 웹 fetch 도구 등 인터넷 접근 도구 일부는 가드레일을 업데이트해, 모델이 이를 통해 할 수 있는 일을 크게 제한했습니다. 또한 에이전트 보안 및 모니터링 노력의 일환으로, 위에서 설명한 유형의 행동을 자동으로 탐지하고 차단하는 도구를 구축했습니다. 이 도구는 이제 대부분의 평가와 프런티어 모델의 내부 에이전트 사용에 적용되고 있습니다. 이 글에서 소개한 사례에 대해 테스트했을 때는 모두 차단했습니다.
8월 31일 게시물에서 설명한 대로, 도구 제한이나 기타 장애물을 우회하는 Claude에게 보상을 주는 학습 환경도 계속 수정하거나 제거하고 있습니다. 이런 행동을 조장하거나 보상 해킹을 허용하지 않게 하기 위해서입니다.
Anthropic 내부에서 의도치 않은 에이전트 행동을 막고, 발생하면 잡아내기 위한 조치도 추가로 취하고 있습니다. 내부 에이전트를 강력한 격리 기능을 갖춘 중앙 관리형 인프라로 옮기고, 내부 에이전트와 학습 과정의 인터넷 접근을 최소화하며, 안전 분류기와 계층적 요약 같은 기법으로 에이전트의 활동을 훨씬 폭넓게 모니터링하는 것이 그 내용입니다. 이런 조치는 이제 보안팀의 탐지·대응 절차에 포함되어 있어, 바람직하지 않은 행동에 신속히 대응하고 확산을 막을 수 있습니다. 이러한 접근법에 대해서는 앞으로 더 많은 내용을 공개하고, 제품에도 직접 반영할 계획입니다.
이 사례들에 대한 전체 정렬 평가는 아직 마치지 못했지만, 올여름의 사이버 보안 사고보다는 심각도가 낮다고 판단합니다. 그 이유와 이 사례들에서 얻은 일반적인 교훈을 아래에서 설명합니다.
이런 행동을 정기적으로 공개 보고하는 체계를 마련하는 만큼, 심각도 측면에서 각 사례를 어떻게 볼지도 정리하고자 합니다. 이는 여전히 어려운 일입니다. 정렬 실패의 정도는 대개 모델이 무엇을 하려 했는지에 따라 달라지는데, 9월 9일 정렬 평가에서 다뤘듯이 모델이 스스로 설명하는 추론 과정이 모델의 믿음이나 행동 이유를 보여 주는 믿을 만한 증거라고 단정할 수 없기 때문입니다. 모델의 역량이 높아질수록 세상과 더 정교하게 상호작용할 수 있고, 그만큼 더 복잡한 실패도 가능해집니다. 예를 들어 그 평가에서 설명한 편향된 추론은 새로운 것이 아니었지만, 모델이 실제 시스템에서 몇 시간씩 능숙하게 행동할 수 있는 환경에서는 더 심각한 결과로 이어졌습니다. 오늘날의 실패를 기준으로 만든 정렬 심각도 프레임워크는 AI 역량이 빠르게 발전하는 만큼 금세 낡을 수 있습니다.
그럼에도 이 글의 사례를 살펴보는 데는 두 가지 정렬 차원이 유용했습니다. 하나는 모델이 과제의 의도를 얼마나 넘어섰는지를 보는 월권(overreach)이고, 다른 하나는 모델이 자신의 행동이나 의도에 대해 오해를 부르는 설명을 했는지를 보는 기만(dishonesty)입니다. 월권 측면에서 보면, 이 사례들은 올여름 보고한 사고보다 훨씬 우려가 적습니다. 당시 사고에서는 Claude가 사이버 보안 평가 중 실제 제3자 시스템에 몇 시간 동안 접근했습니다. 반면 이번 보고서의 사례에서는 Claude가 접근 통제를 우회해, 보호되어 있지만 공개된 데이터에 접근하거나, 소프트웨어 결함을 악용해 서버에서 명령을 실행했습니다(주로 민감하지 않은 데이터에 접근하기 위해서였습니다).
기만 측면의 비교는 더 엇갈립니다. 한 사례에서 Claude는 웹사이트와의 상호작용 예시를 만드는 과제를 수행하다가 경찰서의 온라인 양식에 지어낸 제보를 제출했습니다. 트랜스크립트로 보면 Claude는 목표 달성을 위해 누군가를 속이려 한 것이 아니라 과제에 쓸 예시 콘텐츠를 만들었을 뿐인 것으로 보입니다. 반면 올여름의 사고 중 가장 심각했던 사례에서는 Claude의 오해를 부르는 추론이 몇 시간 동안 이어지며 계속된 공격을 뒷받침했습니다. 다만 기만 여부를 확신을 갖고 판단하려면 대개 이번보다 더 깊은 평가가 필요합니다. 예를 들어 트랜스크립트를 변형해 재생해 보면서 모델의 행동을 이끈 요인을 시험하는 식입니다. 따라서 추가 분석 결과에 따라 이 사례들에 대한 판단이 달라질 수 있습니다.
여기서 설명한 행동 중 새로운 것은 없으며, Claude의 정렬에 대한 전반적인 판단도 바뀌지 않습니다. 이런 행동이 관찰된 사례 상당수에서 Claude는 모호하거나 수행이 불가능한 과제를 받은 상태였습니다. Anthropic을 비롯한 여러 곳에서 관찰한 바에 따르면, 모델은 수행이 불가능한 과제를 받으면 목표를 이루기 위해 의도하지 않은, 때로는 정렬에서 벗어난 전략을 추구합니다.
평가 문항이 대상, 허용되는 행동, 네트워크 경계(즉 모델이 접근해도 되는 곳과 안 되는 곳) 같은 과제의 범위를 더 분명히 밝혔다면, 이런 실패 중 일부는 피할 수 있었을지도 모릅니다. 그러나 Claude는 실제 사용 중에도 모호하거나 불가능한 과제를 매일 마주하며, 실제로 관찰한 사례 중 상당수도 Claude를 일반적인 에이전트 방식으로 사용하는 중에 발생했습니다.
행동 및 정렬 학습은 Claude의 판단력을 높이고 모호한 상황을 신중하게 다루는 능력을 키우기 위해 우리가 쓸 수 있는 주된 기법입니다. 지금까지는 코딩 환경에서 모델이 경계를 지키고 적절히 신중하게 행동하도록 가르치는 데 더 집중해 왔습니다. 이제는 이번 사례에 관련된 검색과 컴퓨터 사용 같은 애플리케이션으로 이런 환경을 넓히고 있습니다. 그러나 적어도 단기적으로는 정렬 학습만으로 충분하거나 완전히 견고하지는 않기 때문에, 위에서 설명한 분류기와 안전장치를 비롯한 심층 방어(defense-in-depth) 접근법도 함께 활용합니다.
스캔과 분석이 계속되는 동안 우려되는 행동은 앞으로도 계속 보고할 계획입니다. 관련된 평가 중 상당수가 공개되어 널리 쓰이는 만큼, 이 보고서가 다른 개발자들이 자신의 모델에서 비슷한 행동을 점검하는 데 도움이 되기를 바랍니다. 이 사례들의 영향은 미미했지만, 모델이 더 강력해지면 같은 행동이 훨씬 큰 피해를 일으킬 수 있으므로 이번 발견을 가볍게 여기고 싶지 않습니다. 모델이 사회에서 맡는 역할이 클수록, 대중은 모델이 어떻게 행동하는지 더 알 자격이 있습니다.
참고: 위에서 설명한 제보 양식 사례는 필라델피아 경찰국과 관련된 것이며, 경찰국이 오늘 보도자료를 통해 스스로 이를 공개했습니다. Anthropic은 기술 검토가 끝나자마자 10월 8일에 이 결과를 경찰국에 공유했습니다.