앤스로픽, 펜타곤과의 소송에서 패배: D.C. 순회항소법원 판결
Anthropic Loses to the Pentagon: The D.C. Circuit Ruling
핵심 요약
앤스로픽의 모델 안전 장치가 오히려 정부의 사용 금지 근거가 된 법적 분쟁을 분석합니다.
- 법적 쟁점 — 앤스로픽의 안전 장치가 모델의 기능을 제한하는 '조작'으로 간주됨
- 상반된 판결 — 두 개의 서로 다른 법령 적용으로 인해 국방부 내 사용은 금지되나 타 부처는 허용됨
- 투명성의 역설 — 모델의 가치를 공개적으로 문서화한 것이 오히려 정부의 공격 빌미가 됨
- 기술적 논쟁 — 국방부는 AI 모델의 복잡성으로 인해 감사가 불가능하다고 주장함
kancelaria-skarbiec.pl
원문 사이트로 이동
앤스로픽(Anthropic)이 제출한 진술서에는 법원이 두 번이나 인용한 문장이 하나 있어. 회사가 "안전 관련 고려 사항을 모델 자체에 직접 내재화하려고 한다"는 점과, "모델 학습이야말로 앤스로픽이 국방부가 사용하는 모델의 행동에 영향을 미칠 수 있는 주된 메커니즘"이라는 내용이지.
앤스로픽은 왜 자기네 모델에 킬 스위치나 백도어가 없는지 설명하려고 이 문장들을 제출했어. 그런데 재판부는 이걸 근거로 앤스로픽이 '위험' 수준을 넘어 '확실하게' 클로드(Claude)의 설계나 작동 방식을 조작해서, 치명적인 자율 살상 무기나 대규모 국내 감시 같은 두 가지 기능을 차단할 것이라고 판단했지.
법원은 앤스로픽의 동기가 아마도 "개인 정보 보호에 대한 원칙적 신념이나 AI 안전에 대한 진심 어린 우려"처럼 숭고할 것이라고 말해. 하지만 법령은 그런 거 신경 안 쓴대. "앤스로픽이 왜 그런 행동을 하느냐가 아니라, 무엇을 하느냐"가 핵심이라는 거야. 이게 이 사건 전체를 관통하는 두 줄 요약인데, 헤그세스(Hegseth)한테 화내기 전에 잠시 이 내용을 곱씹어 볼 필요가 있어.
상황을 좀 정리해 줄게. 두 법원이 판결을 다르게 내리는 바람에 사람들이 엄청 헷갈려 하거든. 지난 3월에 정부가 같은 날 두 개의 서한을 보냈어. 하나는 국방부 전용 법령인 10 U.S.C. § 3252를 근거로 했는데, 이건 시스템을 '사보타주'하거나 '전복'할 수 있는 '적대 세력'을 전제로 해. 샌프란시스코의 린 판사는 이걸 악의적인 의도가 있어야 한다고 해석했고, 그런 의도는 없다고 봐서 8월에 정부 전체의 금지 조치와 계약자 블랙리스트 지정을 영구적으로 금지했어. 물론 국방부가 클로드 구매를 중단하는 건 자유라고 뒀고. 다른 서한은 FASCSA, 즉 41 U.S.C. § 4713을 근거로 했는데, 이건 기능을 '차단'하기 위해 대상 품목의 설계를 '조작'할 가능성이 있는 '모든 사람'을 포괄해. 이 건은 워싱턴 D.C. 순회항소법원만 다룰 수 있어. 재판부는 린 판사가 자기 관할 법령을 해석한 것에 대해 "이의 없다"고 했어. 그냥 자기들 앞에 놓인 법령이 다를 뿐이라는 거지. 그래서 결론은 이거야. 국방부는 자기 시스템에서 클로드를 배제할 수 있지만, 연방 정부의 다른 기관들은 클로드 사용을 중단하라는 명령을 받을 수 없어. 법령은 두 개고 사실관계는 하나인데 결과는 정반대인 상황, 하지만 모순은 아니라는 거지.
대부분의 언론이 건너뛴, 기록에 나타난 실제 사실을 알려줄게. 클로드 거브(Claude Gov) 이전의 초기 상용 클로드는 위협 평가 요약이나 폭력적인 내용을 담은 감청 자료 번역을 거부했어. CDC의 감염병 연구 관련 질문도 거부했지. 앤스로픽은 해당 기관들과 협력해서 이 문제를 해결했는데, 법원은 이걸 인정하면서 동시에 역으로 이용했어. 학습을 통해 제한 사항을 확실하게 강제할 수 있다면, 앤스로픽은 바로 그 법령이 겨냥하는 도구를 가지고 있는 셈이라는 거지.
그리고 1월에 앤스로픽의 한 임원이 계약자가 클로드를 "해외의 민감한 군사 작전"에 사용하는 것에 대해 "적절성"을 의문시하는 일이 있었어. 국방부는 구체적으로 어떤 작전인지 밝히지 않았지. 앤스로픽이 직접 기록으로 제출한 언론 보도들을 보면 마두로(Maduro) 작전과 연결돼 있어. 에밀 마이클(Emil Michael)의 메모에는 "소프트웨어가 작동을 멈추게 만들지 않을지 실질적인 의구심이 든다"는 내용이 적혀 있지. 앤스로픽은 오해라고 주장하지만, 법원은 무슨 일이 있었는지 알 수 없다고 했어. 만약 "외국 국가 원수를 생포하기 위한 긴박한 작전" 중에 그런 일이 벌어졌다면, 국방부가 왜 확실한 보장을 원하는지 충분히 이해가 간다는 거지.
기술적인 논쟁은 앤스로픽에게 불리하게 돌아갔어. 앤스로픽은 외부와 차단된(air-gapped) 환경에는 접근할 수 없고, 모델은 변하지 않으며, 국방부가 모든 업데이트를 테스트하고 거부할 수 있다고 주장했어. 하지만 재판부는 테스트가 만능 해결책은 아니라고 반박했어. 금지된 범주라는 게 칼로 무 자르듯 명확하지 않고, 질문 방식에 따라 거부 여부가 달라지기 때문이지. 법원은 국방부가 "호박 속에 갇힌 것처럼 정체된 AI 시스템을 사용할 수는 없다"고 했어. 또한 5조에서 10조 개의 파라미터를 가진 모델은 출력값에 대한 "엄밀한 분석이나 감사가 수학적으로 불가능하다"는 국방부의 진술을 그대로 받아들였지.
Anthropic은 불투명성 문제에 대해 전반적으로 "어느 정도 타당성"이 있다는 점만 인정했어. 해석 가능성(interpretability) 연구가 얼마나 활발한지 아는 이 갤러리 사람들은 이 주장을 어떻게 생각할지 뻔하지. 게다가 국방부 스스로가 무기 체계의 자율성에 관한 지침(3000.09)에서, 그런 시스템에 들어가는 AI는 "관련 인원이 투명하게 파악하고, 감사할 수 있으며, 설명 가능한 기술과 데이터 소스"를 사용해야 한다고 명시했다는 걸 알아둘 필요가 있어. 정작 같은 국방부가 법원에는 감사가 불가능하다고 주장했으니 말 다 했지.

