이 글은 생물학적 위험(biorisk) 평가와 이에 대한 안전장치 마련이 책임 있는 AI 개발의 핵심 요소인 이유를 설명한다.
Anthropic은 AI가 과학적 발견을 앞당기고—특히 생물학과 의학 분야에서—인류의 삶을 개선할 수 있다는 가능성을 원동력으로 연구를 이어가고 있다. Benchling은 Claude를 활용해 연구자들이 데이터를 체계적으로 정리하고, 더 나은 질문을 던지며, 인사이트를 더 빠르게 도출하고, 실제 연구에 더 많은 시간을 쏟을 수 있도록 지원하고 있다. Biomni는 Claude를 활용해 생물정보학 분석을 가속화하고, 실험 설계 자동화까지 구현하고 있다.
동시에 AI는 본질적으로 양면적 기술이다. 책임 있는 AI 개발의 핵심 원칙 중 하나는, 과학자와 혁신가에게 AI를 유익하게 만드는 바로 그 역량을 악의적 행위자가 악용할 가능성을 사전에 식별하고, 측정하며, 완화하는 것이다.
Anthropic이 Claude Opus 4를 출시할 때 AI 안전 수준 3(ASL-3) 보호 조치를 발동했는데, 이는 화학·생물·방사선·핵(CBRN) 무기 개발과 관련된 특정 작업에 대한 모델의 지원을 차단하는 배포 조치에 초점을 맞춘 것이었다. 당시 밝혔듯이, 이는 예방 차원의 결정이었다. 평가에서 모델 성능이 향상됨에 따라, 우리의 최첨단 모델이 기초적인 STEM 배경을 가진 사람이 이러한 무기를 개발하려 할 경우 실질적인 도움이 될 가능성을 더 이상 자신 있게 배제할 수 없게 되었기 때문이다. 잠재적 결과의 심각성을 고려해, 평가와 그에 따른 안전 조치의 주요 초점을 처음부터 생물 무기에 맞췄다. 이 글에서는 AI와 생물학적 위험(biorisk)에 대한 우리의 관점을 보다 상세히 설명하고자 한다.
프론티어 AI 기업들이 발표한 모든 안전 프레임워크에 생물학적 위험에 대한 언급이 포함되어 있다는 사실은 주목할 만하다—직관적으로 와닿지 않을 수도 있지만.[1] 프론티어 LLM은 기본적으로 범용 모델이기 때문이다. AlphaFold 같은 다른 파운데이션 모델과 달리, 생물학 분야에 특화된 경우는 드물다. 이러한 범용적 특성 때문에, 사실 우선적으로 다뤄야 할 보안 위협은 수없이 많다. AI의 보안 위협을 따질 때 생물학적 위험을 굳이 우선순위에 두는 것에 회의적인 시각이 있는 것도 이해할 수 있다. 이 글은 그러한 회의론자가 제기할 법한 여러 질문들을 하나씩 짚어보고자 한다.
우리의 의도는 공포를 조장하는 것이 아니다. AI와 생물학적 위험에 관한 논의는 엄연히 '발생 가능성은 낮지만 파급력은 큰' 시나리오의 영역에 속한다.[2] 우리가 말하고자 하는 것은, 이러한 위험을 평가하고 그에 대한 안전장치를 마련하는 것이 책임 있는 AI 개발의 핵심 요소라는 점이다.
AI가 악의적 행위자의 무기 획득 및 개발에 어떻게 활용될 수 있는지 우려하는 이유는, AI가 기존 정보·통신 기술과 유사한 면도 있고, 동시에 결정적으로 다른 면도 있기 때문이다.
최근 몇 년간 테러 단체들은 암호화 통신, 암호화폐, 소셜 미디어 같은 기술을 빠르게 흡수해 왔다. AI에서도 같은 흐름이 나타날 것이다. 무기 제조 정보를 구하려는 이들이 물리적 팸플릿이나 매뉴얼을 구해야 하던 시대에서 인터넷 검색으로 옮겨간 것처럼, 이제는 AI에 질문을 던지는 방식으로 이동할 것이다.
그런데 AI가 기존 기술과 결정적으로 다른 점이 있다. 바로 진정한 의미의 보조자 역할을 할 수 있다는 것이다. 인터넷은 모순되고 오해를 부르는 정보들로 가득 차 있고, 웹사이트는 복잡하고 낯선 과정에서 어려움에 부딪혔을 때 실시간으로 도움을 줄 수 없다. 반면 충분히 발전한 AI 모델은 신뢰할 수 있는 정보의 길잡이가 되고, 기존에는 암묵적 지식으로만 머물던 구현 방법을 제공하며, 데이터를 즉시 처리하고 인사이트를 생성할 수 있는 연구 보조자 역할을 할 수 있다.
AI에서 도움을 구하려는 위협 행위자들의 범주 안에서도, 생물학적 위험—나아가 광범위한 파국적 위험—이 결코 유일한 우려 사항은 아니다. 실제로 우리는 사이버 보안에 대한 AI의 잠재적 영향을 연구하고, 사기, 악성 코드 개발, 영향력 공작 등 다양한 형태로 해를 끼치려는 이들이 우리 플랫폼을 실제로 어떻게 악용하는지 정보를 수집하는 데도 상당한 자원을 투입하고 있다.
그럼에도 생물학적 위험이 특히 심각한 이유는 크게 두 가지다. 첫째, 생물학적 공격이 성공했을 때의 결과가 유례없이 치명적이다. 바이러스를 이용한 공격의 피해는 국지적 영향에 그치는 무기와는 질적으로 다른 방식으로 최초 목표물을 훨씬 넘어 확산될 수 있다.
둘째, 생명공학의 다른 영역에서 이루어진 발전이 기존에 '수동적' 생물 방어 역할을 해오던 일부 물질적 장벽을 낮추었을 수 있다. 예를 들어, 핵산 합성 비용 감소, 시약 키트의 표준화, PCR 장비 같은 표준 분자생물학 장비에 대한 접근성 향상으로 인해 재료 확보가 더 이상 병목이 되지 않고 있다. AI 모델은 여기에 더해 정보와 노하우에 대한 장벽마저 낮춘다. 결과적으로 높은 파급력과 증가하는 실현 가능성이 맞물리면서, AI로 인한 추가적인 생물학적 위험 대응이 중요한 과제로 부상하고 있다.
LLM은 금융 모델부터 팬픽션에 이르기까지 방대한 양의 데이터로 훈련된다. 이 과정에서 거의 모든 분야에 대한 지식을 습득하게 된다. 훈련 데이터에 생물과학 관련 논문, 서적, 온라인 토론 등이 포함되어 있기 때문에, 모델은 단백질 구조, 유전공학 기법, 바이러스학, 합성생물학 등에 관한 정보를 다른 모든 지식과 함께 흡수한다. 놀라운 것은 모델 성능이 향상됨에 따라 이러한 생물학적 지식의 수준도 함께 높아졌다는 점이다.
물론 Claude를 비롯한 LLM이 현재 전문가 수준에서 과학을 자율적으로 수행할 수 있는 단계는 아니다. 그러나 잠재적으로 위험한 생물학 지식을 테스트하기 위해 설계된 여러 평가에서 모델 성능은 전문가 수준에 근접하고 있으며, 때로는 이를 초과하기도 한다.
불과 1년 사이에, Claude는 실험실 환경에서의 바이러스학 문제해결 시나리오를 테스트하기 위해 설계된 평가에서 세계 최고 수준의 전문가에 미치지 못하던 성능을 보이다가, 이제는 그 기준을 여유 있게 초과하는 수준에 이르렀다(그림 1 참조).

이처럼 전문가 성능을 초과하는 양상은 여러 벤치마크에서, 특히 분자생물학 분야에서 두드러지게 나타난다.
더욱이 해당 평가의 인간 기준치는 각자의 전문 분야 내에서 질문에 답하는 과학자들을 기반으로 한다. 즉, LLM이 인간 전문가가 따라가기 어려울 만큼 다양한 하위 분야에 걸친 폭넓은 지식을 갖출 수 있다는 것뿐만 아니라, 전문가의 고유 영역에서조차 그들을 앞지르는 경우가 나타나고 있다는 것이다.
AI가 생물학적 위험에 미치는 영향을 평가하려면, 단순히 퀴즈 성적이 얼마나 좋은지를 아는 것만으로는 부족하다. 실제 사람이 참여하고, 우리가 실제로 우려하는 위협 시나리오를 가능한 한 그대로 반영한 평가를 살펴봐야 한다. 또한 AI 지식을 전문가와 비교해 벤치마킹하듯이, AI의 실용성은 가장 쉽게 접근할 수 있는 대안—이 경우에는 인터넷—과 비교해 측정해야 한다.
이 두 가지 기준을 충족하기 위해, 우리는 AI가 가상의 생물 무기 획득 계획 수립을 지원하는 능력을 측정하는 여러 통제 실험을 진행했다. 참가자들은 최대 이틀의 시간이 주어졌으며, 이를 활용해 포괄적인 생물 무기 획득 계획서를 작성했다. 대조군은 기본적인 인터넷 자원만 활용할 수 있었고, 모델 지원 그룹은 안전장치가 제거된 Claude에 추가로 접근할 수 있었다. (이처럼 제한된 경우에는, 기술의 최대 역량을 보다 정확하게 평가하기 위해 신뢰할 수 있는 기관에 안전장치가 제거된 버전의 모델을 제공하는 것이 중요하다.) 작성된 계획서는 획득 경로의 핵심 단계를 평가하는 세부 루브릭을 사용해 생물 방어 전문가들이 채점했다. Claude 4 모델—특히 Claude Opus 4—에 접근할 수 있었던 참가자들은 인터넷만 사용한 대조군에 비해 훨씬 높은 점수를 받았으며, 치명적 실패 항목도 현저히 적었다.


이러한 텍스트 기반 역량 향상 실험은 암묵적 지식, 재료 접근성, 행위자의 지속성 등 추가적인 요소가 관여하는 현실 시나리오를 완벽하게 재현하지는 못한다. 그러나 비전문가 악의적 행위자에게 AI가 차별적으로 우월한 지원을 제공할 수 있다는 기본적인 가능성은 충분히 입증한다.[3]
바이러스학 관련 객관식 문제에 답하는 것, 생물 무기 획득을 위한 텍스트 기반 계획 수립을 지원하는 것, 그리고 실험실에서 실제로 작업하는 위협 행위자가 생물학적 위협을 개발하도록 돕는 것—이 세 가지 사이에는 분명한 차이가 있다.
먼저, AI가 정보를 제공하더라도 실험실 생물학에는 언어로 전달하기 어려운 암묵적 지식이 너무 많아서 실질적인 영향이 없을 것이라는 반론이 있다. 암묵적 지식에는 다양한 반응의 타이밍을 나타내는 미묘한 시각적 신호를 파악하는 것과 같이 언어화하기 어려운 기술적 역량, 그리고 프로토콜에 기록되지 않는 노하우처럼 경험을 통해 체득되는 지식이 포함된다. 이러한 장벽이 실험실 초보자의 시도 자체를 차단할 만큼 높다면, AI가 경험 없는 행위자를 위협이 될 수준까지 끌어올릴 가능성에 대해 덜 우려해도 될 것이다. 둘째, AI와 생물학적 위험 우려의 근저에 있는 시나리오의 현실 가능성을 진정으로 검증하려면, 실제 실험실 실험에서 나온 대규모 증거가 필요하다. 첫 번째 질문에 대한 초기 증거가 일부 있으며, 두 번째 접근법에도 적극적으로 투자하고 있다.
2024년, 우리는 기초적인 생물 실험실 프로토콜을 대상으로 예비적인 습식 실험실(wet lab) 역량 향상 실험을 진행했다. 일부 참가자에게는 Claude를, 나머지에게는 인터넷만 제공했다. 이 연구에서는 역량 향상의 증거를 관찰하지 못했다. 그러나 인터넷 전용 그룹을 포함한 모든 참가자가 실제 실험실의 모든 과제에서 예상외로 높은 성과를 보였다. 이 파일럿 연구는 AI 역량 향상에 대해 어느 쪽으로도 강력한 증거를 제공하지 못했지만, 암묵적 지식이 많은 이들이 주장해 온 것만큼 큰 병목이 아닐 수 있다는 점을 시사했다. 이 실험은 소규모(n=8)였으며, 참가자들이 수행한 프로토콜도 비교적 기초적인 수준이었다는 점을 명확히 해두고 싶다. 그럼에도 이 결과는, 암묵적 지식의 역할과 실제 실험실에서 AI가 역량 향상을 제공할 가능성에 대한 추가적인 통찰을 얻기 위해 보다 대규모 연구로 확장하는 것이 중요하다는 점을 부각시켰다.
이 초기 연구의 후속 작업으로, 우리는 실제 실험실 과제에 종사하는 사람들을 AI가 어느 정도 지원할 수 있는지 심층 조사하기 위해 Frontier Model Forum(FMF)을 통해 대규모 연구를 공동 후원하고 있다. 팬데믹 예방 비영리 단체 Sentinel Bio와 함께 진행하는 이 습식 실험실 연구는, AI가 비전문가를 전문가 수준의 실험실 생물학 과제를 수행할 수 있는 수준까지 끌어올릴 수 있는지 여부를 포함해 우리가 우려하는 다양한 시나리오를 시뮬레이션하며 증거를 수집할 예정이다. 대조군의 성과는 암묵적 지식이 실험실에서 비전문가의 수행 능력을 얼마나 제한하는지에 대한 보다 명확한 기준을 제시하고, 더 큰 표본 크기를 바탕으로 한 처리군과의 비교는 역량 향상 효과를 더 뚜렷하게 측정할 수 있게 해줄 것이다.
이 연구의 결과는 우리의 위험 평가를 보완하는 데 중요한 역할을 할 것이며, 그 결과를 기대하고 있다.
우리는 현재 생물 방어 전문가와의 협의, 그리고 LLM의 진화하는 역량에 대한 이해를 바탕으로, AI 모델이 비전문가의 생물학적 위협 생산을 지원하는 능력을 평가하는 데 주력하고 있다.
그러나 이것이 AI가 생물학적 위험에 기여할 수 있는 유일한 시나리오가 아님을 우리는 잘 알고 있다. 이러한 시나리오를 연구하는 데 투자하고 있지만, 위협 행위자들의 계획과 의도에 관한 차별화된 지식과 전문성은 정부가 보유하고 있다. 미국 AI 표준 혁신 센터(CAISI) 및 영국 AI 안전 연구소와의 자발적 협력 및 배포 전 테스트를 통해 많은 것을 배웠으며, 정부와의 협력을 더욱 심화할 기회를 기대하고 있다. 위협 환경을 파악하는 정부의 전문성과 최첨단 AI에 대한 산업계의 지식이 결합되는 민관 협력은 생물학적 위험 평가와 완화를 최적화하는 유망한 방향이다.
모델 역량이 계속 향상되는 가운데, AI의 시사점에 대해 사회가 충분히 인식할 수 있도록, 개발자들이 안전한 개발 프레임워크(Anthropic의 책임 있는 확장 정책과 같은)를 갖추고 위험한 역량에 대한 모델 평가 결과를 공개하도록 유도하는 투명성 규범을 지지하는 것이 중요하다고 생각한다.
우리는 컨스티튜셔널 분류기(constitutional classifiers) 연구를 기반으로 자동화된 배포 안전장치를 개발했다. 이 분류기 가드는 입력과 출력을 실시간으로 모니터링하고, 잠재적으로 해로운 정보의 특정 범주를 차단하는 방식으로 작동한다. 위협 행위자에 대한 의미 있는 역량 향상 가능성을 배제할 수 없는 모델에 이 보호 조치를 적용하고 있으며, 현재까지는 예방적 조치로서 Claude Opus 4 계열 모델에만 적용되어 있다. (ASL-3 보호 조치 구현에 관한 자세한 내용은 이 보고서를 참조하라.)
모든 모델에 걸쳐, Safeguards 팀은 생물학의 위험한 응용 등 오용의 징후를 포착하기 위해 플랫폼 활동을 모니터링하고 있다. 이 모니터링은 오용 패턴에 대한 통찰을 제공하고, 언제 어떤 제재 조치를 취할지 판단하는 데 도움을 준다.
새로운 미국 AI 행동 계획의 핵심 구성 요소로 바이오 보안에 대한 투자가 포함된 것은 고무적이다. CAISI를 통한 국가 안보 평가 강화와 핵산 합성 스크리닝 확대 방침은 모두 생물학적 위험에 대한 회복력을 높이는 데 기여할 것이다.
AI와 생물학적 위험이라는 주제는 위협 행위자, 모델의 역량, 그리고 그 역량이 실제 위험으로 어떻게 전환되는지에 이르기까지 불확실성으로 가득 차 있다. 그러나 AI에 관한 축적되는 증거와 생물학적 위협의 근본적인 심각성을 고려할 때, 이는 AI 개발자와 정책 입안자 모두가 반드시 주목해야 할 과제라고 우리는 확신한다. 이 중요한 논의를 발전시키기 위해 생물학적 위험 관련 연구 성과를 계속해서 공유해 나갈 것이다.