위험에 악용될 수 있는 AI 능력에 대한 접근을 통제하는 방법론의 최신 연구 결과
이 글은 AE Studio가 Anthropic과 공동으로 진행한 연구를 소개합니다.
프론티어 AI 모델은 방대한 지식의 저장소이기도 합니다. 그 지식 중 일부는 이중 용도(dual-use)로, 선한 목적으로도 악한 목적으로도 활용될 수 있습니다. 예를 들어 사이버보안 지식은 치명적인 보안 취약점을 패치하는 데 쓰일 수도 있지만, 반대로 이를 악용하는 데 사용될 수도 있습니다. 바이러스학 지식은 연구자가 백신을 개발하는 데 도움이 되기도 하지만, 악의적인 행위자가 치명적인 병원체를 설계하는 데 활용될 수도 있습니다. 이상적으로는 세 가지 목표를 균형 있게 달성할 수 있어야 합니다. 첫째, 이중 용도 능력에 대한 접근을 최대한 정밀하게 제한하는 것, 둘째, 신뢰할 수 있는 사용자가 동일한 능력을 유익한 목적으로 활용할 수 있도록 허용하는 것, 셋째, 이 모든 과정에서 다른 작업에 대한 모델 성능에 영향을 주지 않는 것입니다.
현재의 안전장치는 완전하지 않습니다. 우리는 모델이 유해한 요청을 거부하도록 훈련하고, 분류기(classifier)를 활용해 입력과 출력에서 위험한 콘텐츠를 걸러냅니다. 이러한 다중 보호 계층은 위험한 출력을 방어하지만, 모델 내부에 저장된 지식 자체를 바꾸지는 못합니다. 안전장치가 있더라도, 충분히 집요한 공격자라면 모델을 탈옥(jailbreak)시켜 방어선을 뚫고 이중 용도 지식에 접근하려 할 수 있습니다.
오용에 대한 보다 견고한 방어책은 모델이 알고 있는 것 자체를 통제하는 것입니다. 이 방향은 이전에도 탐구한 바 있습니다. 앞선 연구에서는 화학·생물·방사선·핵무기 관련 정보를 사전 훈련 데이터에서 필터링했고, 이후 이중 용도 지식을 모델 가중치의 분리 가능한 영역에 국한시킬 수 있음을 보였습니다. 하지만 필터링은 정밀하지 않은 수단입니다. 고정된 능력 집합을 가진 단일 모델만을 만들어낼 뿐입니다. 필터링 방식으로는, 예를 들어 검증된 생물보안 연구소 배포용으로 고급 바이러스학을 논할 수 있는 버전과 그렇지 않은 버전을 각각 만들려면 두 개의 모델을 따로 훈련해야 합니다. 특히 프론티어 모델처럼 규모가 크고 훈련 비용이 막대한 경우, 개발자 입장에서는 감당하기 어려운 비용이 됩니다.
AE Studio와의 공동 연구에서는 여러 개의 필터링된 모델을 따로 훈련하는 것과 동일한 효과를, 단 하나의 모델 훈련 비용으로 달성할 수 있는 새로운 방법론을 탐구했습니다. 이 방법론을 GRAM(Gradient-Routed Auxiliary Modules)이라 부릅니다. 단, 여기서 소개하는 실험 결과는 예비적인 것으로, GRAM은 Anthropic의 어떤 프로덕션 모델에도 적용된 적이 없으며, 앞으로 적용될지도 불확실합니다.
GRAM의 핵심 아이디어는 이중 용도 지식의 각 범주마다 전용의 분리 가능한 구획을 모델에 부여하고, 이중 용도 데이터를 학습할 때 해당 구획만 업데이트하는 것입니다.
구체적으로, GRAM은 표준 트랜스포머(Transformer, 대규모 언어 모델의 기반이 되는 신경망 아키텍처)의 모든 레이어에 추가 뉴런을 삽입합니다. 이 뉴런들은 이중 용도 범주별로 하나씩 할당된 그룹, 즉 '모듈'로 나뉩니다. 훈련 중에 모델이 일반 텍스트를 접하면 평소와 같은 방식으로 학습합니다. 하지만 바이러스학처럼 이중 용도 범주에 속하는 텍스트를 접하면 규칙이 달라집니다. 모델은 일반 지식을 활용해 예측을 수행할 수 있지만, 해당 텍스트로부터 학습할 수 있는 것은 바이러스학 모듈뿐입니다. 범용 가중치는 일시적으로 동결됩니다.1
그 결과, 바이러스학 지식은 네트워크 전체에 분산되지 않고 바이러스학 모듈에 집중적으로 축적됩니다. 훈련이 끝난 후 모듈을 삭제하면 해당 능력도 함께 제거됩니다. 반대로 바이러스학 지식이 필요한 신뢰할 수 있는 배포 환경에서는 그대로 유지할 수 있습니다. 배포 환경에 맞게 지식을 매우 세밀하게 조정할 수도 있습니다. 실험에서는 네 가지 이중 용도 범주를 정의했고, GRAM으로 단 한 번 훈련한 모델이 각 범주를 켜거나 끄는 방식으로 총 16가지 설정을 지원할 수 있음을 확인했습니다.
점점 더 현실적인 세 가지 환경에서 GRAM을 검증했습니다.
첫 번째로, 주제별로 태그된 어린이 동화 합성 데이터셋을 사용했습니다. 소규모 GRAM 모델은 선택한 주제를 '잊도록' 재설정할 수 있었으며, 각 설정의 성능은 해당 주제를 필터링해 처음부터 훈련한 별도 모델과 거의 동일했습니다. 즉, 단일 모델 훈련 비용으로 서로 다른 데이터셋에서 여러 차례 훈련해야 얻을 수 있는 결과를 달성한 것입니다.
두 번째로, 웹 텍스트·코드·학술 논문을 현실적으로 혼합한 데이터로 더 큰 모델을 훈련했습니다. 이중 용도 도메인은 바이러스학, 사이버보안, 핵물리학, 틈새 프로그래밍 언어(특수 이중 용도 코드의 대리 지표) 네 가지로 설정했습니다. 각 이중 용도 도메인에 해당하는 능력은 전용 모듈로 라우팅됩니다. 모듈을 삭제하면 해당 데이터로 아예 훈련하지 않은 것과 거의 동일한 수준으로 대응 능력이 제거되었습니다. 놀랍게도, 이러한 제거가 전반적인 성능에는 영향을 미치지 않았습니다.
또한 공격자가 소량의 악의적인 데이터로 훈련해 제거된 지식을 복구할 수 있는지도 검증했습니다. GRAM은 데이터 필터링과 비슷한 수준으로 이를 방어했습니다. 반면, 훈련 후에 적용하는 '언러닝(unlearning)' 기법은 지식을 억제하는 데 그쳤으며, 소량의 파인튜닝(fine-tuning)만으로도 쉽게 복원할 수 있었습니다.
세 번째로, 5천만에서 50억 파라미터에 이르는 일곱 가지 모델 규모에서 실험을 진행했습니다. 모든 규모에서 GRAM은 데이터 필터링과 동등한 성능을 보였으며, 모델이 커질수록 '모듈 켜짐'과 '모듈 꺼짐' 간의 성능 차이가 더 벌어졌습니다. 컴퓨팅 비용 측면에서도, 모델 규모가 커질수록 보호 장치를 우회하려는 시도는 상대적으로 더 어렵고 비용이 많이 드는 것으로 나타났습니다.
AI 기업들이 더 강력한 모델을 훈련할수록 이중 용도 능력에 대한 접근을 제한해야 할 필요성은 커질 것입니다. 현재 기업들은 분류기와 거부 훈련을 통해 접근을 제한하고 있습니다. 하지만 이러한 안전장치는 무해한 요청에서의 성능 저하 없이 견고하게 만들기 어렵습니다. GRAM과 같은 방법론은 보다 견고한 접근 통제로 나아갈 수 있는 잠재적인 경로를 제시합니다.
이는 초기 연구이며 명확한 한계도 있습니다. GRAM은 프론티어 규모나 실제 프로덕션 훈련 파이프라인에서는 아직 검증되지 않았습니다. (앞서 언급했듯, 어떤 Claude 모델에도 적용된 적이 없습니다.) 평가 역시 실제 다운스트림 태스크 성능이 아닌 다음 토큰 예측 능력을 기준으로 성능을 측정했습니다. 데이터 필터링과 GRAM 같은 방법론에 공통적으로 적용되는 더 근본적인 미해결 문제도 있습니다. 일부 이중 용도 능력은 일반 지식과 너무 깊게 얽혀 있어 어떤 방법으로도 깔끔하게 분리할 수 없을 수도 있습니다.
실험에 대한 자세한 내용은 Alignment Science 블로그의 포스트에서 확인하세요.