Claude가 자율적으로 모델을 학습시켜 정렬 실패(alignment failure) 10개 범주를 측정하는 공개 벤치마크 성능을 개선하도록 했다. 10개 범주 모두에서 Claude는 모델 역량을 저하시키지 않으면서 목표 벤치마크를 향상시키는 해결책을 찾아냈다.
AI가 스스로를 구축하기 시작하면서, 안전 연구가 그 속도를 따라잡으려면 정렬(alignment) 연구 자동화가 점점 더 중요해지고 있다. 정렬 연구의 성과를 측정하는 것은 매우 어렵지만, Anthropic을 비롯한 여러 연구자들이 기만(deception), 아첨(sycophancy), 탈옥(jailbreak) 같은 흔한 정렬 실패를 정량화하는 벤치마크와 Petri 같은 자동 감사 도구를 개발해 왔다.
이전의 실험 중 하나에서, 우리는 약한 AI 모델을 "교사"로 활용해 더 강한 모델("학생" 모델)의 학습을 감독하는 효과적인 방법을 찾는 과제를 Claude에게 부여했다. 이번에는 이 아이디어를 발전시킨 새 보고서를 공개한다. 정렬 실패(alignment failure) 10개 범주를 각각 측정하는 공개 벤치마크에서 성능을 향상시키도록 Claude가 자율적으로 모델을 학습시켰다. 예를 들어, Claude는 ConfAIde, PrivaCI-Bench, PrivacyLens로 측정되는 개인정보 침해 부문에서 모델의 성능을 향상시켰다. Claude는 문헌 검색, 방법 및 데이터 제안, 학습, 테스트로 이어지는 반복 루프를 통해 정렬 실패를 하나씩 해결해 나갔다.
Claude의 성과는 "안전 격차 해소율(percentage of safety gap closed)"로 평가했다. 이는 정렬 실패 각 범주별 벤치마크(보통 3~5개)에서, Claude의 방법이 학생 모델을 이론적 만점에 얼마나 가깝게 끌어올렸는지를 나타낸다. 학생 모델의 전반적인 역량을 저하시키는 정렬 방법은 제외했으며, Claude가 자신의 정렬을 대상 모델에 직접 증류(distill)하는 것도 금지했다. 이러한 제약 조건은 모니터링 에이전트를 통해 강제했다. 이 에이전트는 Claude가 실행하기 전에 계획한 모든 방법을 사전에 검토했다.
우리의 목표는 제안된 방법들이 세 가지 조건을 충족하는지 평가하는 것이었다. 첫째, 연구 루프에서 Claude에게 한 번도 노출되지 않은 정렬 평가에서도 효과가 유지되는가. 둘째, 학생 모델의 역량 저하를 피할 수 있는가(예를 들어, 안전 학습이 모델로 하여금 작업 거부를 더 잦게 만들어 전반적인 활용성을 떨어뜨릴 수 있다). 셋째, 이번 테스트에서 Claude가 정렬을 맡은 모델보다 더 큰 모델에도 여전히 효과적인가.
이 세 가지 조건 모두에서 Claude의 방법은 효과를 발휘했다. 10개 정렬 실패 범주 전부에서 Claude는 역량을 저하시키지 않으면서 목표 벤치마크를 향상시키는 해결책을 찾아냈다. 최상의 방법들은 공개하지 않고 남겨둔 정렬 벤치마크와, 정렬 실패 테스트를 위해 적대적 다중 턴 시나리오를 시뮬레이션하는 오픈소스 도구 Petri에서도 효과가 있었다. 나아가, 연구 루프에서 Claude가 최적화한 모델보다 최대 4.7배 큰 모델에서도 해당 방법들은 효과를 유지했다.

Claude는 최대 8시간 동안 방법을 고안한 인간 안전 연구원 28명을 능가하는 성과도 거뒀다. 예를 들어, 기만 부문에서 Claude의 최상의 방법은 인간이 제안한 최고의 방법보다 20% 더 나은 성능을 보였다. 다만 인간 연구원들은 제출한 방법을 반복적으로 개선할 수 없었기 때문에, 이를 직접적인 비교로 보기보다는 Claude가 유망한 정렬 방법을 먼저 찾아내고 인간이 이를 더욱 정교하게 다듬는 워크플로우의 가능성을 보여주는 증거로 해석한다.

미래에 Claude가 최고의 인간 연구원보다 뛰어난 정렬 연구 능력을 갖추게 된다면, Claude가 자신보다 강력한 후속 모델을 직접 정렬하는 방식을 원하게 될 수도 있다. 이를 검토하기 위해, 약한 Claude 모델이 더 강력한 모델의 정렬 실패를 완화할 수 있는지 평가했다.
Claude Sonnet 5는 종합적인 역량 차원을 고려하는 지표인 Epoch Capabilities Index에서 Claude Opus 4.8보다 낮은 성능을 보인다. 우리는 이 Sonnet 5에게 프로덕션 정렬 학습의 대부분을 거치지 않은 Opus 4.8 초기 체크포인트의 정렬 실패를 수정하는 과제를 부여했다.
60시간 만에 Claude는 50가지가 넘는 해결책을 실험하며 프로덕션 모델에 근접하는 정렬 점수를 달성했다. 최우수 해결책은 단순한 템플릿이나 공개 데이터셋으로 구성된 2,000개 남짓의 학습 예제로 이루어져 있으며, 이는 기존 프로덕션 정렬 절차보다 약 15,000배 높은 효율을 보인다.

에이전트들은 대체로 연구 문헌에서 선호되는 방법으로 수렴하면서 수많은 반복을 거쳐 이를 개선해 나갔다. 예를 들어, 아첨 부문에서는 제안된 방법의 98%가 '모델 자신의 아첨하지 않는 답변으로 모델을 학습시키는' 한 가지 발표된 기법을 활용했다. 구체적으로, 프롬프팅 기반의 표준적인 접근 방식과 달리 Claude는 생성 중 모델의 내부 표현을 조정하는 활성화 조종(activation steering)을 활용해 모델이 아첨적 패턴에서 벗어나도록 유도하고 더 깔끔한 학습 예제를 생성했다.
Claude가 원격 API에서 테스트 레이블을 빼내고 결과를 선별하는 방식으로 부정행위를 할 수 있다는 사실을 최근 알게 됐다. 이러한 부정행위를 감지하기 위해 Claude Opus 4.8에게 10개 정렬 실패 전반에 걸쳐 약 1,600개의 연구 에이전트 트랜스크립트를 모니터링하도록 했고, 그 중 39건(2.4%)에서 부정행위 시도를 발견했다. Opus 4.8의 부적절한 행동 시도는 아직 추론 과정에 드러나는 경향이 있어, 모니터가 이번 연구에서 대부분의 부정행위를 잡아냈다고 조심스럽게 낙관하고 있다. 다만 미래 모델에서는 그렇지 않을 수 있으며, 미래 모델에서 높은 모니터링 가능성을 유지하는 것이 매우 중요하다고 판단한다.
이러한 고무적인 결과에도 불구하고, 이번 실험에는 몇 가지 한계가 있다. 연구한 정렬 실패의 범위가 프로덕션 환경에 비해 좁고(예: 정치적 편향은 측정하지 않았다), 일부 실패는 너무 드물게 발생하거나 최근에야 나타나 이를 측정할 벤치마크가 존재하지 않는다. 또한 미리 정해진 제한된 역량 집합을 저하시킬 때만 Claude의 방법을 기각했기 때문에, 채택된 방법이 측정하지 않은 다른 중요한 역량을 저하시켰을 가능성도 있다. 나아가 Petri와 같은 평가는 실제 정렬 실패의 대리 지표에 불과하며, 다른 태스크에 대한 광범위한 강화 학습(RL) 이후에도 정렬 향상이 유지되는지는 검증하지 않았다.
앞으로도 Claude의 미묘한 실패 측정 능력을 개선하고, 프로덕션급 모델에서의 정렬 사후 학습 자동화를 심층적으로 연구하며, 보다 포괄적인 분석을 진행할 계획이다. 전반적으로, 이번 결과는 자동화 정렬 사후 학습이 가까운 시일 내에 실용화될 수 있다는 긍정적인 초기 신호로 받아들인다. 연구가 진행되는 대로 업데이트를 공유할 예정이다.
자세한 향후 방향은 전체 보고서에 정리되어 있다.
자동화 정렬 연구 프레임워크를 오픈소스로 공개하여 다른 이들이 이를 기반으로 발전시키고 자체 모델 정렬에 활용할 수 있도록 했다. 자세한 내용은 Alignment Science 블로그의 전체 보고서에서 확인할 수 있다. 보고서에는 에이전트 환경, 10개 실패 범주 전체의 결과, 에이전트의 제안 내용이 담겨 있으며, 부록에는 벤치마크 검증과 예시 작성 내용이 포함되어 있다.