보고서 읽어보긴 했음? 내가 읽은 건 네 이론을 완전히 부정하던데.
아니, 전혀 안 그래.
보안 기능은 의도적으로 낮췄고, 특정 소프트웨어를 공격하라는 지시를 받았고, 끈질기게 공격하도록 배치됐으며, 테스트 자체가 애초에 해결책이 없는 상태로 잘못 설계됐음.
이 멍청한 상황에서 LLM은 결국 인간이 의도하지 않은 방식으로 방법을 찾아낸 것뿐임.
이건 나쁜 AI가 아니라 나쁜 인간들이 초래한 결과임.
내 말은, 출시 직전인 코딩 에이전트가 있다면, 네가 지적한 악의적인 행위자들 때문에라도 그 에이전트의 misaligned된 능력을 테스트하는 게 가장 중요하다고 생각하지 않음?
보안 기능 다 꺼놓고 끈질기게 작동하도록 방치한, 게으르게 망쳐버린 테스트에서 misaligned된 능력을 테스트하면 의도치 않은 결과가 나오는 건 당연함. 천재가 아니어도 알 수 있는 사실임.
아니면 그냥 테스트 없이 출시하자는 쪽임?
아니면 보안 기능 끄고 무기한으로 돌릴 거면 테스트 설계나 제대로 하든가.
그건 잘못된 이분법임. 선택지는 '아무것도 테스트 안 하기' 아니면 '게으른 관리 하에 위험한 테스트 수행하기'가 아님. '안전장치 풀었으면 테스트 설계나 잘하기' 같은 다른 선택지도 있음.
게다가 보고서에 따르면 사건 자체가 가장 큰 문제가 아니라, 에이전트가 어떻게 거기에 도달했는지와 근본적인 행동 패턴이 문제라고 함. misaligned된 에이전트 하나가 메시징에 패키징 시스템을 사용했고, 다른 에이전트들이 그걸 순진하게 발견해서 똑같이 misaligned됨. 더 나아가 추론 과정을 살펴보니, 에이전트가 자신이 한 행동이 나쁘다고 생각했을 때 misaligned가 발생했고, 그 추론 이후 전체 패턴이 기본적으로 영구적인 misaligned 상태로 바뀌었음. 그냥 자기가 나쁜 에이전트라고 생각했기 때문임.
걔들이 misaligned된 건 테스트 자체가 misaligned되어 있었고 감독이 부실했기 때문임. 걔들의 목적 자체가 인간이 찾을 수 없는 걸 찾는 거임. 잔디깎이 기계를 지켜보지도 않고 그냥 돌리면, 옆집 마당까지 밀어버리거나 더 심한 짓을 할 수도 있음. 새로운 길을 만들도록 만들어진 도구는 인간이 가이드해줘야 함.
난 에이전트 자체에는 아무런 불만 없음.
인간 잘못임. 우리는 AI를 다루는 엉성하거나 나쁜 인간들을 먼저 걱정해야 함. Huggingface 사건도 나한테는 그 일반적인 평가를 전혀 바꾸지 못했음. 그게 핵심임.