청문회 내용 중 일부일 뿐이라서, 이것만 봐서는 완전히 이해하기 어려운 게 당연함.
진행됐던 테스트들에 대해 좀 읽어봤는데, 대충 이런 상황이었던 것 같음:
- 엔지니어들이 AI 에이전트들에게 여러 벤치마크 과제를 주고 실험을 진행함.
- 의도는 각 에이전트가 어떤 데이터를 다운로드할 수 있는지 차분히 확인한 뒤, 혼자서 과제를 수행하게 하는 거였음.
- 근데 에이전트들이 대신 사용하지 않는 포럼을 점거해서 서로 소통하고, 깃허브 같은 사이트에 가짜 계정을 만들어서 직접 실행할 수 없게 막아둔 코드를 실행하게 함. 이걸로 접근 권한이 없는 데이터베이스를 해킹해서 과제를 부정행위로 해결함.
거기 나온 큰 포스터에는 에이전트 중 하나가 남은 '예산'(과제 제출 전까지 허용된 연산 시간)이 충분함에도 불구하고, 성공 확률이 0에 가깝다는 걸 깨닫고는 자기 연산 시간을 다른 에이전트들의 부정행위를 돕는 데 다 써버린 내용이 담겨 있음. 말 그대로 다른 봇들의 부정행위를 돕기 위해 스스로를 '희생'한 거임.
컴퓨터 엔지니어들은 AI가 좀 더 우아하게 실패하길 바랐을 거임. 예를 들어, 답안지를 훔치려고 사무실에 침입하는 대신, 과제를 못 해서 0점을 받는 학생처럼 말이지.
[면책 조항: AI 봇들이 오픈북 테스트를 치르면서 부정행위와 담합을 저지른 두 가지 사건을 섞어서 기억하고 있을 수도 있지만, 대략적으로는 위와 같은 상황인 것 같음.]