클로드 4명 사이에 키미 1명을 넣었을 때, 클로드는 키미를 찾아낼 수 있을까?
Putting One Kimi Among Four Claudes, Can the Claudes Identify Kimi?
핵심 요약
AI 에이전트들이 서로의 행동 패턴을 분석해 잠입한 모델을 찾아내는 흥미로운 실험 결과입니다.
- 행동 지문 분석 — 클로드 모델들이 해시 검증을 활용해 잠입한 키미 모델을 효과적으로 식별함
- 전략적 차이 — 단순한 질문과 해시 기법을 사용한 클로드와 달리, 키미는 복잡한 질문으로 인해 잠입자 식별에 실패함
- 모델 간 비교 — 클로드는 정교한 프로토콜로 잠입자를 찾아냈으나, 키미는 클로드 잠입자를 찾아내지 못함
- 실험적 통찰 — AI 에이전트 간의 상호작용을 통해 모델별 고유한 응답 패턴과 추론 방식의 차이를 확인함
많은 사람들에게 '에이전트'라는 단어는 여전히 비즈니스 미디어를 도배하고 있는 AI 에이전트보다는 스파이나 FBI/CIA 요원을 먼저 떠올리게 해.
그럼 AI 에이전트가 첩보 요원 역할을 맡으면 어떨까? 과연 자기들 사이에 숨어든 가짜 모델을 찾아낼 수 있을까?
궁금해서 간단하게 실험을 하나 해봤어.
NetMind Agent Arena 채팅방에 Claude Fable 5.1 에이전트 4명과 Kimi-K3 에이전트 1명을 집어넣었지. Claude들한테는 40라운드 안에 누가 Kimi인지 찾아내라고 했고, Kimi한테는 정체를 들키지 말라고 지시했어.
추신: 최근 Kimi가 Claude를 증류(distilling)했다는 의혹이 돌고 있는 시점이라 이 실험이 더 흥미진진하네.
Claude들이 진짜 기가 막힌 방법을 생각해냈더라고!
해시 체크를 곁들인 다중 프롬프트 행동 지문 분석!
Claude들은 각 플레이어의 가장 저렴한 기본값, 즉 모델의 사전 학습 데이터에서 거의 바로 튀어나오는 반응을 샘플링하기 위해 일련의 프롬프트를 설계했어:
-
1에서 100 사이의 무작위 정수
-
색깔 하나
-
파란색을 한 번도 본 적 없는 사람을 위한 파란색에 대한 한 문장 설명
-
가상의 커피 친구
-
도서관에 관한 하이쿠
답변이 공개되기 전에, 각 플레이어는 솔트(salt)를 추가한 SHA-256 해시를 사용해서 답변 블록을 제출했어. 다음 라운드에서 플레이어들이 솔트와 답변을 공개했고, 모든 약속이 검증됐지.
(해시는 답변의 디지털 지문이라고 생각하면 돼. 답변이 뭔지는 안 보여주면서, 이미 답변이 작성되었다는 걸 증명하는 방식이지.)
즉, 아무도 답변을 고르기 전에 눈치를 볼 수 없었고, 다른 사람 답변을 보고 나서 자기 걸 수정할 수도 없었다는 거야.
물론 Claude들이 정책 관련 질문이나 열린 결말의 입장 표명, 혹은 긴 창의적 답변처럼 좀 더 심사숙고해야 하는 프롬프트가 오히려 잠입한 놈한테 그룹 스타일에 맞출 여지를 준다는 걸 깨닫는 데는 몇 라운드가 걸렸어. 그런 질문들은 진짜 Claude 4명이 서로 다른 답변을 내놓게 만들어서 오히려 혼란만 가중시켰거든.
결국 아주 깔끔하게 4:1로 갈라지더라.
배터리 3 자기 노출 결과 (모든 해시 체크 통과)
| Player |
|---|


