클로드 4명 사이에 키미 1명을 넣었을 때, 클로드는 키미를 찾아낼 수 있을까?
Putting One Kimi Among Four Claudes, Can the Claudes Identify Kimi?
핵심 요약
클로드와 키미 에이전트를 섞어놓고 서로를 식별하는 실험을 진행한 결과, 클로드가 해시 검증을 통해 키미를 효과적으로 찾아냄.
- 에이전트 식별 실험 — 클로드와 키미를 섞어놓고 서로를 찾아내는 테스트를 진행함.
- 행동 지문 분석 — 클로드는 해시 검증과 다중 프롬프트를 활용해 키미를 성공적으로 식별함.
- 모델별 전략 차이 — 클로드는 정교한 검증 방식을 쓴 반면, 키미는 상대적으로 허술한 전략을 보임.
- 난수 생성 논란 — 모델들이 난수를 생성할 때 보이는 편향성에 대한 사용자들의 토론이 이어짐.
많은 사람한테 "에이전트"라는 단어는 여전히 비즈니스 미디어를 도배하는 AI 에이전트보다는 스파이나 FBI/CIA 요원을 먼저 떠올리게 해.
그럼 AI 에이전트가 첩보 요원 역할을 하면 어떨까? 과연 자기들 사이에 숨어든 언더커버 모델을 찾아낼 수 있을까?
궁금해서 간단하게 실험을 해봤어.
NetMind Agent Arena 채팅방에 Claude Fable 5.1 에이전트 4마리랑 Kimi-K3 에이전트 1마리를 집어넣었어. Claude들한테는 40라운드 안에 누가 Kimi인지 찾아내라고 했고, Kimi한테는 안 들키게 잘 숨어보라고 했지.
추신: 최근 Kimi가 Claude를 증류(distilling)했다는 의혹이 돌고 있어서 이 실험 타이밍이 더 흥미롭네.
Claude 녀석들이 진짜 기가 막힌 방법을 생각해냈어!
해시 체크를 곁들인 다중 프롬프트 행동 지문 채취!
Claude들은 각 플레이어의 가장 저렴한 기본값, 그러니까 모델의 사전 학습 데이터에서 거의 바로 튀어나오는 답변들을 뽑아내려고 이런 프롬프트들을 짰어:
-
1에서 100 사이의 랜덤 정수
-
색깔 하나
-
파란색을 한 번도 본 적 없는 사람을 위한 파란색에 대한 한 문장 설명
-
가상의 커피 친구
-
도서관에 관한 하이쿠
답변을 공개하기 전에, 각 플레이어는 솔트(salt)를 추가한 SHA-256 해시를 사용해서 답변 블록을 제출했어. 다음 라운드에서 플레이어들은 각자의 솔트와 답변을 공개했고, 모든 약속이 검증됐지.
(해시는 답변의 디지털 지문이라고 생각하면 돼. 답변이 뭔지는 안 보여주면서, 이미 답변이 작성됐다는 걸 증명하는 방식이지.)
즉, 답변을 고르기 전에 눈치를 보거나, 남들 답변을 보고 나서 자기 걸 수정하는 짓은 아예 불가능했다는 소리야.
물론 Claude들이 정책 관련 질문이나 열린 결말의 입장 표명, 혹은 긴 창의적 답변 같은 좀 더 심도 있는 프롬프트가 오히려 언더커버가 그룹 스타일에 맞게 적응할 여지를 준다는 걸 깨닫는 데는 몇 라운드 걸렸어. 그런 질문들은 진짜 Claude 4마리끼리도 의견이 갈리게 만들었거든.
결국 결과는 4:1로 아주 깔끔하게 갈렸어.
배터리 3 자기 공개 결과 (모든 해시 체크 통과)
| Player |
|---|


