LLM 사회 시뮬레이션의 나비 효과: CLAUDE.md와 시스템 프롬프트 작성에 주는 시사점
The butterfly effect in LLM social simulations. Relevant to how we write CLAUDE.md and system prompts.
핵심 요약
프롬프트의 내용이 같아도 서식(산문 vs 불렛포인트)에 따라 LLM의 행동이 극단적으로 달라질 수 있다는 연구 결과.
- 프롬프트 서식 — 산문과 불렛포인트라는 사소한 차이가 LLM의 행동 양식을 완전히 뒤바꿈.
- 행동 지표로서의 서식 — 서식은 단순한 스타일이 아니라 모델의 행동을 결정하는 하이퍼파라미터로 작용함.
- CLAUDE.md의 중요성 — 시스템 프롬프트의 구조적 선택이 모델의 의도와 결과물에 큰 영향을 미침.
- 실무적 시사점 — 프롬프트 엔지니어링 시 서식의 변화가 모델 성능에 미치는 영향을 고려해야 함.
두 개의 페르소나 프롬프트, 동일한 내용, 같은 모델(gpt-5.2). 유일한 차이는 서식뿐임: 하나는 산문, 하나는 불렛포인트. 10라운드 죄수의 딜레마에서 산문 버전은 약 96% 협력한 반면, 불렛 버전은 약 20%만 협력함. 76%p의 격차, p < 0.001. 같은 의미, 정반대의 행동. 저자들은 이를 LLM 시뮬레이션의 나비 효과라고 부름.
여기서 중요한 부분: CLAUDE.md, 시스템 프롬프트, 그리고 메모리는 대부분 선언적인 자기 설명임. 서식만으로 행동이 이렇게 크게 바뀐다면, 같은 의도를 가진 두 사람이라도 어떻게 작성했느냐에 따라 서로 다른 Claude를 얻게 됨.
실제로 이런 경험 해본 사람 있음? 같은 맥락인데 서식만 산문 vs 불렛으로 바꿨을 때 Claude가 의미 있게 달라진 경우 말이야.

