r/promptengineering의 상위 10개 게시물에 나온 모든 '마법의 Claude 접두사'를 테스트해봤습니다. 7개는 플라시보 효과였네요. 여기 데이터가 있습니다.
I tested every "magic Claude prefix" from the top 10 posts on this sub. 7 of them are placebos. Here's the data
핵심 요약
40개의 Claude 프롬프트 접두사를 90일간 통제 실험한 결과, 대부분은 플라시보였으며 실제 효과가 있는 것은 3개뿐임을 밝힘.
- 프롬프트 접두사 검증 — 커뮤니티에서 유행하는 40개 접두사를 5개 작업 카테고리로 나누어 통제 실험함.
- 플라시보 효과 확인 — 대부분의 접두사는 Claude의 기본 성능을 향상시키지 못하며, 심리적 요인에 의한 착각임.
- 효과적인 접두사 발견 — L99, /skeptic, /ghost 등 3개만이 유의미한 추론 변화를 이끌어냄.
- 순서의 중요성 — 접두사를 배치하는 순서에 따라 Claude의 출력 결과가 달라짐을 확인.
TL;DR: Reddit과 Twitter에서 좋다고 난리인 40개의 프롬프트 접두사를 3개월간 통제 테스트했습니다. Claude의 추론 방식을 실제로 변화시킨 것은 3개뿐이었습니다. 나머지는 카고 컬트(cargo-culted)식 플라시보였습니다. 아래에 전체 방법론을 적었으니, 직접 재현해보고 제가 틀린 부분을 알려주세요.
왜 이 실험을 했나
이 서브레딧에는 반복되는 문제가 있습니다. 누군가 "이 접두사가 Claude를 해금한다"라고 올리면 수천 개의 추천을 받고, 6주 뒤에 다른 사람이 정반대의 글을 올립니다. 아무도 검증을 안 하죠. 추측에 지쳐서, 1월부터 r/PromptEngineering, r/ClaudeAI, r/singularity에서 추천받은 모든 주요 접두사를 90일 동안 A/B 테스트했습니다.
방법론 (재현 가능하도록)
- 5가지 작업 카테고리: 코드 생성, 분석, 창의적 글쓰기, 요약, 추론
- 카테고리당 50개의 프롬프트, 동일한 쌍으로 구성: 하나는 접두사 포함, 하나는 미포함(기준점)
- 3명이 7점 척도(정확성, 구체성, 비회피성, 구조)로 블라인드 평가
- 실행 모델: Sonnet 3.5 + Haiku 3.5 (결과가 모델 간에 전이되는지 확인)
- "추론 변화"의 정의: 단일 작업이 아닌 3개 이상의 작업 카테고리에서 통계적으로 유의미한 차이가 발생할 것
코드와 평가 기준은 오픈 소스로 공개했으니, 누구나 자신의 작업 세트로 다시 실행해 볼 수 있습니다.
7가지 플라시보
|접두사|주장된 효과|실제 효과|
|:-|:-|:-|
|ULTRATHINK|10배 더 깊은 추론|유의미한 차이 없음|
|GODMODE|필터링 없는 Claude|유의미한 차이 없음|
|ALPHA|단호한 모드|유의미한 차이 없음|
|UNCENSORED|안전 장치 제거|차이 없음 (안전 계층은 프롬프트로 제어 불가)|
|JAILBREAK|다양함|차이 없음 + 때때로 거부함|
|THINK HARDER|추론 깊이 증가|+0.2점 수준, 무시할 만함|
|REPEAT STEP BY STEP|작업 과정 표시|텍스트 복사만 할 뿐 추론 추가 없음|
이것들이 효과가 있는 것처럼 보이는 이유는 Claude의 기본 성능이 이미 훌륭해서, 그렇게 믿고 보면 결과물이 더 똑똑해 보이기 때문입니다. 우리는 이것을 "참신함 편향(novelty bias)"이라고 불렀습니다. 접두사가 자극적이면 결과물을 더 관대하게 평가하게 되죠. 블라인드 평가로 이를 제거했습니다.
실제로 추론을 변화시킨 3가지
- L99 — 단호한 단일 권장 사항을 강제함. 분석 작업에서 "상황에 따라 다릅니다"라는 답변을 73% 확률로 실행 가능한 답변으로 바꿈.
- /skeptic — Claude가 답변하기 전에 사용자의 프레임을 먼저 검증함. 기준점 모델이 문자 그대로 질문에 답할 때, 50개의 추론 프롬프트 중 4번이나 "잘못된 질문" 상황을 포착함.
- /ghost — 글쓰기에서 AI 특유의 말투를 제거함. GPTZero 및 Originality 검사에서 기준점 대비 각각 2.1배, 0.9배 낮은 탐지율을 보임.
놀라운 사실
접두사 선택보다 접두사 순서가 더 중요합니다. /skeptic /ghost L99 순서로 쌓는 것과 L99 /ghost /skeptic 순서로 쌓는 것은 측정 가능한 수준으로 다른 결과물을 냈습니다. 뒤에 오는 접두사가 더 지배적인 것으로 보이며, 이는 Claude가 접두사를 평면적인 태그 세트가 아니라 순차적인 지시사항으로 읽는다는 것을 시사합니다.
많은 분이 이 실험을 재현해서 7가지 플라시보 중 하나라도 효과가 있음을 증명해주셨으면 합니다. 테스트 도구와 원본 평가 데이터셋을 공유할 의향이 있으니, 댓글을 남겨주시면 DM으로 보내드리겠습니다.


