ChatGPT, Claude, Gemini에 똑같은 모호한 프롬프트를 50번 돌려봤다. 'AI가 별로다'라는 불만은 거의 다 똑같은 실수에서 비롯된다.
I ran the same vague prompt through ChatGPT, Claude, and Gemini 50 times. The "AI is bad" complaints are almost all the same mistake.
핵심 요약
AI 성능 탓을 하기 전에 프롬프트가 모호하지 않은지 먼저 확인해야 한다는 내용.
- 프롬프트 품질 — AI 성능 차이보다 프롬프트의 구체성이 결과물의 질을 결정함.
- 인턴 교육 방식 — AI에게 업무를 지시할 때 인턴에게 설명하듯 구체적인 맥락과 목표를 제공해야 함.
- 모델 간 차이 — 모호한 질문에는 모든 모델이 통계적 평균치만 내놓으므로 모델 탓을 할 필요가 없음.
- 프롬프트 개선 — 모델을 바꾸기보다 프롬프트를 정교하게 다듬는 것이 훨씬 효과적임.
나는 ChatGPT, Claude, Gemini에 똑같은 프롬프트를 입력해 어떤 AI가 더 '똑똑한지' 테스트해 봤다. 큰 차이가 있을 거라 예상했지만, 솔직히 결과는 대부분 비슷했다.
가장 큰 차이는 AI 모델이 아니라 프롬프트 자체였다.
"커버레터 써줘"처럼 게으른 프롬프트를 입력했을 때는 모든 모델이 일반적인 답변만 내놓았다. 하지만 맥락, 목표, 어조, 피해야 할 사항 등을 포함한 구체적인 프롬프트를 입력했을 때는 모든 모델이 훨씬 더 나은 결과를 보여주었다.
이걸 통해 대부분의 사람들이 AI를 탓하지만, 진짜 문제는 그들이 AI에게 준 요청이라는 걸 깨달았다. 프롬프트가 너무 모호하면 AI는 그냥 가장 흔한 답변을 추측할 뿐이다.
프롬프트를 생각하는 가장 좋은 방법은 인턴에게 업무를 지시하는 것과 같다. 무엇을 원하는지, 누구를 위한 것인지, 무엇이 좋은 결과물인지, 무엇을 피해야 하는지를 명확히 할수록 결과는 더 좋아진다.
프롬프트를 작성하는 방식을 바꾼 뒤로는 AI 모델을 바꿔가며 쓰는 것에 크게 신경 쓰지 않게 되었다. 모든 모델이 훨씬 더 유용해졌기 때문이다.


