AI 에이전트는 프롬프트 평가 및 수정에 젬병인데, 다들 어떻게 해결하시나요?
AI agents are notoriously bad at evaluating and patching bad prompts. How do you approach this?
핵심 요약
AI 에이전트가 프롬프트 최적화에 어려움을 겪는 문제에 대해, 커뮤니티는 직접적인 수정 요청보다는 평가 환경 구축과 실험적 접근을 권장합니다.
- 평가 환경 구축 — 5~20개의 고정된 사례를 통해 에이전트가 변경 사항을 점수화하도록 유도함
- 진단과 변형 분리 — 로그에서 실패 사례를 분류하고 가장 작은 단위의 프롬프트 변경을 시도함
- 실험적 접근 — 프롬프트를 한 번에 하나씩 수정하고 동일한 사례로 테스트하여 개선 여부를 확인함
- 맥락 제공 — 프롬프트 자체보다는 실패한 출력물과 기대하는 출력물을 에이전트에게 보여주어 학습시킴
저는 Claude Code를 통해 제 PC에서 로컬로 실행할 수 있는 엄청나게 좋은 모델을 가지고 있습니다. 적절한 하네스와 가이드만 있다면 최첨단 모델들과 경쟁할 수 있다고 믿습니다.
이 모델은 놀라울 정도로 잘 작동하지만, 프롬프트 엔지니어링에 관해서는 항상 힘을 못 씁니다. 어떤 이유에서인지 타겟 모델의 특성을 이해하지 못하는 것 같거나, 아니면 모델을 멈추게 만드는 이상하고 구식인 프롬프트 및 AI 모델 파라미터 설정에 갇혀 있는 것 같습니다.
ChatGPT나 Claude 같은 온라인 모델들로 시도해 봐도 제대로 해내지 못하는 것 같습니다. 의도한 동작과 기대하는 출력 사이의 기묘한 단절이 있는데, 모델들이 어떤 이유에서인지 그걸 파악하지 못하는 것 같아요.
심지어 이 문제에 대해 웹 검색을 수행하라고 시켜도 결과는 꽤 혼재되어 있습니다. 온라인에 공유된 프롬프트 엔지니어링 팁들이 매우, 매우 뒤섞여 있기 때문이죠.

