AI 기능이 다른 건 다 잘하면서 왜 꼭 하나씩 엉뚱한 선택을 할까요? 어떻게 고치죠?
How do I stop an AI feature from making one obviously wrong choice after getting everything else right?
핵심 요약
AI가 대부분의 추천은 정확히 수행하지만, 가끔씩 어이없는 실수를 반복하는 문제를 해결하기 위한 워크플로우 개선 방안을 질문함.
- 일관성 문제 — AI가 대부분의 추천은 잘 수행하지만 가끔씩 명백한 오류를 범함.
- 프롬프트 반복 — 프롬프트 개선을 시도했으나 여전히 결과가 불안정하고 비용이 낭비됨.
- 워크플로우 설계 — 증상만 고치는 방식에서 벗어나 더 견고한 시스템 구조를 구축하고 싶어 함.
- 실무적 조언 — 이미지 분석이나 레퍼런스 매칭 기능을 개발해 본 경험자의 노하우를 구함.
저는 Replit에서 꽤 복잡한 AI 기반 웹 앱을 만들고 있는데, 경험 많은 바이브 코더분들께 조언을 구하고 싶은 문제가 생겼습니다.
이 앱은 사용자가 업로드한 얼굴 이미지를 분석한 뒤, 스크린샷으로 구성된 방대한 레퍼런스 라이브러리와 비교하여 추천 선택지 전체를 반환합니다. 레퍼런스 라이브러리는 잘 정리되어 있고 이미 스토리지/데이터베이스에 임포트된 상태입니다. 사용자에게 보여주는 출력값도 고정된 구조를 가지고 있어, 모든 필수 필드는 항상 채워져야 합니다.
문제는 일관성입니다.
프롬프트를 수없이 반복한 끝에, 앱은 종종 대부분의 추천을 올바르게 수행하지만, 여전히 쉽게 피할 수 있었을 명백히 잘못된 선택을 한두 개씩 합니다. 예를 들면 다음과 같습니다:
- 절대 비워두지 말라고 지시했음에도 필수 필드를 비워둠
- 원본 이미지와 다른 색상인데도 눈에 띄게 잘못된 색상 카테고리를 선택함
- 업로드된 이미지에서 명백히 보이는 특징을 놓침
- 레퍼런스 라이브러리에 훨씬 더 나은 매칭 결과가 있음에도 '비슷한' 레퍼런스를 선택함
이미 AI 에이전트에게 계속해서 이 문제들을 지적하며 프롬프트를 수정해 봤습니다. 상황은 나아졌지만, 여전히 충분히 신뢰할 수 있는 수준은 아닙니다. 때로는 같은 입력값으로 훌륭한 결과를 내다가도, 다음 실행에서는 명백한 실수를 저지릅니다. 그래서 가끔은 크레딧만 낭비하며 제자리걸음을 하고 있고, 결과적으로 돈을 낭비하는 셈입니다.
그래서 제 질문은 다음과 같습니다:
이런 AI 추천 시스템을 더 일관성 있게 만들고, '명백히 잘못된 답변 하나'가 전체 결과를 망치지 않게 하려면 프롬프팅이나 워크플로우를 어떻게 구성하시겠습니까?
특히 Replit이나 다른 바이브 코딩 도구에서 이미지 분석이나 레퍼런스 매칭 기능을 만들어 본 분들의 조언이 궁금합니다. 저는 전통적인 개발자가 아니라서, 증상만 고치는 방식이 아니라 더 견고하게 워크플로우를 설계하는 가장 실용적인 방법을 이해하고 싶습니다.
어떤 가이드나 프롬프트 패턴, 아키텍처 제안, 혹은 '당신이 잘못 생각하고 있다'는 피드백이라도 주신다면 정말 감사하겠습니다.


