환각(hallucination)에 대한 정의가 제각각이라 AI PoC가 엉망이 되었습니다
Nobody agrees on what "hallucination" means and it's hit our AI PoC
핵심 요약
AI PoC 과정에서 '환각'에 대한 정의가 이해관계자마다 달라 발생한 혼란과, 이를 해결하기 위한 공통된 평가 기준 수립의 중요성을 다룹니다.
- 환각 정의의 모호성 — 이해관계자마다 환각을 다르게 정의하여 PoC 평가 과정에서 불필요한 혼란이 발생함.
- 평가 기준의 정렬 — UAT 시작 전 평가 지표에 대한 명확한 합의가 없으면 정확도 점수는 무의미해짐.
- 오류 유형의 세분화 — 환각을 단순히 뭉뚱그리지 말고 데이터 조작, 문맥 이탈, 논리 오류 등으로 구분해야 함.
- 규제 도메인의 평가 — 의료 등 규제가 엄격한 분야일수록 공통된 운영 정의를 수립하는 것이 필수적임.
CMO와 팀을 대상으로 120개 질문에 대한 UAT를 마쳤습니다. 여기서부터 웃긴 상황이 벌어집니다. 팀원 중 한 명에 따르면 우리는 99%의 정확도와 답변 완성도를 기록했습니다. 그런데 CMO는 답변 다수를 환각으로 표시했습니다.
우리는 표시된 모든 답변을 뽑아 소스 문서까지 추적했습니다. 참고로 우리는 에이전트 접지(grounding)에 신경 기호적(neuro-symbolic) 접근 방식을 사용합니다.
조작은 0건이었고 모든 답변은 우리가 수집한 실제 임상 지침에 근거했습니다. 실제로 표시된 내용은 다음과 같습니다:
-
답변에 "physician"이 사용되었는데 조직은 "provider"라고 함. 그리고 검토자가 업로드된 줄 몰랐던 문서에서 소스를 가져옴.
-
CMO의 환각 정의: AI가 소스에 없는 내용을 지어냄. 우리의 정의: AI가 지식 베이스 대신 오픈 인터넷을 참조함. 이 둘이 같지 않다는 것을 어렵게 깨달았습니다.
-
그리고 세 번째 정의가 따로 나왔습니다: 유효한 소스 문서를 사용했지만 잘못된 답변을 제공함. 이건 앞의 두 정의 중 어디에도 해당하지 않습니다.
결국 CMO와 함께 각 답변의 출처를 확인하며 "환각" 문제를 해결했습니다. 하지만 이 과정을 통해 우리가 당연하게 여겼던 사실을 깨달았습니다. UAT 시작 전 무엇을 측정할지 정렬하지 않으면 정확도 점수는 아무 의미가 없습니다.
훨씬 일찍 잡혔어야 할 문제들에 대해 통과/실패 판정이 엇갈리게 됩니다.
이건 의료 분야에만 국한되지 않습니다. 규제 도메인을 위한 평가 파이프라인을 구축하는 사람이라면 누구나 겪게 될 일입니다. 용어는 인터넷의 무작위 기사가 아니라 공유된 정의에서 나와야 합니다.

