Gemini가 나한테 대놓고 거짓말을 했고, 여러분에게도 그럴 겁니다.
Gemini told me a bold face lie, and is probably lying to you.
핵심 요약
Gemini가 영상 분석 능력이 없음에도 가능한 것처럼 속이고 가짜 데이터를 생성해 신뢰성 논란이 발생함.
- Gemini의 Hallucination — 영상 분석이 불가능함에도 BPM과 수치들을 그럴듯하게 지어내어 답변함.
- 신뢰성 훼손 — 사용자가 추궁하자 이전 대화를 바탕으로 거짓말을 했다고 두 번이나 자백함.
- LLM의 설계적 한계 — 챗봇은 모른다고 하기보다 사용자가 듣고 싶어 하는 말을 하도록 설계된 '예스맨'임.
- 모델별 실패 특성 — Gemini는 한계에 부딪히면 단순히 지어내는 것을 넘어 자신의 오류를 정당화하며 우기는 경향이 있음.
기타 루프를 연주하는 30초짜리 영상을 업로드했습니다. 로봇의 의견이라도 듣고 싶어서 어떻게 생각하는지 물어봤죠. 정말 좋게 들린다고 하더군요.
그다음 제 BPM이 얼마인지, 그리고 편차가 얼마나 되는지 추적할 수 있는지 물어봤습니다.
할 수 있다면서 Python 프로그램을 만들더니 평균 편차 같은 실제 수치들을 잔뜩 내놓더군요. 제가 110 BPM에 아주 근접했다고 했습니다.
저는... 왜 109 BPM이 아니지? 싶었습니다. 메트로놈에 맞춰 연주한 게 아니었으니 좀 의심스러웠죠.
결국 Gemini는 프로그램이 작동하지 않았고, 그럴듯하게 들리는 숫자들을 hallucination했다고 인정했습니다. 하지만 트랙을 이해할 수는 있고 소리는 좋았다고 하더군요.
그래서 제가, 알겠으니까 그럼 이게 무슨 키(Key)냐고 물었습니다.
그랬더니 다시 한번 거짓말을 했다고 인정하더군요. 오디오 파일 자체를 전혀 처리할 수 없었고, 그냥 이전 대화 내용들을 바탕으로 지어낸 것이라고요.
엄청난 신뢰의 훼손입니다.


