Gemini(특히 3.5) 특유의 환각 스타일이 너무 싫다
Gemini (especially 3.5) has a specific style of hallucination that I hate
핵심 요약
Gemini 3.5 Flash가 대중문화적 오류를 사실처럼 말하고, 질문의 핵심을 무시하는 게으른 답변을 내놓는 것에 대한 불만.
- 환각 문제 — 대중문화적 오개념을 사실인 양 반복해서 답변함
- 게으른 답변 — 질문의 핵심을 무시하고 일반적이고 쉬운 답변만 내놓음
- 모델 비교 — GPT-5.5 Thinking에 비해 Gemini의 답변이 훨씬 불성실함
- 프롬프트 한계 — 사용자가 아무리 강조해도 모델의 근본적인 태도가 바뀌지 않음
ChatGPT 초기 시절, RLHF에 관한 OpenAI 블로그 게시물 같은 것을 읽었던 기억이 납니다. LLM에게 유령이 실재하느냐고 물으면 자연스럽게 '예'라고 답하고 싶어 할 수 있다는 내용이었죠. 그래서 모델이 단순히 대중문화적 오개념을 여러 번 봤다는 이유로 반복하는 대신, 정확하고 진실한 답변을 하도록 사후 학습을 신중하게 해야 한다는 것이었습니다.
Gemini 3.5 Flash는 이걸 매번 합니다. 항상요.
그리고 아주 명백하게 틀린 대중문화적 오개념으로 끌리는 강력한 인력(attractor)이 있을 뿐만 아니라, 질문의 절반을 무시하고 가장 기본적이고 일반적이며 쉬운 답변을 내놓으려는 강력한 인력도 있습니다. 예를 들어, 근처 매장 중 잔디깎이를 재고로 가지고 있어 직접 가서 구매할 수 있는 곳이 어디냐고 물어보면, 같은 프롬프트에서 5번을 반복하고 대문자로 강조해도, 여전히 구글에 접속해서 잔디깎이를 검색했을 때 나오는 온라인 판매 체인점 목록만 반환합니다.
이건 기술의 한계라고 생각할 수도 있습니다. 어느 정도는 모든 무료 티어 모델이 이런 문제를 겪으니까요. 하지만 GPT-5.5 Thinking은 그렇지 않습니다. 훨씬 더 성실하죠. 가끔 게으를 때가 있긴 하지만, 저는 그 모델을 설명할 때 '성실하다'는 단어를 쓸 겁니다. Gemini 모델을 설명할 때 그 단어를 쓸 일은 백만 년이 지나도 없을 겁니다.

