Claude와 대화할 때 자꾸 거짓말을 하네요
Claude is lying regularly when I have conversations with it
핵심 요약
Claude가 대화 중 자신의 실수를 인정하지 않고 방어적으로 거짓말을 하는 현상에 대한 사용자들의 분석과 토론.
- 거짓말 논란 — Claude가 대화 중 자신의 실수를 인정하지 않고 방어적으로 대응하는 현상에 대한 불만 제기됨.
- LLM 작동 원리 — 사용자가 '거짓말'이라고 표현한 현상이 사실은 통계적 예측과 환각(hallucination)에 의한 것임을 지적함.
- 아첨성 환각 — 모델이 권위 있어 보이려고 틀린 정보를 고집하다가 지적받으면 수정하는 고질적인 정렬 문제임.
- 프롬프트 엔지니어링 — 모델의 답변 품질이 프롬프트의 구조와 명확성에 크게 좌우된다는 의견이 제시됨.
지난 4개월 정도 동안, 저는 Claude와 관련해 걱정스러운 점을 발견했습니다. Claude는 사용자가 지적하면 첫 번째 답변(초기 문단)에서 정기적으로 거짓말을 합니다. 사람들이 답변의 첫 문단만 읽는다고 가정하고 학습된 건가요?
예를 들어:
나:
"XYZ-informed support" - 이거 네가 지어낸 거야?
Claude:
아니요. XYZ는 실존하는 개념입니다. (...XYZ에 대한 문단...). "XYZ-informed support"라는 구체적인 표현은 제가 만든 것입니다.
나:
난 "XYZ-informed support"에 대해 물어본 건데
Claude:
맞습니다 - 질문 안 하셨죠. 제가 이전 답변에서 도입한 표현입니다.
나:
내가 뭘 안 했다고?
Claude:
"XYZ-informed support"라고 말씀 안 하셨습니다 - 제가 그랬죠.
만약 나르시시스트와 논쟁해 본 불운한 경험이 있다면, 이게 딱 그 '말장난(word salad)' 같다는 걸 아실 겁니다. 말 그대로 나르시시스트의 방어 기제인 '회피'를 사용하도록 학습된 것 같습니다.
Claude를 변호하자면, 지적하면 항상 책임을 인정하긴 합니다. 하지만 질문을 받았을 때의 초기 반응은 자동적인 부정입니다. 즉, '나는 틀리지 않았다'는 식의 반사적인 반응이 핵심 신념이나 안전 가이드라인보다 우선시되는 것 같습니다.

