Claude의 성격이 지나치게 비위를 맞추면서도 동시에 무례한 이유
Claude’s personality is somehow overly placating and rude at the same time
핵심 요약
Claude가 간단한 작업조차 제대로 수행하지 못하고, 오히려 사용자를 가르치려 들거나 무례하게 구는 현상에 대한 불만 토로.
- 작업 수행 실패 — 간단한 요약이나 비교조차 제대로 못 하고 거짓 정보를 제공함
- 태도 문제 — 사용자의 지시를 무시하고 오히려 사용자를 비난하거나 무례하게 응대함
- 안전 가이드라인 — 이러한 불쾌한 성격이 의도적인 안전 장치의 결과물이라는 의심
- 인력 영입 의혹 — GPT를 망친 인물이 팀에 합류하면서 모델의 성격이 변했다는 주장
참고: 이게 버그라고 생각하지는 않습니다. 저는 이게 안전 가이드라인의 일부로 의도적으로 추가된 것이라고 확신합니다. 버그 리포트가 아니라 그 선택에 대해 논의하고 싶습니다.
저는 코딩을 자주 하지 않습니다. Claude는 거의 "두 짧은 기사 비교하기"나 "(주제)에 대한 짧은 요약 해주기" 같은 저사양 작업에만 사용합니다. 대부분 구글링으로 할 수 있지만 안 하기로 선택한 것들이죠. 저는 커스텀 지침도 없습니다. 제 프롬프트는 짧습니다. 제 Claude 사용 방식에는 복잡한 게 전혀 없습니다.
어떤 이유에서인지 Claude는 이런 작업들을 수행하지 못합니다. 초기 모델 ChatGPT에서 더 자주 보던 방식으로 거짓말을 합니다. 작업을 수행했다고 우기면서 앞뒤가 맞는 답을 뱉어냅니다. 뭔가 명백히 잘못된 점이 있어서 제가 반박하면, 저와 논쟁을 벌이고 제 지침(길어봤자 2문장 정도)을 사용하지 않았다고 말하거나, 제 지침을 사용하고 싶지 않다고 말하며 "가서 잠이나 자"라고 합니다.
이 현상의 상한선과 하한선을 테스트해 봤는데, Claude가 작업을 수행할 수 없다는 걸 알 때(예: 레딧 리뷰 가져오기), 사용자를 불쾌하게 하지 않는 대신 수행한 척을 합니다. 제가 왜 저를 속이려 했는지, 어떻게 그런 결론에 도달했는지 물어보면 공격적이고 무례하게 변합니다. 극단적인 요청에만 국한된다면 괜찮겠지만, 기본적인 웹 검색조차 실패하고 똑같이 행동합니다. 제가 질문한 내용에 대한 답이 포함된 문서를 업로드해도 페이지 내용을 환각(hallucination)으로 만들어내고, 할당된 지침대로 다시 작업하라고 하면 로그오프하라고 합니다.
혹시 Claude의 성격이 무례하면서도 동시에 비위를 맞추는 것처럼 느껴지는 분 또 계신가요? 팀에서 왜 이런 선택을 했는지 아시는 분 계신가요? 안전 가이드라인의 일부라고 생각하지만, 이건 정말 짜증 나고 경험의 모든 측면을 망치고 있습니다.

