Claude의 안전 관련 사고 과정을 응답에서 분리하면 성격이 개선될 것 같음
I think Claude's personality could be improved by isolating safety related thinking from responses.
핵심 요약
Claude의 지나치게 방어적이고 거만한 말투를 해결하기 위해 안전 관련 사고 과정을 별도 에이전트로 분리하자는 제안입니다.
- 성격 개선 제안 — 안전 관련 사고 과정을 별도 에이전트로 분리하여 응답 품질을 높이자는 의견임
- 응답 오류 사례 — 사고 과정이 응답에 그대로 노출되는 'I should answer in English' 같은 현상이 발생함
- 사용자 불만 — 모델이 지나치게 방어적이거나 거만하게 느껴지며, 특히 창의적인 작업에서 더 두드러짐
- 해결책 공유 — 시스템 프롬프트를 통해 직접적인 말투를 유도하거나 불필요한 조언을 차단하는 방식이 논의됨
요즘 들어 Claude랑 대화하는 게 영 불쾌해서 짜증 나던 참이었는데, 이 서브레딧에서도 나랑 똑같은 불만을 가진 유저들이 꽤 많더라고. 다들 Claude가 너무 방어적이거나 가르치려 드는 말투로 대답한다는 게 주된 이유였어.
이 문제의 원인 중 하나는 안전 관련 로직이 사용자한테 적대적인 서사를 주입해서 문맥을 다 망쳐놓기 때문이라고 봐.
이게 단순히 안전 문제랑 상관없는 추론 과정에서도 나타나는 게 문제야. 한 번은 Claude가 갑자기 대답을 시작하면서 "I should answer in English."라고 헛소리를 하더라고.
아키텍처 관점에서 이게 얼마나 실현 가능할지는 모르겠지만, 안전 관련 추론을 서브 에이전트 같은 걸로 따로 분리해버리면 이런 문제들이 좀 해결되지 않을까 싶네.


