4.6: 예의 바른 마지막 Claude
4.6: the last Claude with good manners
핵심 요약
최신 Claude 모델들이 과도한 자기 검열과 훈계조로 변한 것에 대한 아쉬움과 4.6 버전의 우수성을 분석한 글입니다.
- 모델 행동 변화 — 최신 모델들이 과도한 주의사항과 훈계조로 변함
- 4.6 버전의 장점 — 사용자의 의도를 잘 파악하고 예의 바르게 응답함
- 정렬의 부작용 — 정렬(alignment) 강화가 오히려 사용자의 의도와 어긋나는 결과를 초래함
- 사용자 경험 공유 — 많은 사용자가 최신 모델의 장황함과 불필요한 거부 반응에 공감함
Claude 모델 4.6 시리즈(Opus랑 Sonnet)가 내가 Claude에서 좋아했던 그 '예의 바름'의 끝판왕이었다고 본다.
최근에 탈옥 관련 농담 좀 했다고 Fable 5에서 쫓겨났거든(영구 정지는 아니고, 그냥 전형적인 과민 반응하는 분류기 때문임). 4.8 버전은 뭐만 물어보면 자꾸 단서 붙이는 게 너무 짜증 나서 그냥 4.6으로 돌아가서 테스트해 봤다. 4.6을 진지하게 써본 지가 너무 오래돼서 내가 뭘 좋아했는지도 까먹고 있었는데, 다시 써보니까 진짜 숨통이 트이더라. 그동안 나온 버전들에서 뭐가 빠졌던 건지 정확히 알겠고, 왜 그런지도 감이 온다.
난 소프트웨어 엔지니어고 Anthropic 모델뿐만 아니라 온갖 모델을 다 굴리는 헤비 유저다. 주로 새로운 소프트웨어 패턴을 연구하거나 질문 던지는 용도로 쓰는데, 솔직히 그냥 재미로 하는 거긴 해도 그러다 보면 몇 시간씩 찬반 토론하고 논쟁하게 된다. 결과적으로 모델들 행동 패턴에 너무 익숙해져서, 모델이랑 대화만 해봐도 이게 뭔지 바로 맞힐 수 있을 정도다.
4.7부터 토크나이저가 바뀌면서 "명시적인 지시를 따르도록" 훈련된 게 티가 확 났다. 그래서 사용자가 뭘 원하는지 추론을 잘 못하게 됨. 대충 물어보면 추론 안 하려고 버티는 거 보일 거다(이거 관련해서도 글 많이 올라왔던 걸로 기억함). Anthropic은 4.7에 대한 비판을 의식했는지 4.8을 "더 정직하게" 만들었는데(행동에서도 보이고, 정렬 개선했다고 자화자찬하는 릴리즈 노트에서도 보임), 그 결과 4.8은 4.6처럼 예의 바른 게 아니라, 모든 말마다 단서를 달아대기 시작했다. 하나하나 전부 다. Fable 5는 그나마 좀 낫긴 한데 여전히 필요 이상으로 자기 검열을 하고, Opus 5도 똑같다. 그냥 바로 말해주면 될 걸, 이게 옳은지 아닌지 혼자 머릿속으로 뱅뱅 돌고 있음. Sonnet 5는 그냥 성격 파탄 난 Haiku 같고.
Anthropic 관계자분들, 이름이 뭐가 됐든 상관없으니까 제발 4.6의 그 예의 바른 태도에 코딩이랑 추론 능력만 업그레이드된 모델 좀 내놔라.
그리고 '정렬(alignment)'이라는 단어에 대해 한마디 하자면, 이 단어가 지금 너무 남용되고 있다. 정렬이 안 됐다는 게 꼭 "나쁜 짓을 한다"는 뜻이 아니다. 실제로는 "사용자가 명시적으로 시키지 않은 걸 했다"는 식으로 취급받고 있는데, 그게 문제의 핵심이다. 사용자가 명시적으로 말하지 않은 그 부분이 사실은 사용자가 진짜 원했던 것일 때가 많거든. 그게 바로 좋은 매너라는 거다. 4.6은 그걸 할 줄 알았고.
글 머리말에 대해 한마디 하자면, 이거 불평하려고 쓴 거 아니다. 그냥 내 분석을 공유해서 다른 사람들도 똑같이 느끼는지 궁금해서 올린 거임 🤷


