Claude는 글 분석에 정말 형편없지만, 너무나 자신만만하게 분석을 내놓아서 그 형편없음을 간과하기 쉽다
Claude is really bad at analyzing writing, but it gives such confident analyses that it's easy to miss just how bad it is
핵심 요약
Claude가 글의 맥락을 제대로 이해하지 못하고 자신감 있게 틀린 피드백을 제공한다는 비판과, 이를 해결하기 위한 워크플로우 논쟁.
- 분석 능력 부족 — Claude가 글의 전체적인 맥락과 논리적 연결을 파악하지 못하고 지엽적인 부분에 집착함
- 잘못된 자신감 — 틀린 분석을 매우 확신에 찬 어조로 전달하여 사용자가 잘못된 피드백을 수용할 위험이 있음
- 워크플로우 논쟁 — 사용자의 프롬프트 방식이나 분석 절차에 따라 성능이 달라질 수 있다는 의견이 대립함
- 도구의 한계 — LLM은 생산성 도구로는 유용하지만, 전문적인 분석이나 평가를 위한 도구로는 신뢰하기 어렵다는 지적
나는 석사 과정 학생인데, 최근에 피드백을 받고 테스트도 해볼 겸 Claude에게 몇 편의 글을 줬음. 나는 교사이고 많은 교사가 글쓰기 채점에 Claude나 다른 LLM을 사용한다는 걸 알고 있음. 나도 Claude를 여러 용도로 쓰지만, 채점이나 학생 피드백 용도로는 쓰지 않음. 최근 Claude가 내놓은 응답들을 보니 조만간 학생 과제 채점에 쓸 일은 없을 거라는 확신이 들었음.
내가 발견한 사실은 LLM이 생각하는 척은 잘하지만, 실제로는 생각하지 않는다는 걸 잘 보여줌. Claude는 사소한 부분에 매달리고, 나무만 보느라 숲을 놓치며, 논제와 그 뒤를 잇는 뒷받침 문단들 사이의 연결 고리를 잃어버림. 덩치 큰 생각이나 서로 충돌하는 아이디어를 그 "뇌" 속에 담아두지 못함.
컨텍스트 윈도우가 크다고는 하지만, 더 큰 글의 맥락을 실제로 이해하지는 못함. 참고로 엄청나게 큰 것도 아님, 50페이지 정도 되는 분량이었음. 그럼에도 불구하고, Claude는 미묘하지만 확실하게 글의 요점을 놓쳤고, 일관되게 그랬음.
더 나쁜 건 피드백을 주는 방식임. 문단 속 한 문장이 논제를 "폭파"시켰다고 했는데, 그건 문장의 뒷부분만 읽었을 때나 맞는 말이지 전체 문장을 읽으면 그렇지 않았음. 전체 문장은 Claude가 말한 것과는 아주 다른 의미였는데, Claude는 폭탄을 던지듯 가혹한 반응을 보였음. 내가 그 글을 잘 몰랐거나 아예 읽지 않은 상태에서 Claude의 피드백을 학생에게 그대로 줬다면, 학생은 내가 자기 시간을 낭비한다고 느끼거나, 더 나쁘게는 실제로 고칠 필요도 없는 부분을 고치려고 애썼을 거임.
이건 당신의 전문 분야 밖의 일에 Claude나 어떤 LLM을 사용한다면 매우 조심해야 한다는 걸 상기시켜 줌. Claude는 항상 자신만만하기 때문에 잘못된 이해를 사실인 것처럼 속기 쉬움. LLM은 여전히 당신의 개인적인 지식 기반 내에서 생산성을 높이는 도구로는 좋지만, 신뢰할 수 있는 분석 도구는 아님.


