주의: Claude의 WebFetch 기능을 사용해 리서치할 때 조심하세요 😵💫
PSA: Be careful letting Claude use WebFetch for research 😵💫
핵심 요약
Claude의 WebFetch 기능이 요약 과정에서 정보를 왜곡하거나 지어낼 수 있으니, 직접 원문을 읽게 하는 것이 정확합니다.
- WebFetch의 한계 — 요약 모델이 정보를 압축하거나 왜곡하여 잘못된 데이터를 생성함
- 워크플로우 개선 — WebFetch 대신 직접 원문을 크롤링하고 읽도록 지시하여 정확도 향상
- 성능 저하 원인 — 모델 자체의 문제보다 입력되는 소스 데이터의 왜곡 가능성 제기
- 리서치 팁 — Claude가 소스를 직접 읽는지, 아니면 요약본에 의존하는지 반드시 확인 필요
Claude(Opus 5)에게 AI 에이전트 프로젝트를 위한 메모리 아키텍처 리서치를 시켰는데, 매우 구체적인 통계, 백분율, 인용구 등을 계속 가져오더라고. 처음엔 그럴듯해 보였지.
알고 보니 상당수가 틀렸거나 지어낸 거였어. 난 항상 도구의 출력물을 확인하는 편인데, WebFetch 출력물이 마치 서브 에이전트가 작성한 것처럼 간결한 요약 형태로 되어 있다는 걸 눈치챘지. 그래서 Opus에게 "너 진짜 이 논문들 읽고 있는 거 맞아?"라고 물어봤더니 아니라고 하더군. WebFetch는 더 작고 저렴한 모델을 사용하고, Opus는 그 요약본을 받는다는 거야.
더 작은 모델은 내용을 압축하고, 추측하고, 때로는 세부 사항을 지어내기도 해. 어떤 "인용구"는 논문 어디에도 존재하지 않는 프레임워크 이름이었어. 또 다른 통계는 같은 표에 있지도 않은 두 숫자를 대충 평균 낸 것처럼 보였지.
WebFetch가 이런 식으로 작동하는 줄은 꿈에도 몰랐고, 아마 많은 사람들도 모를 거야.
그래서 워크플로우를 바꿨어. Opus에게 서브 에이전트를 생성하게 하고 이런 규칙을 줬지: WebFetch는 쓰지 마. 원본 페이지를 curl로 가져와서 직접 grep/읽기 해.
차이가 엄청나더군. 약 30개의 논문에서 17개의 오류를 잡아냈는데, 그중 두 개는 WebFetch의 결론이 완전히 반대로 보고된 경우였어.
그 이후로 Opus 5의 리서치 결과는 정말 훌륭해졌어!
또한 이런 도구들이 더 좋은 모델에서도 "Claude는 멍청해" / "Claude는 계속 거짓 정보를 줘"라는 보고가 나오는 이유가 아닐까 싶어. Claude가 보기 전에 소스 자료가 이미 엉망이 되어 있다면, 모델이 할 수 있는 일에는 한계가 있으니까.
어쨌든, Claude를 리서치에 사용하는 사람들을 위한 공익 광고야: Claude가 실제로 소스를 읽고 있는지, 아니면 WebFetch 요약본에 의존하고 있는지 확인해!


