웹사이트 전체를 에이전트에 덤프하는 건 성능을 떨어뜨릴 뿐인데 다들 왜 이러는 걸까
Dumping your whole site into the agent is making it worse and everyone keeps doing it anyway
핵심 요약
에이전트 성능을 위해 무분별한 데이터 수집보다는 경로 필터링을 통한 선별적 인덱싱이 필수적이라는 의견입니다.
- 데이터 오염 방지 — 무분별한 크롤링은 노이즈를 유발해 에이전트의 검색 품질을 저하시킴
- 경로 필터링 전략 — 크롤링 전 경로를 엄격히 제한하여 필요한 콘텐츠만 선별적으로 수집
- 검색과 에이전트의 차이 — 에이전트는 인간과 달리 잘못된 정보를 바탕으로 즉시 행동하므로 데이터 정제가 중요함
- 유연한 접근 필요 — 무조건적인 필터링이 오히려 필요한 정보를 누락시킬 수 있다는 반론도 존재함
지난주에 어떤 놈이 웹사이트 크롤러 API로 도메인 전체를 긁어서 벡터 스토어에 3,000페이지를 처박아놓고는, 왜 40페이지 있을 때보다 검색 성능이 더 구려졌냐고 나한테 묻더라.
성능이 꼬라박은 이유는 뻔함. 웹사이트 3,000페이지가 다 알짜배기 콘텐츠인 줄 아나 본데, 까보면 내비게이션 바, 이용약관, 2019년에 쓴 블로그 글 400개가 섞여 있거든. 필터링도 안 하고 무지성으로 긁어대는 AI 크롤러는 그냥 돈 써가면서 인덱스에 쓰레기만 들이붓는 짓임.
내가 쓰는 방식은 일단 크롤링으로 URL부터 싹 다 찾은 다음에, 페이지 하나라도 긁기 전에 경로(path)부터 빡세게 필터링하는 거임. 살아남은 놈들만 콘텐츠를 가져오는 거지. 내 필터링 방식은 존나 단순함. 접두사 하나랑 제외할 거 두 개만 설정해도 3,000개에서 250개 정도로 줄어드는데, 사실상 이 정도면 필요한 건 다 들어있음.
이럴 때마다 돌아오는 반박이 "뭐가 중요한지 미리 어떻게 아냐, 일단 다 인덱싱하고 검색 단계에서 걸러내면 되지 않냐"는 건데, 검색 엔진이면 몰라도 에이전트한테는 개소리임. 에이전트는 수행해야 할 작업이 있고 토큰 예산도 정해져 있는데다, 무엇보다 참을성이 1도 없거든.
내 파이프라인 전체를 이 철학으로 짰으니까, 어디서 구멍이 뚫릴지 한번 지적해 봐라.

