AI 에이전트마다 웹사이트를 크롤링하는 방식이 완전히 다르다. 3개월간 1,100만 개의 이벤트 로그를 분석한 결과.
Each AI agent crawls website completely differently. Here's what 3 mons of 11 million event logs actually show.
핵심 요약
3개월간 1,100만 개의 로그를 분석한 결과, AI 에이전트마다 크롤링 전략이 판이하며 이제는 구글 검색 순위보다 AI가 선택하는 페이지가 되는 것이 중요해짐.
- 크롤링 전략 차이 — 봇마다 robots.txt 준수 여부와 접근 방식이 완전히 다름.
- AI의 정보 습득 — AI는 전체 사이트 대신 답변에 필요한 단일 페이지를 집중적으로 수집함.
- 검색 생태계 변화 — 구글 의존도를 낮추기 위해 각 기업이 독자적인 인덱스를 구축 중임.
- SEO의 미래 — 구글 검색 순위보다 AI가 답변으로 선택하는 페이지가 되는 것이 핵심임.
AI 에이전트들은 웹사이트에 방문할 때마다 제각각 다르게 행동한다. 34개 웹사이트에서 1,100만 건의 실제 크롤러 로그를 3개월 동안 추적해 본 결과는 다음과 같다.
- GPTBot: 하루 종일 쉴 새 없이 긁어대는데, 규칙 확인은 거의 안 한다. 23개 사이트에서 28만 번 크롤링하는 동안 robots.txt를 확인한 건 고작 9번뿐이다. 그냥 다 가져간다.
- Google's bot: GPTBot이랑 정반대다. robots.txt를 8,765번이나 다시 불러오면서 규칙을 계속 확인한다. 25년 동안 크롤링하면서 배운 예절이 있는데, 새로 나온 AI 봇들은 그런 걸 배운 적이 없거든.
- ClaudeBot: 우리가 추적하는 사이트들에서 크롤링 횟수가 4월 7.3k → 5월 64k → 6월 첫 열흘 동안 168k로 폭증했다. 웹상의 정보를 최대한 많이 읽으려고 미친 듯이 달리는 중인데, 이 경쟁이 핵심이다(아래에서 더 자세히 다룸).
- 실시간 봇(The live ones): 누군가 AI한테 네 사업에 대해 물어보면, 사이트 전체를 다 보는 게 아니라 딱 정답이 되는 페이지 하나만 낚아챈다. Claude의 실시간 봇을 보면 방문의 75%가 딱 한 페이지에 집중된다. 네가 올린 다른 글들은 다 무시한다는 소리다. 이제 AI가 너를 대표한다고 고른 그 페이지 하나가 전부인 세상이 됐다.
- Bytespider: 이번 분기에 우리가 기록한 가장 악질적인 크롤러는 틱톡 소유주가 운영하는 놈이다. 한 사이트에서만 120만 번을 방문했는데, 구글이랑 OpenAI 크롤러를 다 합친 것보다 많다. 이제 익숙한 이름들도 다 용도가 바뀐 거다.
- Microsoft's Bing: 여전히 예전 검색 엔진처럼 크롤링하지만, 이제는 인덱싱하는 모든 게 Copilot으로 들어간다.
- MetaBot: robots.txt는 거의 확인도 안 하면서, llms.txt 파일을 읽는 몇 안 되는 크롤러 중 하나다.
이 회사들 전부 자기들만의 웹 복사본을 만들고 있다. 자기들만의 크롤러, 자기들만의 인덱스, 자기들만의 답변을 구축하는 중이다. Anthropic이 심심해서 그렇게 빡세게 크롤링하는 게 아니다. 다들 사람들이 질문하러 찾아오는 곳이 되고 싶어 하고, 그 말은 곧 구글 의존도를 끊고 싶다는 뜻이다.
내 생각엔, 앞으로 구글 검색 순위의 중요성은 분기마다 점점 떨어질 거다. 이렇게 많은 AI가 각자의 방식으로 사이트를 읽고 자기들만의 인덱스를 구축하는 상황에서, "구글 1등"을 노리는 건 더 이상 의미가 없다. 이제는 AI가 선택하는 페이지가 되는 게 진짜 승부처다.


