웹사이트 전체를 학습하는 RAG 챗봇을 만든다면, 어떻게 전체 사이트를 크롤링하시겠습니까?
Imagine you're building a RAG chatbot that trained on an entire website. How Would you crawl the entire site
핵심 요약
사이트맵 없이 웹사이트 전체 URL을 단일 API 호출로 빠르게 추출하는 효율적인 방법을 묻는 질문입니다.
- 크롤링 전략 — 사이트맵 없이 웹사이트 전체 페이지 URL을 추출하는 방법 논의
- API 활용 — 단일 API 호출로 비용 효율적이고 빠르게 데이터를 수집하는 기술 탐색
- 데이터 수집 — RAG 챗봇 구축을 위한 전체 웹사이트 데이터 확보 방안 모색
웹사이트 전체를 학습하는 RAG 챗봇을 만든다고 상상해 보세요.
도메인 하나가 주어집니다.
단일 API 호출로 해당 웹사이트의 모든 페이지 URL을 크롤링해서 반환해야 합니다.
요구 사항:
• 백엔드에서 단 한 번의 API 호출.
• 모든 페이지 URL 반환.
• 분 단위가 아닌 초 단위로 완료.
• 비용은 최대한 0에 가깝게.
• 웹사이트에 사이트맵이 없다고 가정.
어떻게 하시겠습니까?

