요즘 프로덕션 환경에서 웹 로더 뭐 쓰시나요?
What are people using now for web loaders in production?
핵심 요약
프로덕션 환경에서 안정적인 웹 데이터 수집을 위해 어떤 도구를 사용하는지 묻는 질문입니다.
- 웹 로더 도구 — 프로덕션 환경에서 신뢰성 높은 데이터 수집 도구 탐색
- 주요 후보군 — WebBaseLoader, Firecrawl, Apify 등 다양한 옵션 비교
- 성능 및 비용 — 복잡한 에이전트 방식보다 효율적인 수집 방식 선호
- 안정성 이슈 — JS 렌더링, 프록시, HTML 구조 문제 해결 방안 논의
LangChain을 실제 앱에서 사용하는 분들께 질문합니다.
요즘 웹 데이터 수집(ingestion)에 뭘 쓰고 계신가요?
제가 본 것들은 다음과 같습니다:
- WebBaseLoader
- Playwright/Selenium
- Firecrawl
- Apify
- 커스텀 스크래퍼
- 사이트맵 크롤러
- browser-use 스타일 에이전트
- 일반 requests + BeautifulSoup
어떤 걸 유지하고, 어떤 걸 교체하셨나요?
저는 특히 신뢰성에 관심이 많습니다: JS 페이지, 보호된 사이트, 엉망인 HTML, 중복되는 내비게이션/푸터 콘텐츠, 그리고 시간이 지나도 문서를 최신 상태로 유지하는 것 등이요.


