리서치 에이전트 스크래핑 비용이 너무 많이 드는데, 요즘 다들 어떤 스택 쓰나요?
Research agents are absolutely murdering my budget on scraping. What’s the actual stack people are using these days?
핵심 요약
멀티 에이전트 시스템의 스크래핑 비용과 Cloudflare 차단 문제를 해결하기 위한 효율적인 기술 스택을 질문함.
- 비용 최적화 — 불필요한 페이지 스크래핑을 줄이기 위해 2단계 필터링 전략 도입.
- 스크래핑 도구 — Firecrawl이나 Apify 같은 전문화된 도구를 활용해 에이전트 친화적인 데이터 추출.
- Cloudflare 우회 — 프록시 관리나 최적화된 스크래퍼를 사용하여 차단 문제 해결.
- MCP 활용 — Apify나 Playwright MCP를 통해 에이전트와 도구 간의 연동성 강화.
멀티 에이전트 시장 분석 시스템을 만들고 있습니다. 현재 리서치 에이전트가 SerpAPI를 통해 병렬 쿼리를 수행하고, 다른 에이전트가 반환된 모든 URL을 스크래핑하려고 시도하는 방식입니다.
너무 느리고(Cloudflare와 계속 싸우는 중), 비용이 감당하기 힘들 정도로 커지고 있습니다.
2026년 기준 에이전트 웹 검색을 위한 표준 스택은 무엇인가요? Exa인가요? 아니면 아직도 커스텀 파서 설정을 유지하는 사람들이 많은가요?
