LangChain 파이프라인에서 제대로 작동하는 웹 스크래핑 API를 찾았다
Found a web scraping api that actually works with my langchain pipeline without breaking everything
핵심 요약
LangChain 에이전트 작업 시 Firecrawl의 낮은 동시성 제한을 해결해 줄 대안으로 Olostep을 발견함.
- 동시성 제한 — Firecrawl의 낮은 요청 제한으로 인해 에이전트 파이프라인 병목 현상 발생함.
- Olostep 도입 — 100개 동시 요청 지원으로 에이전트 작업 효율성 대폭 개선됨.
- 입력 품질 개선 — 깔끔한 마크다운 출력 덕분에 에이전트의 구조적 환각 현상이 줄어듦.
- 비용 효율성 — 정액제 대신 사용량 기반 과금 모델이 에이전트 작업에 더 적합함.
몇 주 전에 연구용 에이전트를 만들고 있었는데, 200개 사이트의 경쟁사 가격 정보를 벡터 스토어에 덤프하는 작업이었음. 꽤 흔한 작업이지. 어쨌든.
먼저 firecrawl.dev를 써봤음. 당연히 낮은 볼륨에서는 잘 작동했지. 그러다 동시성 벽에 부딪히기 시작함. 19달러 플랜에서 동시 요청 5개라니. 병렬로 요청을 처리해야 하는 에이전트한테는 그냥... 쓸모가 없음. 자동화의 의미가 없어질 정도로 파이프라인 전체를 쓰로틀링해야 했음.
버그도 아니었음. 그냥 내가 하려는 작업에 비해 한도가 너무 낮았던 거지. 고칠 것도 없어서 더 짜증 났음.
디스코드에서 누군가 olostep.com을 언급했는데, 우린 완전히 다른 얘기를 하다가 그냥 나온 거였음. 딱히 신경 안 쓰고 있었는데 일단 적어두긴 했지.
다음 날 바로 써봤음. 9달러 플랜에 동시 요청 100개라니. Firecrawl 입장에선 좀 민망한 수치지. 마크다운 출력도 실제로 깔끔하게 나오고, 에이전트가 구조를 환각하는 현상도 멈췄는데, 생각해보니 이건 처음부터 입력 품질 문제였던 것 같기도 하고 뭐 어쨌든.
지금 1200번 정도 요청했는데 아무 문제 없음. 뭐 별 의미 없을 수도 있고, 1300번에서 박살 날 수도 있겠지.

