다들 에이전트를 활용한 브라우저 자동화에 실제로 뭘 쓰고 있음?
What's everyone actually using for browser automation with agents
핵심 요약
에이전트 기반 브라우저 자동화 시 반복 작업의 캐시 무효화 문제와 해결책을 논의함.
- 자동화 전략 — 작업의 새로움과 반복성에 따른 도구 선택
- 반복 작업 문제 — 매번 재추론하는 비용과 캐시된 경로의 stale 문제
- 검증 방식 제안 — 결과물 스키마 체크 대신 페이지 상태 핑거프린트 활용
- 추천 도구 — browser-use, Browserbase, Kernel, steel.dev 등
이걸 정리해보고 있는데, 계속해서 돌아오게 되는 구분점은 '새로움'과 '반복'임.
매번 작업이 다르다면, 핵심은 탐색임. browser-use가 이 부분에 좋음. 아니면 직접 브라우저를 돌리기 싫다면 Browserbase나 Kernel도 괜찮음.
근데 매일 같은 작업이라면, 에이전트가 아침마다 똑같은 6단계를 다시 추론하는 건 비용 낭비임. 내가 겪는 문제가 이거임. 주말에 webcmd를 써봤는데, npm install로 사이트를 한 번 크롤링해서 나중에 호출할 수 있는 명령어로 바꿔줌.
내가 지정한 두 사이트에서는 잘 작동했음. 초기 프로젝트라 별은 35개 정도. 검증됐다기보단 유망한 수준이라고 봄.
아무도 해결 못한 문제: 캐시된 경로가 구식이 되면(사이트 변경 시) 에러 없이 잘못된 데이터를 반환함. 스키마 체크는 구조만 잡지 나머지는 못 잡음.
이거에 대한 확실한 해결책 아는 사람?

