브라우저 에이전트 학습 데이터 어노테이션은 어떻게 하시나요?
How are you handling training data annotation for browser agents?
핵심 요약
브라우저 에이전트 학습을 위한 효율적인 데이터 어노테이션 도구와 워크플로우를 찾는 질문입니다.
- 어노테이션 도구 — 기존의 Labelbox나 LangSmith는 브라우저 에이전트의 시계열 데이터 처리에 한계가 있음.
- 데이터 형식 — 영상 대신 DOM 스냅샷과 액션을 JSONL로 기록하여 차이점을 분석하는 방식이 효율적임.
- 워크플로우 최적화 — Scale AI나 Braintrust 같은 도구를 활용해 어노테이션 시간을 5배 이상 단축 가능함.
- 학습 데이터 — 실제 사람의 시연 데이터와 에이전트가 생성한 트레이스 중 무엇이 더 효과적인지 고민 중임.
내부 SaaS 워크플로우를 처리하는 브라우저 에이전트를 만들고 있는데, 파인튜닝을 위해 작업 기록을 수집하기 시작했습니다. 그런데 이걸 어떻게 제대로 어노테이션해야 할지 몰라 막막한 상황입니다.
Labelbox와 LangSmith를 써봤지만 별로 도움이 안 됐습니다. LangSmith는 화면 기록을 위한 좋은 워크플로우가 없었고, Labelbox도 시계열 액션 시퀀스에 적합한 옵션이라는 느낌이 들지 않았습니다. 결국 Google Sheet로 작업했는데 작업당 시간이 너무 오래 걸리더군요.
다들 어떤 걸 사용하시나요? 제가 쓸 만한 도구가 있을까요?


