출시 전 골드 스탠다드 평가 데이터셋 구축하기
Manufacturing a gold standard eval dataset before launch
핵심 요약
사용자가 없는 초기 단계에서 AI 에이전트 평가 데이터셋을 어떻게 구축할지 고민하는 글입니다.
- 평가 전략 고민 — 실제 사용자 데이터가 없는 상황에서 초기 평가 데이터셋 구축의 어려움을 토로함
- 합성 데이터 활용 — 인간의 행동을 모방한 합성 사용자 및 적대적 페르소나를 생성하여 테스트 중임
- 도구 활용 — Braintrust를 사용하여 버전 관리와 평가를 수행하며 향후 실제 데이터 전환을 대비함
- 출시 전략 문의 — 다른 개발자들에게 초기 데이터셋 구축 방식과 출시 후 수정 전략에 대해 조언을 구함
출시 전 프로젝트 때문에 삽질만 계속하고 있는데, 평가 전략에서 완전히 막혀버렸네.
다들 프로덕션 로그로 데이터셋 만들라는데, 우린 지금 유저가 0명이라 이건 뭐 시작조차 불가능한 상황임. 라이브 가기 전에 베이스라인이랑 골드 스탠다드가 필요한데, 지금 하는 꼴을 보니 그냥 허공에 대고 정답지를 날조하고 있는 기분이다.
지금 합성 유저랑 적대적 페르소나 만드는 데 시간을 너무 많이 쓰고 있어. 인간이 프롬프트를 망가뜨리거나 환각을 유발할 수 있는 모든 경우의 수를 그냥 무식하게 다 때려 박는 중임.
버전이랑 평가 관리하려고 Braintrust를 쓰고 있긴 한데, 나중에 실제 트레이스로 넘어갈 때 문제 안 생기게 하려면 이걸 어떻게 구조화하는 게 제일 좋을지 도통 감이 안 잡히네.
최근에 런칭해 본 사람들은 'Day Zero' 데이터셋 어떻게 처리했음? 그냥 전부 합성 데이터로 밀어붙였어, 아니면 일단 배포하고 프로덕션에서 수정하는 식으로 갔어?

