연구, 웹 검색, 사실 확인을 위한 벤치마크가 절실히 필요합니다.
We seriously need benchmark for research, wide web search and fact retrieval.
핵심 요약
기존 벤치마크의 한계를 지적하며 실제 환경에서의 검색 및 연구 능력을 평가할 새로운 기준이 필요하다고 주장함.
- 벤치마크 한계 — 기존 지표들은 포화 상태이거나 지나치게 제한된 환경에서 테스트됨.
- 실제 환경 요구 — 도구 접근과 인터넷 검색이 허용된 실사용 환경에서의 평가가 필요함.
- 공식 지표 부재 — 최신 업데이트가 이루어지지 않고 공식 리더보드가 없는 실정임.
거의 모든 벤치마크가 이미 점수가 포화 상태거나, 너무 빡빡한 조건에서만 테스트를 돌리고 있음.
예를 들어 AA Omniscience 같은 건 도구 사용에 제한이 걸려 있고.
많은 사람들이 챗봇을 정보 검색, 심층 조사, 광범위한 자료 수집 용도로 쓰고 있잖아.
물론 이런 벤치마크들이 있긴 한데 -
문제는 공식 리더보드도 없고, 마지막 업데이트가 몇 년 전이라는 거임.
우리가 진짜 필요한 건 실제 환경(도구 접근 및 인터넷 검색 허용)에서 테스트하고, Claude나 ChatGPT Work 같은 거 쓸 때처럼 아무런 제약 없는 하니스 시스템을 갖춘 벤치마크라고.
혹시 이런 벤치마크 아는 사람 있으면 좀 알려줄 수 있냐?




