기업 내부 데이터를 위한 현실적인 RAG 테스트 오픈 벤치마크
An Open Benchmark for Testing RAG on Realistic Company-Internal Data
핵심 요약
기업 환경을 모사한 50만 개의 문서를 활용해 RAG 시스템의 성능을 평가하는 새로운 벤치마크를 공개함.
- 벤치마크 구성 — Slack, Jira 등 실제 기업 환경을 모사한 50만 개의 합성 문서를 구축함.
- 평가 방식 — 단순 검색부터 복합적인 추론까지 10개 카테고리의 500개 질문으로 RAG 성능을 측정함.
- 주요 발견 — BM25가 벡터 검색보다 우수한 성능을 보였으며, 에이전트 방식이 검색 완성도 면에서 가장 뛰어남.
- 데이터 노이즈 — 실제 기업 데이터의 특성을 반영해 중복, 오분류, 상충하는 정보 등을 의도적으로 포함함.
우리는 실제 기업을 시뮬레이션하는 50만 개의 문서 말뭉치를 구축했고, 어떤 RAG 시스템이 가장 뛰어난지 경쟁을 붙여보았습니다.
EnterpriseRAG-Bench를 소개합니다. 이는 지저분한 기업 규모의 내부 지식에서 RAG 시스템이 얼마나 잘 작동하는지 테스트하기 위한 벤치마크입니다.
대부분의 RAG 벤치마크는 위키피디아, 웹 페이지, 논문, 포럼 등 공개된 데이터로 만들어집니다. 그것도 유용하지만, 실제로 많은 사람들이 구축하고 있는 환경인 Slack 스레드, 이메일 체인, 티켓, 회의 녹취록, PR, CRM 메모, 문서, 위키 등과는 잘 맞지 않습니다.
그래서 우리는 실제 기업처럼 행동하는 합성 기업을 생성해 보았습니다.
공개된 데이터셋은 Redwood Inference라는 회사를 시뮬레이션하며, 다음을 포함한 약 50만 개의 문서를 담고 있습니다:
- Slack
- Gmail
- Linear
- Google Drive
- HubSpot
- Fireflies
- GitHub
- Jira
- Confluence
우리가 가장 많은 시간을 들인 부분은 단순히 '많은 문서를 생성하는 것'이 아니었습니다. 문서들이 같은 회사에 속해 있는 것처럼 느껴지게 만드는 방법론이었습니다.
대략적인 생성 파이프라인은 다음과 같습니다:
- 먼저 회사를 생성합니다. 우리는 회사가 무엇을 하는지, 제품, 비즈니스 모델, 팀, 이니셔티브, 시장, 내부 용어 등을 정의하기 위해 인간이 개입하는 프로세스로 시작합니다.
- 공유 스캐폴딩을 생성합니다. 거기서부터 고수준 이니셔티브, 직원 디렉토리, 소스별 폴더 구조, 각 영역의 문서가 어떤 모습이어야 하는지 설명하는 agents.md 파일 등을 생성합니다. 예를 들어, 공개된 말뭉치의 GitHub 문서는 무작위 GitHub 이슈가 아니라 풀 리퀘스트와 리뷰 코멘트입니다.
- 고충실도 프로젝트 문서를 생성합니다. 우리는 회사 이니셔티브를 더 작은 프로젝트/워크스트림으로 나눕니다. 각 프로젝트는 PRD, Slack 토론, 회의 메모, 티켓, PR, 고객 메모 등 소스 전반에 걸쳐 관련된 문서 세트를 얻습니다. 이 문서들은 서로를 인식하며 생성되므로 현실적인 문서 간 링크와 의존성을 얻을 수 있습니다.
- 대량의 문서를 더 저렴하게 생성합니다. 말뭉치의 대부분을 위해 소스 유형별로 주제 스캐폴딩을 사용합니다. 이는 LLM이 계속해서 같은 몇 가지 주제로 붕괴되는 것을 방지합니다. 나이브한 실험에서 LLM에게 회사 개요만으로 100개의 회사 문서를 생성하라고 요청했을 때, 40% 이상이 매우 유사한 중복/형제 문서를 가졌습니다. 주제 스캐폴딩은 이를 해결하기 위한 우리의 방법이었습니다.
- 현실적인 노이즈를 추가합니다. 실제 기업 데이터는 깨끗하지 않으므로 우리는 의도적으로 다음을 추가합니다:
- 무작위로 잘못 배치된 문서
- LLM이 그럴듯하게 잘못 분류한 문서
- 사실이 변경된 거의 중복된 문서
- 밈, 해커톤 메모, 무작위 자산 등 비공식/기타 파일


