18개의 RAG 파이프라인과 에이전트 루프를 Google FRAMES에서 벤치마크했습니다. 최고 파이프라인은 78.9%, 에이전트 루프는 92.7%를 기록했습니다.
We benchmarked 18 RAG pipelines against an agent loop on Google's FRAMES. The best pipeline hit 78.9%. The agent loop hit 92.7%.
핵심 요약
다양한 RAG 파이프라인과 에이전트 루프를 비교한 결과, 에이전트 루프 방식이 복합 질문 해결에서 훨씬 높은 정확도를 보였습니다.
- 벤치마크 결과 — 에이전트 루프가 92.7%의 정확도로 기존 RAG 파이프라인보다 우수한 성능을 보임
- 리랭커 효과 — 멀티홉 질문에서는 리랭커가 오히려 정확도를 떨어뜨리거나 유의미한 개선을 주지 못함
- 환각 방지 — 모델이 학습된 지식으로 답변을 채우지 않도록 검색된 문서와 답변을 대조하는 검증 수행
- 비용 및 효율 — 에이전트 루프는 복잡한 질문에 더 많은 비용을 쓰지만, 단순 질문에서는 기존 파이프라인과 유사한 효율을 보임
하이브리드 검색, 리랭킹, 쿼리 분해, 쿼리 확장은 RAG 좀 한다 싶으면 필수 요소로 취급받지. 그래서 이게 진짜 얼마나 도움이 되는지 궁금해서 직접 테스트해 봤다. 모델, 임베딩, 문서 전부 똑같이 맞추고 FRAMES에 있는 824개 멀티홉 질문으로 돌려봄.
파이프라인 변형 18개를 만들어서 테스트했는데, 제일 잘 나온 게 78.9% 찍더라. 근데 검색 툴을 써서 결과를 읽고 다시 검색하는 에이전트 루프를 돌리니까 92.7%가 나옴. 이건 모델한테 처음부터 정답 문서를 쥐여준 거랑 거의 비슷한 수준이야.
리랭킹 결과 보면 좀 놀랄걸? 작은 리랭커를 썼더니 오히려 최고 성능 파이프라인 정확도가 9% 포인트나 깎였고, 큰 리랭커를 써도 거의 효과가 없었음. 사실 리랭킹이 여기서 별 도움 안 될 거라 예상은 했는데, 직접 확인해 보고 싶었거든.
또 하나 발견한 게 있는데, 모델한테 검색된 문서만 참고하라고 신신당부를 해도 가끔 지 기억으로 빈틈을 채워 넣더라. 심지어 그렇게 쓴 답도 인용구는 그럴싸하게 달려 있음. 그래서 결국 시스템이 실제로 읽은 내용이랑 정답을 일일이 대조해 봐야 했다.
관심 있으면 아래 글 한번 읽어봐:
Agentic RAG vs. traditional RAG on FRAMES
참고로 나는 오픈소스인 PipesHub에서 일하고 있음. 벤치마크 코드랑 런북은 여기 저장소에 다 올려놨다: https://github.com/pipeshub-ai/pipeshub-ai/tree/frames
숫자 의미에 대해 짧게 설명하자면, 이건 검색 점수가 아니라 엔드투엔드 답변 정확도야. 모든 답변은 FRAMES 논문에서 쓴 채점 프롬프트를 활용해서 LLM 판정단(Claude Sonnet 3.5)이 채점했고, 두 번째 판정단(Gemini Flash 1.5)이 독립적으로 다시 검증했어. 두 판정단 결과가 거의 일치했음(Cohen's κ 0.93–0.98). 그리고 모델이 지 기억으로 쓴 답은 검색 성공으로 치지 않으려고 시스템이 실제로 본 텍스트랑 정답을 전부 대조했다.


