RAG 파이프라인 자동 평가 및 설정 순위 지정 도구 개발 후기
I built a free tool that auto-evaluates your RAG pipeline and ranks configurations — here's what I learned
핵심 요약
RAG 파이프라인의 성능을 자동으로 평가하고 최적의 설정을 찾아주는 무료 도구 'RAG-Eval Studio' 개발기.
- RAG 평가 자동화 — LangGraph를 활용해 문서에서 평가 질문을 생성하고 RAGAS로 성능을 측정함.
- 설정 비교 리더보드 — 청킹 전략, 임베딩 모델 등 다양한 설정을 사이드 바이 사이드로 비교 가능함.
- 문서 특성 분석 — 이력서 같은 특정 문서가 RAG 성능에 미치는 영향력을 수치로 확인 가능함.
- 무료 스택 구성 — LangGraph, Groq, HuggingFace, Qdrant 등 무료 티어 위주로 구축됨.
여러분 안녕하세요 — RAG 시스템이 실제로 잘 작동하는지 확인하기가 너무 어려워서 답답한 마음에 RAG-Eval Studio를 만들었습니다.
계속 부딪혔던 문제: 모든 RAG 프로젝트는 청킹 전략, 청크 크기, top-K, 임베딩 모델 등을 선택해야 합니다. 보편적으로 "옳은" 선택은 없으며, 문서 유형에 따라 다릅니다. 하지만 모든 조합을 수동으로 테스트하는 건 정말 고통스러운 일이죠.
이 도구의 기능:
- PDF/TXT 파일 업로드
- 7개 노드로 구성된 LangGraph 파이프라인이 문서에서 평가 질문을 자동으로 생성 (수동으로 테스트 케이스 작성할 필요 없음)
- RAG 설정을 사용하여 각 질문을 검색하고 답변
- RAGAS를 사용하여 결과 점수 산정 (faithfulness, answer relevancy, context precision, context recall)
- 설정들을 나란히 비교할 수 있도록 순위가 매겨진 리더보드 제공
흥미로운 발견: 1페이지짜리 이력서 PDF(의도적으로 RAG에 좋지 않은 문서)로 실행해 봤는데, Context Recall은 1.0(모든 정보 존재)이었지만 Context Precision은 0.39였습니다. 이력서의 불렛 포인트들이 의미적으로 비슷해서 검색 노이즈를 유발했기 때문이죠. 문서의 토폴로지가 파이프라인 품질과는 별개로 RAG 품질에 어떤 영향을 미치는지 보여줍니다.
기술 스택: LangGraph + Groq (무료 LLM) + HuggingFace Inference API (무료 임베딩) + Qdrant 인메모리 + RAGAS + FastAPI + Streamlit. Render 무료 티어(512MB RAM 미만)에서 실행됩니다.
GitHub: https://github.com/sunny84patel/RAG-Evaluation
평가 파이프라인을 구축해 보신 분들의 피드백을 듣고 싶습니다 — RAGAS 외에 어떤 지표들을 추적하시나요?


