대규모 복잡한 법률 문서를 위한 가장 정밀한 RAG 구축 방법
How to build the MOST PRECISE RAG for big complex legal documents
핵심 요약
400만 건의 방대한 법률 문서를 대상으로 1초 이내에 정밀한 검색이 가능한 RAG 시스템 구축 전략을 논의함.
- 검색 전략 — 벡터 검색 대신 지식 그래프나 하이브리드 검색, ColBERT 활용 제안
- 문서 처리 — 고정 청킹보다는 원자적 명제 추출이나 부모-자식 청킹 방식 권장
- 모델 활용 — 대규모 컨텍스트 모델 활용 및 에이전트 기반의 검색 최적화 고려
- 기술 스택 — 2026년형 최신 기술로 하이브리드 검색과 reranker 조합의 중요성 강조
여러분 안녕하세요,
제 열정 프로젝트인 최고의 법원 판결 검색기를 만들고 싶지만, 많은 난관에 부딪혔습니다.
먼저 몇 가지 매개변수를 말씀드리자면:
- 400만 건 정도의 법률 문서, 대부분 6k 토큰 정도지만 30k 토큰이 넘는 다중 A4 페이지 분량도 있음
- 구조화가 거의 되어 있지 않고, 사건 경위를 설명하는 긴 텍스트 덩어리임
- 가능하다면 1초 이내에 검색이 완료되어야 하고 16GB RAM 내에서 작동해야 함
- 중앙 유럽 언어인 슬로바키아어임
- 검색은 매우 정밀해야 함. reranker를 사용하여 시간이 더 걸리더라도 더 정확한 결과를 얻을 수 있다면 1초 규칙은 무시해도 됨.
지금 바로 떠오르는 2026년 최고의 기술 스택은 무엇인가요?
저는 8k 청크의 jina, qwen 0.6b, 언어별 임베더, 8k 이하의 청크, 심지어 "pplx-embed" 같은 모델을 사용한 "late-chunking" 기법까지 시도해 봤습니다. 512 토큰 청크를 위한 스마트 시맨틱 청킹도 해봤고요.
모두 순수 벡터 검색에서 T1 기준 약 20%, T10 기준 50% 정도의 점수를 기록했습니다. Late-chunking 같은 더 전문적인 시도는 기본 jina보다 더 나쁜 결과를 보였습니다.
가장 성능이 좋았던 것은 단연 jina v5였고, 하이브리드 검색을 사용하면 5k 정도의 샘플 문서와 8k 청크로 Top 100 기준 90% 정도의 점수를 낼 수 있었습니다.
법률 환경에서는 여전히 꽤 나쁜 수준이지만, 파인튜닝과 reranker를 조합하면 작동할 수 있지 않을까요?
파인튜닝에 대해 말하자면, 대상 문서/청크에서 쿼리를 생성하여(긍정 데이터를 얻기 위해) 부정 데이터를 마이닝하거나(Gemini를 다시 사용하여), 단순히 긍정 데이터가 Top 10에 나타나는지 확인하는 전략이 타당할까요?
또한 파인튜닝 전에 무엇을 시도해야 할까요? 바로 파인튜닝으로 뛰어드는 것은 최선이 아니라고 생각합니다.
"late-chunking"처럼 GPU 대여 비용과 API 토큰만 낭비하는 막다른 길은 피하고 싶습니다.
혹시 이와 관련하여 추천해주실 만한 기사가 있다면 알려주세요! 읽어주셔서 감사합니다!

