RAG + 데이터 웨어하우스 구축을 위한 최적의 스택 추천 부탁드립니다
Best stack for RAG + Data Warehouse from scratch
핵심 요약
700대 트럭의 텔레메트리 데이터와 사내 문서를 다루기 위한 개인정보 보호 중심의 효율적인 기술 스택을 고민 중입니다.
- 데이터베이스 선택 — 텔레메트리 저장을 위해 PostgreSQL과 TimescaleDB 조합이 ClickHouse나 BigQuery보다 효율적일지 고민함.
- RAG 구현 — PDF 문서 처리를 위해 Qdrant나 pgvector를 사용하고 Dify.ai로 UI를 구성하는 방안을 검토함.
- Text-to-SQL 모델 — 텔레메트리 데이터의 정확한 쿼리 생성을 위해 Llama 3 같은 오픈소스 모델로 충분할지, GPT-4o가 필수일지 질문함.
- 비용 및 보안 — 엔터프라이즈 도구의 과도한 비용을 피하면서 EU 규정을 준수하는 자가 호스팅 솔루션을 선호함.
물류 회사를 위한 AI 프로젝트를 진행 중인데 아키텍처에 대해 고민이 좀 있습니다. 과도한 엔지니어링을 피하면서 무엇을 선택해야 할지 확신이 서지 않아 조언을 구합니다.
The setup:
이 회사는 700대 이상의 트럭을 보유하고 있습니다. 두 가지 기능을 수행하는 내부 챗봇을 원합니다.
- RAG: 사내 PDF(통관 절차, 인사 규정 등)를 기반으로 질문에 답변.
- Text-to-SQL: 트럭 텔레메트리(연료 소비, GPS, 경로 등)를 기반으로 질문에 답변.
The problem:
현재 데이터 웨어하우스(DWH)가 없습니다. 또한 데이터 프라이버시가 매우 중요하기 때문에, 모든 데이터를 OpenAI로 보내는 대신 EU 호스팅 솔루션이나 오픈소스(자가 호스팅)를 선호합니다.
My doubts & what I need help with:
- The Database: DWH가 없는데 700대 트럭의 텔레메트리를 어디에 저장해야 할까요? 간단하게 PostgreSQL + TimescaleDB를 사용할까 생각 중입니다. 이것으로 충분할까요, 아니면 바로 ClickHouse나 BigQuery 같은 것으로 가야 할까요?
- The RAG part: 문서 처리를 위해 Qdrant나 pgvector를 사용하고, UI와 인용 처리를 위해 Dify.ai를 사용할까 합니다. 지금 시점에서 괜찮은 선택일까요?
- The LLM: 오픈소스 모델(API를 통한 Llama 3 70B 등)이 트럭 데이터에서 SQL 쿼리를 안정적으로 생성할 수 있을까요? 아니면 Text-to-SQL이 제대로 작동하려면 정말 GPT-4o가 필요한가요?
탄탄한 기반을 구축하고 싶지만, 아직 필요하지 않은 엔터프라이즈 도구에 엄청난 비용을 쓰고 싶지는 않습니다. 이 경우 어떤 스택을 추천하시나요?

