직접 호스팅 가능한 LLM 관측 플랫폼을 만들었습니다 — 비용, 에이전트 실행, TTFT, RAG 추적 가능. 오픈 소스, MIT 라이선스.
I built a self-hosted LLM observability platform — tracks cost, agent runs, TTFT, and RAG. Open source, MIT license.
핵심 요약
LLM 애플리케이션의 비용, 성능, 에이전트 실행 과정을 추적할 수 있는 오픈 소스 자가 호스팅 관측 플랫폼 'Lumina' 소개.
- 자가 호스팅 — VPC 내부에서 데이터 보안 및 규정 준수 유지 가능
- 상세 관측 기능 — 모델별 비용, TTFT, RAG 메트릭 및 에이전트 실행 경로 추적
- 기술 스택 — Go, ClickHouse, Kafka, PostgreSQL 기반의 고성능 아키텍처
- 간편한 통합 — Python SDK 및 OpenTelemetry 지원으로 즉시 사용 가능
다들 안녕,
LLM 애플리케이션 전용으로 만든 오픈소스 셀프 호스팅 관측 플랫폼인 Lumina를 개발해 봤어.
LLM 기반 기능을 배포해 본 사람이라면 이런 고민 한 번쯤 해봤을 거야:
- 사용자별/기능별로 비용이 정확히 얼마나 나가는지
- 내 서비스에 어떤 모델이 더 빠르고 저렴한지
- 왜 내 에이전트가 5단계면 끝날 걸 40단계나 돌고 있는지
- 지연 시간이 어디서 발생하는지 (대기열 vs TTFT vs 생성 시간)
...이런 문제 해결하려고 만든 거야.
주요 기능:
🔍 LLM 관측
- 모델, 제공자, 기능, 사용자별 토큰 분석 — 호출당 비용 계산
- 프롬프트 캐시 절감액 (OpenAI/Anthropic 캐싱으로 얼마나 아꼈는지 정확히 보여줌)
- 모델별 TTFT(Time-to-first-token) 및 초당 토큰 수
- 모델 간 A/B 비교 — 감에 의존하지 말고 데이터로 모델 갈아타기
- 에이전트 실행 궤적 — 단계별 비용과 함께 모든 단계, 도구 호출, 검색 과정 확인
- 도구 카탈로그 — 어떤 도구가 제일 많이 터지는지, 어떤 에러가 나는지 확인
- RAG/검색 지표 — 쿼리량, 평균 문서 반환 수, 지연 시간
📡 핵심 관측 (가벼운 SigNoz 느낌)
- 워터폴 뷰를 지원하는 HTTP 트레이스
- 실시간 테일링이 가능한 로그 탐색기
- 지표 탐색기
- 스택 트레이스가 포함된 예외 그룹화
- 서비스 맵
- 멀티턴 세션 뷰
🔔 알림
- 비용, 지연 시간, 에러율, 토큰 사용량에 대한 임계값 알림
- 기능별/사용자별 LLM 비용 예산 설정
- 알림 일시 정지
기술 스택:
- Go 백엔드 (수집 API + 워커)
- 분석용 ClickHouse
- 버퍼링용 Kafka
- 메타데이터용 PostgreSQL
- Next.js 대시보드
- Python SDK + OpenTelemetry 완벽 지원
한 줄 명령어 설치:
git clone https://github.com/lumina-gen/lumina-core
cd lumina-core
cp .env.example .env
make start
대시보드는 http://localhost:9191에서 돌아가. 어떤 LLM 제공자랑도 다 잘 붙어.
Python SDK (설정 필요 없는 인스트루멘테이션):
import lumina
lumina.init(api_key="pk_live_...")
# OpenAI, Anthropic, LiteLLM calls traced automatically
이런 피드백 좀 부탁해:
🐛 버그 — 특히 OTEL 수집이나 Python SDK 패치 관련해서
💡 부족한 점 — Langfuse / Helicone / Datadog 쓰다가 이걸로 갈아타려면 뭐가 더 필요할까?
🏗️ 아키텍처 피드백 — Go + ClickHouse + Kafka 조합인데, 다르게 구성할 사람 있어?

