Anthropic이 Claude를 데이터 웨어하우스에 직접 연결하는 건 안 된다고 확인해 줬네요. 다들 프로덕션 에이전트 분석은 어떻게 하고 계신가요?
Anthropic just confirmed pointing Claude at a warehouse doesn't work. What are folks here doing differently for production agentic analytics?
핵심 요약
Anthropic의 에이전트 분석 가이드라인을 바탕으로, 실제 프로덕션 환경에서 데이터 유지보수와 정확도를 어떻게 관리하는지 묻는 글입니다.
- 에이전트 분석 한계 — 데이터 웨어하우스에 직접 연결 시 정확도 저하 발생
- 유지보수 핵심 — 스킬 파일과 시맨틱 레이어 도입으로 정확도 개선
- 실무 고민 — 스킬 레이어 유지보수 비용과 인간의 검토 루프 필요성
- 현장 경험 공유 — 데이터 스키마 설명 최적화와 데이터 구조화의 중요성
Anthropic이 내부 팀에서 셀프 서비스 분석을 위해 Claude를 어떻게 사용하는지에 대한 새 게시물을 정독 중입니다. 그 안에 핵심적인 내용이 담긴 문장이 하나 있더군요. Claude를 데이터 웨어하우스에 직접 연결하고 에이전트가 실행하게 두는 것은 "정확도에 대한 잘못된 확신을 심어줄 수 있다"는 내용입니다.
나머지 내용은 그 문제를 해결하기 위해 그들이 구축한 4계층 스택에 대해 설명합니다. 표준 데이터셋, 시맨틱 레이어 강제 적용, 도메인별 스킬 파일, 그리고 중요한 쿼리에 대한 적대적 검토 과정이죠. 스킬 파일이 없으면 내부 정확도는 21%에 머물지만, 적용하면 95%까지 올라갑니다. 하지만 능동적인 유지보수가 없으면 한 달 만에 다시 65%로 떨어지죠.
여기서 프로덕션 환경의 에이전트 분석 스택을 운영 중인 분들께 묻습니다:
Anthropic이 필요하다고 암시하는 수준의 주기로 스킬/컨텍스트 레이어를 실제로 유지보수하고 계신가요, 아니면 데이터가 썩지 않게 유지할 더 저렴한 방법을 찾으셨나요?
LLM이 초안을 작성한 정의를 인간의 검토 루프에 태우고 계신가요, 아니면 모두가 수동 작성만 고수하고 계신가요?
50명 규모의 데이터 조직이 없는 팀을 위해 Anthropic이 무엇을 잘했고 무엇을 잘못했는지 분석한 이 분석글은 제가 현장에서 계속 보는 내용과 일치합니다. 하지만 다른 분들이 실제로 이 유지보수 격차를 어떻게 메우고 있는지 궁금합니다.
현재 프로덕션에 스택을 운영 중이라면, 실제로 가장 먼저 고장 나는 부분은 어디인가요?


