문서 추론 API를 만들었습니다 — 에이전트 개발자들의 실제 고충을 해결할 수 있을지 궁금합니다
We built a document reasoning API — curious if it solves a real pain for agent devs
핵심 요약
문서 내 데이터 검증과 추론을 자동화하는 API를 개발하여 에이전트 개발자들의 피드백을 구하는 글입니다.
- 문서 추론 API — 단순 추출을 넘어 계산, 검증, 교차 참조를 수행함
- 기술 스택 통합 — 파싱, 샌드박스 계산, OCR, 재시도 로직을 단일 API로 구현
- 데이터 검증 기능 — LLM의 암산 대신 샌드박스 환경에서 정확한 계산 및 근거 제시
- 개발자 피드백 요청 — 기존의 PDF 컨텍스트 주입 방식 대비 실질적인 효용성 확인
저는 The Drive AI의 창립자입니다. 저희는 자체 에이전트들이 단순히 필드를 추출하는 것을 넘어 문서를 추론하고, 답을 계산하며, 숫자를 검증하고, 섹션 간의 내용을 교차 참조해야 했기 때문에 내부적으로 이 API를 만들었습니다.
저희는 pdfplumber를 이용한 파싱, 수학 계산을 위한 샌드박스, 스캔 문서를 위한 tesseract, 도구 사용 루프, 재시도 로직 등 동일한 파이프라인을 계속해서 다시 구축해야 했습니다. 결국 이를 단일 API 호출 형태로 제품화했습니다.
파일과 함께 무엇을 파악해야 하는지 설명하는 스키마를 보내면 됩니다:
result = client.analyze(
file="invoice.pdf",
schema={
"math_checks_out": {"type": "boolean", "description": "Do line items sum to total?"},
"growth_rate": {"type": "number", "description": "YoY revenue growth"},
"still_active": {"type": "boolean", "description": "Is this contract currently in effect?"},
}
)
이 API는 문서를 탐색하고, 샌드박스에서 답을 계산하며(LLM의 암산이 아님), 추론 과정과 인용 근거를 반환합니다. 스캔된 문서와 웹사이트를 포함하여 107개 이상의 형식에서 작동합니다.
진심으로 궁금한 점이 있습니다. 여기 계신 에이전트 개발자분들은 이런 종류의 추론을 위해 커스텀 문서 도구를 만들고 계신가요, 아니면 그냥 PDF를 컨텍스트에 때려 넣고 계신가요? 이게 정말 고충인가요, 아니면 기존 솔루션들로 충분한가요?
관심 있으신 분들을 위해 무료 티어를 열어두었습니다: https://dev.thedrive.ai


