인도 은행 명세서 PDF에서 거래 내역 표를 어떻게 추출하시나요? 오픈소스/온프레미스 방식을 찾습니다
How are you extracting transaction tables from Indian bank statement PDFs? Looking for open-source/on-prem approaches
핵심 요약
다양한 인도 은행의 PDF 명세서에서 거래 내역을 추출하기 위한 오픈소스 및 온프레미스 솔루션을 찾는 중입니다.
- 데이터 추출 난관 — 은행마다 다른 PDF 레이아웃과 비정형 데이터 구조로 인해 자동화에 어려움을 겪음
- 기술적 요구사항 — 데이터 보안을 위해 외부 API 대신 오픈소스 모델 및 온프레미스 환경 선호
- 추천 기술 스택 — Tesseract OCR, 로컬 LLM을 활용한 시맨틱 매핑 및 레이아웃 분석 기법 제안
- 데이터 검증 — 금액의 우측 정렬 특성을 활용한 열 식별 및 잔액 대조를 통한 정확도 확보
지금 NBFC에서 신용 심사 AI 에이전트 만드는 중인데, 파이프라인 첫 단계인 고객 은행 거래내역서 PDF에서 정보 추출하는 거 때문에 골머리 앓고 있다.
지금 여기서 꽉 막혀서 진도가 안 나가네.
인도 은행들(HDFC, ICICI, SBI, Axis, Kotak 등)마다 거래내역서 양식이 제각각이라 PDF 레이아웃이 완전히 다 달라.
내가 확실하게 뽑아내야 하는 정보는 이런 것들이야:
고객/계좌 정보 — 이름, 계좌번호, IFSC, 지점 등
거래 내역 테이블 — 날짜, 적요/설명, 출금, 입금, 잔액
여러 줄에 걸쳐 있는 거래 내역
페이지가 넘어가면서 테이블 헤더가 사라지는 경우
디지털로 생성된 PDF랑 스캔/이미지 기반 PDF 둘 다
가능하면 특정 은행 양식에 종속되지 않는 범용적인 솔루션이면 좋겠어.
pdfplumber, 테이블 추출 라이브러리, OCR, 정규식 파싱, LLM 기반 추출 같은 것들 다 시도해봤거나 고려해봤거든. 근데 가장 큰 문제는 텍스트를 제대로 추출해도 열/행 구조가 다 깨진다는 거야. 은행 PDF들이 실제 테이블 구조를 가진 게 아니라, 그냥 좌표값에 맞춰 텍스트를 뿌려놓은 수준이라 더 그래.
이게 금융/고객 데이터라 외부 API로 보내는 건 좀 껄끄럽고, 오픈소스나 온프레미스 솔루션을 선호해.
비슷한 거 만들어본 사람 있으면 좀 알려줘:
어떤 방식이 제일 효과적이었어?
특히 궁금한 건 이거야:
추천할 만한 PDF 파싱/레이아웃 라이브러리
스캔본 처리를 위한 OCR 모델
오픈소스 비전/문서 AI 모델
의미론적 열 매핑(semantic column mapping)에 LLM/VLM을 쓰는지
은행마다 일일이 규칙 안 짜고 다양한 양식을 처리하는 노하우
거래 내역 행을 감지하고 값을 올바른 열에 매핑하는 기술
추출한 데이터 검증 방식 (예: 잔액 대조, 입출금 확인, 거래 건수 체크 등)
혹시 인도 은행 거래내역서 다뤄본 적 있으면, 아키텍처나 라이브러리/모델, 아니면 삽질하면서 배운 점들 공유 좀 부탁해.
고맙다!


