Anthropic의 Claude Fable 5가 Hebbia의 금융 특화 모델 평가에서 역대 최대 정확도 향상을 기록하며 기존 모델들을 앞질렀다.
Hebbia는 기관 금융의 엄격한 요구에 맞게 설계된 AI 플랫폼으로, 상위 50대 자산운용사 중 3분의 1 이상과 주요 투자은행, 로펌을 고객으로 두고 있습니다. 창립 멤버인 프로덕트 매니저 Divya Mehta는 근무 시간의 절반가량을 대형 투자은행, 사모펀드, 크레딧 고객과 함께 보냅니다.
이들 고객은 수천 페이지에 달하는 방대한 문서를 분석한 결과를 바탕으로 의사결정을 내립니다. 숫자 하나가 잘못되면 딜 전체의 결과가 뒤바뀔 수 있는 환경입니다.
투자 기회를 검토하는 뱅커나 투자자는 기업의 공시 자료, 신용 계약서, 내부 문서, CRM 데이터 같은 정형 데이터까지 의사결정에 영향을 미칠 수 있는 모든 데이터를 검토해야 합니다. Hebbia의 메타 프롬프팅(meta-prompting)은 자연어 요청을 프롬프트로 변환하고, Claude가 수백 개의 문서에 걸쳐 분석의 각 단계를 수행합니다. 각 답변은 Hebbia의 Matrix 그리드 내 개별 셀에 기록되어 완전한 투명성과 추적 가능성, 제어 가능성을 보장합니다.
이 답변들의 정확도를 대규모로 유지하는 일은 Adithya Ramanathan이 이끄는 Hebbia의 응용 AI 연구팀이 담당합니다. Ramanathan에게 이 작업의 핵심은 신호를 찾는 것입니다. 즉, 모델이 올바른 맥락에서 적절한 데이터를 참조해 고객이 알고 싶은 정보를 끌어내도록 하는 것입니다.
"올바른 데이터에 연결하고 적절한 생태계에 배치했을 때," Ramanathan은 말합니다. "그때 비로소 금융 전문가들이 실제로 추구하는 알파(alpha)를 얻을 수 있습니다."
이를 위해 새로운 모델이 나올 때마다 Hebbia의 금융 특화 벤치마크를 통해 기존 모델과 직접 비교 테스트를 진행합니다. 모델이 발전함에 따라 벤치마크의 측정 범위도 매 릴리스마다 확장됩니다. 이 벤치마크는 의도적으로 난이도를 높게 설계했습니다.
"기준이 극도로 높고, 고객들도 우리에게 그 높은 기준을 요구합니다. 당연한 일이죠," Mehta는 말합니다. "결국 고객들은 Hebbia에서 구축한 분석 결과와 최종 작업물을 기반으로 대규모 투자 결정을 내리니까요."

응용 AI 팀 연구원 Joe Renner는 금융 지식 근로자의 핵심 사용 사례를 재현한 일련의 테스트로 새로운 Claude 모델을 평가합니다. 테스트 중 하나는 금융 문서에 대한 질의응답 및 인용 출처 찾기를 다룹니다. 또 다른 테스트는 실제 고객이 수행하는 개방형 다중 출처 분석을 Hebbia의 에이전트 시스템과 채팅 제품 도구를 활용해 진행합니다.
Claude Fable 5는 Renner가 측정한 역대 최대 격차로 두 테스트를 모두 통과했습니다. 질의응답 및 인용 테스트에서는 금융 문서 대비 정확도가 약 20% 향상되었으며, 이는 Renner가 어떤 신규 모델에서도 본 적 없는 최고 수치입니다. 인용 일치율은 거의 동일하게 유지되었는데, Renner는 이 향상이 모델이 찾은 근거를 더 잘 이해하는 데서 비롯된다고 봅니다.
"결국 두 가지 근본적인 능력으로 귀결됩니다. 방대한 데이터에서 올바른 정보를 찾아내는 능력, 그리고 그것을 정확하게 종합하는 능력이죠," Divya는 말합니다. "기본적인 모델 역량처럼 보이지만, 금융 및 리서치 워크플로우에서는 엄청난 차이를 만들어냅니다." 에이전트 실행에서는 복합적인 요청의 모든 부분을 동시에 처리하며, 각 답변에 해당 출처를 정확히 인용했습니다.
Claude Fable 5는 더 넓은 분석 범위도 보여줬습니다. 개방형 분석에서는 더 광범위한 데이터를 바탕으로 추론해 팀이 주목할 만한 결론에 도달했습니다. Renner는 이를 모델이 긴 작업을 일관되게 처리하는 방식 덕분이라고 분석합니다. 요청의 모든 부분을 시야에 두고, 적절한 사실이 도출되도록 하위 에이전트와 도구를 활용하며, 각 주장을 추론이 아닌 출처에 근거해 뒷받침합니다.
고객에게 경쟁 우위를 제공하는 정보는 대부분 비정형 독점 문서에 담겨 있습니다.
이런 문서는 금융에서 이미 잘 다루는 정형 정량 데이터에 비해 대규모로 분석하기 훨씬 어렵습니다. Hebbia는 이 정성적 작업을 체계화하기 위해 Matrix를 구축했으며, 모델 세대가 거듭될수록 처리할 수 있는 범위도 넓어지고 있습니다.
수천 개의 문서가 담긴 데이터룸(data room)에서 관련 신호를 찾아 인용하고, 투자 메모의 각 섹션을 작성하는 작업이 그 예입니다. 또는 크레딧 딜과 관련된 모든 문서(신용 계약서, 수정 계약서, 사이드 레터 등 각각 수백 페이지에 달하는 기술적 문서들)를 분석해 비정형 자료에서 전체 약정 패키지, 재무 조건, 운영 제한 사항을 추출하는 작업이 될 수도 있습니다.
"사실 이런 종류의 문서는 Anthropic 모델이 항상 뛰어난 성능을 보여온 영역입니다," Mehta는 말합니다.
이전 Sonnet과 Opus 모델로도 Matrix는 신용 계약서의 약정(covenants), 즉 대출기관이 자신을 보호하기 위해 설정한 복잡한 조항들을 추출하고 종합할 수 있었습니다. Claude Fable 5와 함께 Hebbia는 이제 그 다음 단계까지 나아가고 있습니다. 약정에 대한 다단계 분석, 실시간 모니터링 데이터와의 비교, 리스크 플래깅(flagging)부터 약정 검토 초안 및 내부 메모 작성까지입니다. 약정 검토는 과거 크레딧 회사들이 외부 팀에 상당한 비용을 지불하며 수작업으로 생산해오던 결과물입니다.

Claude Fable 5 같은 모델이 이 작업을 처음부터 끝까지 수행할 수 있게 된 지금, 비교 기준은 대체되는 전문가 작업 시간이 되었습니다.
AI 이전에는 매니징 디렉터가 CEO 피칭용 덱이 필요할 때, 주니어 뱅커가 회사를 파악하고 재무 데이터를 수집해 슬라이드를 만드는 데 2~3일이 걸렸습니다. Opus 이전에는 초안 작성 기간이 12~24시간으로 단축됐고, Hebbia에서 초기 Opus 모델을 사용하면서는 처음부터 끝까지 약 하루 수준으로 더 줄었다고 Mehta는 말합니다. Hebbia는 이후 전체 작업을 Matrix로 체계화했습니다. 일련의 결정론적 에이전트 단계를 통해 여러 소스에서 데이터를 수집하고, 분석을 수행하며, 최종 덱과 재무 모델, 내부 리서치를 단 몇 분 만에 완성합니다. 덕분에 뱅커는 어떤 잠재 인수자를 공략하고 어떻게 포지셔닝할지에 집중할 수 있습니다. Claude Fable 5는 이를 한층 더 빠르게 만든다고 그녀는 덧붙입니다.
"모델이 아무리 뛰어나더라도" 작업을 단계별로 분해하는 것은 여전히 중요합니다. 어떤 문서가 분석에 투입되고 각 단계가 어떻게 구성되는지 회사가 직접 통제하길 원하기 때문입니다. 이에 Hebbia는 이러한 작업을 단일 모델 실행이 아닌, 더 작고 반복 가능하며 검증된 단계들로 구성하기 위해 Claude Agent SDK를 도입하고 있습니다.
"딜 사이클을 단축하면 투자 경쟁에서 회사의 역량에 엄청난 영향을 미칩니다," Mehta는 말합니다. 고객과의 대화에서도 이를 실감한다고 합니다. 2~3년 전만 해도 질문은 방어적이었습니다. 환각(hallucination)이 발생하는지, 계산이 맞는지를 물었습니다. "지금은 대화가 완전히 달라졌습니다. '워크플로우를 어떻게 더 자동화할 수 있나요? 더 많은 단계를 어떻게 연결할 수 있나요? 클릭 한 번으로 10개, 15개, 20개의 슬라이드 덱을 높은 정확도와 일관성으로 만들 수 있나요?'라고 묻습니다."
시작하기:Claude Fable 5.