BAM의 최고 AI 책임자와 이야기를 나눴습니다. 이 회사가 Claude Fable 5를 선택한 이유와, 최첨단 AI를 안전하고 안정적으로 도입하는 과정에서 안전장치가 어떤 역할을 하는지 들어봤습니다.
Balyasny Asset Management(BAM)은 약 380억 달러의 자산을 운용하며, 약 2,000명의 투자 전문가와 직원을 보유한 글로벌 멀티전략 투자회사입니다. 최고 AI 책임자 Charlie Flanagan은 Anthropic과의 인터뷰에서 수천 가지 실제 금융 업무를 통해 새로운 모델을 어떻게 평가하는지, 에이전트 실행을 위한 자체 플랫폼을 구축한 이유, 그리고 Claude Fable 5 출시 이후 달라진 점에 대해 이야기했습니다.
2026년은 AI 시스템이 '검색'에서 '실제 업무 수행'으로 전환된 해입니다.
핵심 변화는 모델 자체만이 아니라, Claude Code 같은 실행 환경(harness)에도 있었습니다. 이를 통해 저희가 구축한 AI 솔루션이 훨씬 복잡하고 오래 걸리는 작업도 처리할 수 있게 됐습니다. 프롬프트 대신 목표 결과물을 제시하면 AI가 완료될 때까지 스스로 작업을 이어가는 방식, 이것이 판도를 바꿨습니다.
구체적인 사례로 합병 차익거래(merger-arbitrage) 분석이 있습니다. 이제는 거래가 발표되면 에이전트가 초기 딜 분석 패키지를 직접 구성합니다. 거래 성사 가능성과 예상 소요 기간을 추정하고, 핵심 경제·법률 조건을 추출하며, 주요 조건과 마일스톤을 파악하고, 투자자의 판단이 필요한 사안을 짚어냅니다.
1년 전만 해도 이 과정은 수작업 리서치와 별도 도구들에 분산돼 있었고, 복잡한 다단계 워크플로우를 끝까지 안정적으로 실행해 실용적인 결론을 도출하는 에이전트가 없었습니다. 이 작업에 3~5일이 걸렸지만, 이제는 하루가 채 걸리지 않습니다. 에이전트가 약 30분 만에 실행을 완료하고, 이후 중요한 결과물을 활용하기 전에 담당자가 검토합니다.
저희는 Anthropic의 최첨단 모델을 사용하지만, 실행 환경, 데이터 접근, 검토 통제 등 대부분의 인프라는 BAM 내부에서 자체 구축합니다.
몇 년 전부터 탄탄한 평가 시스템에 투자해온 것이 지금까지 큰 도움이 됐습니다. 저희는 범용 벤치마크나 단편적인 데모에 의존하지 않고, 주식·거시경제·원자재 등 다양한 분야에 걸쳐 결과 검증이 가능한 수천 가지 실제 금융 업무로 신규 모델을 테스트합니다. 덕분에 모델 선택과 라우팅을 데이터 기반으로 결정할 수 있었으며, 모든 기업이 이 부분에 투자해야 한다고 생각합니다.
모델 단독 성능뿐 아니라, 실제 사용자와 동일한 도구·파일·요건을 갖춘 에이전트 환경에서의 성능도 함께 테스트합니다. 작업을 계획하고, 적절한 도구를 선택·활용하며, 근거를 찾아 분석하고, 오류에서 복구하고, 중간 결과를 점검하며, 근거 있는 결과물을 도출할 수 있는지 확인합니다. 수치 오류, 누락 항목, 근거 없는 결론, 검색 오류 같은 특정 실패 유형도 점검합니다.
관련 과제를 대상으로 한 평가에서 Fable은 수천 건의 테스트 기준 89.4%를 기록하며, 기존 프로덕션 모델의 86.1%를 넘어섰습니다. 특히 복잡한 계획 수립, 분석, 에이전트 실행 영역에서 두드러졌습니다.
놀라운 결과도 있었습니다. 오랫동안 테스트해왔지만 어떤 모델도 완수하지 못했던 경제학 문제들을, Fable이 처음으로 해결해낸 것입니다. 저희가 테스트한 모든 모델 대비 눈에 띄는 성능 향상이었기에, 처음에는 평가 오류가 아닌지 의심했습니다. 평가를 재실행하고, 과제와 채점 로직을 독립적으로 검토했으며, Anthropic과 함께 결과를 확인한 끝에 실제 성능 향상임을 결론 내렸습니다. 정말 놀라운 순간이었습니다.
현재 투자 팀들은 체계적인 업무와 코딩 작업에 Fable을 주력 최첨단 모델로 활용하고 있습니다. 효율성과 비용을 고려해 Fable과 다른 모델 중 어떤 상황에서 무엇을 써야 할지 가이드라인을 제공하고 있습니다.
저희는 안전을 모델 선택 시 한 번 고민하고 끝나는 문제가 아니라, 제품과 운영 모델 차원의 지속적인 과제로 봅니다. 핵심 질문은 모델이 무엇을 할 수 있는가에서 그치지 않습니다. 어떤 데이터에 접근할 수 있는지, 어떤 도구를 사용할 수 있는지, 어떤 행동을 취할 수 있는지, 무엇은 반드시 사람의 승인이 필요한지, 문제가 생겼을 때 어떻게 감지할 것인지도 함께 고려합니다.
모델 자체가 통제 수단이라고 전제하는 대신, 모델 주변에 통제 장치를 마련한다는 의미입니다. 승인된 데이터 경계, 최소 권한 접근(least-privilege access), 도구 수준의 권한 관리, 로깅과 추적 가능성, 중요 결과물에 대한 사람의 검토, 예외 상황에 대한 명확한 에스컬레이션 경로를 활용합니다. 또한 접근 범위를 확대하기 전에 반드시 악의적 시나리오와 장애 시나리오를 테스트합니다.
이러한 통제 장치는 처음부터 최우선 과제였으며, Fable 도입으로 보안 기조가 근본적으로 바뀌지는 않았습니다. 모델이 더 뛰어난 추론과 계획 능력을 갖췄다고 해서 더 넓은 권한이 주어지지는 않습니다. 모델은 해당 사용자와 작업에 승인된 도구와 데이터 소스만 사용할 수 있으며, 스스로 접근 권한을 확장할 수 없습니다. 투자 판단과 책임은 여전히 사람에게 있습니다.
앞으로의 방향은 더 복잡한 다단계 작업을 장시간 수행할 수 있는 에이전트로 나아가는 것입니다. 이는 거버넌스의 중요성을 낮추는 게 아니라 오히려 높입니다. 저희에게 그 답이 BAMAgent입니다. 에이전트를 승인된 기업 워크플로우에 안전하게 배포하기 위한 내부 플랫폼으로, 에이전트에게 필요한 도구와 시스템을 제공하되, 그것만을 제공합니다. 6개월째 구축해온 이 플랫폼은 현재 수천 개의 자율 에이전트가 24시간 7일 내내 작동하는 것을 지원합니다.
BAMAgent는 기존 채팅 플랫폼의 다음 단계입니다. 채팅이 정보를 받아들이고 정리하는 데 도움을 준다면, BAMAgent는 실제 업무를 수행합니다. 에이전트들이 병렬로 작동하며 몇 시간 또는 며칠에 걸친 다단계 리서치·분석을 진행하고, 최종적으로 사람이 검토할 수 있는 결과물을 만들어냅니다. 회사 리서치 패키지를 구축·유지하거나, 실적 발표 혹은 거시경제 이벤트를 준비하거나, 새로운 근거를 금융 시나리오로 변환하는 작업도 처리합니다. 에이전트는 작업을 계획하고, 승인된 내부 시스템을 활용해 분석을 실행하고, 중간 결과를 점검한 뒤, 리서치 결과물·모델·의사결정 지원 패키지를 반환합니다.
Fable은 계획 수립과 분석 단계에서 저희의 선호 모델입니다. 이 단계에서의 실수는 이후 모든 결과물에 영향을 미치기 때문에, 문제를 어떻게 분해할지, 어떤 근거가 중요한지, 상충하는 신호를 어떻게 조율할지 판단하는 데 가장 뛰어난 모델을 쓰고자 합니다. 그래야 에이전트가 유능한 동료처럼 일할 수 있습니다.
모든 기업이 기업 차원의 관리와 통제를 유지하면서도 사용자에게 에이전트의 효용을 최대한 제공할 수 있는 호스팅 에이전트 모델로의 전환 전략을 수립해야 합니다.
반응은 굉장히 긍정적이었습니다. 결국 사람들이 관심을 갖는 건 이 기술이 일상 업무에서 무엇을 가능하게 해주느냐입니다.
한 사례로, BAMAgent가 세금 손실 수확(tax-loss harvesting) 분석을 수행했습니다. 9만 개의 데이터베이스 테이블을 탐색해 관련 뮤추얼 펀드 보유 데이터를 찾아내고, 자체적인 가중치 시스템을 구축했습니다. 저희 팀의 검토를 거친 결과물은 기존 방식보다 훨씬 포괄적이었습니다.
또 다른 사례로, 수석 이코노미스트가 에이전트 워크플로우를 구성해 반복적인 중앙은행 분석 작업을 약 이틀에서 약 30분으로 단축했으며, 검토와 판단은 이코노미스트가 직접 맡습니다.
Fable은 추론, 종합, 다단계 문제 해결을 담당하고, BAM의 실행 환경은 워크플로우 설계, 승인된 데이터·도구 접근, 검색 컨텍스트, 권한 관리, 모니터링, 사람의 검토 통제를 제공합니다. 프로덕션 수준의 결과를 위해서는 양쪽 모두 필요합니다.
올해는 사람들이 도구를 갖는 시대에서 팀원을 갖는 시대로 전환되는 해입니다. 팀원처럼, 에이전트도 함께 일하면서 더 복잡한 작업을 수행하고, 나아가 선제적으로 도움이 되는 업무를 처리하는 방향으로 발전할 것입니다.
이미 일부 팀은 300개 이상의 에이전트를 운용하며 새로운 데이터와 정보를 끊임없이 분석하고 있습니다. 덕분에 팀들은 인사이트를 더 빠르게 얻으면서도 중요한 것을 놓치지 않을 수 있습니다.
이는 저희가 던지는 질문 자체를 바꿔놓기도 합니다. 과거에는 전문가 시스템을 구축하고, 기존 프로세스를 자동화하는 방법을 사람들에게 가르쳤습니다. 이제는 목표 결과에 더 나은 방법이 있는지를 먼저 묻습니다.
한계는 오직 우리의 상상력뿐입니다. 도구와 데이터, 모델은 이제 몇 시간이고 실제 업무를 수행할 수 있는 수준에 이르렀습니다. 무엇이 가능한지 계속해서 재정의하는 것은 우리의 몫입니다. 앞으로 12개월이 정말 기대됩니다.
Claude Fable로 시작하기.