Ora는 Vercel 위에 에이전트 벤치마킹(benchmarking) 플랫폼을 구축했습니다. 이 플랫폼은 Claude Code, ChatGPT, Gemini, eve를 실제 웹사이트에 직접 실행해 각 에이전트가 어디서 실패하는지 찾아냅니다. 16명의 팀이 eve를 활용해 하루 수백 개의 커밋을 배포하며 플랫폼을 운영 중입니다.
프론트엔드, 백엔드, 에이전트 런타임을 하나의 플랫폼에서
주요 에이전트를 실제 사이트에서 나란히 테스트
16명 엔지니어링 팀이 하루 수백 개의 커밋을 배포
Ora는 실제 웹사이트에 에이전트를 투입해 제품에 가입하고, 연동하고, 결제하는 작업을 수행하게 합니다. 에이전트는 자주 실패하며, Ora의 추산에 따르면 웹의 99%는 아직 에이전트를 받아들일 준비가 되어 있지 않습니다. 이 플랫폼은 고객에게 에이전트가 어디서, 왜 실패하는지, 그리고 무엇을 바꿔야 하는지 보여줍니다.
Ora 공동창업자 Assaf Elovic은 수년간 에이전트가 웹을 탐색하도록 돕는 일을 해왔습니다. 그의 이전 회사 Tavily는 AI 에이전트를 위한 웹 검색 엔진을 구축했으며, 올해 초 Nebius에 인수되었습니다. 검색은 문제의 절반을 해결했지만, 제품을 찾아낸 에이전트가 실제로 그것을 사용하려면 또 다른 과제가 남습니다. 그와 공동창업자 Liad Yosef는 웹이 에이전트를 얼마나 잘 받아들일 수 있는지 측정하고, 준비되지 않은 부분을 개선하기 위해 Ora를 창업했습니다.
현재 Ora는 journey.ora.ai에서 고객의 실제 사이트에 에이전트를 투입해 저니(journey)를 실행하고, 에이전트가 작업을 완료하는 데 드는 비용·지연 시간·단계 수를 기록합니다. 에이전트 런타임을 포함한 플랫폼 전체가 Vercel 위에서 실행됩니다.
에이전트는 두 가지 요소로 구성됩니다. 추론을 담당하는 모델(model)과, 모델에 도구를 제공하고 단계별로 실행을 이끄는 소프트웨어인 하네스(harness)입니다. Ora가 지원하는 에이전트 라인업은 고객이 가장 많이 사용하는 Claude Code, ChatGPT, Gemini, Hermes, OpenClaw, 그리고 Vercel의 에이전트 프레임워크 eve입니다. Ora는 각 에이전트를 고객 웹사이트에서 실행하며 일반적인 워크플로를 어떻게 처리하는지 관찰합니다.
하네스마다 원하는 인프라가 다릅니다. 각 하네스는 고유한 실행 환경을 요구하고 단계를 노출하는 방식도 제각각이기 때문에, Ora는 하네스별로 별도의 런타임을 실행하고 모든 단계를 추적합니다. Ora의 엔지니어링 리더 Ido Finder는 이 나란히 비교하는 방식이 Ora가 고객에게 제공하는 가장 가치 있는 것 중 하나라고 말합니다.
에이전트가 가입 흐름에서 멈추면, 고객은 어느 단계에서 무엇을 시도했는지 확인할 수 있습니다. 추적 정보 없이는 결과가 그저 숫자에 불과합니다.
Ora는 이 테스트 시스템을 전적으로 Vercel 위에 구축했습니다. 프론트엔드, 백엔드, 에이전트 런타임이 동일한 배포 경로, 로그, 인증을 공유합니다. 에이전트 런타임은 별도로 운영해야 할 인프라가 아니라, 나머지 제품과 함께 동일한 공간에 존재합니다.
Vercel이 eve를 출시했을 때, Ora는 eve를 특별 취급하지 않았습니다. eve는 라인업의 다른 하네스와 동일한 조건에서 동일한 벤치마크를 거쳤습니다. Ora는 Vercel 엔지니어링과 디자인 파트너로 협력하고 있으며, Finder는 eve 팀에게 플랫폼에 직접 접근해 결과를 살펴볼 수 있는 권한을 제공했습니다.
첫 테스트에서는 여러 도메인의 실제 저니 수백 건을 대상으로 eve와 Claude Code를 비교했습니다. 두 하네스 모두 동일한 모델인 Claude Fable 5와 Haiku 4.5를 사용했으며, 매 실행마다 에이전트에게 동일한 과제를 부여했습니다. 바로 제품과 연동하는 것입니다.
Ora는 이 비교에서 세 가지 수치를 공개했습니다:
목표 달성에 필요한 단계 7% 감소
네이티브 성공률 2배: 웹 검색으로 우회하지 않고 고객의 자체 사이트에서 완료한 작업이 두 배 더 많음
유효 엔드포인트 9% 증가: 에이전트가 찾아낸 엔드포인트 중 실제로 호출 가능한 것의 비율이 더 높음
벤치마크 결과는 eve 개선에도 직접 반영되었습니다. 한 번의 실행에서 프롬프트 캐싱 문제가 발견되었고, eve 팀이 수정 사항을 배포했습니다. 이후 Ora의 다음 테스트 결과에서는 총 비용이 약 15% 낮아진 것으로 측정되었습니다.
주요 하네스를 전문적으로 벤치마킹하는 회사에게 이 선택은 결코 가볍지 않습니다. 바로 이 결과를 바탕으로 Ora는 eve 위에 서비스를 구축합니다.
eve는 Next.js 패러다임을 따르기 때문에 설정할 것이 거의 없으며, 도구·스킬·커넥터를 구현하는 코드도 간결합니다. 최종적으로 결정을 굳힌 기능은 샌드박스 오버라이드(sandbox override)였습니다. eve 같은 에이전트 프레임워크는 자체 샌드박스를 제공합니다. 이 샌드박스는 에이전트가 실행되고, 도구를 사용하고, 파일을 처리하는 격리된 환경입니다. 대부분의 팀에게는 안전한 실행 환경을 별도 설정 없이 사용할 수 있다는 점에서 좋은 기본값입니다. 그러나 프레임워크 자체 샌드박스에서 실행되는 에이전트는, Ora가 모든 단계를 추적하는 계측 환경 바깥에서 동작하게 됩니다. 오버라이드를 통해 팀은 해당 환경을 직접 교체할 수 있어, 별도의 추가 구현 없이도 eve 에이전트를 다른 하네스와 동일하게 기록할 수 있습니다.
이제 Journey.ora.ai 에는 eve가 양쪽에 모두 존재합니다. eve는 테스트 대상 하네스 중 하나이면서, 동시에 플랫폼 자체를 구동하는 프레임워크이기도 합니다.
엔지니어링 팀은 16명이 하루 수백 개의 커밋을 배포하며, 일상적인 인프라 작업은 코딩 에이전트가 담당합니다. 모든 것이 한 곳에 모인 스택 덕분에 에이전트가 처음부터 끝까지 작업을 실행할 수 있습니다.
Finder는 이를 통해 주당 최소 몇 시간을 절약한다고 말합니다. Elovic은 비슷한 시간이 Vercel 라이브러리와의 높은 호환성 덕분에 절약된다고 평가합니다.
Ora는 더 많은 제품을 추가하고 있으며, 아키텍처도 함께 성장하고 있습니다. 팀은 플랫폼을 마이크로서비스로 분리하는 중이며, 모두 Vercel 위에 올라갑니다. 새 서비스는 동일한 인프라에 배포되며 별도 설정 없이 서로 통신하고, eve 위에 구축된 내부 에이전트도 하나의 서비스로 운영됩니다.
Ora의 자체 기준으로 볼 때, 가입하고 연동하고 결제하러 온 에이전트를 웹의 99%는 아직 받아들이지 못합니다.
Ora 소개: Ora는 웹을 에이전트 친화적으로 만듭니다. 기업들은 Ora를 통해 AI 에이전트가 자사 웹사이트를 얼마나 잘 탐색하고 상호작용하는지 벤치마킹하고, 에이전트가 제품을 찾고 사용하고 거래할 수 있는 인프라를 구축합니다.