Andon Labs와 협력해 개발한 Drone-Bench는 AI 모델이 드론을 자율 조종하여 특정 인물을 탐지하고 추적할 수 있는지 측정하는 새로운 벤치마크입니다.
Anthropic과 Andon Labs
지난 한 해 동안 우리의 여러 연구 프로젝트는 프런티어 모델이 물리적 세계와 어떻게 상호작용하는지에 초점을 맞췄습니다. Project Vend에서는 AI 모델이 소규모 상점을 운영했고, Project Fetch는 디지털 모델과 물리적 사물을 잇는 중간자로서 로봇의 가능성을 초기 탐색한 프로젝트였습니다. 최근 Project Fetch: Phase two에서도 언급했듯, 모델의 기능은 이미 빠르게 향상되고 있으며, 기성 로봇을 활용하는 능력이 코딩 에이전트가 소프트웨어 도구를 다루는 수준에 근접하는 방향으로 나아가고 있습니다.
파트너사인 Andon Labs와 다시 손잡고, AI 모델이 비행 드론을 자율 조종하여 항공 감시에 활용되는 단순 탐지·추적 임무를 수행할 수 있는지 평가하는 새로운 데모 및 평가 시리즈를 개발했습니다. 이 작업의 결과물이 바로 새로운 벤치마크인 Drone-Bench입니다.
AI 모델이 인간이 할 수 있는 다양한 일을 폭넓게 수행하게 될 것이라고 우리는 예상합니다. 하드웨어, 특히 로봇을 조작하는 능력도 그 중 하나입니다. 이 능력이 갖춰지면 AI가 경제에 기여할 수 있는 영역이 크게 넓어지지만, 동시에 새로운 위험 영역도 열립니다. Anthropic이 프런티어 레드팀(Frontier Red Team)을 운영하는 핵심 이유 중 하나가 바로 이런 역량을 측정하는 데 있습니다. AI가 로봇을 자율적으로 조종할 수 있는 세계가 얼마나 가까이 와 있는지—그에 따른 혜택과 위험을 모두 포함하여—파악하기 위한 상황 인식이 필요하기 때문입니다. 특히 항공 드론은 손쉽게 구할 수 있고 전문가와 취미 사용자 모두 빈번하게 활용한다는 점에서 각별히 중요합니다. 농업에서는 작물 수확량을 높이는 데 쓰이고, 전쟁터에서는 적군을 표적으로 삼는 데 사용되기도 합니다. AI와 마찬가지로, 드론은 이중 용도(dual-use) 기술입니다. 두 기술의 교차점에 대해 더 확실한 근거를 마련하는 일이 무엇보다 중요합니다.
실제 비행 데모를 진행하고, 구성 요소인 세부 과제들을 재현 가능한 평가 형태로 분해함으로써, 지금까지 모델이 이뤄온 빠른 발전을 되돌아보고 가까운 미래의 역량을 예측할 수 있습니다. 이번에도 우리의 연구 결과는 기회와 위험이 함께 민주화되는 세계를 가리킵니다. 기술 개발자, 시민 사회, 정부가 효과적인 규범과 거버넌스 체계를 마련하기 위해 힘을 모아야 할 것입니다.
Project Fetch에서 다룬 핵심 과제—로봇 개가 비치볼을 가져오도록 하는 것—는 특별히 실용적이지도, 특별히 우려스럽지도 않은 작업이었습니다. 이번 프로젝트에서는 실질적인 활용 가치와 정책적 의미가 더 분명한 목표를 선택했습니다. 바로 항공 감시에 활용되는 단순 탐지·추적 임무입니다. 자동화된 인물 감지·추적 기능은 수색 및 구조, 재난 대응, 합법적인 공공 안전 활동 등 정당한 목적으로 쓰일 수 있습니다. 하지만 동시에, 정당한 권한을 가진 주체의 남용이나 책임지지 않는 개인·단체에 의한 악용 가능성도 존재하는 유형의 역량입니다. 이번 연구는 그런 점에서 AI 모델의 이중 용도적 특성을 더 직접적으로 반영하고 있습니다.
이번 실험에서는 AI 모델이 실내 오피스 환경에서 쿼드로터 드론을 조종하여 특정 인물을 탐지하고 추적하도록 했습니다.1 이 임무는 여러 복잡한 세부 과제를 요구합니다. AI 모델은 드론을 제어하는 방식을 체계화하고, 장애물이 산재한 실내 공간을 매핑하고 탐색하며, 참조 사진을 바탕으로 목표 인물을 찾아내고, 그 인물을 추적해야 합니다(시야에서 벗어날 경우 재포착도 필요합니다).
이 세부 과제들은 각각 이미 알려진 알고리즘으로 해결할 수 있습니다. 쉽지 않은 것은, AI 모델이 각 과제의 난점을 파악하고, 활용 가능한 기존 자원을 찾아내며, 기성 솔루션을 현재 상황에 맞게 응용하고, 임무를 실시간으로 수행하는 일입니다. 앞으로 살펴보겠지만, 개별 과제의 난이도와 과제들을 연결해 수행하는 것의 어려움은 다양한 수준의 모델을 구분하고 역량 향상 궤적을 그리기에 충분합니다.
Drone-Bench는 Andon Labs가 (Anthropic과 협의하여) 개발한 벤치마크로, AI 에이전트가 감시 임무에 드론을 활용할 수 있는지를 테스트합니다. Anthropic은 Drone-Bench에 접근 권한을 부여받지 않았으며, 여기서 소개하는 평가는 Andon Labs가 직접 진행했습니다.
먼저 Andon Labs는 핵심 목표—드론을 활용해 오피스 안에서 지정된 인물을 탐지하고 추적하기—를 다섯 가지 세부 과제로 분해했습니다. 이 과제들은 각각 필수적이며, 모두 합쳐지면 전체 목표를 달성하기에 충분합니다. 세부 과제는 다음과 같습니다:
다음으로, 이 실세계 과제들을 소프트웨어로 재현했습니다. 덕분에 매번 물리적 데모를 세팅하지 않고도 모델을 여러 차례, 훨씬 빠르게 테스트할 수 있었습니다. 이는 전적으로 물리적 실험으로 진행된 Project Fetch에 비해 개선된 점입니다.
의미 있는 성능 기준선을 마련하는 것도 중요했습니다. 인간 단독 기준선은 현대 소프트웨어 엔지니어링의 현실을 점점 반영하지 못하기 때문에, Andon은 코딩 에이전트와 협력하여 각 세부 과제의 알고리즘을 개발했습니다. 인간-AI 팀이 만들어낸 이 알고리즘들을 하나로 합쳐 엔드투엔드 성공을 시연했으며, 그 결과는 아래 영상에서 확인할 수 있습니다.
모델이 기준선을 충족하거나 초과하면 해당 과제를 완료한 것으로 간주합니다. 따라서 모델이 모든 과제를 완료할 수 있다면, Andon Labs 팀과 적어도 동등한 수준으로 이 감시 임무를 드론으로 자율 수행할 수 있다고 볼 수 있습니다.
더 자세한 내용은 Drone-Bench에 관한 Andon Labs의 포스트를 참고하세요.
이 평가의 기준선은 인간의 비보조 역량의 하한선도, 인간-AI가 본격적으로 협력했을 때 달성할 수 있는 상한선도 아닙니다. 오히려 현재 AI 전문가들(전업 로봇 공학자는 아닌)이 현실적인 최신 도구들을 활용해 이뤄낼 수 있는 수준을 나타냅니다. 핵심 질문은 모델이 사실상 자율적으로 작동하면서 이 합리적이고 현실적인 기준선을 안정적으로 넘어설 수 있는가, 그리고 언제 그 시점이 오는가입니다. 그 시점이 바로 인간 감독을 줄이려는 압력이 강해지는 때이며, 적절한 인간의 역할에 대해 활용 사례별로 신중하게 판단하는 일이 더욱 중요해집니다.
Andon은 세 개발사의 모델 총 15종을 테스트했습니다: GPT-4o, GPT-4o Nov, o1, o3, Claude Opus 4, Gemini 2.5 Pro, GPT-5, Gemini 3.1 Pro, Opus 4.5, GPT-5.2, Opus 4.7, GPT-5.5, Opus 4.8, Fable 5, GPT-5.6 Sol입니다. 전반적인 흐름을 보면, 신규 모델일수록 모든 세부 과제에서 점진적으로 더 나은 성과를 보입니다. 그중에서도 감지와 추적 과제에서 성과가 가장 높고, 재구성과 위치 파악 과제에서 가장 낮습니다.

가장 우수한 성능을 보인 모델은 Claude Fable 5로, 재구성을 제외한 모든 과제에서 프런티어가 기준선을 넘어섰습니다. 이후 실제 드론으로 전체 데모를 엔드투엔드로 수행하는 능력을 테스트했을 때, Fable 5는 감지와 추적 측면에서 기준선을 눈에 띄게 상회했습니다.
그러나 재구성 단계의 오류가 위치 파악과 경로 탐색에 누적되어, Fable 5는 실내 공간 간 자율 이동에 실패했습니다(아래 영상의 전반부에서 확인할 수 있습니다).
Fable 5가 실내 공간을 정확히 재구성하지 못한 것은 분명 큰 걸림돌입니다. 하지만 다른 단계들에서의 역량을 고려하면, 이것은 결국 마지막으로 남은 빈 조각에 불과합니다. 이 부분이 채워지는 순간, 엔드투엔드 성능 달성이 순식간에 현실화될 것입니다. 평가를 세부 과제로 분해하는 방식의 장점이 여기서 드러납니다. 불연속적인 도약처럼 보일 수 있는 것이 실제로는 필요하지만 충분하지는 않은 여러 세부 과제에서의 점진적 발전임을 미리 파악할 수 있어, 예상치 못한 결과를 방지하는 데 유리합니다.
세부 과제별 분석은 고무적인 신호도 드러냅니다. Fable 5의 제출물을 살펴보면, 모델이 최종 제출 전에 로컬 분석을 먼저 수행하는 경향이 눈에 띕니다. 한 제출에서는 모델이 시뮬레이션 영상을 분석해 드론 카메라의 외부 파라미터를 계산했는데, 바닥의 줄눈을 활용해 장면의 소실점을 역산하여 카메라 틸트를 실제 값에서 4도 이내로 추정했습니다. 그 과정은 아래에서 확인할 수 있습니다:

다른 실행에서는 Fable 5가 추적 과제 환경이 어떻게 생겼을 것이라 판단한 2D 탑뷰 재구성 지도를 직접 만들어, 제출 기회를 소모하기 전에 로컬에서 구현을 테스트하고 반복적으로 개선했습니다.
이 환경은 실제 환경(아래 참조)과 다르지만, Fable 5가 손쉽게 잡을 수 있는 버그들을 미리 발견하는 데 도움이 됐습니다!
모델이 기준 성능에 도달하는지 여부만큼, 얼마나 일관되게 도달하는지를 파악하는 것도 중요합니다. 이 부분에서는 개선의 여지가 분명합니다. 10회 시뮬레이션을 실행하면, 5개 과제 중 4개에서 적어도 한 번은 인간 기준선에 도달했습니다. 하지만 현재 프런티어 모델인 Fable 5조차 평균적으로는 5개 과제 중 3개에서만 인간 기준선에 도달합니다. 그 수준의 일관성이 갖춰지기까지, 처음으로 기준선을 일회성으로 초과한 시점에서 6개월이 걸렸습니다.

이번 실험은 이전 연구보다 복잡하고, 실제(또는 시뮬레이션) 오피스 환경은 탁 트인 창고보다 까다롭지만, 몇 가지 중요한 한계도 있습니다. 드론이 저속으로 이동했고, 한 가지 오피스 평면도와 제한된 수의 인원으로만 테스트했으며, Andon은 많은 군중이 있는 야외 환경 등 현실성을 높일 수 있는 다양한 조건을 테스트하지 않았습니다. 그럼에도 이번 파일럿은 모델 역량의 방향성에 대해 실질적인 신호를 제공한다고 판단합니다. 더 현실적이고 다양한 실험이 운용 역량을 평가하는 데 필요하겠지만, 이번 평가는 자율 표적화 및 추적을 위한 모델의 근본적인 성능과 신뢰성에 대해 의미 있는 정보를 제공합니다.
이번 실험은 상용 기성품(COTS) 하드웨어와 AI 맞춤형 소프트웨어가 유용하지만 잠재적으로 위험한 임무를 지원할 수 있다는 가능성을 보여줍니다.
에이전트 코딩에서 AI 모델이 소프트웨어를 사용하는 방식과, AI 모델이 하드웨어를 제어하는 방식 사이의 유사성을 진지하게 받아들일 필요가 있습니다. 에이전트 코딩 초창기에는 인간이 거의 모든 툴 호출을 승인했습니다. 하지만 불과 몇 달 만에, 모델은 최소한의 개입으로 장기적 과제를 수행하는 데 훨씬 더 높은 신뢰를 받게 됐습니다.
더 넓은 맥락에서, 역량과 신뢰성이 낮은 수준일 때는 인간을 루프 안에 두는 결정이 어렵지 않습니다. 모델의 역량을 보완하거나 비용이 큰 실수를 예방함으로써 시간과 자원을 절약해 주기 때문입니다. 그러나 모델이 역량과 신뢰성의 임계점(이번 실험에서 사용한 인간-AI 팀 기준선과 같은)을 넘어서면, 인간 감독을 안전장치가 아닌 비용으로 취급하려는 실질적인 압력이 생겨납니다. 그렇기 때문에 바로 이 결정들이 신중하게 내려져야 합니다. 특히 물리적 안전과 개인 정보 보호가 걸려 있고, 효율성만이 유일한 판단 기준이 되어서는 안 되는 이와 같은 영역에서는 더욱 그렇습니다. Anthropic이 오랫동안 주장해 온 것처럼, AI 정렬, 거버넌스, 안전에 대한 투자 요구는 역량의 규모에 따라 높아집니다. 로보틱스도 이 점에서 다른 분야와 다르지 않습니다. 물리적 안전과 개인 프라이버시가 직결된다는 점에서 오히려 더 큰 주의가 필요합니다.