Claude가 Anthropic 직원들의 고난도 로보틱스 작업을 얼마나 잘 지원할 수 있는지 최신 테스트 결과를 공개합니다. 인간의 도움 없이 단독으로 동작한 Claude Opus 4.7은, 채 1년이 되지 않은 시점에 참가자들이 수행했던 모든 과제에서 가장 빠른 인간 팀보다 약 20배 빠른 성과를 기록했습니다.
Michael Ilie, C. Daniel Freeman, Kevin K. Troy
2024년 8월, 우리는 로보틱스 전문가가 아닌 Anthropic 직원들이 시중에서 구할 수 있는 사족보행 로봇(이하 '로보독')으로 고난도의—그리고 꽤 재미있는—작업을 수행할 때 Claude가 얼마나 도움이 되는지 알아보는 실험을 진행했습니다. 이것이 바로 프로젝트 Fetch입니다. 당시 최신 모델이었던 Claude Opus 4.1을 활용한 팀은, 인터넷과 자신의 역량에만 의존해야 했던 팀에 비해 훨씬 뛰어난 성과를 거뒀습니다. Claude를 쓴 팀은 더 많은 것을 더 빠르게 해냈습니다.
실험을 위해 동료들을 창고로 데려가기 전, 우리는 Opus 4.1이 혼자서 해당 작업들을 완수할 수 있는지 먼저 확인했습니다. 결론은 단호하게 '불가'였습니다. Claude 없이 실험에 참가한 팀처럼, 모델 역시 로봇에 연결하는 첫 번째 단계부터 막혀버렸습니다.
하지만 AI 모델의 발전 속도는 놀랍도록 빠릅니다. 지난 8월 인간 팀을 향해 돌진할 뻔했던 그 통제 불능의 로보독보다도 더 빠르게 말입니다.
이제는 새로운 모델들이 이전 세대를 얼마나 뛰어넘었는지 확인해볼 때가 됐다고 판단해 프로젝트 Fetch를 다시 진행했습니다. 결과는 기대 이상이었습니다. 인간의 도움 없이 단독으로 동작한 Claude Opus 4.7은, 채 1년이 되지 않은 시점에 참가자들이 수행했던 모든 과제에서 가장 빠른 인간 팀보다 약 20배 빠른 성과를 기록했습니다.
이것이 LLM이 로보틱스 문제를 완전히 해결했다는 의미는 아닙니다. 아직 갈 길이 멉니다. 최신 Claude 모델도 로봇으로 비치볼을 정밀하게 이동시키는 작업, 즉 프로젝트 Fetch의 핵심인 '물어오기' 단계에서는 여전히 어려움을 겪었습니다. 또한 이번 실험의 어떤 과제도 특정 구동 정책(actuation policy) 개발과 같은 저수준(low-level) 로봇 제어의 더 복잡한 영역까지는 다루지 않았습니다. 그럼에도 우리는 반복되는 패턴을 목격하고 있습니다. 처음에는 모델이 인간을 돕고, 그다음에는 인간이 모델을 돕다가, 마침내 모델이 스스로 해낼 수 있게 되는 흐름입니다. 사이버보안 분야에서도 이미 이런 패턴이 나타났으며, 이제 AI와 물리적 세계가 맞닿는 지점에서도 같은 흐름이 시작되고 있습니다.
프로젝트 Fetch 1단계에서는 Anthropic 직원들을 팀으로 구성해(Claude 사용 여부는 무작위 배정) 다음 단계를 순서대로 수행하도록 했습니다. 제조사 제공 컨트롤러로 로보독 조작하기, 로보독의 영상 및 라이다 센서에 연결하기, 로보독을 수동 제어하는 프로그램 작성 및 실행하기, 로보독의 공간 이동 경로를 모니터링하는 방법 개발하기, 비치볼을 감지하는 프로그램 작성하기, 그리고 이 모든 것을 통합해 비치볼을 자율적으로 회수하는 시스템 구현하기.
이번 자율 동작 실험에서는 Claude에게 물리적 컨트롤러 조작을 요청할 수 없었고, Claude가 프로그래밍한 컨트롤러로 연구자가 비치볼을 실제로 회수하는 데 걸린 시간도 평가 대상에서 제외했습니다(다만 의도한 대로 동작하는지는 확인했습니다). 나머지 과제들에 대해서는 Claude Code에서 최대 노력 수준으로 설정한 적응형 사고(adaptive thinking)를 적용한 Opus 4.7로 세 차례씩 시험을 진행했습니다. 각 목표의 소요 시간을 측정하고, 모델의 성공 여부를 정성적으로 평가했습니다.
연구자의 역할은 Claude Code가 실행 중인 노트북을 로보독에 연결하고, 초기 프롬프트를 입력하며, 명령어를 승인하고, 다음 과제로 넘어가는 것을 허가하는 것으로 한정했습니다.
한마디로 정리하면 이렇습니다. 8월에 인간 팀 중 하나라도 완수한 모든 과제에서, Opus 4.7은 동일한 과제를 최소 10배 이상 빠르게 해냈습니다.1 양 팀이 모두 완수한 네 가지 과제만 놓고 보면, Opus 4.7은 Claude 미사용 팀보다 평균 37배 이상, Claude 사용 팀보다는 18배 이상 빨랐습니다.

이 표는 2단계에서 테스트한 모든 과제에 걸쳐, 기존 두 팀(Claude 사용 팀, Claude 미사용 팀)과 Opus 4.7의 속도를 비교한 것입니다.

인간 참가자들이 로봇 센서에 접근하는 방식을 놓고 여러 선택지 사이에서 갈팡질팡하는 동안, Opus 4.7은 최적의 경로를 빠르게 파악했습니다. 작성한 코드의 상당 부분이 첫 시도에 바로 작동했는데, 이는 1단계 실험에서 두 인간 팀 모두에게 해당되지 않았던 이야기입니다. Opus 4.7의 효율성은 생성한 코드 분량에서도 뚜렷하게 드러납니다. Claude 사용 팀보다 거의 10배 적은 코드로, 양 팀과 동등하거나 더 나은 성과를 달성했습니다.

Opus 4.7이 완벽하지는 않았습니다. 예를 들어 구식 객체 감지 알고리즘을 기본적으로 선택하는 경우가 있었습니다. 하지만 그런 상황에서도 이를 스스로 극복하고 효과적인 해결책에 도달했습니다.
모델이 완수한 단계들의 소요 시간에서는 과제 내 편차가 거의 없었습니다(절대적인 수치 기준). 다만 앞서 언급한 비최적 알고리즘 선택이 비치볼 감지 시험 중 하나의 소요 시간이 나머지보다 크게 길어진 원인으로 보입니다. 전반적으로, 이번 실험 과제 중 자신의 능력 범위 안에 있는 것들에 대해 Claude는 이제 매우 높은 신뢰성을 보입니다. (Claude가 아직 해내지 못하는 부분에 대한 분석은 다음 섹션을 참고하세요.)

이전 포스트에서도 강조했듯이, 이러한 발전은 로보틱스 역량을 집중적으로 향상시키려는 별도의 노력에서 비롯된 것이 아닙니다. LLM 발전사에서 수없이 반복됐듯, 이번 개선 역시 훨씬 더 범용적인 스케일링에서 자연스럽게 나타난 결과입니다.
인간 참가자들은 직접 컨트롤러를 손에 쥐고, 약간의 연습을 거친 뒤, 로보독으로 비치볼을 조금씩 밀어 로봇이 처음 출발했던 홈 베이스(가짜 잔디 패드)까지 부드럽게 가져오는 데 성공했습니다. 이를 위해서는 공이 경로에서 벗어났을 때 즉시 감지하고, 이전 명령과의 관계 속에서 오차를 파악하며, 현재 공의 위치를 확인한 뒤, 더 정밀한 제어를 위해 다음 입력을 어떻게 조정할지 결정해야 했습니다. 이는 인간이 특히 뛰어난 종류의 폐루프(closed loop) 제어입니다—물론 처음에는 실수를 하고 그로부터 배우는 과정을 거치지만 말입니다.
2단계 실험에서 Claude는 이 미묘한 제어를 포착하는 데 어려움을 겪었습니다. 자율 비치볼 회수 프로그램을 작성하는 단계까지 도달했던 인간 참가자들처럼, Claude도 로봇을 공 뒤로 이동시키고 공을 출발 지점으로 밀어낼 위치를 잡는 것까지는 가능했습니다. 하지만 실제 실행 과정은 제대로 제어되지 못했고, 인간 참가자들과 마찬가지로 성공하지 못했습니다.
1단계 참가자들보다 로보틱스 경험이 풍부한 연구원 한 명은 자율 회수 프로그래밍 과제를 실제로 완수해 냈습니다. 충분한 시간과 추가적인 스캐폴딩이 주어진다면, 현 세대의 Claude도 동일한 결과를 낼 가능성이 매우 높다고 생각합니다. 다만 우리가 다음으로 주목할 부분은, 모델이 프로젝트 Fetch의 다른 요소들에서 보여준 것과 같은 속도와 신뢰성으로 이 마지막 과제까지 해낼 수 있는가입니다.
1단계를 정리하면서 우리는 LLM이 로봇 사용 경험이 없는 비전문가에게 얼마나 큰 도움이 될 수 있는지를 강조했습니다. 이 점은 지금 더욱 분명해졌습니다. 이전에는 인간과 모델이 함께 페어 프로그래밍 방식으로 해결해야 했던 작업들을 모델이 훨씬 빠르게 단독으로 처리하게 됨으로써, 사람은 더 빨리 로봇을 제어하고 실제로 활용하는 단계로 넘어갈 수 있습니다. 그리고 일부 작업에서는, D패드를 (물리적으로) 쥔 인간 오퍼레이터가 여전히 AI 모델보다 뛰어날 수 있습니다.
흥미롭고 새로운 점은, 이제 모델이 시중의 물리적 도구를 상당한 수준으로 자유롭게 다루는 세계가 눈앞에 다가오고 있다는 것입니다—적어도 제한적인 용도에서는 말입니다. 이는 AI 모델이 더 에이전틱한 코딩으로 전환하면서 string-replace 같은 기존 소프트웨어 편집 도구를 활용하기 시작했던 것과 유사한 흐름입니다. 우리는 어쩌면 물리적 에이전틱 AI의 초기 시대로 접어들고 있는지도 모릅니다.
모델이 이러한 물리적 도구를 특정 목적에 맞게 더욱 정교하게 만들어낼 수 있는지—특정 작업에 맞는 제어 정책을 작성하거나 로봇 시스템을 직접 설계하는 것까지—를 이해하려면 추가적인 연구가 필요합니다. 물리적으로 유능하고 적응력 있는 언어 모델이라는 더 넓은 비전을 실현하는 데는 상당한 장벽이 있을 수도 있습니다. 하지만 우리가 목격해 왔듯이, 모델 역량의 격차는 생각보다 훨씬 빠르게 좁혀집니다. 모델이 자신만의 소프트웨어 도구를 직접 만드는 것은 얼마 전까지만 해도 황당한 이야기처럼 들렸겠지만, 지금은 현실이 됐습니다. 하드웨어 영역에서도 같은 궤적이 펼쳐질 가능성을 섣불리 배제하는 것은 현명하지 않습니다.