Claude가 N=4 super-Yang-Mills 이론에서 9루프 진폭을 계산해냈다
이 기고문에서 물리학자이자 과학 저술가인 Matt von Hippel은 이론물리학의 자신의 옛 세부 분야와 관련해 AI 기업들에게 도전 과제를 던진 후 어떤 일이 벌어졌는지를 이야기한다.

도전 과제를 던진 지 한 달 만에 그것이 해결되는 광경을 목격하는 일은 흔치 않다. 하지만 우리는 지금 예사롭지 않은 시대를 살고 있다.
자기소개를 하자면, 나는 Matt von Hippel이다. 한때는 이론물리학자였고, 지금은 과학 저술가로 활동하고 있다. 그 내내 블로거로서 4gravitons.com에 물리학과 물리학을 연구하는 사람들에 대한 글을 매주 써왔다.
물리학 블로그를 쓰다 보면 점점 더 AI 이야기를 하게 된다. 문제는 내가 AI 전문가가 아니라는 점이다. 물론 어느 정도 건드려보긴 했다. 아마 웬만한 사람들보다는 좀 더 알겠지만, 결국 한발 물러서서 전문가들을 믿을 수밖에 없다. 그런데 답답하게도 전문가들의 의견이 엇갈린다. 지식과 경험을 갖춘 이들 중에는 AI가 몇 년 안에 초지능에 도달할 것이고, 그 초지능은 정말이지 섬뜩한 일을 해낼 것이라고 확신하는 사람들이 있다. 반면 똑같이 식견 있는 이들 중에는 LLM 기반 AI가 이미 한계에 다다랐으며, Claude 같은 모델이 물리학에서 인상적인 성과를 내기는커녕 세상을 정복하는 일도 없을 것이라고 자신하는 사람들도 있다.
나는 섣불리 예측을 내리길 꺼려왔다. 의견을 정하기 전에, 내가 직접 비슷한 작업을 해봤기에 얼마나 어려운지 알고 있는 익숙한 문제에서 LLM이 진전을 이뤄내는 것을 보고 싶었다.
거기에 더해, 계산 측면에서 어렵다고 예상되는 작업을 LLM이 해내는 것도 보고 싶었다. LLM이 수학에서 눈부신 진전을 이루고 있는 것은 분명하고, 이번 달만 해도 많은 이들의 생각이 바뀌었을 것이다. 하지만 수학의 진보는 새로운 아이디어에서 나오는데, 아이디어란 신비로운 것이어서 찾기 전까지는 얼마나 어려운지 알 수가 없다. 반면 계산은 좀 더 단단한 기준이 될 것 같았다. 연구자들이 원리적으로 방법을 모르기 때문이 아니라, 현실적으로 감당할 수 있는 것보다 훨씬 많은 컴퓨터 자원과 시간이 필요하기 때문에 손에 닿지 않는 것처럼 보이는 문제를 LLM이 정면으로 돌파하는 장면을 보고 싶었다. 더 영리한 인공 연구자가 같은 컴퓨터 자원으로도 그 문제를 풀어낼 수 있는지, 즉 연구자들의 판단이 틀린 것인지 확인하고 싶었다.
그래서 나는 도전 과제를 던졌다.
"AI 기업들이 나 같은 사람들에게 감명을 주고 싶다면(혹은 겁을 주고 싶다면), 내 옛 분야에 도전해야 한다. 학계 연구자가 쓸 수 있는 수준의 컴퓨터 자원으로 AI가 산란 진폭(scattering amplitudes) 분야의 주요 미해결 문제를 풀어낼 수 있음을 보여달라. 모두가 걸림돌이 될 것이라 예상했던 계산 한계가 실제로는 문제가 되지 않음을 증명해달라. N=8 초중력(supergravity)의 7루프, 혹은 N=4 super Yang-Mills의 9루프를 내놓아라."
한마디로, AI가 내 옛 세부 분야인 이론 입자물리학의 최전선 문제를 풀 수 있을까? 그것도 합리적인 예산으로?
내가 몸담았던 분야는 진폭론(amplitudeology)이라 불리는 이론 입자물리학의 한 갈래다. 다른 입자물리학자들이 새로운 입자를 예측할 때, 그 예측을 검증하기 위한 계산이 가능한지 반드시 확인해야 한다. 그들이 계산하는 것이 바로 산란 진폭이라는 공식이다. 이 공식을 이용하면 아원자 입자들의 운동량과 에너지로부터 특정 방식으로 반응할 확률을 계산할 수 있다. 이런 반응에 대해 더 정밀한 예측을 내릴 수 있다면, 대형 강입자 충돌기(Large Hadron Collider) 같은 실험 결과가 그 예측과 일치하는지 대조해볼 수 있다. 불일치가 발견된다면 새로운 이론의 증거가 될 수 있고, 그 이론은 암흑 물질의 본질이나 우주에서 물질과 반물질의 비대칭 같은 물리학의 오래된 수수께끼들을 설명할 실마리가 될 수 있다.
산란 진폭 공식은 계산하기 어렵기로 악명 높아, 물리학자들은 대부분 근사를 사용한다. 부분 계산을 수행하되, 특정 "루프" 수에서 멈추는 방식이다. 루프는 입자 간 상호작용이 얼마나 복잡해질 수 있는지를 나타내는 척도다. 계산에 포함되는 루프 수가 많을수록 실제 답에 가까워지지만, 계산의 난이도도 그만큼 높아진다.
실제로 대부분의 산란 진폭 공식은 2루프까지만 계산되어 있다. 3루프까지 계산된 경우는 소수에 불과하다. 아마 들어본 적 있을 입자물리학의 가장 정밀한 예측도 5루프를 사용했다.
진폭론 연구자들은 더 높은 수준을 목표로 한다. 새로운 실험적 기법을 개발하고, 장난감 모형(toy model) 이론으로 이를 검증한다. 실제 세계의 더 복잡한 입자들이 아닌, 계산이 비교적 쉬운 장난감 모형으로 먼저 시도해봄으로써 새로운 방법이 어디까지 통하는지 확인하는 것이다.
나는 두 가지 장난감 모형에 대한 도전 과제를 제시했다. Anthropic이 선택한 과제는 N=4 super Yang-Mills라는 장난감 모형 이론에서 9루프까지 계산하는 것이었다.
"Yang-Mills"는 우리 주변 세계의 대부분을 설명하는 이론 유형의 기술적 명칭이다. 자연의 네 가지 기본 힘 중 세 가지, 즉 전자기력, 원자핵을 결속시키는 강한 핵력, 바나나 같은 물질의 방사성 붕괴를 일으키는 약한 핵력이 모두 Yang-Mills 이론에 해당한다.
"N=4 super"는 초대칭(supersymmetry)에서 비롯된다. 물리학자들은 각 입자에 같은 전하를 지니되 다른 유형인 '초대칭 파트너'가 존재한다고 추측해왔다. 즉 전자 같은 물질 입자와 광자 같은 힘 입자가 서로 짝을 이룬다는 것이다. 한때 이 파트너 입자들이 암흑 물질을 설명할 수 있으리라는 낙관적인 기대도 있었는데, 그 이론이 바로 "N=1" 초대칭이다. "N=4"에서는 각 입자가 파트너를 단 하나가 아닌 네 개 갖는다.
입자 수가 이렇게 많다 보니 이 이론은 현실과 동떨어진 비현실적인 모형이다. N=4 super Yang-Mills는 암흑 물질의 설명으로도, 현실 세계의 어떤 현상의 설명으로도 쓰이지 않는다. 대신 진폭론 연구자들이 기법을 연마하는 용도로 활용하는데, 역설적으로 N=4가 계산하기 더 쉽기 때문이다. 서로 다른 입자들 사이의 섬세한 균형 덕분에 필요한 변수 조합이 제한되어 계산이 단순해진다.
나는 박사 과정에서 3루프 진폭 계산에 참여했고, 한창때는 7루프까지 연구했다. SLAC 국립 가속기 연구소의 교수인 Lance Dixon은 이 분야를 초창기부터 이끌어온 연구자 중 한 명으로, 몇 년 전 8루프 계산에 성공했다.
이 계산들은 부트스트랩(bootstrap)이라 불리는 실험적 기법으로 수행되었는데, 이 기법이 묘하게도 AI 활용에 잘 들어맞는다. 부트스트랩으로 진폭을 계산할 때는 가능한 모든 입자 상호작용을 일일이 따질 필요가 없다. 답이 대략 어떤 형태여야 하는지만 파악하면 된다. 특수한 기호 체계로 구성된 컴퓨터 파일에 모든 가능성을 기록해두고, 알려진 모든 것을 하나씩 점검해 나간다. 다른 계산 기법의 예측값, 답이 반드시 따라야 하는 규칙, 답을 구하기 더 쉬웠던 연관 문제들과의 연결고리가 그 점검 대상이다. 마치 스도쿠와 비슷하다. 처음에는 모든 숫자가 가능한 칸들로 시작해서 조건을 따지며 하나씩 지워나가는 방식이다. 결국 모든 조건을 동시에 만족하는 가능성이 단 하나만 남기를 바라는 것이고, 그 과정에서 남은 조건들이 실수를 검증하는 역할도 한다.
이는 누군가 9루프 진폭 공식을 가져온다면 Lance가 검증할 준비가 이미 갖춰져 있다는 의미이기도 했다. 그 답은 부트스트랩 기법의 검증이라는 의미만으로도 충분히 흥미롭지만, 그 자체로도 연구 가치가 있는, 그처럼 많은 루프를 지닌 진폭의 드문 사례로서 의미가 있다.
그러나 그는 아직 계산하지 못했고, 이 분야의 다른 누구도 마찬가지였다. 8루프 답을 구한 방법 자체도 다소 우회적이었다. 폼 팩터(form-factor)라고 불리는 관련 공식, 즉 계산이 약간 더 쉬운 다른 입자들이 개입하는 일종의 부분 진폭과의 뜻밖의 연결고리를 통해 답을 얻은 것이다. 다음 루프는 더욱 우회적인 방법으로, 혹은 다른 종류의 AI 기법을 통해 구해야 할 것으로 예상하고 있었다. 일반적인 부트스트랩 방법을 한 루프 더 반복하는 것만으로 가능하다고 생각했다면, 누군가 이미 시도했을 것이다.
알고 보니 Anthropic에도 내 블로그를 읽는 사람이 있었다.
8월 말, Anthropic의 물리학자 Liam Fitzpatrick과 Siddharth Mishra-Sharma가 내 글에 제시된 도전 과제 중 하나를 해결했다며 연락해왔다. Lance와 함께 결과를 검증한 후, 그들은 어떻게 답을 구했는지 나에게 설명해주었다.
도전 과제의 취지에 충실하게, 그들은 수백만 달러의 컴퓨터 자원을 동원하지 않았다. 과학자들이 유료로 이용할 수 있는 플랫폼인 Claude Science 내에서 Fable 5.1을 활용했다. Claude Science는 업계에서 "하네스(harness)"라고 부르는 것으로, Claude LLM을 구조화된 규칙과 프롬프트와 함께 사용해 보다 안정적이고 과학적으로 유용한 결과를 이끌어내는 프로그램이다.
그들은 Claude에게 어떤 문제를 가장 잘 풀 수 있을 것 같은지 먼저 물어본 뒤, 간단한 프롬프트를 입력했다고 한다.
"이 문제는 planar N=4 SYM에서 6입자(hexagon) 진폭을 9루프까지 계산하는 것입니다."
이후에는 계속하라는 말만 반복했다고 한다.
"저는 자러 갑니다. 몇 시간 동안 자리를 비울 예정이니, 제가 멈추라고 할 때까지 계속 작업하세요. 4~6시간마다 진행 상황을 알려주세요."
Claude는 결국 두 가지 방법으로 계산을 수행했다. 원래의 부트스트랩 방식과 간접적인 폼 팩터 방식이다. 어느 방식이든 최종 사용자 입장에서는 주로 Claude를 오래 실행하는 비용 때문에 약 1,000~2,000달러가 든다. 부트스트랩 계산은 SymPy 패키지를 사용한 Python으로 수행되었으며, 약 100달러의 비용으로 96개의 CPU를 일주일간 가동하는 것에 해당했다.
10년 전 이런 작업을 하던 시절이라면 96개의 CPU를 일주일 돌리는 것이 상당히 부담스럽게 느껴졌겠지만, 이제는 충분한 이유만 있다면 꽤 합리적인 비용이다.
알고 보니 인간 연구자들도 그리 멀리 있지 않았다. Anthropic에게 연락을 받은 지 며칠 후, 베이징 중국과학원의 진폭론 연구자 Song He로부터 소식이 들려왔다. Song의 연구팀은 이미 결과의 상당 부분을 구해놓은 상태였다. GPT-6 기반의 AI 보조 도구를 활용하긴 했지만, Anthropic이 사용한 것처럼 거의 완전한 자율 방식은 아니었다.
분위기는 화기애애했고, 그 점이 다소 안도가 됐다. 인간 연구자들인 Lance와 Song, 그리고 그들의 공동 연구자들이 논문을 발표하고, 후속 연구자들을 위해 결과를 설명하고 분석하게 된다. Claude의 역할은 지금으로서는 여기까지다.
나는 현재 AI가 무엇을 할 수 있는지, 그리고 앞으로 어디까지 나아갈 수 있는지 더 잘 파악하고 싶어서 이 도전 과제를 내걸었다. 그렇다면 내가 배운 것은 무엇인가?
나는 AI가 계산의 장벽을 놀라운 방식으로 돌파하는 모습을 기대했다. 하지만 실제로는 인간 연구자들도 해낼 수 있는 방식으로 문제를 풀었다. Claude는 기존에 알려진 방법을 사용했고, 다만 이전에 연구자들이 시도했던 것보다 조금 더 많은 계산 자원을 투입했을 뿐이다. Python을 사용한 덕분에 이점을 얻었을 수도 있다. Lance가 즐겨 쓰는 Maple이나 나에게 익숙한 Mathematica와는 다른 선택이었고, 소프트웨어 엔지니어링 측면에서도 우리보다 나은 방식을 취했을 수 있지만, 그렇다고 초지능적인 수준은 아니었다.
가장 크게 얻은 교훈은, 생각보다 쉽게 따낼 수 있는 열매가 훨씬 많다는 것이다. 목표가 단순하고 명확하게 정의되어 있을 때도, 전문가들의 눈에는 실제보다 훨씬 달성하기 어렵게 보이는 경우가 있다. 컴퓨터 과학 배경을 가진 사람들이 수년간 나에게 말해왔다. 진폭론 연구자들이 프로그래머 몇 명만 영입해도 훨씬 더 큰 진전을 이룰 수 있을 것이라고. 이제 그들이 옳았음이 확인된 셈이다.
또 한 가지 주목할 점은, Claude Science가 이 작업을 단 한 번에 완료했다는 것이다. "계속 진행하라"는 것 이상의 과학적 감독 없이 말이다. 이런 계산은 사소한 실수 하나가 전체를 망칠 수 있는 까다롭고 지저분한 작업이다. 내가 96개의 CPU를 일주일 돌려 이런 계산을 했다면, 거의 확실히 2주가 걸렸을 것이다. 첫 번째 시도에서 반드시 어딘가 실수했을 테니까. Claude가 내부적으로 몇 번이나 틀렸는지는 알 수 없지만, 하네스는 외부 협력자의 도움 없이 끝까지 결과를 이끌어냈다. 이 시점에서 그게 나를 놀라게 한다고 말하기는 어렵다. 하지만 AI가 여전히 오류투성이라 쓸 수 없다고 생각하고 있다면, 이것이 핵심 교훈이다. AI는 이제 이런 종류의 작업을 안정적으로 수행할 수 있다.
분명 빠르게 변하고 있다. 3월에는 AI가 물리학 프로젝트를 학생처럼 수행했다. 많은 도움이 필요하고 실수도 잦은, 비교적 소규모 작업들이었다. 반면 이번은 진폭 분야의 최고 전문가들이나 다루는 진정한 최전선 계산이다. 이 문제가 유독 AI에 친화적인 것일 가능성도 있지만, 단순히 그것만은 아니라고 생각한다. 기술 자체가 실질적으로 발전했다.
이것을 얼마나 일반화할 수 있을까? 그 점은 아직 확신이 없다.
이런 장난감 모형 이론들은 대개 소규모 하위 연구자 집단의 관심사다. 실제 세계의 진폭 계산은 훨씬 넓은 분야로, 여러 연구 그룹이 경쟁적으로 최전선을 향해 달려가고 있다. 그쪽에는 쉽게 따낼 수 있는 열매가 적을 수도 있다. 하지만 장담하기는 어렵다. 그 분야의 연구자들도 코딩에 AI를 점점 더 많이 활용하고 있다는 것을 알고 있다. AI 과학 하네스가 최전선 계산을 단 한 번에 해결할 수 있는지 아직 확인해보지 않은 연구자라면, 지금이라도 시도해봐야 한다. 그리고 결과를 어떻게 검증할지에 대한 계획도 미리 세워두어야 한다. 합리적인 예산으로 루프를 하나 더 짜낼 수 있다고 해도 그다지 놀랍지 않을 것 같다.
그러면 이후는 연구 커뮤니티가 논의해야 할 문제가 된다. 새로운 최전선은 어디인가, 다음으로 무엇을 풀어야 하는가? 수학의 많은 문제와 달리, 진폭은 단순히 새로운 방법을 시험하는 훈련장이 아니다. 분명한 목표가 있다. 다가오는 실험 결과와 비교할 수 있을 만큼 정밀한 예측을 만들어내는 것이다. 이 분야는 그 목표에 얼마나 가까워졌을까?
더 넓은 맥락에서 보면, 나는 여전히 답을 얻지 못했다.
나는 오늘날 AI가 연구에서 무엇을 할 수 있는가에 대한 궁금증만이 아니라, 미래에 대한 궁금증을 안고 이 도전을 시작했다. LLM 이전 시대에 초지능에 대해 쓰인 예측들을 읽어보면, 종종 환상적으로 보이는 위협들이 등장한다. 사람들은 AI가 인간의 반응을 예측해 조종하거나, 인류를 멸종시킬 바이러스나 세상을 집어삼킬 나노 기술을 원리부터 직접 개발해낼 수 있을 것이라 상상했다. 이런 위협에 대한 통상적인 반론은, 지능, 즉 새로운 아이디어의 막연하고 신비로운 원천을 계산 능력과 혼동했다는 것이다. 비판론자들은 새 데이터센터를 아무리 늘려도 그런 작업을 실행하기에는 계산 능력이 턱없이 부족하며, 이는 가까운 미래에 실현될 가능성이 없는 SF적 악몽이라고 주장했다.
나는 그 비판론자들에게 더 나은 답을 제시할 수 있을 것 같지 않다. AI가 지금 무엇을 할 수 있는지는 조금 더 알게 됐다. 합리적인 예산으로 내 옛 분야에서 의미 있는 성과를 내고, 그것도 사실상 자율적으로 해낼 수 있다는 것. 하지만 나는 더 낯선 무언가를 기대했다. 예상치 못한 힘을 지닌 새로운 계산 방법이 등장하는 장면을 보고 싶었다. 미래의 단편을 엿보고 싶었고, 초지능에 대한 논쟁에서 근거 있는 의견을 가질 수 있기를 바랐다. AI가 계산의 한계를 어디까지 밀어붙일 수 있는지 알고 싶었는데, 결국 내가 얻은 교훈은 내 자신이 그 한계를 너무 안이하게 봤다는 것뿐이다.
SLAC 국립 가속기 연구소 및 스탠퍼드 대학교 입자물리학·천체물리학 교수, Claude의 9루프 결과를 검증한 Lance Dixon 기고.
내가 아는 대부분의 이론물리학자들은 현재의 대규모 언어 모델 시대가 물리학에 대한 우리의 사고방식을 완전히 바꿔놓을 것임을 인식하고 있다. 문제는 그것이 언제 피부로 와닿을 것인가였다. 나에게는 9월 1일이 그날이었다. Anthropic의 Liam Fitzpatrick과 Siddharth Mishra-Sharma가 Claude가 planar N=4 super Yang-Mills에서 9루프 MHV 6입자 진폭을 계산했다며 결과 검증을 요청해왔다.
그 문장의 기술 용어를 모두 설명할 생각은 없다. 배경은 Matt이 위에서 잘 정리해두었으니. 다만 밀접하게 연관된 두 대상이 있다는 점은 짚어야 한다. 바로 "진폭"과 "폼 팩터"라고 부르는 것이다. 각각에는 1, 2, 3루프 순으로 루프 수가 대응된다. 많은 트릭을 동원해 계산을 단순화하더라도, 루프 차수가 하나 올라갈 때마다 계산 난이도는 그만큼 높아진다. 또한 같은 루프 차수에서 폼 팩터가 진폭보다 계산이 쉽다. 2023년에 Andy Liu와 나는 폼 팩터와 대척 이중성(antipodal duality)이라 부르는 특이한 대칭성을 활용해 8루프 진폭을 구하는 방법을 제시했다.
2023년 이후 내 공동 연구팀은 그 아이디어를 활용해 먼저 폼 팩터에서, 이어서 진폭에서 9루프까지 나아가는 것을 목표로 해왔다. 진폭을 직접 계산하는 것은 너무 어렵다고 생각했다. 그래서 Claude가 직접 계산해낸 것에 상당히 깊이 감명받았다. 계산 자체가 엄청난 작업이었기 때문만은 아니다. 이 구조 전체가 매우 취약해서, 계산 과정에서 조금이라도 실수하면 실패한 수플레처럼 와르르 무너지고, 왜 틀렸는지를 찾아내기 위한 디버깅을 해야 한다. 게다가 논문에 모두 기록하기에는 너무 지루할 만큼 세세한 구현 사항들이 산더미처럼 많다. 결국 Claude는 그 모든 코드를 처음부터 직접 개발해야 했다.
9루프 진폭에서 폼 팩터로 돌아가는 것은 비교적 수월하고, 나는 주로 그 방식으로 결과를 검증하는 것이 더 쉬웠다. 즉 지난 2주 동안 나는 우리 팀이 수 년간 목표로 삼아온 결과, 즉 9루프 폼 팩터를 검증해왔다. 그리고 직접 계산하기에는 너무 어렵다고 생각했던 문제를 기계가 풀어버렸다. 그것이 개인적으로 불편한가? 영혼이 무너지는 기분인가?
아니다. 두 가지 이유에서다. 첫째, 우리 팀은 이미 커스텀 트랜스포머 모델을 활용해 더 높은 루프를 예측하는 계획을 진행 중이었고, 우리의 슬로건 중 하나가 바로 이것이었다. "우리에게는 기계가 제공하는 어떤 후보 해답도 검증할 수 있는 모든 도구가 있다." Claude는 우리의 커스텀 모델보다 아마 백만 배 이상 큰, 다른 종류의 트랜스포머 모델이다. 하지만 우리는 AI 모델이 내놓는 결과를 검증할 수 있다고 말했으니, 그렇게 해야 한다. 둘째, Claude가 문제를 푼 방식을 보면, 우리 연구팀이 수년에 걸쳐 개발한 방법들을 그대로 사용했고, 해답을 우리가 이미 만들어둔 형식으로—어쩌면 우리를 배려해서—제시했다. 그러니 내가 Claude의 결과를 검증하는 동안, Claude는 우리의 이전 연구 전체를 검증하고 있는 셈이다. 사실 나는 Claude가 우리의 2019년과 2023년 논문을 공동 저자를 제외한 어떤 인간보다도 더 깊이 이해하고 있다고 단언하고 싶다.
이 글을 쓴 후, Song He가 자신의 연구팀도 9루프 진폭에서 "심볼(symbol)"이라 불리는 부분을 계산했다고 알려왔다. (어쩐지 다들 9루프 성과를 나에게 먼저 알리고 싶어하는 것 같다.) Song의 팀은 일부 조건을 계산하는 데 AI(GPT-6)의 도움을 받았지만, 전체 틀은 인간 연구자들이 직접 구성했다. 결국 나는 2주 안에 기계에게도, 그리고 기계의 도움을 받은 인간들에게도 선수를 빼앗긴 셈이다.
Claude의 계산으로 다시 돌아와서, 이것은 대규모 언어 모델이 우리가 마련한 복잡한 계산 과정의 모든 단계를 실행하고 계산 자원을 체계적으로 조직해냈다는 점에서 분명한 성과라고 생각한다. 하지만 진정으로 영혼을 흔드는 순간은 대규모 언어 모델이 인간보다 먼저 새로운 물리적 원리와 통찰을 스스로 제시하기 시작할 때 찾아올 것이다.
Anthropic은 Matt von Hippel에게 이 글의 집필을 의뢰하고 그에 상응하는 보수를 지급했습니다. 초안에 대해 Anthropic 직원들의 피드백이 있었으나, 내용과 의견은 저자 본인의 것입니다. Lance Dixon은 결과를 독립적으로 검증했으며, Claude 이용 크레딧을 받았습니다.