OpenAI가 미공개 모델을 활용해 나비에-스토크스 존재성과 매끄러움 문제를 풀어냈다. 이 문제는 2000년 5월 24일부터 100만 달러의 상금이 걸려 있는 밀레니엄 현상금 문제(Millennium Prize Problems) 일곱 가지 중 하나로, 해당 글은 OpenAI의 이번 성과를 상세히 소개한다.
나비에-스토크스 밀레니엄 현상금 문제에 대한 단상은 OpenAI의 놀라운 성과를 소개한다. OpenAI는 미공개 모델을 활용해 나비에-스토크스 존재성과 매끄러움 문제를 풀어냈는데, 이 문제는 2000년 5월 24일부터 100만 달러의 상금이 걸려 있는 밀레니엄 현상금 문제 일곱 가지 중 하나다.
그런데 이번 발견은 NYU 수학과 교수 트리스탄 버크마스터(Tristan Buckmaster)의 부정행위 의혹 제기로 빛이 바랬다. 그는 현재 Anthropic에 재직 중인 뛰어난 수학자 르방 알포제(Levent Alpöge)와 함께 관련 문제를 공동 연구해왔다.
트리스탄은 자신들의 연구 결과를 서둘러 공개한 버전과 함께 이 같은 이의를 제기했다. 당시 상황을 설명한 PDF가 여기 있다. 아주 간략히 요약하면, 트리스탄과 르방은 약 1년 가까이 Claude와 Codex(주로 GPT-5.6 Sol)를 폭넓게 활용하며 이 문제에 매달렸고, 8월 15일 마침내 돌파구를 찾아냈다. 수학계에 소문이 퍼지기 시작했고, 트리스탄과 르방은 Anthropic이 "주요 미해결 문제"를 해결했다는 소식이 OpenAI에도 전해졌다는 사실을 알게 됐다. 이에 직접 연락을 취해보니, OpenAI에도 유사한 접근법으로 관련 문제를 연구하는 팀이 있었다. 트리스탄의 말을 직접 인용하면:
나는 그들이 첫 번째 프롬프트를 언제 보냈는지 물었다. OpenAI는 한동안 이 질문에 직접적인 답을 내놓지 않았다. 결국 그 시점이 우리 연구에 관한 정보가 OpenAI에 전해진 이후, 불과 며칠 전이었다는 사실이 인정됐다.
나는 모델이 우리의 Codex 세션 데이터를 학습했거나 접근 권한이 있었는지 물었다. 우리는 프로젝트 내내 모든 초안을 Codex에 저장해두었기 때문이다. OpenAI 측은 모델이 사용자 데이터를 조회하지 않는다고 했다. 학습 데이터에 관해 다시 물었지만, 답은 돌아오지 않았다.
상황은 더욱 복잡하게 흘러갔다. OpenAI 팀은 트리스탄이 먼저 논문을 발표할 때까지 기다리거나, 자신들의 연구 결과에 대한 논문에 그를 저자로 올리겠다고 제안했다. 다만 르방은 공동 저자로 절대 포함시킬 수 없다고 선을 그었는데, OpenAI와 그의 고용주 Anthropic이 경쟁 관계에 있다는 이유에서였다.
OpenAI는 자신들의 작업을 이렇게 설명했다:
9월 1일 화요일, 두 가지 밀레니엄 현상금 문제가 해결됐다는 소문을 들었습니다. 이 소문과 내부 모델의 비약적인 성능 향상에 자극받아, 미해결 밀레니엄 현상금 문제 전체와 파급력이 큰 몇 가지 문제에 대해 모델을 평가하는 작업에 착수했습니다. [...]
에이전트들은 9월 5일 토요일, 첫 번째 에이전트가 가동된 지 약 88시간 만에 문제를 해결했습니다. Lean 형식화 및 검증은 GPT‑6 Astra를 통해 추가로 17시간이 소요됐습니다.
시도한 모든 문제에 걸쳐 에이전트들은 490만 개의 메시지를 주고받으며 약 3,000억 개의 출력 토큰을 사용했습니다. 나비에-스토크스 문제를 해결하는 과정에서만 270만 개의 메시지와 약 1,300억 개의 출력 토큰이 쓰였습니다.
(사용된 내부 모델의 비용 구조는 알 수 없지만, GPT-6 Astra의 공개 API 가격 기준으로 3,000억 개의 출력 토큰이면 1,500만 달러에 달한다.)
트리스탄과 르방의 작업에 대한 OpenAI의 입장이다(강조는 필자):
저희의 작업은 9월 1일에 시작됐습니다. 그 무렵 들은 소문이, 나중에 알고 보니 Anthropic 직원인 르방 알포제와 NYU 수학과 교수 트리스탄 버크마스터와 관련된 것이었습니다. 전체 프로젝트와 Lean 검증이 완료된 9월 6일, 그 소문을 바탕으로 그들도 나비에-스토크스 문제의 풀이를 갖고 있다고 판단해, 양측의 연구를 동시에 발표하고 공동 발표를 통해 그들의 우선권을 인정하자고 연락을 취했습니다. [...]
저희(연구진과 에이전트들)는 그들이 결과를 공개하기 전까지 어떤 경로로도 그들의 연구에 접근하지 않았습니다. 특히 이 문제를 풀기 위해 특정 사용자 데이터에 접근한 사실은 없습니다. 가능성은 낮지만, 저희 제품을 통한 그들의 사용 이력에서 파생된 비식별화 데이터가 모델 성능 향상에 기여했을 가능성을 완전히 배제할 수는 없습니다. 다만 두 증명은 상당히 다르며, 오일러 방정식의 경우 증명된 결과 자체도 다릅니다(강제 대 비강제).
내가 보기에 이번 사태의 본질은 이렇다. OpenAI는 LLM으로 몇몇 밀레니엄 현상금 문제가 풀렸다는 소식을 듣고, 이를 자사 최신 모델의 역량을 과시할 기회로 삼았다. 문제는 거의 1년간 OpenAI 자신의 모델을 써가며 같은 문제를 연구해온 팀을 선점하는 것이 어떻게 비칠지, 충분히 고려하지 않았다는 점이다.
이 상황은 지금 컴퓨터 보안 분야에서 벌어지고 있는 일과 묘하게 닮아 있다. 아닐 마드하바페디(Anil Madhavapeddy)는 최근 요즘은 버그에 대한 소문만으로도 보안 취약점을 찾아내기에 충분하다고 지적했다. 어떤 소프트웨어에 패치되지 않은 취약점이 있다는 사실만 알아도, 에이전트를 동원해 그것을 찾아내면 그만이기 때문이다. 수학도 이제 같은 처지에 놓인 걸까? 미발표 풀이가 존재한다는 사실만으로도, 선점을 위해 수백만 달러를 LLM에 쏟아붓는 일이 벌어질 수 있는 것이다.
이번 일은 내가 오래전부터 품어온 불만을 다시금 수면 위로 끌어올린다. AI 기업이 내 데이터를 "모델 성능 향상에 활용한다"고 말할 때, 그게 실제로 무슨 의미인가?
이와 관련해 내가 즐겨 던지던 가상의 질문이 두 가지 있었다:
이제 내가 가장 즐겨 떠올리는 가상의 질문은 이것이다:
출처: Hacker News.
현재 블로그의 장문 아티클만 표시되고 있습니다. 모든 게시물을 받아보려면 /atom/everything/을 구독하거나, 다른 구독 옵션을 확인해보세요.