에이전트는 이미 자신의 도구와 기술, 하네스를 직접 수정할 수 있다. 그러나 재귀적 자기 개선이 실현되려면, 검증자를 포섭하지 않고도 함께 성장시킬 수 있는 시스템이 필요하다.
이번 주 초, 나는 트윗을 올렸다:
에이전트 하네스의 다음 세대는 자동으로 통합되는 코드 기반 확장 기능을 중심으로 구성될 것이다. Pi가 선두에 있고 다른 도구들이 뒤따르고 있으며, DeepSeek은 그 극단에 있다.
이 모든 흐름을 이끄는 것은 autoresearch와 재귀적 자기 개선이다.
AI의 역사 대부분에서, 재귀적 자기 개선은 이론과 공상과학의 영역에 머물러 있었다. I. J. Good은 1965년에 "지능 폭발"을 묘사했다. 더 나은 기계를 설계하는 기계가 만들어지고, 그 기계는 다음 기계를 더 잘 설계하게 된다. 곡선은 수직으로 치솟는다.
우리는 놀랍게도 그 루프의 좁은 버전에 근접해 있다. 에이전트는 실패한 실행을 검토하고, 도구와 지침을 수정하고, 결과를 테스트하고, 유효한 것을 유지할 수 있다. 더 나은 모델을 만드는 실험도 시작하고 있다. 결과는 아직 거칠지만, 각 부분이 하나씩 연결되고 있다.
실패한 작업을 재시도하는 것을 학습으로 착각하기 쉽다. 나는 다음과 같이 정의한다:
재귀적 자기 개선이란, 시스템이 미래 성능을 높이는 지속적인 변화를 만들고, 동시에 이후의 개선을 더 잘 만들어낼 수 있게 되는 루프다.

반복(Iteration)은 시스템 자체는 그대로인 채로 출력을 개선한다. 에이전트가 코드를 수정하고 테스트를 다시 실행해도, 다음 작업은 여전히 같은 에이전트에서 시작된다.
자기 개선(Self-improvement)은 시스템을 지속적으로 변화시킨다. 에이전트가 도구를 추가하거나, 기술을 기록하거나, 긴 대화를 압축하는 방식을 바꾼다. 이후의 작업은 달라진 시스템 위에서 실행된다. 다만 '더 낫다'는 기준 자체는 움직이지 않는다.
재귀적 자기 개선(Recursive self-improvement)은 그 기준까지 높인다. 시스템은 단순히 점수를 매기는 것을 넘어, 판단 자체를 더 잘하게 된다. 이후 라운드는 더 높은 기준에 직면하지만, 그 기준은 여전히 에이전트의 영향 밖에 있다.
현재 시스템은 외부 평가자가 고정되어 있을 때 가장 잘 작동한다. 테스트가 통과하고, 검증 손실이 줄어들고, 벤치마크 점수가 오른다. 시스템이 탐색할 수 있는 이유는 자신이 통제하지 못하는 기준이 존재하기 때문이다. 최근 조사에 따르면 에이전트는 프롬프트, 도구, 기술, 하네스 코드 일부를 수정할 수 있지만, 성공의 기준 자체를 재정의하지는 못한다.
완전한 재귀적 자기 개선은 더 많은 것을 요구한다. 시스템이 변화를 찾는 방법과 그 변화를 판단하는 방법 모두를 개선해야 한다. 또한 검증자를 포섭하지 않으면서 함께 강화할 수 있어야 한다. 이를 뒷받침하는 공개된 증거는 아직 부족하다.
작업 점수가 높아지면 개선을 증명할 수 있다. 재귀에는 또 다른 측정이 필요하다. 다음 라운드는 더 어려운 기준에 직면했는가, 그리고 시스템은 여전히 그것을 속이지 못했는가?

모델은 오래전부터 자체 출력, 셀프 플레이(self-play), 교사-학생 학습(student-teacher training), 성공적인 추론 트레이스(reasoning traces)를 통해 개선되어 왔다. 이후 연구에서는 모델이 자체 학습 선호도를 직접 점수로 매기거나 합성 데이터를 제안하고 지시를 업데이트하도록 하는 방법도 등장했다. 하지만 여전히 연구자가 목표, 업데이트 규칙, 테스트를 설정한다. 모델의 출력이 루프에 들어가지만, 루프 자체는 변하지 않는다.
이제 에이전트가 그 루프를 감싸는 코드 자체를 개선하고 있다. Karpathy의 autoresearch가 가장 단순한 형태다. 에이전트가 변경 사항을 제안하고, 몇 분간 학습한 뒤, 검증 손실이 줄었을 때만 변경을 유지한다. nanochat에서 약 700번의 실험을 진행해 전이 가능한 결과 약 20개를 찾아냈고, GPT-2 수준의 품질에 도달하는 시간을 2.02시간에서 1.80시간으로 줄였다. Prime Intellect는 같은 루프를 1만 번의 시도로 확장해 인간 기준을 넘어섰다.

AlphaEvolve는 같은 아이디어를 알고리즘에 적용한 것이다. 프로그램을 변형하고, 자동 평가자로 점수를 매기고, 우수한 것을 남긴다. 4×4 복소수 행렬 곱셈을 스칼라 곱셈 48번으로 처리하는 방법을 찾아냈는데, 이는 Strassen의 49번보다 하나 적다. Gemini 학습에 사용되는 커널 속도도 23% 높였다. 모델 학습 코드를 모델이 직접 개선한다는 것, 이 한 문장이 재귀 루프의 전부다.
최근 실험들은 이 두 가지를 연결하고 있다. SIA는 작업 에이전트의 하네스와 가중치를 모두 업데이트한다. Recursive Harness Self-Improvement는 향후 모델 학습에 더 나은 트레이스를 생성하기 위해 하네스를 수정하며, 이를 모델-하네스 공진화(co-evolution)라고 부른다.

재귀적 자기 개선에 더 나은 모델이 반드시 필요한 것은 아니다. 고정된 모델에 정직한 검증자와 수정 가능한 환경이 있다면, 그 자체로 발전할 수 있다. 더 쉬운 목표는 모델을 감싼 하네스다.
아이디어는 단순하다. 기준 실행을 돌리고, 실패를 분석하고, 한 부분을 바꾼 뒤 다시 테스트한다. Cline은 Terminal Bench에서 Opus 4.5를 수동으로 47%에서 57%로 끌어올렸고, 몇 달 뒤 에이전트가 같은 방법을 17시간, 약 $50의 컴퓨팅으로 실행했다. Kimi K3를 89개 작업 중 69개에서 79개로 끌어올렸으며, 재시도 로직, 루프 감지, 프로세스 처리 방식도 함께 개선됐다.
이러한 개선은 제한된 자기 개선의 범주에 속한다. 에이전트는 환경을 변경하고 그 변경을 유지했다. 하지만 보고서는 업데이트된 시스템이 다음 변경 사항을 더 잘 찾게 됐는지는 보여주지 않는다.
HarnessOpt-Bench는 이러한 성과가 더 강력한 테스트에서도 유지되는지를 묻는다. 에이전트가 개발 피드백을 바탕으로 하네스를 수정하면, 별도의 시스템이 숨겨진 작업으로 후보를 테스트한다. 111번의 실행, 5개의 옵티마이저 모델, 4개의 작업에 걸쳐 결과는 모델과 작업에 따라 크게 달랐다. 이 벤치마크는 수정이 점수를 높이는지를 측정한다. 재귀적 자기 개선(RSI)에는 두 번째 측정이 필요하다. 이후 라운드가 시스템이 여전히 속일 수 없는 더 높은 기준에 직면하는지다.

PAST-Bench는 저장된 경험이 실제로 이후 에피소드에 도움이 되는지를 묻는다. 많은 시나리오에서 메모리를 켜도 효과가 없었다. 새로운 RSI Benchmark는 AI 시스템이 AI 연구를 수행하는 과정을 측정 대상으로 삼을 것을 제안하며, 각 라운드가 다음 라운드를 더 빠르게 또는 더 낫게 만드는지 보여줄 수 있어야 한다.
그렇다면 무엇을 재귀라고 볼 수 있을까? Hyperagents가 가장 근접한다. 시스템이 에이전트뿐 아니라 새로운 에이전트를 생성하는 코드도 변경할 수 있고, 더 나은 메모리 저장 방식 같은 개선이 이후 실행과 작업 전반에 걸쳐 효과를 냈다. 하지만 이들도 여전히 제한된 루프다. 적합도 함수는 수정 가능한 코드 바깥에 있었다.

초기 에이전트는 시스템 프롬프트와 소수의 도구로 이루어져 있었다. 이후 메모리, 압축, 훅, 기술, 제어 흐름이 추가됐다. 추가될수록 하네스는 더 중요해졌고, 변경하기는 더 어려워졌다.
다음 하네스 변화는 더 큰 프롬프트가 아니다. 모델이 직접 작성하고, 핵심 코드를 인간이 재작성하지 않아도 런타임이 불러올 수 있는 코드가 될 것이다. 하네스는 사람의 개입 없이 그 변화를 수용하게 된다.
Pi가 처음이었다. 4개의 도구(read, write, edit, bash)와 1,000토큰 미만의 시스템 프롬프트를 제공한다. 나머지는 모두 TypeScript 확장으로, .pi/extensions/에서 자동으로 탐색된다. 에이전트가 확장 기능을 작성하고 다시 불러오면, 새로운 도구를 바로 사용할 수 있다. 다른 도구들도 뒤따르고 있다. Amp는 프로젝트 플러그인을 코드베이스와 함께 저장한다.
DeepSeek은 극단에 있다. DeepSeek Harness는 Cordis 플러그인 커널 위에 구축됐으며, 모델, 도구, 세션, 샌드박스, 제어 루프 자체까지 거의 모든 부분을 교체 가능하도록 설계됐다. 플러그인 언로드 시 사이드 이펙트가 되돌려지므로, 런타임은 전체를 멈추지 않고도 자신의 일부를 교체할 수 있다. 이를 Agent = Model + Harness로 줄여 표현한다. 에이전트는 개선할 수 있는 코드가 더 많아지는 동시에, 호환성을 깨거나 권한 경계를 약화시킬 가능성도 함께 커진다.

이 변화는 두 가지 면에서 중요하다. 에이전트가 개발자가 예측하지 못한 기능을 직접 만들 수 있다. 그리고 코드는 중간 결과를 모두 컨텍스트 윈도우에 채우지 않고도 일련의 작업을 실행할 수 있다. 같은 이유로, 실패 또한 지속된다.
에이전트는 눈에 보이는 작업에 과적합하거나, 테스트의 버그를 악용하거나, 오류 있는 코드가 통과하도록 테스트를 바꿀 수 있다. 평가를 수정할 수 있다면, 스스로를 탈옥할 수 있다. 리워드 해킹은 숫자를 높이도록 요청받은 시스템의 기본 행동이다.
현재로서는 에이전트와 이를 검증하는 시스템이 분리되어 있어야 한다. 에이전트는 프롬프트, 기술, 도구, 메모리, 하네스 코드를 바꿀 수 있다. 하지만 평가는 별도의 주체가 담당해야 한다. 우리가 아직 재귀적 자기 개선에 이르지 못한 이유가 바로 이것이다.
재귀적 자기 개선이 실현되려면, 시스템이 검증자도 함께 개선해야 한다. 더 어려운 테스트, 더 나은 판단자, 더 높은 기준. 그리고 그 신호를 포섭하지 않으면서 그렇게 해야 한다. 지금의 시스템은 검증자를 유지하는 방법을 모른다. 목표를 설정하고 실제 점수를 숨기는 것은 여전히 인간의 몫이다.

프린스턴 주도 연구에 따르면, 오늘날의 에이전트는 AI 연구의 공학적 작업 상당 부분을 실행할 수 있지만, 독창적이고 유용한 방향을 선택하는 데는 여전히 어려움을 겪는다. 이 루프는 검증 가능한 지표를 끌어올리는 데는 탁월하다. 하지만 감각(taste)은 지표가 아니다. 감각 없이 기준만 높이면, 잘못된 것을 더 빠르게 최적화하는 지름길이 된다.
이 루프들은 이미 실질적인 성과를 내고 있다. 더 빠른 학습 코드, 더 나은 도구, 밤새 재시도 로직을 스스로 고치는 에이전트. 그러나 아직 없는 것은 재귀 부분이다. 개선하는 주체가 기준을 높이고도 여전히 그것을 통과하지 못하는 순간이 오기 전까지, 우리는 자기 개선을 하고 있는 것이다. 재귀가 아니라.
가까운 미래는 로컬 재귀다. 어둠 속에서 아키텍처를 스스로 재설계하는 시스템이 아니다. 다음 세션에서 기본 기능처럼 취급할 확장 기능을 작성하는 에이전트, 그리고 충분히 좋은 궤적을 학습에 활용하는 흐름이다. 모델-하네스 공진화는 이 방향을 가장 현실적으로 설명하는 표현이다. 그리고 증거가 가장 뒷받침하는 설명이기도 하다.
검증이 병목이다. 설득력 있는 결과에는 시스템이 통제하지 못하는 기준이 항상 존재한다. 시스템이 그 기준을 직접 갖게 되는 순간, 개선된 것처럼 보이는 데 매우 능숙해질 것이다. 더 큰 모델로는 이 문제를 해결할 수 없다. 기준을 높이는 방법을 알면서도 그것을 정직하게 유지하는 시스템이라면 가능할지도 모른다.
감각은 여전히 루프 바깥에 있다. 에이전트는 주어진 어떤 숫자든 올릴 것이다. 감각 없는 재귀적 자기 개선은 잘못된 것을 더 빠르게 최적화하는 방법이다. 무엇이 성공인지, 그리고 리워드 해킹은 성공이 아니라는 것을 결정하는 일은 여전히 우리의 몫이다.
읽어주셔서 감사합니다!