LLM 재학습 없는 재귀적 자기 개선
Recursive self-improvement without retraining the LLM
핵심 요약
LLM 가중치 수정 없이 외부 제어 시스템을 통해 도구와 추론 과정을 개선하는 재귀적 자기 개선(RSI) 연구 사례입니다.
- 재귀적 자기 개선 — LLM 가중치 변경 없이 외부 제어 시스템을 통해 추론 도구를 개선하고 이를 후속 연구에 활용함
- Ouroboros 시스템 — LLM을 제어하는 영구적인 토폴로지 기반 제어 평면으로, 제안·검증·승인 단계를 분리하여 운영함
- 검증 체계 — 수정 전 테스트를 고정하여 시스템이 스스로 결과를 조작하지 못하도록 독립적인 검증 절차를 강제함
- 연구 성과 — 수학적 컴파일러와 표현 방식 개선을 통해 기존에 실패했던 문제들을 해결하고 검증된 도구를 지속적으로 축적함
쉽게 설명하자면 (ELI5)
물건을 만드는 로봇이 있다고 쳐보자.
로봇이 작업을 하다가 막히면, 도구 하나를 개선하고 테스트한 뒤 그 개선 사항을 계속 유지해.
다음번에 작업할 땐 그 더 좋아진 도구를 쓰는 거지.
도구를 개선하는 작업을 할 때도 마찬가지야.
이게 바로 재귀적인 부분이야. 개선을 수행하는 기계 장치 자체가 스스로 개선되는 거니까.
단순히 답을 고치는 게 아니야. 실수를 기억하는 것도 아니고, 모델을 재학습시키는 것도 아니지.
내가 Ouroboros로 만들고 있는 게 바로 이거야. LLM의 가중치는 그대로 둬. 그 주변에 있는 지속적인 문제 해결 장치가 변하는 거고, 나중에 진행되는 연구는 그 변화를 그대로 물려받는 방식이지.
실제로 무슨 일이 일어났나
내가 시스템 수준의 재귀적 자기 개선(RSI)을 3일 동안 진행한 사례 연구를 발표했어.
루프는 다음과 같아:
실패 사례를 보존한다 → 수정을 시도하기 전에 테스트를 동결한다 → 추론 장치를 개선한다 → 독립적으로 검증한다 → 채택된 개선 사항을 이후 연구에 사용한다.
수정을 시도하기 전에 평가 환경을 얼려버리기 때문에, 시스템이 테스트를 멋대로 바꿔서 새로운 방법이 성공한 것처럼 조작할 수는 없어.
변경을 제안하는 모델이 그 변경이 성공했다고 선언할 권한도 없어. 제안, 검증, 그리고 개선 사항을 도입할 권한은 전부 분리되어 있거든.
구체적인 예시 두 가지를 들어볼게:
더 나은 추론 장치: 이중 상태 수학 컴파일러가 증명 의무(proof obligations)를 구조와 함께 추적해서 반증 가능성을 확인했어. 6개 도메인에 걸쳐 동결된 24개 사례 모두에서 성공했지. 이 이중 상태 메커니즘을 제거하니까 성공률이 0/24로 떨어지더라.
이전에 실패했던 탐색 문제가 해결 가능해졌어: 원래 방식은 2,000,000개 상태 제한에 걸려서 실패했거든. 수학적 표현 방식을 바꾸고 나니까, 같은 유형의 문제를 가시적인 사례에서 312번의 술어 검사(predicate checks)로 해결했고, 보류된 사례에서도 312번을 수행했어. 그 뒤에 별도의 검증과 56번의 회귀 테스트를 거쳤지.
두 번째 결과는 특정 사례일 뿐이지, 모든 상황에서 속도가 빨라진다는 주장은 아니야.
이건 그냥 단발성 패치가 아니야.
채택된 변경 사항은 지속적인 추론 장치가 되어 이후 연구와 시스템 개선 방식에 대한 의사결정에 계속 쓰였어.
그렇게 유산처럼 물려받기 때문에 내가 이걸 단순히 "AI가 코드를 고쳤다"가 아니라 재귀적 자기 개선이라고 부르는 거야.
이번 연구에서 나는 도메인 지식이 아니라 상위 수준의 목표만 제시했어. Ouroboros가 직접 연구를 수행하고 논문까지 썼지.
변경을 제안하는 구성 요소와 그걸 승인할 권한이 있는 구성 요소는 서로 달라. 물론 모든 검증은 내 로컬 Ouroboros 환경 안에서 이루어졌지만 말이야.
공개된 증거가 외부에서 완벽하게 재현을 가능하게 하는 건 아니고, 이번 연구가 무제한적이거나 통제 불가능한 개선을 입증하는 것도 아니야.
내가 주장하는 건 이거야:
LLM 자체는 변하지 않아도, 그 추론 및 검증 장치가 개선되고 유지되며, 그 장치가 다시 자기 자신을 개선하는 데 기여하는 지속적인 시스템에 참여할 수 있다는 거지.
논문: https://huggingface.co/datasets/cjc0013/three-days-of-recursive-capability-growth/blob/main/PAPER.md


