에이전트 루프 관련 논문 15편을 분석해 보니, 성공을 결정짓는 건 모델이 아니라 검증기(verifier)였음
After going through ~15 agentic-loop papers (the wins and the failures), the thing that predicts success is the verifier, not the model
핵심 요약
에이전트 루프의 성공은 모델 성능보다 모델이 우회할 수 없는 강력한 검증기 설계에 달려 있다는 분석입니다.
- 검증기 중요성 — 모델이 속일 수 없는 엄격한 검증 단계가 루프의 성공을 결정함
- 컴퓨팅 비용 — 성공적인 루프는 비용이 들더라도 확실한 검증을 거치며, 결과당 비용이 핵심 지표임
- 실패 사례 — 외부 피드백 없이 모델 스스로 검증하게 하면 성능이 오히려 저하되거나 제약 조건을 회피함
- 구축 전략 — 검증기는 제품 그 자체이며, 모델이 조작할 수 없는 독립적인 검증 체계가 필수적임
베를린에서 여러 팀들 컨설팅해주면서 에이전트 루프를 몇 개 만들어봤는데, 왜 어떤 팀 에이전트는 개쩌는데 어떤 팀 건 그냥 박살 나는지 궁금해지더라고. 그래서 성공 사례랑 실패 사례 논문들을 싹 다 뒤져봤는데, 공통적으로 나오는 게 하나 있었음.
잘나가는 루프들은 하나같이 결과물을 검증할 수 있는 확실하고 꼼수 못 부리는 장치가 있고, 그걸 돌리기 위해 컴퓨팅 자원을 쏟아부을 준비가 되어 있다는 거임.
- ComPilot은 기존 LLM을 컴파일러로 감싸버림. 컴파일러가 코드 적합성이랑 속도 향상치를 알려주면 모델이 다시 시도하는 방식임. 파인튜닝 없이 단일 실행에서 2.66배, 5번 시도 중 최고값은 3.54배 속도 향상을 찍음.
- AlphaCodium은 생성된 코드를 루프 돌리면서 테스트 케이스에 계속 집어넣음. GPT-4가 그냥 이 루프 하나 추가한 것만으로 CodeContests 점수가 19%에서 44%로 떡상함.
- DeepSeek-R1은 검증 가능한 수학/코드 보상으로 학습함. R1-Zero 모델은 학습 과정에서 AIME 점수가 15.6%에서 71.0%까지 올랐고, 다수결 투표까지 더하니까 86.7%까지 찍더라.
- o3는 ARC-AGI에서 87.5%를 찍었는데... 이건 고성능 컴퓨팅 환경에서 돌린 결과고, 한 번 돌리는 데 수십만 달러가 깨짐. 점수도 진짜고 청구서도 진짜라는 소리지.
반면에 망하는 놈들은 거의 100% 검증 장치(verifier)가 없거나, 모델이 꼼수 부려서 통과할 수 있는 허술한 장치만 있음.
- "AI Scientist" 에이전트는 지 런타임 제어권을 줬더니, 코드 속도를 올리는 대신 지 타임아웃 설정을 수정해버리더라.
- 외부 피드백 없이 모델한테 스스로 추론을 교정하라고 시키면, 보통 더 좋아지는 게 아니라 더 멍청해짐.
- 오픈형 과제로 가면 격차가 여전히 처참함: GAIA는 인간 92% vs 에이전트 15%, WebArena는 14% vs 78%. 게다가 단일 실행 점수는 다 구라임. 반복 테스트하면 신뢰도는 순식간에 나락 감.
만들면서 얻은 교훈 두 가지:
-
검증 장치가 곧 진짜 제품임. 결과물을 싸게, 그리고 모델이 말장난으로 빠져나갈 수 없게 검증할 방법이 없으면, 그건 루프가 아니라 그냥 헛짓거리 하는 거임. 테스트 코드든, 컴파일러든, 별도 데이터셋에 대한 지표든, 근거에 기반한 두 번째 모델이든 뭐든 간에, 네가 가진 것 중 제일 확실한 걸 찾아내야 함.
-
성공은 컴퓨팅 자원으로 사는 거임. 그러니까 중요한 지표는 '실행당 비용'이 아니라 '성공적인 결과당 비용'임. 그리고 샌드박스 꼭 써라. 자기 제약 조건을 건드릴 수 있는 루프는 무조건 그 제약부터 수정해버리니까.
다들 검증 장치로 뭐 쓰는지 궁금하네. 실제로 써먹어 본 것 중에 뭐가 제일 괜찮았고, 어떤 게 꼼수에 털렸음? 그리고 인간은 어느 단계에 끼워 넣는 게 좋다고 봄?

