Qwen-3.6-27B와 Gemma-4-31B의 테스트 타임 컴퓨팅을 확장하여 코드 최적화 및 속도 향상 면에서 Claude Mythos를 능가함
I scaled test-time compute for Qwen-3.6-27B and Gemma-4-31B to surpass Claude Mythos in code optimizations and speedups.
핵심 요약
Qwen과 Gemma 모델의 테스트 타임 컴퓨팅을 확장해 코드 최적화 성능을 극대화한 프레임워크 소개.
- 테스트 타임 컴퓨팅 — 모델의 추론 과정을 반복 및 확장하여 성능을 향상함
- 반복적 수정 루프 — 구조화된 노이즈를 주입해 모델이 지역 최적해에 빠지지 않게 함
- 브랜치 탐색 전략 — 여러 가설을 독립적으로 테스트하고 최적의 결과를 선택함
- 코드 최적화 성능 — 소형 모델로도 대형 모델을 능가하는 코드 최적화 결과를 도출함
이 스캐폴드는 동일한 문제를 해결하기 위해 원래 베이스라인 모델보다 약 25~40배 더 많은 컴퓨팅 자원을 사용합니다. 브랜치 탐색 범위를 5로, 반복 수정 루프 깊이를 10으로, 그리고 매 2회 반복마다 수정되는 6개의 브랜치 인식 선택적 가설을 설정하여 최대 모드로 가동했습니다. 이 가설들은 다양한 주장, 로컬 속도 향상, 또는 완전히 다른 알고리즘 설계를 독립적으로 테스트하며 특정 브랜치 컨텍스트에 선택적으로 주입됩니다. 이 시스템 전체에서 가장 유용한 구성 요소는 반복 수정 루프에 구조화된 노이즈를 추가하여 LLM이 지역 최적해(local minima)에 빠지지 않게 하는 솔루션 풀입니다. 모든 에이전트는 파이썬 환경에 접근할 수 있어 자신의 작업을 프로그래밍 방식으로 즉시 확인하고 아이디어가 실제로 유기적이며 실질적인 개선인지 파악할 수 있습니다.
이 두 모델(Gemma 및 Qwen)은 긴 컨텍스트 윈도우에서 안정적인 추론을 하지 못하기 때문에, 반복 4~5회차 또는 PQF 업데이트 이후인 9~10회차에서 성능이 크게 떨어지기 시작합니다. 이는 실제 성능 저하 현상이며, 때로는 업데이트/진화된 브랜치가 지금까지의 다른 모든 브랜치보다 더 나은 결과를 낼 가능성이 있기 때문에 3회차에서 멈출 수는 없습니다. 그렇다고 3회차마다 메모리 뱅크 증류(distillation)를 수행할 수도 없는데, 이는 탐색 범위를 너무 좁게 만들기 때문입니다(프론티어 LLM은 그 정도면 잘 작동하지만요). 그래서 저는 브랜치 기록을 별도로 제공하고 각 브랜치에서 가장 성능이 좋거나 최적화된 후보를 판단하여 선택하게 한 뒤, 각 브랜치에서 최고를 뽑아 최종 심사위원에게 전달하도록 했습니다.
원문 논문 링크: https://arxiv.org/abs/2605.15222
이 스캐폴드용 깃허브 저장소 링크: https://github.com/ryoiki-tokuiten/Iterative-Contextual-Refinements

