SkillOpt: 마크다운 스킬 파일을 최적화 가능한 파라미터로 활용
SkillOpt treats markdown skill files as trainable parameters with proper optimization machinery
핵심 요약
마크다운 스킬 파일을 모델의 학습 가능한 파라미터로 취급하여 성능을 최적화하는 새로운 방법론이 공개됨.
- 마크다운 스킬 최적화 — 마크다운 파일을 모델의 파라미터처럼 취급해 성능을 개선함.
- 검증 기반 학습 — 자동 채점기를 통해 엄격하게 검증된 수정 사항만 반영함.
- 범용적 성능 전이 — 최적화된 스킬이 다른 모델에서도 수정 없이 성능 향상을 보임.
- 제한적 적용 범위 — 명확한 정답이 있는 코드나 스프레드시트 작업에만 효과적임.
최근 에이전트 개발자들이 임시방편으로 해오던 방식을 공식화한 논문이 나왔음. 프론티어 모델을 사용해 마크다운 스킬 파일에 대한 제한적 수정(추가/삭제/교체)을 제안하고, 모든 수정을 별도의 검증 세트로 검사함. 엄격하게 개선된 경우에만 수용하고, 동점은 거부하며, 거부된 수정은 다음 라운드를 위한 부정적 신호로 활용함.
주목할 만한 몇 가지 사항:
최고의 스킬은 많은 제안 중 1~4개의 수용된 수정으로 수렴함. 단계당 4~8개의 수정 예산이 가장 효과적이며, 제한을 없애면 성능이 급락함. 최종 스킬의 중간값은 약 920 토큰임.
Codex에서 최적화된 스킬은 수정 없이 Claude Code로 전이되어 SpreadsheetBench에서 +59.7의 성능 향상을 보임. 또한 최적화된 스킬을 적용한 GPT 4.1 nano는 절차적 벤치마크에서 프론티어 모델과 거의 대등한 성능을 냄.
한계점은 검증 게이트가 명확한 정답이 있는 자동 채점기를 요구한다는 것임. 코드나 스프레드시트에는 잘 작동하지만, 개방형 작업에는 적용이 어려움.

