9개 모델의 에이전트 스킬 적용 테스트: Haiku 4.5가 스킬 적용 시 기본 Opus 4.7을 능가함
tested 9 models with and without agent skills. Haiku 4.5 with a skill beat baseline Opus 4.7.
핵심 요약
에이전트 스킬을 활용하면 저렴한 Haiku 모델이 고성능 Opus 모델보다 더 효율적이고 뛰어난 성능을 낼 수 있다는 연구 결과.
- 성능 향상 — 에이전트 스킬 적용 시 Haiku 모델이 기본 Opus 모델보다 더 높은 정확도를 기록함.
- 비용 효율성 — Haiku에 스킬을 추가하는 비용은 매우 낮아 Opus 대비 압도적인 가성비를 보여줌.
- 범용적 효과 — 모든 모델과 벤더에서 스킬 적용 시 성능 향상이 확인됨.
- 워크플로우 변화 — 일상적인 코딩 작업에서 고성능 모델 대신 최적화된 소형 모델 사용이 가능해짐.
공개: 저는 Tessl에서 일하며 이 연구를 공동 집필했습니다. 이 결과가 제가 매일 어떤 Claude 모델을 선택할지 생각하는 방식을 바꿨기 때문에 글을 올립니다.
저희는 880개의 평가를 실행했습니다 - 11개의 스킬 × 8개의 모델 × 5개의 시나리오, 각 스킬을 컨텍스트에 포함하거나 제외하면서요:
* Haiku 4.5 baseline: 61.2%
* Haiku 4.5 + skill: 84.3%
* Opus 4.7 baseline: 80.5%
즉, 라인업 중 가장 저렴한 모델에 스킬을 적용하니 블라인드로 실행한 가장 비싼 모델을 이겼습니다. 비용 측면에서는: Haiku-with-skill 실행 시 $0.12, 기본 Opus 실행 시 $0.61입니다.
몇 가지 강조할 점이 있습니다:
- 스킬은 전반적으로 강력한 모델보다 약한 모델에 더 큰 도움이 되었습니다. Haiku는 23.1포인트 상승했고, Opus 4.7은 14포인트 상승했습니다.
- Haiku에 스킬을 추가하는 것은 비용을 거의 움직이지 않았습니다(실행당 1.5센트 추가). Opus에 같은 스킬을 적용하면 실행당 39센트가 추가되었습니다!
- 성능 향상은 모든 벤더에서 균일했습니다 - 모든 Codex 변형과 Cursor의 Composer-2도 스킬로부터 이득을 얻었으며, 단지 그 크기가 다를 뿐이었습니다.
제가 앞으로 코딩하고 작업하는 방식에 대한 실질적인 업데이트: 커밋 메시지, 코드 리뷰, 리팩토링 제안과 같은 일상적인 작업의 경우, Haiku + 좋은 스킬 조합이면 충분히 빠르고 정확합니다. 저는 과도한 성능이 필요 없는 작업에도 기본적으로 Opus를 선택하곤 했습니다.
다른 분들은 어떻게 하고 계신지 궁금합니다 - 모든 작업에 Opus를 기본으로 사용하시나요, 아니면 Haiku나 Sonnet 워크플로우가 충분하다고 느끼시나요?
전체 벤치마크 및 방법론: https://tessl.io/blog/anthropic-openai-or-cursor-model-for-your-agent-skills-7-learnings-from-running-880-evals-including-opus-47/
면책 조항: 이 벤치마크의 11가지 스킬은 모두 코딩 중심입니다(예: node-best-practices, 커스텀 API 스킬 등); 향상 수치는 이들을 종합한 것입니다. 결과는 방향성을 제시하며 신호를 보여주기 위한 것입니다.
수정: 실험을 위해 선택한 11가지 코딩 스킬 전체 목록은 https://github.com/mcollina/skills에서 확인하실 수 있습니다 (documentation, fastify-best-practices, init, linting-neostandard-eslint9, node-best-practices, nodejs-core, oauth, octocat, skill-optimizer, snipgrapher, typescript-magician)

