Sonnet 4.6과 스킬 사용 시 Opus 4.7과 1.2점 차이, 비용은 3분의 1 수준
Sonnet 4.6 with a skill lands within 1.2 points of Opus 4.7 with a skill - at a third of the cost
핵심 요약
AI 에이전트 스킬을 활용해 Sonnet 4.6이 Opus 4.7과 대등한 성능을 내면서 비용을 대폭 절감했다는 주장.
- 성능 비교 — 스킬 적용 시 Sonnet 4.6이 Opus 4.7과 1.2점 차이의 정확도를 보임.
- 비용 효율성 — Sonnet 4.6 사용 시 Opus 대비 약 3분의 1 수준의 비용으로 운영 가능.
- 평가 방법론 — 11가지 코딩 스킬을 활용해 880개의 평가를 진행한 결과임.
- 커뮤니티 반응 — 평가 기준의 모호함과 마케팅성 문구에 대해 강한 비판을 받음.
나는 Tessl에서 일하고 있고(미리 밝혀둠), 우리는 9개 모델에 걸쳐 880개의 평가를 마쳤어. https://github.com/mcollina/skills에서 가져온 11가지 코딩 스킬(documentation, fastify-best-practices, init, linting-neostandard-eslint9, node-best-practices, nodejs-core, oauth, octocat, skill-optimizer, snipgrapher, typescript-magician)이 어떻게 작동하는지 확인하기 위해서지.
수정: 스킬이 익숙하지 않은 사람들을 위해 설명하자면, 에이전트 스킬은 에이전트에게 제공하는 마크다운 파일이야. 에이전트에게 전문 지식, 워크플로우, 도구 통합 기능을 확장해 주지. 이 벤치마크에 포함된 11가지 스킬은 모두 코딩에 초점이 맞춰져 있어(예: node-best-practices 및 커스텀 API 스킬). 리프트 수치는 이들을 종합한 결과야. 결과는 방향성을 제시하며 신호를 보여주기 위한 목적이야.
스킬을 로드했을 때의 전체적인 헤드라인 수치는 다음과 같아:
* Opus 4.7: 94.5% 정확도, $1.00/run, ~159s
* Opus 4.6: 93.8% 정확도, $0.53/run, ~127s
* Sonnet 4.6: 93.3% 정확도, $0.31/run, ~125s
스킬이 컨텍스트에 포함되면 Opus 4.7과 Sonnet 4.6 사이의 격차는 1.2포인트가 돼. 스킬이 없을 때는 격차가 5포인트에 가까웠으니, 스킬이 모델 등급 간의 정확도 격차를 줄여주는 셈이지.
하루에 20번의 에이전트 호출을 하는 100명의 개발자 팀을 기준으로 대략 계산해 보면, Opus-with-skill은 월 약 6만 달러, Sonnet-with-skill은 월 약 1만 8,600달러가 들어. 같은 스킬을 사용하면 가장 어려운 5%의 작업을 제외하고는 비슷한 결과물을 내지.
일상적인 작업을 위해 Opus에서 Sonnet으로 다운그레이드했다가 후회한 적이 있는지, 아니면 괜찮았는지 궁금해. 시도했을 때 무엇이 망가졌어?
방법론과 다른 6가지 발견 사항이 포함된 전체 보고서: https://tessl.io/blog/anthropic-openai-or-cursor-model-for-your-agent-skills-7-learnings-from-running-880-evals-including-opus-47/


