Claude Code 공식 문서 - Opus 5.5와 Fable 5.1의 Effort 설정
Claude Code Official Docs - Effort with Opus 5.5 and Fable 5.1
핵심 요약
Claude Code의 새로운 벤치마크와 Effort 설정에 대한 심층 분석 및 실무 활용 가이드.
- 벤치마크 데이터 — 내부 테스트 결과와 극단적인 작업 환경에서의 성능을 분석함.
- Effort 메커니즘 — 시간 예산을 늘려 Claude가 스스로 검증하고 더 많은 호출을 수행하게 함.
- 실무 워크플로우 — 작업 유형에 따라 Effort 단계를 조절하고 사전에 명확한 스펙을 설계하는 것이 중요함.
- 효율적 활용 — 잘못된 접근 방식을 Effort로 해결할 수 없으므로 계획 단계가 필수적임.
Opus 5 결과물 보고 충격받아서 문서 읽는 거 멈췄었는데, 아직도 읽어볼 만한 좋은 내용들이 계속 나오네. Claude 코드 팀에서 일하는 Anthropic 직원이 쓴 Terminal-Bench 3.0 심층 분석 글인데 이거 진짜 물건임.
캐시, 노력치(effort), 벤치마크 관련해서 흥미로운 내용이 많은데, 핵심은 결국 '설계랑 스펙을 잘 짜야 한다'는 거임.
문서에서 다룬 9가지 핵심 포인트를 3개 섹션으로 정리해 봄:
섹션 1 - 벤치마크 데이터: Anthropic이 이 기능들을 어떻게 테스트했고 수치가 뭘 의미하는지.
-
수치는 전부 내부 데이터임. Anthropic이 직접 돌린 거고, 작업당 5번 시도, 일부 안전 기능은 끈 상태라 공개 리더보드랑은 결과가 다를 수밖에 없음.
-
벤치마크 과제가 존나 빡셈. 게임 콘솔 칩 설계나 정식 수학 증명 같은 건데, 일반적인 코딩보다 훨씬 어려움. 이론상으로는 일상적인 작업도 더 잘한다는 소리인데, 어디까지나 '이론상'임.
-
단계가 올라갈수록 점수는 잘 나오는데 토큰은 더 많이 처먹음. 이제 Claude 코드에서 노력치(effort)를 바꿔도 프롬프트 캐시가 안 깨짐. 이거 진짜 개꿀임.
-
분야마다 차이가 큼. 보안이나 하드웨어 쪽은 점수가 확 뛰는데, 규칙이 빡빡한 관리 작업은 별 차이 없음. 이건 그냥 개이득인 부분임.
섹션 2 - 노력치 메커니즘: 노력치 레벨을 올리면 내부적으로 무슨 일이 일어나는지.
-
스펙을 상세하게 짜면 노력치 영향력이 줄어듦. 대충 시키면 노력치가 높을수록 지 맘대로 기능 추가하고 추측해서 만듦. 예: 피트니스 앱 만들 때 낮음(low)은 1.5분, 최대(max)는 67분 걸림. 근데 스펙을 완벽하게 짜면 어떤 레벨이든 비슷하게 나옴. 팁: 그냥 설계랑 스펙을 잘 짜라.
-
노력치는 놓친 엣지 케이스를 잡아주는 거지, 잘못된 접근 방식을 고쳐주는 게 아님. Claude가 과제를 잘못 이해했으면 노력치를 높여봤자 소용없음.
-
노력치의 정체: 시간 예산(time budget). 높게 설정할수록 Claude가 테스트를 더 많이 하고, 지가 짠 코드를 검토하고, 스스로 호출을 더 많이 함.
섹션 3 - 실무 워크플로우: 이 설정들을 매일 하는 개발 업무에 어떻게 써먹을지.
-
경험칙: 브레인스토밍이나 간단한 수정은 낮음(low), 일상적인 기능 구현은 중간(medium), 기존 코드 버그 수정은 높음(high), 완전히 자동화된 빡센 작업은 최대(max).
-
따라 할 만한 루프: Claude한테 스펙에 대해 인터뷰하게 시키고, 낮음(low)으로 빌드하고, 낮음(low)으로 검토 및 수정하고, 마지막에 높음(high)으로 테스트 및 검증. /effort 명령어로 언제든 전환 가능.
인상 깊은 문구 (첫 문장):
"우리의 최신 Claude 모델들이 가진 가장 큰 장점 중 하나는 Claude Code에서 프롬프트 캐시를 깨뜨리지 않고도 노력치(effort) 설정에 반응한다는 점이다."
