Opus 4.7 추론 설정(Low~Max)별 성능 분석: 29개 실무 작업 결과
Opus 4.7 Low Vs Medium Vs High Vs Xhigh Vs Max: the Reasoning Curve on 29 Real Tasks from an Open Source Repo
핵심 요약
Claude Opus 4.7의 추론 강도를 높인다고 성능이 비례하지 않으며, Medium 설정이 가장 효율적임이 확인됨.
- 추론 강도 분석 — Low부터 Max까지 29개 실무 작업으로 성능 비교함.
- Medium의 우위 — 테스트 통과율과 코드 품질 면에서 가장 뛰어난 성능을 보임.
- 비용 효율성 — 추론 강도를 높여도 성능 향상 없이 비용과 시간만 증가함.
- 적응형 추론 — 모델이 이미 자체적으로 추론 예산을 조절하므로 강도 설정의 영향이 제한적임.
TL;DR
Claude Code에서 Opus 4.7의 모든 추론 강도 설정(Low, Medium, High, Xhigh, Max)을 사용하여 오픈 소스 저장소(Go 언어 기반의 GraphQL-go-tools)의 동일한 29개 작업에 대해 테스트를 수행했습니다.
이번 테스트에서 Opus 4.7은 추론 강도를 높일수록 지능이 선형적으로 향상되는 모델처럼 작동하지 않았습니다. 사실, 성능 곡선은 Medium에서 정점을 찍는 것으로 보입니다.
이 결과가 이상하게 들린다면 저도 동의합니다! 이는 Opus가 비단조적인(non-monotonic) 성능을 보였던 Zod 테스트의 후속 작업이었습니다. 더 변별력 있는 저장소에서 테스트하고 싶었고, '추론 강도 증가 = 더 나은 결과'라는 가설을 신뢰할 수 없었기에 GraphQL-go-tools에서 다시 테스트를 진행했습니다. GraphQL 저장소에서의 테스트 결과는 더욱 명확했습니다. Opus는 여전히 단순한 '추론 강도 비례 성능 향상' 곡선을 보여주지 않았습니다.
Codex의 GPT-5.5와는 대조적인 결과입니다. GPT-5.5는 직관적인 곡선을 보여주며, 추론 강도가 높을수록 의미론적/검토 품질이 향상되었습니다. 해당 포스트는 여기에서 확인할 수 있습니다: https://www.stet.sh/blog/gpt-55-codex-graphql-reasoning-curve
Medium 설정은 가장 높은 테스트 통과율, 인간이 작성한 원본 변경 사항과의 가장 높은 일치도, 최고의 코드 리뷰 통과율, 그리고 최고의 종합적인 완성도/규율 점수를 기록했습니다. Low 설정은 더 저렴하고 빠르지만 정확도가 너무 떨어집니다. High, Xhigh, Max 설정은 중요한 지표에서 Medium을 앞서지 못하면서 더 많은 시간과 비용을 소모합니다.
추론 강도를 높이는 것은 단순히 비용만 증가시키는 것이 아니라, Claude의 작업 방식을 변화시키지만 판단력을 안정적으로 향상시키지는 못합니다. Xhigh 설정은 테스트/픽스처 범위를 가장 많이 부풀립니다. Max 설정은 전반적으로 더 바쁘게 움직이며 가장 큰 구현 라인 범위를 가집니다. 하지만 두 설정 모두 더 많이 생각한다고 가정함에도 불구하고, Medium보다 '더 나은' 패치를 생성하지는 못합니다.
한 가지 유력한 이유는 Opus 4.7이 적응형 사고(adaptive thinking)를 사용하기 때문입니다. 모델은 이미 작업별로 자체적인 추론 예산을 선택하므로, 강도 조절 노브는 지능을 더 구매하는 것이 아니라 이미 적응형인 정책에 편향을 주는 것에 가깝습니다. 이에 대해서는 아래에서 더 자세히 다룹니다.
대표적인 예로 PR #1260이 있습니다. 재시도 후 Medium은 실제 패치를 복구해냈습니다. 반면 High와 Xhigh는 추가 추론 예산을 사용하여 이전 PR의 커밋 해시를 찾아내고는 자신 있게 "작업 불필요"라고 선언하며 패치 없이 턴을 종료했습니다. Medium과 Max는 문자 그대로의 제어 흐름을 읽고 수정 사항을 적용했습니다.
저에게 남은 더 큰 교훈은 이것이 일회성 수동 벤치마크로 끝나서는 안 된다는 점입니다. 추론 수준이 에이전트가 작성하는 패치의 종류를 바꾼다면, 다음 단계는 에이전트가 실제 저장소 작업에서 스스로 설정을 테스트하고 개선하도록 하는 것입니다.
이 포스트에서 "동등함(equivalent)"은 패치가 병합된 인간 PR의 의도와 일치함을 의미하며, "코드 리뷰 통과"는 AI 리뷰어가 수용 가능하다고 판단했음을 의미합니다. 완성도/규율은 0-4점의 유지보수성/스타일 기준이며, 풋프린트 위험은 에이전트가 인간 패치 대비 얼마나 많은 추가 코드를 건드렸는지를 나타냅니다.
또한 예쁜 차트와 작업별 상세 분석이 포함된 대화형 버전도 만들었습니다: https://stet.sh/blog/opus-47-graphql-reasoning-curve
데이터:


