3라운드: Claude Opus 4.7 1M vs Opus 4.7 vs Opus 4.6 Legacy vs Sonnet 4.6, 동일한 React 기능 구현 과제에서의 노력 수준별 비교
Round 3: Claude Opus 4.7 1M vs Opus 4.7 vs Opus 4.6 Legacy vs Sonnet 4.6 across effort levels on the same real React feature-build task
핵심 요약
Claude Opus 4.7 1M 모델이 전반적으로 가장 우수한 성능을 보였으나, 'Max' 노력 수준이 항상 더 나은 결과를 보장하지는 않음.
- 모델 성능 비교 — Claude Opus 4.7 1M이 코드 품질 점수에서 가장 높은 성적을 기록함.
- 노력 수준 효율성 — 무조건 높은 노력(Max) 설정이 더 나은 품질을 보장하지 않으며 비용만 증가시킬 수 있음.
- 실제 프로젝트 테스트 — React 앱 기능 구현이라는 실무적인 과제로 모델 간 성능 차이를 검증함.
- 향후 비교 계획 — 이번 결과를 바탕으로 OpenAI 모델들과의 가성비 및 성능 비교를 진행할 예정임.
자, 3라운드 시작합니다.
며칠 전 2라운드 결과를 올렸었죠. 벤치마크를 통해 GPT-5.4, GPT-5.5, GPT-5.3-codex, GPT-5.4-mini를 같은 React 프로젝트와 기능 구현 프롬프트로 테스트했습니다. 테스트에 사용된 노트 앱은 여기 있습니다.
이번 라운드는 첫 번째 실험에서 얻은 많은 유용한 피드백을 반영한 결과입니다.
첫 번째 버전은 Git 저장소(Express JS) 요약을 기반으로 했지만, 요약 방식은 매우 주관적이라는 문제가 있었습니다(모든 요약은 관점이나 선호도에 따라 본질적으로 '정답'이 될 수 있으니까요).
그래서 2라운드부터는 더 실용적인 방식으로 바꿨습니다. 모든 모델에 동일한 저장소 내에서 동일한 실제 코딩 과제를 주고, 실제 기능 구현을 비교하는 방식이죠.
3라운드에서는 Claude Code를 통해 Anthropic 모델들로 같은 방식의 실험을 반복했습니다.
테스트한 모델 및 모델 제품군은 다음과 같습니다:
- Claude Opus 4.7 1M
- Claude Opus 4.7
- Claude Sonnet 4.6
- Claude Opus 4.6 Legacy
- Claude Haiku 4.5 (결과 도출 실패로 최종 결과에서는 제외)
과제는 이전과 동일한 실제 기능 구현 벤치마크였습니다. 기존 앱 동작을 유지하고 프롬프트 제약 조건을 준수하면서 작은 React 노트 앱 내에 개요 패널을 구현하는 것이었죠.
각 모델과 노력 수준 조합을 Claude Code 프로그래밍 방식 접근을 사용하여 별도의 Git 작업 트리에서 실험했습니다. 모든 실행은 동일한 저장소와 프롬프트를 사용했습니다. 실행이 완료된 후, 점수 체계를 적용하기 전에 UI에서 실제로 구현이 작동하는지 먼저 확인했습니다. 그 후 4개의 모델이 동일한 코드 품질 속성 세트를 기준으로 채점하고 평균 점수를 냈습니다.


