Opus 4.7 대 Codex 5.4의 대결이 오늘 막을 내린 과정
How the saga Opus 4.7 vs Codex gpt 5.4 came to an end today
핵심 요약
Claude Opus 4.7과 Codex 5.4의 코딩 성능 및 비용 효율성을 비교 분석한 결과, 상호 교차 검증의 중요성이 강조됨.
- 성능 비교 — Opus 4.7과 Codex 5.4의 코드 생성 및 감사 능력을 실제 에픽으로 테스트함.
- 교차 검증 — 모델 간 상호 감사를 통해 단일 모델의 한계를 보완하는 것이 가장 효과적임.
- 비용 효율성 — Codex가 속도와 비용 면에서 우위를 점했으나, Opus의 정밀한 감사 기능은 여전히 유효함.
- 도구 활용 — 특정 모델에 의존하기보다 작업 성격에 맞춰 두 모델을 병행 사용하는 전략이 권장됨.
2월 초, Opus가 품질을 보장하던 시절에 Opus 4.6으로 완료했던 에픽을 하나 꺼내 들었어. 내 에픽들은 이미 스토리 분류, 파일 계획, 아키텍처 문서, 스키마, 계약, 클래스/함수 시그니처가 다 갖춰진 상태였지.
오늘 4.6으로 완료된 에픽을 다시 감사해봤어:
-
Opus 4.7: 3개 이슈 (치명적 0, 주요 2, 경미 1)
-
Codex: 9개 이슈 (치명적 2, 주요 3, 경미 4, 근거 없는 '드라마 퀸' 이슈 2개)
4.7에게 물어보니, 자기가 식별하지 못한 6개의 이슈에 대해 동의하더라고… 🙄
그다음 둘 다에게 똑같은 새로운 에픽을 줬어:
-
Opus가 프로덕션용 LOC를 20% 더 많이 생성함 (독스트링 제외)
-
Opus 4.7이 자기 코드를 스스로 감사함: 8개 이슈 (치명적 3, 주요 2, 경미 3)
-
Codex가 자기 코드를 스스로 감사함: 2개 이슈 (치명적 1, 주요 1)
둘 다에게 실수 수정하라고 시켰어. 둘 다 이제 자기 감사가 이슈 제로라고 확인하더군. 그래서 Codex한테 Opus를 감사하게 하고, 반대로 Opus한테 Codex를 감사하게 시켰지:
-
Codex의 Opus 4.7 감사: 14개 이슈 (치명적 6, 14개 전부 유효)
-
Opus의 Codex 감사: 11개 이슈 (치명적 0, 11개 중 5개만 유효)
Codex가 Opus 4.7보다 거의 2배 빠르게 끝냈어. 둘 다 높은 사고 모드(high thinking mode)였지. Codex($136/월)는 거의 소비한 게 없다고(2%) 하고, Opus($280/월)는 5시간 세션의 33%와 주간 한도의 8%를 썼다고 하네…
그다음 Opus 4.7과 Codex에게 이 에픽을 위한 가장 견고한 구현을 식별하라고 했어. 둘 다 Codex가 낫다고 동의하더군.
"코딩 판단력에서 가장 날카로운 차이를 발견했어. E27_a는 SignalV2 객체를 수동으로 백필(backfill)하다가 모델 계약을 깨뜨렸고, E27_b는 리포지토리 모델 변환을 재사용해서 그런 유형의 실패를 완전히 피했어. E27_b 백필 경로에 대해 비변형 스모크 테스트를 하나 수행해서 추천이 정적 읽기에만 기반하지 않도록 할 거야.
...E27_a 문제 6건 확인...
결론: E27_b의 문제는 국소적이고 수정 가능함(SQL 술어 2개 + 누락된 e2e 테스트 1개 + 문서 조정 1개). E27_a의 문제는 구조적임(백필 스크립트가 모델 매핑을 거치지 않아서 런타임에 이미 증상이 보임). 반복 가능한 수정의 비대칭성과 더 나은 구성 루트를 고려할 때, E27_b가 앞으로 나아갈 더 강력한 기반임."
그래서 내 $280/월 Claude 구독은 이제 $140/월 구독이 됐고, 내 $30/월 ChatGPT 구독은 이제 $136/월 구독이 됐어. Claude는 몇 주나 몇 달 안에 $20/월로 내려갈지도 모르겠네.

