Grok 4.5와 Composer 2.5를 테스트해 봤습니다
I tested Grok 4.5 vs Composer 2.5
핵심 요약
복잡한 코드베이스에서 Grok 4.5와 Composer 2.5의 성능을 비교한 결과, Composer 2.5가 더 나은 결과를 보였습니다.
- 성능 비교 — 복잡한 Terraform/AWS 환경에서 모델별 버그 수정 능력 테스트함
- Composer 우위 — Grok 4.5보다 Composer 2.5가 더 많은 버그를 해결함
- 모델 평가 — GPT-5.6 Sol Medium은 가격 대비 성능이 좋지 않음
- 사용자 경험 — 모델마다 성능 편차가 커서 일관된 결과를 얻기 어려움
Grok 4.5 high와 Composer 2.5를 복잡한 코드베이스(Terraform, AWS)에서 테스트해 봤습니다. Opus 4.8 high로 이미 해결되어 검증까지 마친 버그 몇 가지를 해결하려고 시도했는데, 이 버그들은 메인 브랜치에 병합되지 않고 별도 브랜치에 남아있던 것들입니다. (두 모델 모두 해당 PR을 확인하지 않았음을 확실히 했으니, 정답을 베낀 것은 아닙니다.)
놀랍게도 Composer 2.5가 Grok 4.5 high보다 성능이 좋았고, 격차도 꽤 컸습니다. 더 충격적인 건 Composer 2.5가 GPT-5.6 Sol Medium보다 더 많은 버그를 수정했다는 점인데, GPT-5.6은 가격 대비 성능이 꽤 나빴습니다.
과학적인 실험과는 거리가 멀지만, 혹시 Composer 2.5로 더 좋은 결과를 얻으신 분 계신가요?


