MineBench에서 GPT-5.4와 GPT-5.5 비교
GPT-5.4 compared to GPT-5.5 on MineBench
핵심 요약
MineBench 벤치마크를 통해 GPT-5.4와 GPT-5.5의 성능 차이와 비용 효율성을 비교 분석함.
- 모델 성능 비교 — GPT-5.4는 프롬프트 충실도가 높고, 5.5는 창의성을 더하려다 불필요한 코드를 생성함.
- 비용 효율성 논쟁 — 5.5가 5.4보다 API 비용이 높지만, 토큰 효율성 덕분에 실제 비용은 비슷하다는 의견이 있음.
- 벤치마크 주관성 — MineBench는 정답이 없는 주관적 평가 방식이라 모델 간 순위가 사용자마다 다를 수 있음.
- 이미지 생성 기능 — GPT-5.5 모델 자체와 별개로 GPT 이미지 API의 한계에 대한 불만이 제기됨.
제가 일반적인 MineBench 담당자는 아니지만, 그들의 트위터 계정에서 이걸 발견했습니다.
https://www.reddit.com/r/singularity/comments/1sofehv/differences_between_opus_46_and_opus_47_on/

