DeepSWE에서 GPT 6 Sol이 GPT 5.6 Sol보다 낮은 점수를 기록함
GPT 6 Sol worse than GPT 5.6 Sol on DeepSWE
핵심 요약
GPT 6 Sol이 이전 모델보다 벤치마크 점수는 낮지만, 비용 효율성과 실사용 성능 면에서 더 낫다는 평가가 지배적입니다.
- 벤치마크 결과 — GPT 6 Sol이 DeepSWE에서 68.8%를 기록하며 5.6 Max의 72.7%보다 낮은 성능을 보임
- 비용 효율성 — 점수는 소폭 하락했으나 토큰 사용량과 처리 시간이 절반 이하로 줄어들어 실사용자에게는 더 유리함
- 모델 활용 — Luna 6 모델이 에이전트 작업에서 뛰어난 효율을 보이며 실무에서 강력한 성능을 발휘함
- 안전성 강조 — 일부 사용자는 성능 수치보다 모델의 안전성이 더 중요한 지표라고 평가함



