50개의 실제 PR을 대상으로 한 GPT-6 Astra와 GPT-5.6 Sol 벤치마크, 피드백 구함
GPT-6 Astra vs GPT-5.6 Sol on 50 real PRs, looking for feedback
핵심 요약
50개의 실제 PR을 활용해 GPT-6 Astra와 GPT-5.6 Sol의 성능과 비용을 비교한 벤치마크 결과 공유 및 피드백 요청.
- 벤치마크 대상 — Cal.com, Sentry 등 50개 실제 PR을 활용해 모델 성능 비교함.
- 모델 성능 비교 — Sol은 버그 탐지 효율이 높고, Astra는 정밀도와 속도가 우수함.
- 다음 벤치마크 — 다음 주 Fable과 Opus 모델 비교를 앞두고 방법론에 대한 피드백을 구함.
Cal.com, Sentry, Discourse, Keycloak, Grafana에서 가져온 실제 PR 50개를 가지고 GPT-6 Astra랑 GPT-5.6 Sol 성능을 벤치마크해 봤음.
Sol이 확인된 버그는 더 많이 찾아냈고 버그당 비용도 저렴했는데, Astra는 더 정확하고 속도가 빨랐음. 단순히 모델이 보고한 걸 그대로 센 게 아니라 우리가 직접 하나하나 검증해서 결과를 냈음.
다음 주에는 Fable vs Opus 벤치마크 돌릴 예정임. 다음 테스트 들어가기 전에 방법론이나 수정할 부분 있으면 피드백 좀 부탁함.



