GPT-5.6 Sol부터 GPT-6.1 Sol까지: pi와 Codex 미니 벤치마크 업데이트
GPT-5.6 Sol → GPT-6 Sol → GPT-6.1 Sol in pi and Codex: another mini-bench update
핵심 요약
다양한 모델의 코딩 성능과 비용 효율성을 비교한 미니 벤치마크 업데이트 결과입니다.
- 모델 성능 비교 — GPT-5.6부터 6.1까지의 추론 성능과 비용 효율성을 분석함
- 벤치마크 업데이트 — 캐시 적중률 지표를 추가하고 10개 작업으로 3회 반복 테스트함
- Codex 효율성 — GPT-6.1로 넘어가면서 턴 수와 토큰 사용량이 크게 감소함
- 향후 계획 — 더 어려운 작업 세트를 구축하고 pi-agent 확장 도구를 테스트할 예정임
ibragim.dev
원문 사이트로 이동
my-mini-bench 관련해서 올린 글들 봤을 거야: 1 post, 2 post. 글 자주 올려서 미안! 이번에 GPT-5.6 Luna, Terra, sol, GPT-6, 그리고 GPT-6.1 Sol(sol은 Pi랑 Codex 둘 다)을 medium reasoning으로 추가했고, 얘네가 어떻게 돌아가는지 좀 더 자세히 살펴봤어. 아, cache hit rate 지표도 추가함. input/output 토큰을 어떻게 제대로 넣어야 할지 잘 모르겠어서, 표가 너무 지저분해지지 않게 조절했어.
설정은 똑같아: 내 작업에서 뽑은 10개 태스크 × 설정당 3번씩 실행, Harbor 통해서 돌렸고. 이미지는 이번에 새로 돌린 결과고, 전체 리더보드에서 비교 데이터 다 볼 수 있어.
최신 모델들은 여기 있는 태스크 다 풀어버리네. 그래도 이번 테스트로 유용한 인사이트는 얻었어. 어떤 설정이 더 빠르고 싸게 먹히는지, 행동 패턴은 어떻게 바뀌는지, 그리고 그 차이가 왜 발생하는지 같은 것들 말이야.
예를 들어, GPT-6에서 GPT-6.1로 넘어오면서 Codex는 턴 수는 20%, 토큰은 22% 줄었는데, pi는 턴 수 8번 정도에 비용도 거의 그대로였어.
모델들이 파일 읽고, 코드 짜고, 테스트하고, 계획 수정하는 방식 비교한 스크린샷들을 X 스레드에 짧게 정리해 뒀어. 세대 바뀌면서 패턴이 좀 변한 것들도 있더라.
지금은 모델들이 실제로 뭘 풀 수 있는지 제대로 비교해 보려고 더 어려운 태스크 세트 만드는 중이야. 아마 업데이트 한 번 더 하고, 결과 올리는 건 좀 쉬면서 그쪽에 집중할 생각임.
결과를 더 좋게 만들거나 시간/비용 줄여줄 만한 툴이나 pi-agent 확장 프로그램들도 테스트해 볼 예정이야.
혹시 에이전트들이 토큰이나 턴 수를 어디서 아끼고 어디서 날려먹는지 흥미로운 패턴 발견한 거 있으면 알려줘. 테스트해 볼 만한 pi 확장 프로그램 추천도 환영!


