pi-agent에서 Opus 5.5 vs GPT-6 Sol / Luna 비교: 실제 코딩 작업 결과
Opus 5.5 vs GPT-6 Sol / Luna in pi-agent: results on my everyday coding tasks
핵심 요약
개인 코딩 작업 벤치마크를 통해 모델별 성능과 비용 효율성을 비교 분석함.
- 벤치마크 구축 — 3개월간의 에이전트 채팅을 기반으로 10가지 코딩 작업을 자동화함.
- 모델 성능 비교 — Luna 모델이 Sol 대비 22배 저렴하면서도 높은 성공률을 기록함.
- 최적화 목표 — 코딩 작업의 성공률은 유지하면서 비용과 처리 시간을 줄이는 데 집중함.
- 향후 과제 — 단순 작업은 이미 모델들이 잘 처리하므로 속도와 병렬 처리가 중요해짐.
실제 코딩 작업 내용을 바탕으로 나만의 작은 개인용 벤치마크를 만들었고, pi-agent를 하네스로 써서 같은 작업으로 모델들을 비교해 봤다.
데이터 엔지니어링, 백엔드, 프론트엔드, 데브옵스, 그리고 트래젝토리 분석까지 총 10개 태스크로 구성했다. 각 태스크를 3번씩 돌려서 모델당 총 30번의 시도를 거쳤다.
이걸 만들려고 3개월치 에이전트 채팅 기록을 싹 긁어모아서 중복 제거하고, 괜찮은 세션들을 골라 자동 검증기가 포함된 Harbor 태스크로 바꿨다. 에이전트랑 직접 수동 검토를 병행하면서 체크 로직을 다듬었다. 원래 내가 하면 1시간도 안 걸릴 만한, 범위가 확실한 작업들이다.
최신 결과는 다음과 같다:
-
Opus 5.5 high랑 Astra low는 비용이 거의 비슷하다.
-
Sol high는 그 점수를 거의 절반 가격에 뽑아낸다.
-
Luna는 30번 중에 29번 성공했는데, Sol보다 22배 정도 싸다.
이 벤치마크의 목적은 내 일상적인 작업 환경(모델, 하네스, 프롬프트, 플러그인)을 최적화하는 거다. 성공률은 유지하면서 비용이랑 시간을 줄이고 싶거든.
개인적인 작은 샘플이긴 하지만, 짧고 명확하게 정의된 코딩 작업들은 이미 여러 모델이 충분히 안정적으로 처리하는 느낌이다. 이런 작업들에 있어서는 이제 속도, 비용, 그리고 병렬 에이전트를 얼마나 확장할 수 있는지가 훨씬 더 중요한 문제가 되고 있다.


