후속: Pi에서의 Opus 5.5 vs GPT-6, 추론 레벨 추가 및 DeepSeek, GLM, Qwen 테스트
Follow-up: Opus 5.5 vs GPT-6 in pi, more reasoning levels + DeepSeek, GLM, Qwen
핵심 요약
다양한 모델과 추론 설정을 활용해 코딩 에이전트의 효율성과 성능을 비교한 벤치마크 후속 결과입니다.
- 모델 성능 비교 — Opus 5.5, GPT-6, DeepSeek 등 다양한 모델의 코딩 작업 효율을 테스트함
- 추론 레벨 영향 — Luna 모델의 추론 강도를 높일수록 검증 과정이 늘어나며 비용과 시간이 증가함
- 오픈 모델 분석 — DeepSeek와 GLM은 성능은 준수하나 토큰 효율성이 낮고 작업 시간이 길게 소요됨
- 향후 계획 — Opus 5.5의 추론 패턴 분석 및 Pi 에이전트 최적화를 위한 확장 기능 탐색 예정
ibragim.dev
원문 사이트로 이동
내 이전 게시물에 이어서 쓴다. 의견 준 사람들 다들 고맙다! 모델이랑 추론 설정 더 테스트해보고, Oh My Pi도 추가하고, 검증기(verifier) 쪽도 좀 손봤다. 몇몇 설정은 다시 돌린 거라 토큰 수에 약간 변화가 있을 거다. 전체 결과는 리더보드에 올려놨고, 계속 업데이트하고 확장할 생각이다.
간단 요약: 내 업무에서 뽑은 쉬운 작업 10개, 설정당 3번씩 돌림(총 30번 시도). 일단은 정확도 유지하면서 비용이랑 시간을 얼마나 줄일 수 있는지 보려고 한다.
주요 내용:
질문 답변:
Luna 노력치 더 올리면: Medium → high → xhigh 순으로 96.7% → 93.3% → 100% 나왔고, 비용은 $0.006 → $0.015, 시간은 1분 2초 → 2분 46초 걸림. 노력치를 올린다고 첫 초안이 좋아지는 게 아니라, 대부분 검증하는 데 시간을 다 씀(작업당 코드 실행 3.5회 → 5.1회). Luna가 쓰는 셸 명령어 절반은 rm -rf __pycache__ 같은 뒷정리용이더라.
Opus low 설정: 된다. Opus 5.5 low 설정으로도 다 통과함. high 설정보다 비용은 약 2.6배 싸고 속도는 2.8배 빠르다. Medium도 30/30 통과함($0.22, 1분 12초).
오픈 모델: DeepSeek-V4.1-Flash는 $0.04에 93.3% 나오는데, 테스트 통과할 때까지 코드를 8.4번이나 돌려서 4분 30초 걸림. GLM-5.3-Flash는 96.7%인데 7분 걸리고 토큰 120만 개 잡아먹음. 한 번 실패한 건 코드 없이 64k 출력 제한 걸려서 뻗은 거임. Qwen3.8-27B는 76.7% 나왔는데, 엣지 케이스에서 무한 루프 돌거나 툴 호출 안 하고 멈추는 경우가 있음.
Oh My Pi vs Pi: Luna xhigh는 작업당 툴 호출을 18번이 아니라 28번이나 하고, 토큰도 29만 개가 아니라 77만 6천 개나 씀. 비용은 2배 더 드는데 실패하는 작업도 하나 있더라.
이 정도 쉬운 작업에서는 추론을 더 시켜봤자 검증만 더 하는 꼴이다. 첫 초안부터 틀리는 어려운 작업에서는 효과가 있을지도 모르겠는데, 이건 일단 추측이다.
설정 방법이랑 는 정리해 뒀다.



