GPT-5.6 Sol, Luna, Terra: 단일 순위 대신 비용, 속도, 성능으로 선택하기
GPT-5.6 Sol, Luna and Terra: choosing by cost, speed and capability instead of one universal ranking
핵심 요약
DeepSWE 벤치마크를 기반으로 작업 성격에 맞는 최적의 GPT-5.6 모델 선택 전략을 제안합니다.
- 모델 선택 전략 — 비용, 속도, 성능을 고려한 최적의 모델 라우팅 제안
- Luna 모델 활용 — 비용 효율적인 반복 작업 및 검증 가능한 태스크에 적합
- Sol 모델 활용 — 복잡한 디버깅 및 아키텍처 설계 등 고성능이 필요한 작업에 권장
- 벤치마크 한계 — DeepSWE는 참고 지표일 뿐 실제 성능은 환경에 따라 다름
최근에 나온 DeepSWE 결과들, 특히 GPT-5.6 Sol, Luna, Terra 변형 모델들을 쭉 훑어봤거든. 결론부터 말하자면, 어떤 모델이 "최고냐"고 묻는 건 애초에 질문 자체가 잘못된 거 같아.
진짜 중요한 질문은 이거지: 비용, 속도, 깡성능, 신뢰성 중에서 뭘 최우선으로 잡을 거냐?
관련 결과는 여기:
내가 실전에서 써보고 내린 해석은 이래:
Luna max는 시간보다 비용이 중요할 때 가성비가 제일 좋아. Sol max보다 점수는 6점 정도 낮지만, 비용은 거의 14배나 싸거든. 단계(step)를 훨씬 많이 쓰니까 속도가 느리거나 돌아갈 순 있어도, 계획 잘 짜고 수락 기준이랑 테스트 확실하게 잡아두면 복잡한 작업에서도 꽤 매력적인 선택지야.
Sol high는 프리미엄급에서 밸런스가 제일 좋아. Sol max랑 점수 차이도 4점밖에 안 나는데 비용은 훨씬 저렴하고, Terra max보다 토큰이랑 단계도 훨씬 적게 먹어. 속도랑 신뢰성 둘 다 챙겨야 하는 어려운 작업에는 이게 제일 합리적인 기본값이 될 거야.
Sol xhigh는 '최상급 바로 아래' 옵션이야. Sol max 성능에 근접하면서도 돈은 꽤 아낄 수 있거든. 일상적인 작업에 쓰기엔 좀 아깝지만, Sol high로 해결 안 되는 어려운 디버깅이나 아키텍처 설계, 깊이 있는 코드 분석할 땐 이게 딱이야.
Sol max는 진짜 중요하거나 난이도 극악인 문제에만 쓰는 게 맞아. 원인 모를 버그, 아키텍처 결정, 리포지토리 전체 분석처럼 틀렸을 때 치르는 대가가 모델 비용보다 훨씬 클 때만 꺼내 쓰는 거지.
Luna xhigh는 작고 반복적이고 검증하기 쉬운 작업에 딱이야. 특히 대량으로 돌릴 때 좋지. 근데 0.3달러만 더 쓰면 Luna max가 성능 10% 포인트 정도 더 나오니까, 개별 작업 단위로 보면 그냥 max 쓰는 게 나을 수도 있어.
Terra max는 계획이 이미 다 짜여 있을 때 강력한 실행기 역할을 한다는 점에선 여전히 흥미로워. 근데 이 수치들만 보면 전반적으로 Sol high가 더 효율적인 거 같아. Terra xhigh는 Sol medium, Terra high, Terra max 사이에서 좀 애매한 포지션이고.
간단하게 라우팅 전략을 짜보자면 이래:
Luna xhigh → Luna max → Sol high → Sol xhigh → Sol max
모든 작업을 무조건 제일 싼 티어부터 시작할 필요는 없어. 복잡하고 모호한 문제는 처음부터 Sol high나 xhigh를 박는 게 맞고, 테스트 코드 확실한 구현 작업은 Luna max로 돌리는 게 완벽하지.
벤치마크나 데이터 소스가 워낙 많아서 DeepSWE가 실제 Codex 사용 환경을 제대로 반영 못 한다고 까는 사람들도 있을 거야. 그 말도 일리는 있어. 근데 솔직히 어떤 벤치마크도 절대적인 진리는 아니잖아. 모든 평가는 제한된 환경, 에이전트 설정, 작업 분포 안에서만 측정되는 거니까.
나는 DeepSWE를 최종 판결문이 아니라 유용한 지표 중 하나로 봐. 결국 실전 성능은 리포지토리 상태, 프롬프트, 계획, 테스트, 그리고 어떤 일을 하느냐에 따라 갈리는 거니까.
너희들은 Sol, Luna, Terra 써보면서 어땠어? 내가 생각한 라우팅 방식이랑 비슷하게들 쓰고 있나?


