GPT-5.6 Sol과 Luna 중 뭘 기본 코딩 모델로 쓸까? 8가지 설정으로 테스트해 봄
GPT-5.6 Sol or Luna as a daily coding default? I ran one task across 8 configs
핵심 요약
LeetCode 문제를 통해 GPT-5.6의 Sol과 Luna 모델 설정을 비교한 결과, Sol Low/Medium이 의외로 뛰어난 성능을 보임.
- 모델 설정 비교 — 8가지 GPT-5.6 구성으로 LeetCode 문제를 풀어 성능과 비용을 테스트함.
- Sol 모델의 강점 — Sol Low와 Medium이 비용 대비 효율과 코드 품질 면에서 준수한 결과를 보여줌.
- Luna 모델의 한계 — Luna는 단순 작업에는 효율적이지만 복잡한 실제 프로젝트에서는 성능이 떨어질 수 있음.
- 벤치마크의 한계 — LeetCode 문제는 학습 데이터에 포함되어 있어 실제 실무 환경을 완벽히 대변하지 못함.
Luna Max가 Sol Medium을 대체할 수 있는지, Luna를 기본 워커로 써야 하는지, 아니면 Sol을 쓰는 게 돈값 하는지 물어보는 글들이 계속 올라오네. Luna Max랑 Sol Low가 저평가됐다는 의견도 보여서, 그냥 대충 빠르게 테스트 한번 돌려봤다.
Codex 모델/추론 설정 8개를 똑같은 작업에 돌려봄:
-
GPT-5.6 Sol: Low, Medium, XHigh, Max
-
GPT-5.6 Luna: XHigh, Max
-
GPT-5.5: XHigh
-
GPT-5.3 Codex Spark: XHigh
작업 및 설정
작업은 LeetCode 3348, Smallest Divisible Digit Product II로 정했다.
LeetCode 문제를 고른 이유는 요구 사항이랑 제약 조건이 명확하게 공개되어 있고, 비공개 저장소 맥락을 몰라도 누구나 결과물을 이해할 수 있으며, 외부 테스트 스위트에 제출해서 검증까지 가능하기 때문임.
각 실행은 프로젝트별 AGENTS.md나 스킬, 저장소 맥락 같은 거 하나도 없는 깨끗한 워크스페이스에서 동시에 시작했다. 프롬프트에서 웹 검색이랑 네트워크 호출은 금지했고, 기록된 도구 활동 내역에도 검색이나 네트워크 호출은 전혀 없음.
결과
8개 구현물 전부 LeetCode에서 Accepted 받았다. 생성 시간은 모델이 응답을 내놓는 데 걸린 시간이지, 생성된 파이썬 코드가 실행되는 시간은 아님.
| Model | Reasoning | Generation time | Input tokens (cached) | Output tokens | Estimated API-equivalent cost |
|---|---|---|---|---|---|
| GPT-5.6-sol | low | 86.7s | 13,530 (9,984) | 2,775 | $0.07368 |
| GPT-5.6-sol | medium | 223.3s | 101,633 (87,552) | 7,109 | $0.23352 |
| GPT-5.6-sol | xhigh | 254.6s | 92,285 (69,376) | 9,895 | $0.31729 |
| GPT-5.6-sol | max | 368.7s | 13,322 (9,984) | 14,209 | $0.30153 |
| GPT-5.6-luna | xhigh | 251.3s | 12,339 (0) | 13,585 | $0.01877 |
| GPT-5.6-luna | max |

