구현 전용 5.6 Luna vs Terra medium vs Sol medium 테스트
Testing 5.6 Luna vs Terra medium vs Sol medium for implementation only
핵심 요약
Luna XHigh 모델이 상세한 구현 계획 하에서 비용 대비 가장 우수한 성능을 보여줌.
- 테스트 환경 — 오케스트레이터 워크플로우를 통해 모델별 구현 성능을 비교함.
- 모델 성능 — Luna XHigh가 Luna Max와 동일한 품질을 유지하면서 비용은 더 저렴함.
- 계획의 중요성 — 상세한 구현 계획이 모델의 결함 없는 결과 도출에 핵심적임.
- 비용 효율성 — Luna Medium은 저렴하지만 신뢰도가 낮고 Sol Medium은 비용이 매우 높음.
내 테스트 결과를 공유해. 업무용으로 오케스트레이터 워크플로우(예: 스크립트가 codex exec를 실행)를 사용하는데, 계획(.md 파일로 저장), 구현, 코드 리뷰, 검증 등이 각각 별도의 세션을 가짐(서브 에이전트가 아님). 이렇게 하면 Cursor나 Codex 같은 하네스 간에 전환할 수 있고, 각 단계나 기능에 따라 모델과 추론 수준도 바꿀 수 있어.
작업은 두 개의 레포지토리에 걸친 기능이었고, 그 사이에는 내부 API 계약이 있는 Java 및 TypeScript 서비스였어. 각 모델은 동일한 3,378단어의 구현 계획을 받았는데, 여기에는 수락 기준, 종속성, 코드 앵커, 검증 작업이 포함된 11개의 스토리가 포함되어 있었어.
참고: 모델들은 계획을 구현하기만 했고, 직접 만들지는 않았어. 내 오케스트레이션 작업은 항상 에픽(PR을 나타냄)과 검증 가능한 스토리로 세분화돼.
각 구성에 대해 세 번의 시도를 수행했어:
| Model | Defect-free trials | Checks | Expected behaviors | Avg Cost |
| --- | --- | --- | --- | --- |
| Luna Medium | 0/3 | 12/15 | 14/15 | $0.1412 |
| Luna High | 1/3 | 13/15 | 13/15 | $0.4685 |
| Luna XHigh | 3/3 | 15/15 | 15/15 | $0.5917 |
| Luna Max | 3/3 | 15/15 | 15/15 | $0.8199 |
| Terra Medium | 0/3 | 12/15 | 12/15 | $1.0594 |
| Sol Medium | 0/3 | 12/15 | 12/15 | $11.0130 |
내가 본 것:
- Luna XHigh는 이 작업에서 가격 대비 최고의 결과를 일관되게 전달했고, 모든 품질 측정에서 Luna Max와 대등했어. 반면 Luna Max는 비용이 더 많이 들고 시도당 약 40% 더 오래 걸렸어.
- Luna Medium은 훨씬 저렴했지만 신뢰성이 충분하지 않았어. Luna High는 더 근접했지만, 두 번의 시도에서 여전히 라우팅 계약을 잘못 구현했어.
- 상세한 계획이 정말 중요해. 훨씬 짧고 덜 상세한 계획으로 했던 초기 테스트에서는 어떤 Luna 구성도 세 번의 결함 없는 시도를 만들어내지 못했어. 상세한 계획을 사용하니 Luna XHigh와 Max 모두 3/3을 달성했어.


