Astra Low vs Luna Max 구현 실험, 2부: 결과
Astra Low vs Luna Max implementer experiment, Part 2: Results
핵심 요약
Astra Low가 Luna Max보다 코딩 구현 작업에서 더 빠르고 정확하며 효율적임을 입증한 실험 결과입니다.
- 실험 결과 — Astra Low가 더 적은 토큰과 시간으로 고품질 코드를 구현함
- 성능 비교 — Astra는 수리 없이 8분 만에 완료한 반면 Luna는 수리 포함 56분 소요됨
- 운영 전략 — Luna를 컨텍스트 수집 및 오케스트레이터로, Astra를 구현자로 활용하는 방식 제안
- 실험 방법론 — 변수를 통제한 단순화된 환경에서 작업 패킷을 분리하여 효율성 극대화
Astra Low가 압승이다. Plus 계정에서 복잡한 와이어프레임 기능을 구현해 봤는데, 5시간 동안 Luna는 27%, Astra는 29%를 써서 비용은 거의 비슷했다. 주간 총 소모량: Astra 2%, Luna 1%.
소모량 대부분은 컨텍스트 로딩에서 나왔다. Sol이 어느 정도 지분을 차지하는 것 같아서 다음 테스트를 준비 중이다. 내 프로덕션 모델은 모호함을 최대한 쳐내니까, 다음 실험은 Luna Max를 오케스트레이터로, Astra Low를 구현자로 쓰는 조합이랑, 그냥 Astra만 쓰는 걸로 가볼 생각이다.
요약:
Astra가 이겼다. 작업 완료까지 Astra는 8분 16초 걸렸는데, Luna는 36분 18초에 수정 시간 19분 42초까지 추가로 들어갔다. Luna MAX는 수정 두 번 들어갔고, Astra는 한 번도 안 했다.
토큰 텔레메트리 결과:
Luna Max (수정 2회 포함):
-
총 보고 토큰: 191,839
-
입력: 176,284
-
캐시된 입력(별도 보고): 3,788,544
-
출력: 15,555
-
추론 출력: 4,527
-
워커 세션: 3
Astra Low:
-
총 보고 토큰: 79,870
-
입력: 72,402
-
캐시된 입력(별도 보고): 1,200,256
-
출력: 7,468
-
추론 출력: 2,964
-
워커 세션: 1
작업 품질: 말할 것도 없이 Astra가 압승이다. 작업 의도를 훨씬 잘 파악했고, 코드 퀄리티나 최종 결과물도 더 좋았다. 디자인도 깔끔하고 UI 문구도 덜 모호함.
앞으로 며칠 동안은 다른 앱 프로젝트들로 Astra Low랑 Luna Max 비교 검증을 해볼 생각이다. 이 패턴이 계속 유지되면 Astra Low를 메인 코딩 구현자로 박을 거다.
추가 참고: 이건 아주 기본적인 환경에서 돌린 결과다. 변수를 최대한 줄이려고 스킬 같은 건 다 뺐고, 작업 범위가 명시된 디자인 문서만 가리키는 간단한 AGENTS.md만 썼다.
나는 LLM 프로덕션을 설계할 때 사고 과정을 최대한 앞단으로 빼도록 만들었다. codex/work는 계획 짜는 데 안 쓰고 오직 Chat만 쓴다. 이렇게 하니까 토큰 소모도 줄고 효과가 아주 좋다. 작업을 깔끔하게 쪼개고, 필요하면 의사 코드(pseudocode) 쓰고, 최대한 군더더기 없이 돌린다. 핵심이 뭐냐고? 이 실험 결과를 절대적인 진리로 받아들이지 마라. 네 환경은 다를 수 있으니까.


