GPT-6 Astra 사용량을 98% 절감해주는 오케스트레이션 패키지를 만들었습니다
I built an orchestration package that lowered my GPT-6 Astra usage by 98%
핵심 요약
DeepSeek V4.1 Flash를 활용해 Astra의 비용 효율성을 극대화하는 오케스트레이션 도구를 개발하여 사용량을 98% 줄였습니다.
- 비용 절감 — Astra 사용량을 기존 대비 98%까지 획기적으로 낮춤
- 모델 오케스트레이션 — Astra가 설계를 맡고 Flash가 구현과 테스트를 담당
- 기술적 구현 — codex-router를 통해 외부 모델을 Astra에 통합
- 성능 검증 — 7시간 빌드 런타임에서 주간 사용량의 2%만 소모함
Astra 처음 나왔을 때 첫 주는 진짜 효율 미쳤었음. 주간 제한 근처에도 안 갔는데 토큰 5억 개 정도 썼으니까. OpenAI가 준 무료 초기화 2번도 한몫했고. 근데 갑자기 제한 계속 걸리더니 그다음 5억 개 쓸 때는 초기화를 4번이나 더 해야 했음. (참고로 나 20x 플랜 쓰는 중)
그래서 Astra 사용량 다 안 태우면서 최대한 뽑아먹을 방법 이것저것 테스트해 봄. 제일 먼저 한 건 다른 에이전트에서 쓰던 스킬들 Astra에 설치해서 빌드 작업에 하위 모델 쓰게 만드는 거였음. 근데 별 효과 없더라. 사용량 한 10% 줄었나? 오히려 문제만 더 생김 (이상하게 Claude의 Fable은 네이티브 모델 쓸 땐 잘 돌아가는데 codex에선 개판임). Astra로 Sol, Luna, Opus, Sonnet 굴리면서 하위 에이전트 오케스트레이션도 해봤는데, 장단점은 있어도 드라마틱한 건 없었음.
마지막으로 Deepseek V4.1 Flash를 써봤는데, 출력 퀄리티가 바로 좋아짐 (Opus 5 쓰는 거랑 비슷함). 처음에 Astra 사용량을 60%나 줄여줘서 개꿀이었지. 근데 Astra가 여전히 오케스트레이션에 너무 개입하는 것 같아서 계속 최적화함. 지금은 테스트 결과 Astra 사용량 98% 넘게 줄였음. 오늘 7시간짜리 빌드 돌렸는데 주간 사용량 2%밖에 안 씀. 예전에 5시간짜리 빌드 돌릴 땐 28% 넘게 썼던 거 생각하면 진짜 미친 수준임.
Deepseek V4.1 Flash는 전체적으로 엄청 저렴하고 Astra랑 비교하면 그냥 공짜 수준임. 코딩 능력도 좋고 긴 작업 처리하는 게 진짜 사기임.
| Per 1M tokens | Astra estimator | V4.1 Flash | Astra is more expensive |
|---|---|---|---|
| Uncached input | $10 | $0.15-$0.30 | 33-67x |
| Cached input | $1 | $0.003-$0.006 | 167x-333x |
| Output | $50 | $0.60-$1.20 | 42-83x |
패키지는 여기 Github에 있음.
설치 방법:
- codex-router 써서 외부 모델을 codex에 바로 박아버림
- Deepseek나 openrouter API를 V4.1 Flash용으로 연결
- 레포가 ~/.agents/skills/ 에 스킬 하나 설치함
- ~/.codex/agents/ 에 Flash 역할 설치함
- ~/.codex/AGENTS.md 에 워크플로우 정책 추가함
작동 방식:
- Astra가 전체 단계에서 범위, 설계, 작업 브리핑 담당
- Flash가 각 작업이랑 단계 찾아서 구현하고 테스트하고 보고함
- Astra가 작업이랑 단계별로 검토하고 확인하거나 수정 요청함
지금 실시간으로 작업하면서 계속 테스트 중인데 결과가 벌써 미쳤음. 써보고 문제 있거나 PR 보낼 거 있으면 편하게 올려줘. 피드백은 언제나 환영임!

