GPT-6.1 Sol을 플래너로만 쓰고 로컬 27B 모델로 코딩하게 했더니 API 비용이 77% 절감됨
Using GPT-6.1 Sol only as the planner and letting a local 27B write the code cut my API bill by 77%
핵심 요약
GPT-6.1 Sol을 기획자로, 로컬 27B 모델을 코더로 활용해 API 비용을 77% 절감한 실험 결과 공유.
- 비용 절감 — API 호출 비용을 77% 줄임
- 성능 저하 — 로컬 모델 사용으로 작업 시간이 6배 이상 늘어남
- 하이브리드 방식 — 고성능 모델은 기획만, 로컬 모델은 코드 작성 담당
- 도구 활용 — Atomic Agent의 Fusion 모드를 통해 구현함

오늘 Sol 6.1이 나왔는데, 스마트 모델 가격이 이미 저렴해진 마당에 아키텍트/에디터 분리 방식이 여전히 가성비가 나올지부터 확인해봤다.
결론부터 말하면, API 비용 측면에서는 확실히 이득이다. 똑같은 3D 게임 3개(당구, 볼링, 테이블 축구)를 세 가지 방식으로 만들어봤다.
| Game | Sol alone | Sol plans, local Qwen 3.8 27B codes | Qwen 27B alone |
|---|---|---|---|
| Pool | $0.39 · 2.9 min | $0.05 · 18.6 min | $0.00 · 43.1 min (attempt) |
| Bowling | $0.14 · 1.7 min | $0.06 · 13.7 min | $0.00 · 34.7 min |
| Foosball | $0.22 · 2.0 min | $0.06 · 11.1 min | $0.00 · 36.4 min |
| Total | $0.75 · 6.6 min | $0.17 · 43.4 min | $0.00 · 114.2 min |
결과적으로 Sol 단독으로 쓸 때보다 77%나 저렴했다. 로컬 환경은 RTX 3090(24GB) 한 장 썼고.
왜 이렇게 되는지는 사실 별거 없다. 코딩할 때 나오는 토큰 대부분은 그냥 코드 그 자체거든. 계획 짜고 검토하는 건 전체에서 아주 작은 비중일 뿐이야. 그러니까 비싼 모델은 딱 작업 분배하고 결과물 확인하는 역할만 하고, 정작 코드 짜는 노가다는 토큰 비용 안 나가는 모델한테 시키면 되는 거임.
aider의 아키텍트 모드랑 똑같은 개념인데, 에디터 쪽을 내 GPU에서 여러 개 병렬로 돌린다고 보면 된다.
물론 단점도 있지:
-
느리다. Sol 단독으로 할 땐 7분도 안 걸렸는데, 이건 게임 3개 만드는 데 43분이나 걸림. 로컬 GPU 성능이 곧 속도니까.
-
절감 폭이 일정하지 않음. 당구는 87%, 볼링은 57% 줄었음. 게임당 한 번씩만 돌려본 거라 77%가 무조건 고정값이라고 보긴 힘들다.
-
이건 순수 API 비용만 따진 거임. GPU랑 전기세는 내 돈 나가는 거니까.
-
플래너는 파일이 제대로 생성됐는지만 확인하지, 코드가 제대로 돌아가는지까지는 체크 안 함. 나머지는 리뷰 단계에서 다 걸러내야 함.

