GPT 6 Astra 88%, Fable 5.1 74%, GLM 5.3 98% 할인 등 400개 이상의 모델을 지원하는 Openrouter 대안을 만들었습니다
I built Openrouter, except you save 88% on GPT 6 Astra, 74% on Fable 5.1, 98% on GLM 5.3, and 400+ more models
핵심 요약
다양한 할인 모델을 통합하여 API 비용을 획기적으로 절감해 주는 자동 라우팅 서비스를 개발했습니다.
- 비용 절감 — 여러 할인 제공업체를 통합하여 토큰당 단가를 최적화함
- 자동 라우팅 — 요청별로 가장 저렴하고 신뢰할 수 있는 모델로 자동 연결함
- 모델 퓨전 — 자체 분류 모델을 통해 여러 모델을 조합하여 성능과 효율을 극대화함
- 사용자 반응 — 파격적인 할인율에 관심을 보이면서도 보안 및 신뢰성에 대한 의문을 제기함
나 지금 ChatGPT Pro 200달러짜리 플랜 하나 쓰는데, GPT-6 Astra 돌리다 보면 사용량 제한 때문에 금방 털리거든. 근데 이제 200달러 플랜 추가 구독도 막혀버려서, Astra를 합리적인 가격에 계속 쓸 방법 없나 찾아보고 있었음.
남는 컴퓨팅 자원을 할인된 가격에 쓸 수 있는 곳들을 몇 군데 찾긴 했는데, 문제는 업체마다 성능이 너무 들쭉날쭉하다는 거임. 업체마다 가격이랑 가용성이 다 다르고, 스트리밍이나 툴 콜, 추론, 캐싱 같은 거 붙이면 싼 엔드포인트는 동작 방식이 완전히 달라지더라고.
그래서 친구랑 같이 오토 라우터를 하나 만들었음. 여러 할인 업체들을 하나의 API 뒤로 묶어서, 특정 요청에 대해 토큰당 가격이 제일 싼 곳으로 자동으로 보내주는 놈임.
주로 Claude Code 안에서 쓰고 있는데, Claude Code를 오케스트레이터로 써서 할인 모델들을 호출하는 방식임. 지금까지 1,000달러 넘게 아꼈고 평균 66% 정도 절감 중임. GPT-6 Astra 호출할 때는 최대 90%까지도 싸게 먹히더라. 진짜 개쩜.
할인율이 얼마나 미쳤는지 알려주자면, 지금 GPT-6 Astra는 88% 할인 중이고, Fable 5.1은 74%, Deepseek v4.1 Flash는 74%, GLM 5.3은 98% 할인 중임. 이 외에도 엄청 많음.
우리가 직접 학습시킨 분류 모델도 있는데, 이걸로 "Fusion" 모델을 만들었음. 여러 모델을 하나로 합쳐서 요청 들어올 때마다 작업 성격에 맞춰서 분류기가 알아서 모델을 골라주는 방식임. 목표는 최상급 모델이랑 비슷한 성능을 내면서 토큰당 비용은 훨씬 낮추는 거임. Sukuna Fugu 모델 같은 건데, 니가 직접 만들 수 있다고 보면 됨.
난 지금 추론에는 Astra, 코딩에는 GLM 5.3, 글쓰기에는 Gemini 3.1 flash 쓰고 있는데, 덕분에 추론 비용 진짜 엄청나게 아끼는 중. 나중에 성능 벤치마크도 돌려볼 생각인데, Astra보다 성능 좋으면서 가격은 쥐꼬리만큼 나오는 모델 조합이 있는지 확인해 보려고. 이건 아직 작업 중임.
암튼, 다들 어떻게 생각하는지 궁금하고 쓸 의향 있는지 궁금함. 피드백이나 질문 있으면 뭐든 환영! 핵심은 추론에 말도 안 되는 시장 가격 내기 싫다는 거고, 지금까지는 아낀 돈 올라가는 거 보는 재미에 아주 중독됨 ㅋㅋ
한번 구경해보고 써보고 싶으면 여기로 오셈.

