Pi를 위한 자동 모델 선택용 Jev 기반 모델 라우터를 만들었습니다
I built a Jev-based model router for Pi for automatic model selection
핵심 요약
Jev를 활용해 작업 난이도에 따라 모델을 자동으로 배정하여 비용을 절감하는 Pi용 라우터를 구현했습니다.
- 모델 라우팅 — 작업 난이도에 따라 저렴한 모델과 고성능 모델을 자동으로 선택함
- 비용 최적화 — 모든 요청에 고성능 모델을 쓰는 대신 라우팅을 통해 약 15%의 비용 절감 효과를 확인함
- 캐시 문제 — 모델 전환 시 캐시 재사용이 어려워지는 문제를 해결해야 할 과제로 지목함
- 오픈소스 구현 — GitHub를 통해 Pi용 모델 라우터 구현체를 공개하고 실험 중임
Jev가 처음 나왔을 때 든 생각 중 하나가 이거였음. 이렇게 빠르고 싼 놈이 에이전트 다음 턴을 어떤 모델이 처리할지 골라줄 수 있지 않을까?
그래서 Jev를 써서 모델이랑 사고 수준을 결정하는 Pi용 플러그인을 만들어봤음. 간단한 작업은 싼 모델한테 던지고, 어려운 건 비싼 모델한테 맡기자는 거지.
Pi에서는 모델 매핑을 입맛대로 설정할 수 있고, 라우터가 고른 게 맘에 안 들면 모델을 고정할 수도 있음.
며칠 써봤는데 지금까지는 아주 만족스러움. 내가 직접 계산해보니까 라우팅 써서 쓴 돈이 $141인데, 모든 요청을 Opus 5.5로 돌렸다고 가정하면 $166 정도 나왔을 거임. 대충 15% 정도 아낀 셈이지.
물론 이건 내 데이터일 뿐임. 그냥 가격 비교일 뿐이고, 모든 작업을 Opus로 돌려서 비교한 건 아님. 품질이 똑같다거나, 라우팅 결정이 매번 옳았다거나, 네 청구서도 15% 줄어들 거라는 보장은 못 함.
그리고 캐시 문제도 있음. 모델을 바꾸면 캐시 재사용이 안 돼서 아낀 돈 다 까먹을 수도 있거든. 그래서 단순히 토큰 가격만 비교하는 게 아니라 그 부분까지 고려하려고 노력 중임. 솔직히 제공업체들이 이 부분을 좀 더 잘 지원해줬으면 좋겠음. 어떤 곳은 노력 수준이 바뀌어도 캐시를 유지해주긴 하는데, 모델이 바뀌어도 캐시를 공유하는 건 훨씬 어려운 문제라.
아직은 실험 단계임. 모델한테 어떤 모델을 쓸지 물어보는 게 좀 웃기긴 한데, 실제로 어떻게 돌아가는지 궁금했거든. 이런 라우팅 기능이 코딩 에이전트에 기본으로, 그것도 투명하게 들어갔으면 좋겠음.
직접 써보고 싶거나 구현 방식이 궁금하면 여기 확인해봐:

