Cactus Hybrid Router: Gemma4-2B 모델로 15~55%의 작업을 클라우드로 라우팅하여 Gemini-3.1-Flash-Lite와 대등한 성능 구현
Cactus Hybrid Router: Gemma4-2B can match Gemini-3.1-Flash-Lite by routing 15-55% of tasks to Gemini And Running The Rest Locally.
핵심 요약
65k 파라미터의 경량 모델로 로컬과 클라우드 작업을 지능적으로 분배하여 비용과 성능을 최적화하는 하이브리드 라우터 기술입니다.
- 모델 효율성 — 65k 파라미터로 로컬과 클라우드 작업을 실시간으로 분배함
- 성능 최적화 — 단순 작업은 로컬에서, 복잡한 작업은 클라우드로 보내 비용을 절감함
- 범용성 — 텍스트, 비전, 오디오 프롬프트를 모두 처리하는 단일 라우터 모델임
- 신뢰도 기반 — 토큰 생성 시 신뢰도 점수를 계산해 클라우드 전환 여부를 결정함
지난주, 우리는 26m 파라미터로 자신보다 10~25배 큰 모델을 능가하는 함수 호출 모델 'Needle'과 'Simple Attention Network'를 발표했습니다. 일부 LocalLlama 레디터들이 라우터 모델을 만들 수 있는지 물어봤죠. 그래서 우리는 작업의 성격에 따라 엣지 모델에서 처리할지, 클라우드로 보낼지 실시간으로 결정하는 65k 파라미터 모델 'Cactus Hybrid Router'를 만들었습니다.
- 엣지 모델을 양자화해도 라우터 성능은 탄탄합니다. 참고로 이건 4비트 균등 양자화가 fp16에 근접하는 'Cactus Quants' 기술을 사용했습니다.
- 엣지-클라우드 비율을 조절해 리소스를 최적화할 수 있습니다. "프랑스 수도가 어디야?" 같은 질문을 굳이 조 단위 파라미터의 비싼 클라우드 모델로 돌릴 필요가 없으니까요.
- 동일한 64k 라우터가 텍스트, 비전, 오디오 프롬프트를 모두 처리합니다.
여러분의 생각은 어떤가요? 우리가 놓치고 있는 부분이 있을까요?
실시간 AI와 코딩은 많은 추론을 요구하기 때문에 클라우드 인프라에 큰 부담이 됩니다.
단순한 작업은 로컬에서 처리하고, 꼭 필요한 경우에만 클라우드로 넘기는 엣지 컴퓨팅으로 나아가는 건 어떨까요?


