Gemma 4 26b와 E4B는 미쳤고, 내 Qwen을 대체했다!
Gemma4 26b & E4B are crazy good, and replaced Qwen for me!
핵심 요약
Gemma 4 모델들이 기존 Qwen 기반의 복잡한 로컬 LLM 라우팅 시스템을 효율적으로 대체하며 성능을 입증함.
- 모델 라우팅 개선 — Gemma 4 E4B를 도입하여 기존 Qwen 4B 라우터의 부정확한 모델 할당 문제를 해결함.
- 성능 및 효율성 — Gemma 4 26b가 기존 Qwen 27b/30b 모델보다 추론 및 코딩 작업에서 더 뛰어난 효율을 보임.
- 생각 토큰 최적화 — Gemma 4 26b는 불필요한 반복 없이 효율적으로 사고하며, 간단한 작업에서는 사고 과정을 생략하기도 함.
- 하드웨어 최적화 — llama-swap과 통합 메모리 설정을 통해 다수의 모델을 효율적으로 로드하고 관리함.
Gemma 4 이전의 내 설정은 다음과 같았음:
Llama-swap, open-webui, 그리고 Claude code router를 2개의 RTX 3090 + 1개의 P40(세 번째 3090이 죽어서 RIP)과 128GB 시스템 메모리에서 사용함.
Qwen 3.5 4B를 다음 모델들에 대한 시맨틱 라우팅용으로 사용했고, 필요시 n_cpu_moe를 사용함:
Qwen 3.5 30b A3B Q8XL - 일반 대화, 기본 문서 작업, 웹 검색, 추론이 필요 없는 방대한 컨텍스트 작업용. 최신 쿼리에 "quick"이 포함되면 이 모델을 사용하도록 하드코딩됨.
Qwen 3.5 27b Q8XL - A3B를 대신하는 "고정밀" 모델로, 특히 추론이 필요할 때 사용. 모든 간단한 수학 및 요약 작업에 사용됨. 최신 쿼리에 "think"가 포함되면 이 모델을 사용하도록 하드코딩됨.
Qwen 3 Next Coder 80B A3B Q6_K - 코드 생성용 (더 나은 결과물을 보여주었지만, 기존 코드 디버깅에는 122b가 더 나았음).
Qwen 3.5 122b UD Q4KXL (추론 없음) - 즉각적인 실세계 지식이 필요한 모든 작업.
Qwen 3.5 122b Q6 (추론) - 추론 능력과 Qwen 3.5 27b보다 더 많은 일반 지식이 필요한 가장 복잡한 쿼리용. 최신 쿼리에 "ultrathink"가 포함되면 이 모델을 사용하도록 하드코딩됨.
이 시스템은 매우 견고했지만, 시맨틱 라우팅 계층이 약점이었음. Qwen 3.5 4B는 가끔 작업에 맞지 않는 모델을 선택하곤 했고, 이게 점점 짜증 났음. "Hello"나 "Who are you?" 같은 간단한 인사말조차 Qwen 3.5 4B는 추론 모델, 보통은 122b 비추론 모델에 할당하곤 했음. 또한 시맨틱 라우터에 대한 프롬프트 설정(각 모델의 강점과 약점을 강조하는 여러 문단)과 상관없이 "ultrathink"나 "quick" 오버라이드 키워드를 완전히 무시하기도 했음. 결국 라우터 스크립트에 키워드를 하드코딩해야 했음.
두 번째 약점은 27b 모델이 간단한 수학 문제(기본 PEMDAS)에서도 최적의 샘플링 파라미터를 사용함에도 불구하고 과도하게 생각하며 토큰을 낭비하는 경우가 있었음. 122b 모델은 생각 시간 면에서는 훨씬 나았지만 생성 속도가 느렸음. Claude Code Router의 경우, 122b 모델은 가끔 가벼운 Qwen 모델들이 더 잘 처리하는 도구 호출(tool calls)에 실패하기도 했음(아마 unsloth 양자화 문제일 수도?).
어쨌든, 이 설정은 ChatGPT를 완전히 대체했고, 놀랍게도 대부분의 Claude 코드 작업까지 대체했음. 라우터가 제대로 작동하지 않을 때 키워드로 수동 변경하면서 시맨틱 라우터 문제를 해결했음.
하지만 Gemma 4가 나오면서, 정말 많은 문제가 해결됨.
무엇보다 먼저, Qwen 3.5 4B 시맨틱 라우터를 Gemma 4 E4B로 교체했음. 이것으로 시맨틱 라우팅 문제가 즉시 해결되었고, 지금까지 불만이 전혀 없음. 지금까지 내가 선택했을 법한 모델로 완벽하게 라우팅해주고 있음(Qwen 3.5 4B는 자주 실패했던 것들임). 심지어 추론 기능을 껐는데도 아주 잘 작동하고, 모델 선택 속도도 엄청나게 빠름. 이 작업에 대한 품질은 추론 기능을 켠 Qwen 3.5 9B와 맞먹는데, 라우팅만을 위해 그만큼의 메모리와 시간을 쓸 여유가 없었음.
둘째로, Qwen 3.5 30B A3B와 Qwen 3.5 27B를 모두 Gemma 4 26b로 교체했음. 보통 이 모델들에 라우팅되던 작업들에 대해, 기대치를 완전히 뛰어넘음. 기본 작업, 이미지 작업, 수학 및 아주 가벼운 스크립트 작업이 훨씬 더 나음. 가끔은 프론트엔드 HTML 디자인 및 수정과 같은 아주 구체적인 코딩 작업에서 Qwen3 Next Coder나 122b 모델을 이기기도 함. 대규모 컨텍스트 처리도 아주 훌륭함.
Gemma 4 26b의 가장 좋은 점은 생각 토큰을 매우 효율적으로 사용한다는 것임. 무한 루프나 지나치게 길고 반복적인 출력 생성 문제도 아직 겪지 않았음. 답변에 매우 자신감이 있어 보이고, 몇 번의 재확인 외에는 다시 시작하는 경우가 거의 없음. 아주 간단한 작업에서는 아예 생각조차 안 할 때도 있음!
그래서 지금 내 설정은 다음과 같음:
Gemma 4 E4B - 시맨틱 라우팅용
Gemma 4 26b (추론 끔) - 일반 대화, 아주 기본적인 작업, 기존 데이터/출력에 대한 간단한 후속 질문 등
Gemma 4 26b (추론 켬) - 추론이 조금이라도 필요한 모든 작업, 간단한 수학 및 요약 작업. 최신 쿼리에 "think"가 포함되면 이 모델을 사용하도록 하드코딩됨. 또한 아주 간단한 HTML/JavaScript UI 작업 및/또는 파이썬 스크립트용
Qwen 3 Next Coder 80B A3B Q6_K - 기타 모든 코드 생성용
Qwen 3.5 122b UD Q4KXL (추론 없음) - 즉각적인 실세계 지식이 필요한 모든 작업
Qwen 3.5 122b Q6 (추론) - Gemma 4보다 더 많은 일반 지식과 추론 능력이 필요한 가장 복잡한 쿼리용. 최신 쿼리에 "ultrathink"가 포함되면 이 모델을 사용하도록 하드코딩됨.


