지난 24시간 동안 진행된 Gemma 4 추가 수정 사항
More Gemma4 fixes in the past 24 hours
핵심 요약
Gemma 4 모델의 추론 예산 및 도구 호출 문제를 해결하기 위한 llama.cpp 설정 가이드와 최신 템플릿 공유.
- 추론 예산 수정 — llama.cpp의 추론 예산 관련 버그가 수정되어 병합됨.
- 도구 호출 템플릿 — Google에서 제공하는 새로운 chat template을 통해 도구 호출 오류를 해결함.
- 설정 최적화 — llama-server 실행 시 적절한 파라미터와 템플릿 파일을 지정하여 성능을 개선함.
- 비전 작업 팁 — 이미지 토큰 설정을 조정하여 비전 모델의 성능을 향상시킴.
Reasoning budget fix (병합됨): https://github.com/ggml-org/llama.cpp/pull/21697
도구 호출 문제를 해결하기 위한 Google의 새로운 채팅 템플릿:
31B: https://huggingface.co/google/gemma-4-31B-it/blob/main/chat_template.jinja
27B: https://huggingface.co/google/gemma-4-26B-A4B-it/blob/main/chat_template.jinja
E4B: https://huggingface.co/google/gemma-4-E4B-it/blob/main/chat_template.jinja
E2B: https://huggingface.co/google/gemma-4-E2B-it/blob/main/chat_template.jinja
제가 틀렸을 수도 있지만, 지난 24시간 동안 새로운 템플릿으로 업데이트된 GGUF를 새로 다운로드하지 않는 이상 이 템플릿들을 사용해야 합니다.
llama.cpp에서 다음 명령 인자를 통해 특정 템플릿을 사용할 수 있습니다:
--chat-template-file /models/gemma4/gemma4_chat_template_26B.jinja
현재 제 llama-swap/llama.cpp 설정 26B 예시입니다 (16GB VRAM에서 테스트 중이라 컨텍스트 윈도우가 제한적입니다):
"Gemma4-26B-IQ4_XS":
ttl: 300 # 5분 동안 활동 없으면 자동 언로드
cmd: >
/usr/local/bin/llama-server
--port ${PORT}
--host 127.0.0.1
--model /models/gemma4/gemma-4-26B-A4B-it-UD-IQ4_XS.gguf
--mmproj /models/gemma4/gemma-4-26B-A4B-it.mmproj-q8_0.gguf
--chat-template-file /models/gemma4/gemma4_chat_template_26B_09APR2026.jinja
--cache-type-k q8_0
--cache-type-v q8_0
--n-gpu-layers 99
--parallel 1
--batch-size 2048
--ubatch-size 512
--ctx-size 16384
--image-min-tokens 300
--image-max-tokens 512
--flash-attn on
--jinja
--cache-ram 2048
-ctxcp 2
filters:
stripParams: "temperature, top_p, top_k, min_p, presence_penalty, repeat_penalty"
setParamsByID:
"${MODEL_ID}:thinking":
chat_template_kwargs:
enable_thinking: true
reasoning_budget: 4096
temperature: 1.0
top_p: 0.95
top_k: 64
min_p: 0.0
presence_penalty: 0.0
repeat_penalty: 1.0
"${MODEL_ID}:thinking-coding":
chat_template_kwargs:
enable_thinking: true
reasoning_budget: 4096
temperature: 1.5
top_p: 0.95
top_k: 65
min_p: 0.0
presence_penalty: 0.0
repeat_penalty: 1.0
"${MODEL_ID}:instruct":
chat_template_kwargs:
enable_thinking: false
temperature: 1.0
top_p: 0.95
top_k: 64
min_p: 0.0
presence_penalty: 0.0
repeat_penalty: 1.0"


