Gemma 4는 여전히 게으르다
Gemma 4 is still lazy
핵심 요약
Gemma 4 모델이 에이전트 작업 중 자꾸 멈추는 현상에 대해 사용자들이 원인과 해결책을 논의합니다.
- 에이전트 작업 한계 — Gemma 4는 멀티턴 작업에서 도구 호출 후 자주 멈추는 경향이 있음
- 모델 특성 차이 — Qwen이나 DeepSeek와 달리 Gemma는 지시를 매우 엄격하게 따르도록 튜닝됨
- 설정의 한계 — 프롬프트로 멈춤 현상을 해결하기 어려우며 외부 스캐폴딩이 필요함
- 사용자 경험 공유 — 일부는 모델의 정밀함을 칭찬하지만, 에이전트 작업에는 부적합하다는 의견이 지배적임
제발 제가 뭘 잘못하고 있는 건지 좀 알려주세요.
제 설정:
[*]
flash-attn = on
jinja = true
fit = true
offline = true
mmproj-offload = false
mmap = false
cram = -1
parallel = 1
[unsloth/gemma-4-31B-it-qat-UD-Q4_K_XL-TP-WORK-147K]
hf = unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL
ctx-size = 147456
temp = 1.0
top-p = 0.95
top-k = 64
sm = tensor
fit = off
spec-default = true
chat-template-kwargs = {"preserve_thinking": true}
새로운 채팅 템플릿이 적용된 최신 Unsloth GGUF를 가져와서 preserve thinking을 true로 설정했는데도, Gemma는 여전히 에이전트 작업에 형편없습니다. Hermes에서 작업을 주면 도구 호출을 몇 번 하다가 "A는 했는데 B와 C가 발생해서 이제 D를 할 거야" 같은 식으로 응답하고 그냥 멈춰버립니다. 그냥 작업을 계속하고 멈추지 말라고 해도 또 똑같이 합니다. Qwen 3.6 27B(UD-Q5_K_XL)에서는 이런 문제가 없고, DeepSeek V4 Flash(UD-IQ3_XXS)에서도 없고, 심지어 더 구형인 GPT-OSS 120B에서도 문제가 없습니다. 이 모델들은 작업을 주면 나중에 돌아와 봐도 여전히 문제를 해결하려고 열심히 돌아가고 있는데, 도대체 Gemma 4는 왜 이런 거죠?
이 모델이 정말 멀티턴 에이전트 작업에는 부적합한 건가요? 솔직히 Gemma는 훌륭한 챗봇입니다. 세계관 설정 같은 주제로 대화하는 건 즐겁거든요. 하지만 분명히 매우 유능한 모델임에도 불구하고 에이전트 작업에는 전혀 노력을 기울이려 하지 않는 느낌입니다.

