Gemma 4 모델이 너무 게으른데, 저만 그런가요? (약간의 하소연)
Gemma 4 - lazy model or am I crazy? (bit of a rant)
핵심 요약
Gemma 4 26B 모델이 도구 사용이나 웹 검색을 거부하고 내부 지식만 고집하는 '게으른' 현상에 대한 사용자들의 공감과 해결책 공유.
- 모델 성능 논란 — Gemma 4 26B가 웹 검색이나 도구 사용을 거부하고 내부 지식만 고집함.
- 프롬프트 민감도 — Qwen 3.5와 달리 매우 엄격한 지시가 필요하며 의도 파악이 부족함.
- 템플릿 문제 — 최신 Jinja 템플릿 업데이트로 도구 호출 문제가 해결될 수 있다는 의견이 제시됨.
- 사용자 경험 공유 — 많은 사용자가 동일한 게으름을 겪고 있으며, 일부는 과거 버전의 과도한 도구 호출을 경험함.
제목 그대로입니다. 특히 26b MoE 모델에 대해서요.
이 모델을 정말 좋아하고 싶었습니다. Qwen 3.5 27b를 대체할 수 있을 거라 생각했거든요. 업데이트가 있을 때마다 다시 돌아와서 시도해 보며 개선되었기를 바랐습니다.
저는 llama.cpp에서 unsloth UD_Q4_K_XL을 실행 중입니다. main의 최신 커밋을 사용하고 있고요. —jinja에 대해서도 알고 있습니다. 인터리브드 사고 템플릿도 알고 있고요. 낮은 양자화 KV 캐시를 사용하는 것도 아닙니다. 제가 처음 다뤄보는 모델도 아니고요.
매번 제 테스트 결과는 똑같습니다. 기술을 사용하거나 웹을 검색하는 데 있어서 매우 게으른 모델입니다. 질문을 하면 기본적으로 웹 검색 한 번 없이 자신의 지식으로만 답변합니다. 명시적으로 웹 검색을 요청하면, 딱 _한 번_의 웹 검색을 수행하고 검색 결과 스니펫을 빠르게 훑어본 뒤 내부적으로 "스니펫과 내 내부 지식으로 충분한 정보를 얻었으니 더 검색할 필요 없다"고 판단해 버립니다.
심지어 다음과 같은 경우에도 그렇습니다:
-
검색 및 가져오기 도구를 제공하고, 검색 도구에는 "이 스니펫으로 답변하지 말고 fetch를 사용해라"라는 설명을, fetch 도구에는 "검색 도구에서 얻은 페이지를 가져오는 데 사용해라"라는 설명을 넣었을 때.
-
"광범위하게 검색해라", "깊게 파고들어라", "게으르게 굴지 마라" 등을 명시적으로 지시했을 때.
-
"searching-the-web"이라는 강압적인 기술을 컨텍스트에 넣고 위와 같은 작업을 모두 수행하라는 명시적 지침을 주었을 때.
-
"적용 가능성이 조금이라도 있다고 생각되면 기술을 사용해야 한다"는 강압적인 기술 지침을 컨텍스트에 넣었을 때.
-
"searching-the-web 기술을 참조하라"고 명시적으로 지시했을 때.
Qwen 3.5는 굳이 부탁하지 않아도 알아서 정보를 찾기 위해 모험을 떠나곤 합니다. Gemma 4는 얼굴이 파래질 때까지 소리를 질러도 검색 한 번을 제대로 안 하려고 합니다. 제 결론은 이 모델이 그냥 _웹 검색을 정말 하기 싫어한다_는 것뿐입니다(물론 AI의 '원함'이라는 가치 기준에서 말이죠).
제가 이상한 건지 알려주세요. 만약 이 모델을 잘 활용해서 억지로 시키지 않아도 웹을 깊게 파고들게 만들고 있다면, 제게도 알려주세요. 그리고 어떤 양자화/설정으로 그렇게 만들었는지 친절하게 공유해 주시면 감사하겠습니다.


