Gemma 4 12B가 이제 내 주력 모델임
Gemma 4 12B is my new main squeeze
핵심 요약
Gemma 4 12B 모델을 로컬 코딩용 주력 모델로 채택한 사용자의 경험담과 Qwen 모델과의 비교.
- 모델 성능 — Q5_K_XL 양자화 모델로 코딩 작업 시 안정적인 성능 제공함.
- 설정 최적화 — 32k 컨텍스트와 Q8 KV 캐시를 사용하여 효율적인 VRAM 관리함.
- 도구 호출 — Qwen 대비 간편한 설정으로 플러그 앤 플레이 방식의 편리함 제공함.
- 활용 분야 — 코딩, 소설 작성, HTML 게임 및 Lua 모딩 작업에 활용됨.
Unsloth Q5_K_XL이 공식적으로 내 로컬 코딩 주력 모델이 됐음.
처음엔 Q4_K_XL로 시작했는데, 문법 오류를 너무 자주 수정해야 했음. 아주 끔찍한 건 아니었지만, 파일 하나에서 문법 때문에만 23번이나 수정해야 했던 적도 있었음. Q4 쓸 때는 초당 61토큰(t/s) 정도 나왔는데, Q5로 바꾸니 50t/s로 떨어졌음. 그래도 이제는 대부분 한 번에 해결됨(제로샷은 아님, 이 녀석한테 뭘 만들지 알려줘야 함 윙크, 문법/기술 나치들 보고 있나).
모델 파일은 8.6GB 정도임. llama.cpp에서 컨텍스트 윈도우를 32k로 제한하고 Q8 KV 캐시를 써서 쾌적하게 유지했음. 다 합치면 캐시된 체크포인트까지 포함해서 VRAM을 15.7GB 정도 먹음. 솔직히 내 작업 흐름에는 32k면 충분함. 딱 필요한 작업에 집중하기에 차고 넘치는 공간임.
Qwen 3.6 27B(어차피 돌릴 수도 없었지만)나 35B A3B보다 이게 더 나은지 묻기 전에 미리 말하자면, 몇 가지 이유로 나한테는 이게 더 나음:
-
도구 호출(Tool call) 골치: Qwen의 도구 호출을 XML에서 JSON으로 설정해야 했음. 이게 일관성을 떨어뜨리고 채팅 템플릿, llama.cpp 설정, 메모리 관리까지 너무 손댈 게 많았음.
-
Gemma 4는 그냥 꽂으면 바로 됨(Plug-and-play): 캐시 설정하고 컨텍스트 길이 고정하고 PI 하스(harness)에 연결하니까 바로 돌아감. 코딩, 단편 소설, HTML 게임 다 가능함. Godot으로도 테스트해 봐야겠지만, Lua는 아주 잘 돌아감. 사이버펑크 2077 모딩을 취미로 하거든.
Qwen, 헤어져서 미안해. 너 때문이 아니라 나 때문인 거 알지. XOXO

