Gemma4-26B-A4B 및 31B-QAT Uncensored Balanced 버전 출시 (MTP로 35% 및 53% 속도 향상!)
Gemma4-26B-A4B & 31B-QAT Uncensored Balanced are out with MTP (35% & 53% speed boost)!
핵심 요약
Gemma 4 모델의 언센서드 버전이 MTP 기술을 탑재하여 더 빠른 속도로 출시되었습니다.
- 모델 출시 — Gemma4-26B-A4B 및 31B-QAT 언센서드 버전 공개
- 성능 향상 — MTP(Multi-Token Prediction) 적용으로 각각 35%, 53% 속도 향상
- 사용 권장 — 창의적 글쓰기 및 역할극에 최적화된 Balanced 설정 제공
- 기술 사양 — Q4_K_M 양자화 최적화 및 비전 지원 포함
일단 기쁜 소식부터 알릴게. HF 다운로드 2천만 회 달성 직전이다! (내 계정 기준이고, 중복이나 양자화, 파인튜닝 버전 같은 건 다 뺀 수치임) 그리고 디스코드 멤버도 5천 명 코앞이야!
약속한 대로 이번엔 Gemma 4 QAT 모델 두 개를 가져왔어. 둘 다 Balanced 버전이고, 둘 다 MTP 적용됨:
https://huggingface.co/HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
https://huggingface.co/HauhauCS/Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-MTP
GenRM 또 털렸다 — 둘 다 0/465 거절률 기록함*.
Balanced 버전은 진짜 수위 높은 질문 들어오면 답변하기 전에 가벼운 추론 서론을 덧붙이는 방식이야. 성격이 변하거나 이상한 짓 안 하니까 걱정 마. 그냥 원래 Gemma4-26B-A4B-QAT랑 Gemma4-31B-QAT를 검열만 푼 거임. 이번엔 Aggressive 버전 따로 안 만들어도 될 듯.
늘 그렇듯 내 Balanced 버전은 극단적인 상황에서 가끔 첫 시도에 튕길 수 있는데, 다시 물어보면 바로 답변해 줄 거야. 만약 Balanced로도 안 뚫리는 게 있으면 디스코드 와서 알려줘. 다음 릴리즈 때 수정하게.
99% 이상의 유저들은 이걸로 충분히 만족할 거라 기본값으로 추천함. 창작, RP, 감성적인 대화에 최적화돼 있어. 보통은 "에이전트 코딩/도구 사용"도 좋다고 하겠지만, 내가 빡세게 테스트해 본 결과 그쪽은 Qwen3.6이 더 낫더라.
직접 테스트해 보니까 루프 현상 없고, 재실행해도 샘플링 안정적이고, 긴 문맥 유지력도 좋아.
새로운 기능 — 둘 다 MTP 적용 (추측 디코딩을 위한 멀티 토큰 예측 드래프트 헤드): 26B-A4B는 약 35%, 31B는 약 53% 더 빨라짐. 출력 품질은 똑같아 (모델이 드래프트된 토큰을 전부 검증해서 속도만 빨라지고 품질 저하는 없음). llama.cpp 사용법: -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp (31B는 파일명만 바꾸면 됨). (MTP 드래프트는 Unsloth 팀 덕분임 — 땡큐!) 참고: llama.cpp로만 테스트해 봄.
생각하는 기능 끄려면: jinja 템플릿을 수정하거나 chat-template 인자로 {"enable_thinking": false}를 넘겨주면 돼.
포함된 내용 (각 릴리즈):
- Q4_K_M (텍스트)
- mmproj (비전 지원)
- MTP 드래프트 헤드 (추측 디코딩)
왜 Q4_K_M만 있냐고? Gemma 4는 ~4비트 양자화 인식 학습(QAT) 모델이라 Q4_K_M이 품질 최적점이야. QAT 모델은 정밀도 높여봤자 용량만 커지지 성능은 별 차이 없음.
26B-A4B vs 31B — 뭘 써야 할까?

