Gemma 4 12b 8Q Heretic 모델의 원샷 코딩 테스트
Gemma 4 12b 8Q Heretic Oneshot Coding
핵심 요약
Gemma 4 12b Heretic 모델을 활용해 복잡한 레트로 게임 코드를 단 한 번의 프롬프트로 완벽하게 생성한 사례입니다.
- 모델 성능 — Gemma 4 12b Heretic 모델이 45k 토큰 규모의 복잡한 코딩 작업을 원샷으로 완벽 수행함
- 하드웨어 스펙 — Ryzen 9 9950X와 RX 6800을 사용해 18.76 t/s의 안정적인 생성 속도를 기록함
- 캐시 효율성 — llama-server의 LCP 및 체크포인트 기능을 활용해 90% 이상의 캐시 재사용률을 달성함
- 구현 결과 — 외부 라이브러리 없이 HTML5와 Vanilla JS만으로 사이버펑크 테마의 벽돌 깨기 게임을 구현함
오늘 나온 Gemma 4 12b 써봤는데 꽤 괜찮네. heretic 버전도 바로 올라왔길래 냉큼 돌려봄. 공식 8Q 모델은 자꾸 거부하길래 빡쳐서 레트로 게임 하나 원샷으로 짜달라고 시켜봤는데, 그냥 가볍게 해치우네. 시작부터 끝까지 프롬프트 하나로 45k 토큰 다 먹더라.
-
하드웨어 스택: Ryzen 9 9950X + AMD RX 6800 (16GB VRAM), Vulkan 백엔드 사용, 32GB 6000 시스템 램.
-
모델 & 설정: H-gemma-4-12B-heretic-Q8.gguf, 8-bit KV 캐시 적용 ( --cache-type-k q8_0 --cache-type-v q8_0 ).
-
생성 속도: 4번의 턴 내내 18.44 t/s에서 18.93 t/s 사이를 오가며 아주 안정적임.
-
컨텍스트 스케일링: 마지막 턴에 활성 컨텍스트가 23,125 토큰까지 늘어났는데도 속도 저하 거의 없음.
-
대규모 생성: 2번째 턴에서 4분 동안 끊김 없이 18.76 t/s 속도로 4,372 토큰 분량의 코드(467줄짜리 게임)를 한 번에 뽑아냄.
-
프롬프트 처리: 처음엔 228.79 t/s로 시작해서 컨텍스트 깊이가 깊어짐에 따라 자연스럽게 157.72 t/s까지 내려감.
-
캐시 효율: llama-server가 컨텍스트 체크포인트랑 Longest Common Prefix (LCP) 유사도를 제대로 써먹음. 다음 턴에서 캐시 재사용률이 91.7%, 96.4%까지 찍히면서 빡센 재연산 과정을 다 건너뜀.
내 llama.cpp 실행 명령어는 이거임: ./llama.cpp/build/bin/llama-server -m /home/dsmason321/models/H-gemma-4-12B-heretic-Q8.gguf -c 256000 --jinja --chat-template-file /home/dsmason321/llama.cpp/models/templates/custom_pub_chat_template_gemma4.jinja --reasoning off --cache-type-k q8_0 --cache-type-v q8_0
프롬프트는 아래와 같음.
너는 베테랑 프론트엔드 개발자이자 게임 디자이너야. 지금부터 HTML 파일 하나로 완벽하게 돌아가는 "레트로 사이버펑크 벽돌 깨기" 게임을 만들어라.
생략이나 말줄임표(...) 같은 거 쓰지 말고, 코드 복사해서 브라우저로 열면 바로 게임이 돌아가게끔 최종 결과물을 내놔.
기술 아키텍처
-
언어: HTML5, CSS3, Vanilla JavaScript.
-
렌더링: HTML5 API.
-
파일 구조: 단일 파일. 모든 CSS는 <style> 태그 안에, 모든 JS는 <script> 태그 안에 넣을 것.


