Gemma 4 26B A4B 모델, 245k 컨텍스트(94%)에서도 여전히 완벽하게 작동함!
Gemma 4 26B A4B is still fully capable at 245283/262144 (94%) contex !
핵심 요약
Gemma 4 26B A4B 모델이 245k 컨텍스트 환경에서도 뛰어난 성능과 속도를 유지하며 로컬 환경에서 안정적으로 작동함을 입증함.
- 컨텍스트 성능 — 245k 토큰(94%) 상황에서도 완벽한 문맥 유지와 빠른 응답 속도 확인됨.
- 최적화 설정 — llama.cpp와 Unsloth GGUF를 활용해 반복 루프를 방지하고 안정적인 추론 환경 구축.
- 모델 효율성 — 31B 모델 대비 5배 빠른 속도를 보여주며 에이전트 작업에 최적화된 성능을 제공함.
- 하드웨어 활용 — 240k 컨텍스트 사용 시 약 22GB VRAM을 점유하며 로컬 PC에서 원활하게 구동됨.
NVIDIA SMI에서 실시간 데이터를 가져오는 스크립트 문제를 해결해 줬습니다. Gemini 3.1은 세션을 새로 시작해도 해결하지 못했는데 말이죠, 하하.
2026년에 이미 200k 이상의 컨텍스트를 가진 안정적인 로컬 모델이 있다는 게 정말 놀랍습니다! VRAM에 어떤 영향을 주는지 확인하려고 Reddit 게시물, 무작위 문서 파일, llama.cpp 저장소의 원본 파일들을 최대한 많이 입력해서 사용량을 높여봤습니다. 이런 테스트 중에도 Gemma는 정신줄을 놓지 않았습니다! 262,144 중 245,283(94%)의 컨텍스트에서 특정 사용자가 무슨 말을 했는지 물어보면 완벽하게 일치하는 내용을 2~5초 안에 대답합니다.
이전 테스트를 통해, 모델이 스스로 질문하는 루프에 빠지지 않도록 온도를 낮추고 반복 페널티를 1.17/1.18로 높여야 한다는 것을 알게 되었습니다. 100k 컨텍스트 이상에서는 자기 생각에 갇혀서 논쟁을 벌이곤 했거든요. 최종 답변을 내놓는 대신 끝없이 떠들기만 했죠. 이 설정들이 큰 도움이 되었습니다!
거의 매시간 업데이트되는 최신 llama.cpp와 2~6시간 전에 나온 최신 Unsloth GGUF를 사용 중이니 꼭 다시 다운로드하세요!
모델: gemma-4-26B-A4B-it-UD-IQ4_NL.gguf, unsloth (unsloth bis)
다음은 제가 pshell 스크립트로 시작하는 llama.cpp용 현재 설정입니다:
# --- [2. OPTIMIZATION PARAMETERS] ---
$ContextSize = "262144"
$GpuLayers = "99"
$Temperature = "0.7"
$TopP = "0.95"
$TopK = "40"
$MinP = "0.05"
$RepeatPenalty = "1.17"
# --- [3. THE ARGUMENT CONSTRUCTION] ---
$ArgumentList = @(
"-m", $ModelPath,
"--mmproj", $MMProjPath,
"-ngl", $GpuLayers,
"-c", $ContextSize,
"-fa", "1",
"--cache-ram", "2048",
"-ctxcp", "2",
"-ctk", "q8_0",
"-b", "512", # Smaller batch for less activation overhead
"-ub", "512",
"-ctv", "q8_0",
"--temp", $Temperature,
"--top-p", $TopP,
"--top-k", $TopK,
"--min-p", $MinP,
"--repeat-penalty", $RepeatPenalty,
"--host", "0.0.0.0",
"--port", "8080",
"--jinja",
"--metrics"
)


