RTX 5090에서 DiffusionGemma 26B A4B 튜닝 결과
DiffusionGemma 26B A4B results on my 5090
핵심 요약
RTX 5090 환경에서 DiffusionGemma 26B 모델의 최적 파라미터와 성능을 분석한 튜닝 결과입니다.
- 성능 최적화 — Q4_K_M 양자화 모델이 Q6_K보다 18% 빠르고 컨텍스트 처리 효율이 높음
- 온도 파라미터 — t-max와 t-min 값을 낮추는 것이 속도 향상의 핵심 요인임
- 컨텍스트 처리 — Flash Attention 미지원으로 인한 컴퓨팅 버퍼 병목 현상 확인
- 워크플로우 제안 — 초기 아이디어 생성용으로 활용하고 후속 작업은 전문 모델로 보완함
DiffusionGemma 26B A4B — 튜닝 결과
(참고: 이건 내 튜닝 결과고, 테스트 스크립트랑 보고서 작성은 Deepseek 도움 좀 받음)
https://huggingface.co/unsloth/diffusiongemma-26B-A4B-it-GGUF
시스템
- **GPU**: RTX 5090 (32 GB VRAM), CUDA 13.3
- **Build**: `llama.cpp` PR #24423, GCC-15, Ninja, ccache
- **Flash Attention**: Auto-disabled on SM120 — limits max context
- **Models**: `unsloth/diffusiongemma-26B-A4B-it-GGUF`
모델
| Q6_K | `diffusiongemma-26B-A4B-it-Q6_K.gguf` | 22 GB |
| Q4_K_M | `diffusiongemma-26B-A4B-it-Q4_K_M.gguf` | 16 GB |
최대 안정 컨텍스트
| Quant | Formula | Max ctx | -n limit | VRAM limit |
|-------|---------|---------|----------|------------|
| Q6_K | 16 blocks × 256 + 2048 | 6,144 | -n 4096 | 22 GB model + ~10 GB buffers |
| Q4_K_M | 32 blocks × 256 + 2048 | 10,240 | -n 8192 | 16 GB model + ~14 GB buffers |
컨텍스트는 컴퓨트 버퍼 크기 때문에 제한됨. RTX 5090(SM120)에서는 Flash Attention이 자동으로 꺼져서 풀 어텐션 쓸 때 메모리가 O(n²)로 늘어남. 모델 자체는 262k 컨텍스트까지 지원하는데, Flash Attention 켜면 64k까지는 무난하게 뽑힘.
최적 파라미터
| Parameter | Q6_K | Q4_K_M |
|-----------|------|--------|
| `--diffusion-eb-t-max` | 0.4 | 0.3 |
| `--diffusion-eb-t-min` | 0.1 | 0.05 |
| `--diffusion-eb-max-steps` | auto (48) | 20 |
| `--diffusion-eb-entropy-bound` | 0.1 (default) | 0.1 (default) |
| `--diffusion-eb-confidence` | 0.005 (default) | 0.005 (default) |
| `--diffusion-eb-stability` | 1 (default) | 1 (default) |
| `-ub` / `-b` | auto-derived from -n | auto-derived from -n |
최적 호출 방식
**Q6_K 가장 빠름:**
./build/bin/llama-diffusion-cli \
-m /path/to/diffusiongemma-26B-A4B-it-Q6_K.gguf \
-ngl 99 -n 2048 \
--diffusion-eb-t-max 0.4 --diffusion-eb-t-min 0.1
**Q4_K_M 가장 빠름:**
./build/bin/llama-diffusion-cli \
-m /path/to/diffusiongemma-26B-A4B-it-Q4_K_M.gguf \
-ngl 99 -n 8192 \
--diffusion-eb-max-steps 20 \
--diffusion-eb-t-max 0.3 --diffusion-eb-t-min 0.05
속도 비교
멀티 블록 처리량 (긴 프롬프트, 2048 토큰 생성)


