Ornith-1.0-35B GGUF 업데이트: 네이티브 MTP 추측 디코딩 적용 및 전체 서빙/TTFT/긴 문맥 수치 공개 (llama.cpp, tp=1)
Ornith-1.0-35B GGUF update: native MTP speculative-decode graft + full serving/TTFT/long-context numbers (llama.cpp, tp=1)
핵심 요약
Ornith-1.0-35B 모델에 MTP 추측 디코딩을 적용하여 성능을 최적화하고, 다양한 양자화 버전의 벤치마크 수치를 공개했습니다.
- MTP 추측 디코딩 — IQ4_XS 모델에 네이티브 MTP 헤드를 이식하여 단일 GPU에서 1.3배 이상의 디코딩 속도 향상 달성함
- 성능 지표 공개 — 다양한 양자화 버전별 처리량, TTFT, KLD 수치를 비교하여 모델의 효율성을 검증함
- 긴 문맥 처리 — 32k 토큰까지의 긴 문맥에서도 안정적인 TTFT 성능을 유지하며 기존 Q4_K_M 대비 우수한 프리필 속도를 보임
- 하드웨어 최적화 — RTX PRO 6000 Blackwell 96GB 환경에서 tp=1 설정으로 최적화된 서빙 환경을 제공함
저번에 올렸던 Ornith-1.0-35B Q3_K_M 글 후속이다.
IQ4_XS 바디에 네이티브 MTP draft head를 이식했다(head는 Q6). llama.cpp에서 싱글 GPU로 self-speculative decode 돌려본 결과임:
- 1.3-1.35배 싱글 스트림 디코드 (172.6 -> 233.8 tok/s).
- 다음 토큰 분포는 target-only와 바이트 단위로 동일함 (KLD 0.0, 32/32).
- BF16 KLD 0.073 — Q4_K_M보다 살짝 더 나음.
- 문제점: 긴 결정론적 생성 시에는 target-only와 비트 단위로 완벽히 일치하진 않음 (6/8 일치, 토큰 매치율 93.4%).
KLD 순위표에서의 위치 (BF16 대비 상위 64개 다음 토큰 KL, 낮을수록 좋음):
| Quant | Mean KLD | Top-1 | Size |
|---|---|---|---|
| Q8_0 | 0.011 | 96.9% | 36.9 GB |
| Q6_K | 0.017 | 100.0% | 28.5 GB |
| Q5_K_M | 0.035 | 93.8% | 24.7 GB |
| IQ4_XS-MTP graft (new) | 0.073 | 90.6% | ~19.6 GB |
| Q4_K_M | 0.086 | 90.6% | 21.2 GB |
| IQ4_XS | 0.143 | 84.4% | 18.9 GB |
| Q3_K_M | 0.362 | 84.4% | 16.8 GB |
