ExLlamaV3 주요 업데이트!
ExLlamaV3 Major Updates!
핵심 요약
ExLlamaV3의 최근 업데이트로 DFlash 지원 및 모델 최적화가 이루어져 로컬 LLM 성능이 크게 향상됨.
- DFlash 지원 — 에이전트 및 코딩 작업에서 최대 3배의 속도 향상 달성
- 모델 최적화 — Qwen 및 Gemma 모델 등 다양한 모델의 추론 속도 개선
- 캐싱 효율성 — 이전 버전 대비 캐싱 처리 방식이 더욱 효율적으로 개선됨
- 지속적인 개발 — turboderp의 활발한 업데이트로 로컬 에이전트 실용성 증대
Turboderp는 최근 엄청난 기세로 더 작고 빠른 상자에 새로운 라마를 쑤셔 넣기 위한 끝없는 전투를 벌이고 있습니다.
지난달 gemma 4 지원 릴리스로 시작하여 캐싱 효율성 개선으로 이어졌습니다.
2주 전에는 DFlash 지원이 추가되었으며, 다음과 같은 인상적인 결과를 보여주었습니다:
|Category|Baseline|N-gram/suffix|DFlash|
|:-|:-|:-|:-|
|Agentic, code|55.98 t/s|89.58 t/s (1.60x)|140.61 t/s (2.51x)|
|Agentic, curl|54.03 t/s|74.62 t/s (1.38x)|125.94 t/s (2.33x)|
|Coding|59.21 t/s|75.34 t/s (1.27x)|177.67 t/s (3.00x)|
|Creative|59.10 t/s|67.26 t/s (1.13x)|89.19 t/s (1.50x)|
|Creative (reasoning)|59.03 t/s|64.25 t/s (1.09x)|93.54 t/s (1.58x)|
|Translation|58.11 t/s|55.39 t/s (0.95x)|75.73 t/s (1.30x)|
|Translation (reasoning)|58.08 t/s|80.21 t/s (1.38x)|119.43 t/s (2.06x)|
지난주에는 추가적인 모델 최적화가 이루어졌으며, 개선 사항은 다음과 같습니다:
|Model|3090¹|4090¹|5090¹|6000 Pro¹|5090²|6000 Pro²|
|:-|:-|:-|:-|:-|:-|:-|
|Qwen3.5-35B-A3B 4.00bpw|5.3%|5.8%|8.6%|10.3%|21.0%|23.5%|
|Qwen3.5-27B 4.00bpw|0.0%|1.9%|8.1%|11.7%|13.1%|15.0%|
|Trinity-Nano 4.15bpw|29.5%|48.6%|52.3%|52.9%|70.5%|72.4%|
|Gemma4-26B-A4B 4.10bpw|3.1%|2.9%|7.8%|9.6%|16.4%|19.2%|
|Gemma4-31B 4.00bpw|4.0%|4.9%|10.0%|8.0%|16.0%|12.0%|
지난 2일 동안 DFlash 모델 양자화 및 추가 버그 수정과 효율성 개선이 있었으며, dev 브랜치에서는 이미 더 많은 작업이 진행 중입니다!
exllama 디스코드에 오셔서 인사 나누세요.


