ExLlamaV3 v1.0.0 출시 - 대규모 성능 향상
ExLlamaV3 v1.0.0 - Major Performance Upgrades
핵심 요약
ExLlamaV3가 1년 이상의 개발 끝에 정식 출시되어, 다양한 커널 최적화와 성능 개선을 선보였습니다.
- 성능 최적화 — 새로운 어텐션 커널과 GEMM/GEMV 성능 향상으로 추론 속도 개선
- 의존성 제거 — flash-attention-2 및 xformers 의존성 삭제
- 모델 지원 확대 — Gemma4, GptOss, NemotronH 등 다양한 모델 지원 추가
- 개발 효율성 — 컴파일 단위 증가로 확장 빌드 속도 개선
1년 이상의 개발 끝에, ExLlamaV3가 첫 프로덕션 릴리스를 맞이했습니다.
Turboderp는 Fable과 함께 이 방대한 개선 사항들을 제공하기 위해 하루 10시간씩 매달려 왔습니다. 상세한 성능 지표와 그가 작성한 짧은 글은 여기에서 확인하세요.
가장 큰 변경 사항들은 다음과 같습니다:
- flash-attention-2 및 xformers 의존성 제거
- Gemma4를 포함한 대부분의 모델에 텐서 병렬 지원 확장
- 온라인 캐시 양자화, SWA 레이어 및 어텐션 싱크를 위한 듀얼 입력을 갖춘 새로운 어텐션 커널; KV 양자화로 인한 속도 저하 없음 (이제 추론 속도가 더 빨라질 수도 있음)
- 모든 attn/GDN 모듈을 위한 그래프 경로
- 새로운 conv1d 커널 (causal_conv1d에 대한 지원/필요성 제거)
- Ampere 아키텍처에서 GEMM/GEMV 성능 대폭 향상
- 새로운 INT8 GEMV 커널
- 새로운 MoE 커널 티켓 스케줄러
- GptOssForCausalLM 추가
- NemotronHForCausalLM 추가
- 다수의 사소한 최적화
- 더 많은 버그 수정
- 다수의 사용자 경험(QoL) 개선
- 더 많은 컴파일 단위를 통한 확장 빌드 속도 향상
질문이 있거나, 그냥 들러서 이야기를 나누고 Turbo를 축하해주고 싶으신가요? exllama 디스코드에서 함께하세요.


