ExLlamaV3는 저평가되어 있음
ExLlamaV3 is underrated
핵심 요약
최근 CPU 오프로드 지원으로 주목받는 ExLlamaV3의 성능과 장점을 공유하며 사용자들의 경험담이 이어짐.
- 성능 우위 — llama.cpp 대비 더 높은 퀄리티와 빠른 속도를 보여줌
- CPU 오프로드 — 최근 업데이트로 접근성이 크게 개선됨
- 사용자 경험 — 특정 모델 지원 부족과 설정의 어려움이 여전히 존재함
- 홍보 논란 — 최근 갑작스러운 홍보 캠페인에 대한 의구심이 제기됨
이거 올리면 욕먹을지도 모르겠는데, 다들 이 좋은 소프트웨어를 너무 안 쓰는 것 같아서 좀 아까운 마음에 글 쓴다. Exl3 진짜 미쳤거든. 아마 NVIDIA 카드 쓰는 사람만 쓸 수 있는 거 같긴 한데, 맞나?
내가 개인적으로 로컬 모델들 돌려보면서 테스트해 본 바로는(벤치마크는 아님), Exl3 양자화가 llama.cpp보다 용량 대비 퀄리티도 훨씬 좋고, KLD 지표도 훨씬 낮게 나오고, 속도도 더 빠르더라. 보니까 CPU MoE 오프로드가 최근에 추가된 거 같던데, 그래서 그동안 사람들이 많이 안 썼나 싶기도 하고? 그 이후로도 업데이트 엄청 자주 올라오고 있어서 진짜 기대됨. ik_llama, beellama, llamacpp 같은 거만 쓰다가 새로 반짝이는 장난감 찾은 기분이라 너무 신난다.
요즘 나는 tabbyAPI exl3 백엔드에 qwen 3.8 27b sc 6bpw H6이랑 qwen 3.8 flash next 4bpw 조합해서 데일리로 쓰고 있는데, 성능 진짜 지린다. 더 많은 사람들이 이 소프트웨어 좀 알았으면 좋겠어. 뭐 관계자나 그런 거 절대 아니고, 그냥 너무 좋아서 공유하고 싶었음. 진짜 개쩌니까 다들 한번 써봐!!

