ExllamaV3/exl3를 Flash Next에 사용해보라는 추천글
One more 'you should try ExllamaV3/exl3 for flash next' appreciation post
핵심 요약
ExllamaV3와 exl3를 사용하여 Flash Next 모델을 구동한 결과, 뛰어난 추론 속도와 성능을 경험했다는 후기입니다.
- 성능 향상 — 기존 vllm이나 llama.cpp 대비 훨씬 빠른 디코딩 속도를 보여줌
- 하드웨어 효율 — 3090 및 5090 환경에서 262k 컨텍스트를 안정적으로 처리함
- PagedAttention 지원 — 메모리 관리 효율이 좋아 병렬 요청 처리에 유리함
- 다양한 모델 지원 — Qwen FN 및 GLM Flash 모델 등에서 우수한 성능을 입증함
여기 올라온 글들 몇 개 보고 나서, 드디어 flash next 돌리려고 exl3 3bpw랑 exllamav3 써봤는데 결과가 미쳤음.
3x3090, 128GB DDR4 환경: 1500 prefill, 80 tps decode
1x5090, 128GB DDR4 환경: 1500 prefill, 29 tps decode
둘 다 262k 컨텍스트에 vision/spec decoding까지 다 켰음. 진짜 감탄했다. 이 모델 돌릴 때는 vllm이나 llama.cpp 대신 이걸로 완전히 갈아탈 듯.
양자화 성능도 지금까지는 꽤 괜찮아 보임. 나중에 비교해보려고 4bpw도 테스트해 볼 생각임.
나처럼 아직 안 써보고 멍 때리고 있었으면 당장 확인해 봐!


