Qwen Flash Next IQ4와 Qwen 27b FP8 전체 벤치마크 해본 사람 있나요? 여기 제 결과입니다
Did anyone do a full bench of e.g. Qwen Flash Next IQ4 and Qwen 27b FP8? Here are some
핵심 요약
작성자가 Qwen Flash Next IQ4_XS와 Qwen 27b FP8의 간이 벤치마크 결과를 공유하며 성능과 속도를 비교했습니다.
- 벤치마크 결과 — Flash Next IQ4_XS가 MMLU-Pro와 GPQA 등에서 27b FP8보다 높은 점수를 기록함
- 테스트 환경 — 64GB DDR5와 2x R9700 환경에서 vLLM을 사용하여 측정함
- 성능 차이 — 단일 사용자 환경에서는 Flash Next가 우세하나, 동시성 환경에서는 27b FP8이 약 4배 빠름
- 결과 신뢰도 — 표본 수가 적은 간이 테스트이므로 정확한 수치보다는 경향성 파악에 중점을 둠
edit: 지금 모바일이라 포맷이 깨져서 수정 좀 했음..
Codex한테 Qwen 3.8 Flash Next IQ4_XS (vLLM + r9v로 구동)랑 Qwen 3.8 27B FP8 (vLLM + Radiance로 구동) 성능 평가 좀 빠르게 돌려보라고 시켰다.
전체 평가 돌린 건 아니고, 내 시스템에서 풀 버전 돌리면 시간 너무 오래 걸려서 맛보기로만 짧게 테스트함.
결과:
MMLU-Pro
Flash Next IQ4_XS: 83.8%
27B FP8: 75.0%
GPQA Diamond
Flash Next IQ4_XS: 42.5%
27B FP8: 27.5%
GSM8K
Flash Next IQ4_XS: 97.5%
27B FP8: 90.0%
German MGSM
Flash Next IQ4_XS: 92.5%
27B FP8: 90.0%
IFEval
Flash Next IQ4_XS: 89.6%
27B FP8: 89.6%
퀵 테스트 돌리는 데 총 2시간 정도 걸렸다. 다음번에 좀 더 제대로 돌리면 내 시스템에서 8시간 넘게 걸릴 것 같아서 지금은 풀 평가 돌릴 시간이 없음.
250개 케이스 "빠른" 테스트는 27B FP8에서 36분 27초, Flash Next IQ4_XS에서 2시간 5분 47초 걸림.
!! 중요: MMLU는 여기서 무작위 질문 80개만 뽑아서 돌린 거니까 수치 너무 진지하게 받아들이지 마라. 다른 평가들도 마찬가지로 전체 다 돌린 거 아님. 이건 제대로 된 벤치마크라기보단 그냥 가볍게 비교해 본 거니까. 당연히 두 양자화 모델 다 똑같은 질문으로 테스트함.
참고로 내 사양은 DDR5 64GB에 R9700 2개 꽂아 쓰고 있음.
최신 r9v 업데이트는 여기 적용 안 된 상태임.
DDR5 128GB 있으면 tcclaviger가 만든 Flash Next의 MXFP4 양자화 버전도 쓸 수 있을 텐데, 그럼 QFN 속도 2배 정도 더 빨라질 거다.
더 확실한 벤치마크 추천 좀 해줄 사람 있냐? 혹시 더 크게 비교해 본 사람 있음?
매주 댓글 보면 FP8 27B가 QFN 저용량 양자화보다 낫다는 소리가 하도 많아서 말이야. 근데 난 IQ4_XS도 이미 충분히 낮은 용량이라고 보는데, 실사용이나 이번 퀵 테스트 결과나 딱히 그런 느낌은 안 들거든. 1인용으로 쓸 거면 난 여전히 QFN 저용량 버전이 더 낫다고 본다.
물론 동시 접속은 얘기가 다르긴 함. 내 시스템에서 동시 작업 돌리면 FP8 27B가 QFN보다 4배 정도 빠르긴 하더라.
