제발 FP4 추론 엔진 좀 그만 좀 만들어라
Please stop with the FP4 inference engines for the love of god
핵심 요약
FP4 양자화가 모델 성능을 저하시킨다는 작성자의 불만에 대해, 기술적 차이를 지적하거나 최신 기술은 문제없다는 반론이 팽팽함.
- FP4 성능 논란 — 지나친 양자화가 모델의 지능과 정확도를 심각하게 훼손한다고 주장함.
- 양자화 방식 차이 — FP4와 Q4_K 등 양자화 기법 간의 기술적 차이와 손실 여부가 핵심 쟁점임.
- 최신 기술 옹호 — NVFP4 등 최신 기술은 FP8과 거의 차이가 없는 무손실 수준이라고 반박함.
- 양자화의 본질 — JPEG 압축처럼 정보 손실을 최소화하는 지능적인 압축 방식이 중요하다고 강조함.
매일같이 최적화된 설정이니 새로운 추론 엔진이니 하면서 특정 작업 하나에만 미친 듯이 좋은 결과물을 내놓는 글들이 올라오는데, 들어보면 또 다 그럴싸하단 말이지.
근데 글 맨 밑이나 누가 물어보고 나서야 "NVFP4/MXFP4 전용"이라는 말이 튀어나옴.
그래, 잘했다! 세상에서 제일 빠른 옵션을 아주 쬐끔 더 빠르게 만들었네. 근데 결과물은 십중팔구 다 망가져서 사방팔방에서 환각 증상이나 뿜어대겠지.
방금 r/ROCm에서도 또 하나 봤다.
거대 모델을 4비트로 돌리는 건 괜찮아. 어차피 모델 안에 든 게 많아서 손실 좀 나봤자 그 기가 막힌 스파게티 볼로네제 레시피나 좀 까먹는 수준이니까. 근데 작은 덴스 모델을 FP4로 돌리는 건 그냥 모델을 죽이는 짓임. 완전히 박살 난다고. 모델이 갑자기 1+1=3이라고 우기기 시작하면 뭘 제대로 할 수 있겠냐?
그냥... 제발 좀 그만해.
수정: 몇몇 헷갈려 하는 거 같아서 여기다 적어둠. 표준 Q4 양자화는 보통 민감한 텐서들을 BF16, Q8, 혹은 Q6/5로 남겨둠. K/V 캐시도 보통 FP8/Q8까지만 양자화하고.
이런 "추론 엔진"들이 하는 짓은 보통 기존 엔진(llama.cpp, SGlang, vLLM) 포크해서 그냥 전부 다 FP4로 때려 박는 거임. 속도 면에서는 좋지, 특히 온라인 역양자화 안 쓰면 더더욱. 근데 결과물 품질은 개판이 됨.
unsloth에서 나오는 표준 Q4_K_M/XL 양자화 정도면 충분히 쓸만함.


