Llama.cpp 양자화 방식에 문제가 있음
Llama.cpp quantization is broken
핵심 요약
Llama.cpp의 기본 양자화 방식이 Qwen 모델의 성능을 저하시키므로, Intel AutoRound와 같은 더 나은 대안을 표준으로 도입해야 함.
- 양자화 품질 저하 — Q4_K_M 등 표준 양자화 방식이 모델의 안정성을 해치고 환각 및 루핑 현상을 유발함.
- AutoRound 도입 제안 — Q1-Q4 수준의 낮은 비트 양자화에서 더 일관된 결과를 보여주는 Intel AutoRound를 표준으로 채택할 것을 주장함.
- 시각적 증거 제시 — 동일한 프롬프트에서 표준 양자화와 AutoRound 양자화 결과물을 비교하여 성능 차이를 입증함.
- 모델 성능 이슈 — Qwen 27B 모델 테스트 결과, 표준 양자화보다 AutoRound 방식이 훨씬 더 나은 결과물을 생성함을 확인함.
가장 큰 이유는 양자화 품질이 모델의 성능과 안정성에 직접적인 영향을 미치며, 이것이 실제 유용성으로 이어지기 때문입니다. GRM-2.6-Plus가 벤치마크상으로는 기반이 된 qwen3.6 27b 모델보다 더 좋음에도 불구하고, 크기가 거의 동일한 qwen3.6 27b의 autoround Q2_K_mixed 양자화 버전보다 더 나쁜 결과를 보여줍니다.
이것은 단지 하나의 예시일 뿐이며, 제가 테스트한 대부분의 양자화 모델들이 같은 문제를 겪고 있고, Q5 미만에서는 대부분 다른 양자화 메커니즘을 사용하는 소수만이 유용했습니다.
저는 Q1-Q4 수준의 낮은 비트 양자화에 대해 autoround 양자화를 표준으로 도입할 것을 주장하고 싶습니다. apex도 꽤 잘 작동했지만 크기가 더 컸습니다. 혹시 일관된 결과를 제공하는 다른 대안적인 방법을 알고 계신가요? Q4_K_M과 같은 표준 양자화는 적절한 결과를 제공하지 못하며, 종종 버그가 있는 동작(루핑, 환각, 불일치)을 초래하기 때문입니다.
프롬프트: 자전거를 타는 펠리컨의 SVG 이미지를 생성해줘
다양한 양자화 결과의 여러 예시
https://www.reddit.com/r/LocalLLaMA/comments/1szp96f/comment/oj3r4b1/
Autoround Q2_K_Mixed https://huggingface.co/sphaela/Qwen3.6-27B-AutoRound-GGUF
일반 llama.cpp Q4_K_M https://huggingface.co/morikomorizz/GRM-2.6-Plus-GGUF
이것은 단지 하나의 예시일 뿐이며, 까다로운 질문을 던졌을 때 환각이나 루핑 등이 발생하는 출력 품질은 일관되게 더 나쁩니다.
커뮤니티는 Intel autoround와 같은 더 지능적인 메커니즘을 통해 조정하지 않는 한, Q5-6 미만의 일반적인 양자화가 qwen 모델에는 부적절하다는 점을 이해해야 합니다.
제 경험상 루핑은 예를 들어 깨진 양자화의 직접적인 증상이며, 에이전트 코딩에서의 간헐적인 구문 오류도 마찬가지입니다.


