Gemma 4 - MLX가 GGUF보다 나은 것 같지 않음
Gemma 4 - MLX doesn't seem better than GGUF
핵심 요약
M1 Max 환경에서 Gemma 4 모델의 MLX와 GGUF 성능을 비교한 결과, GGUF가 더 효율적이라는 의문을 제기함.
- 성능 비교 — MLX와 GGUF의 추론 속도 및 메모리 사용량을 동일 하드웨어에서 테스트함.
- GGUF 우세 — GGUF가 병렬 처리와 캐싱 기능에서 MLX보다 실질적인 이점을 제공함.
- 사용자 오류 — 작성자가 서로 다른 모델(Dense vs MoE)을 비교하는 실수를 범해 댓글에서 지적됨.
- 기술적 질문 — MLX의 mxfp 형식 등 최적화 방식에 대한 추가적인 논의가 이루어짐.
먼저 밝혀두자면, 이 서브레딧에는 똑똑한 사람들이 많다는 걸 알아. 내 초보적인 실수나 오해를 바로잡아주고 가르침을 주길 바라.
모델:
버전:
- MLX: https://huggingface.co/mlx-community/gemma-4-26b-a4b-it-4bit
- GGUF: https://huggingface.co/lmstudio-community/gemma-4-26B-A4B-it-GGUF/tree/main
프롬프트:
Gemma로 테스트 중인 프롬프트는 약 3k 토큰 정도인데, 구성은 다음과 같아:
- 전체 코드 스크립트.
- 내 질문과 관련된 부분(Streamlit 대시보드를 실행하기 위해 subprocess를 사용하는 파이썬 함수)을 발췌함.
- Streamlit 기능에 대한 질문(특정 포트를 설정하는 인자가 무엇인지).
기본적인 내용이지..
어쨌든, 같은 하드웨어(M1 Max + 32GB)에서 이 프롬프트를 사용해 MLX와 GGUF를 테스트해봤는데 아래와 같은 결과를 얻었어:
MLX:
- 프롬프트 처리: 6.32s
- 초당 토큰 수: 51.61
GGUF:
- 프롬프트 처리: 4.28s
- 초당 토큰 수: 52.49
몇 번 실행해봤는데 결과는 대체로 비슷했어.. MLX가 실질적인 성능 향상을 제공하는 것 같지는 않아.
메모리:
메모리를 정확히 측정하기가 어려웠는데, 부분적으로는 애플의 활성 상태 보기가 엉망이기 때문이야.. 하지만 측정값이 정확하다고 가정하면(아마 아닐 테지만), 추론 실행 시:
- MLX:
- "메모리": 16.14GB
- "실제 메모리": 9.15GB
- "사용된 메모리": 25.84GB
- GGUF:
- "메모리": 4.17GB
- "실제 메모리": 18.30GB
- "사용된 메모리": 29.95GB
둘 다 LM Studio에서 총 가용 컨텍스트를 50k 토큰으로 설정했어(내가 기본값으로 사용하는 설정이야). 사고 및 출력 과정에서 약 1~1.5k 토큰이 소요되어, 3k 프롬프트를 포함하면 총 완료 길이는 약 4~4.5k 토큰 정도가 돼.
실제 사용 환경에서.. GGUF는 다음을 제공해:


