Transformers에서 GGUF 네이티브 지원 시작!
GGUFs in transformers natively!
핵심 요약
Hugging Face의 Transformers 라이브러리가 GGUF 모델을 공식 지원하여, 별도 변환 없이 파이토치 환경에서 바로 사용할 수 있게 되었습니다.
- 네이티브 GGUF 지원 — 별도 변환 과정 없이 Transformers API로 GGUF 모델 로드 가능함
- 메모리 효율성 향상 — 양자화된 모델을 사용하여 노트북 환경에서도 원활한 실행 가능함
- 학습 및 디버깅 용이 — 파이토치 툴링을 그대로 활용해 LoRA 학습 및 모델 디버깅이 훨씬 수월해짐
- 성능 최적화 — Apple Silicon 환경에서 ggml 커널을 재사용하여 llama.cpp와 대등한 속도 제공함

다들 안녕!
Hugging Face의 Aritra야. transformers에 새로 바뀐 점이 있어서 알려주려고 왔어. 이제 GGUF(llama cpp 양자화)를 네이티브로 지원하게 됐거든.
사용법은 아래와 같아:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "unsloth/Qwen3.5-4B-GGUF"
filename = "Qwen3.5-4B-Q4_K_M.gguf"
model = AutoModelForCausalLM.from_pretrained(
model_id,
gguf_file=filename,
)
모델을 불러온 다음에는 평소 쓰던 Transformers API 그대로 쓰면 돼.
왜 이걸 만들었냐고?
-
양자화 모델은 용량이 작아서 노트북에서도 잘 돌아가거든.
-
PyTorch 툴을 바로 쓸 수 있어서 디버깅할 때 개꿀이야.
-
디버깅, 평가, 커스텀 생성 작업이 훨씬 쉬워져.
지원되는 Apple Silicon 환경에서는 ggml 커널을 재사용해서, 압축된 양자화 가중치에서 모델이 바로 돌아가게 만들었어. M2 Max에서 Qwen 체크포인트로 테스트해 본 결과는 이래:
-
Qwen3.5-4B Q4_K_M: 70.4 tok/s (llama.cpp는 71.8 tok/s)
-
Qwen3.8-27B UD-Q4_K_M: 15.9 tok/s (llama.cpp는 13.4 tok/s)
-
Qwen3.5-35B-A3B UD-IQ4_XS: 60.2 tok/s (llama.cpp는 61.3 tok/s)
이게 llama.cpp를 대체하려는 건 아니야. 로컬에서 무조건 최고 성능만 뽑아내는 게 목적이라면, 그냥 llama.cpp 쓰는 게 나을 거야.
핵심은 이제 더 유연한 환경에서 똑같은 GGUF 모델을 쓸 수 있다는 거지.
더 자세한 내용은 여기서 봐: https://huggingface.co/blog/transformers-llama-cpp-quants


