GGUF 모델 실행 시 갑작스러운 성능 저하에 대한 짧은 메모
Quick note on sudden performance loss when running GGUFs
핵심 요약
GGUF 모델의 성능이 급격히 떨어진다면 파일 손상 가능성이 있으니 sha256sum으로 무결성을 확인하세요.
- 성능 저하 원인 — MTP 레이어 삽입 과정에서 모델 파일이 손상되어 추론 속도가 급격히 떨어짐.
- 무결성 확인 방법 — sha256sum을 사용하여 모델 파일의 해시값이 일치하는지 확인해야 함.
- 문제 해결책 — 파일 손상이 확인되면 모델을 다시 다운로드하여 문제를 해결할 수 있음.
- 예방 조치 — 모델 실행 시 체크섬을 검증하는 기능이 있으면 좋겠다는 의견이 제시됨.
GGUF 모델 몇 개(Qwen3.5-35B-A3B-APEX-I-Quality와 Unsloth 모델)에서 갑자기 이상한 성능 특성(초당 20토큰 이상에서 5토큰으로 급락)이 나타났는데, 알고 보니 둘 다 MTP 레이어를 수동으로 삽입하는 과정에서 손상된 거였음(논리적으로는 원본 모델을 건드리면 안 되는데 말이지..). sha256sum을 써서 확인해 보니 파일이 정상이 아니라는 걸 알게 됐고, 다시 다운로드하니까 다 해결됨.
TLDR: 모델이 이상하게 작동하면 sha256sum이 맞는지 확인해 보셈.

