96GB VRAM에서 MiniMax-M2.7 vs Qwen3.5-122B-A10B 풀 오프로드 비교
MiniMax-M2.7 vs Qwen3.5-122B-A10B for 96GB VRAM full offload?!
핵심 요약
96GB VRAM 환경에서 MiniMax-M2.7과 Qwen3.5-122B 모델의 성능과 효율성을 비교 분석함.
- 모델 비교 — 96GB VRAM 환경에서 MiniMax-M2.7과 Qwen3.5-122B의 성능을 벤치마크함.
- 벤치마크 결과 — Qwen3.5-122B가 추론 속도와 코드 품질 면에서 더 우수한 성능을 보임.
- 기술적 차이 — MiniMax는 자체 추론 가속을 지원하지만, Qwen은 더 큰 KV 캐시와 이미지 처리를 지원함.
- 커뮤니티 논쟁 — vLLM의 MTP 지원 여부와 모델 양자화 수준에 대해 사용자들 간 의견이 갈림.
tl;dr;
96GB VRAM 풀 오프로드 환경이라면, 오늘날에는 MiniMax-M2.7보다 Qwen3.5-122B-A10B를 선택할 것 같음. 다들 어떤 경험을 했는지 궁금함.
테스트한 양자화 모델
- ubergarm/MiniMax-M2.7-GGUF IQ2_KS 69.800 GiB (2.622 BPW)
- ubergarm/Qwen3.5-122B-A10B-GGUF IQ5_KS 77.341 GiB (5.441 BPW)
상세 내용
로컬에서 코딩할 때 꽤 잘 작동하는 오픈 웨이트 LLM이 여러 개 있다는 건 정말 놀라운 일임! 테스트한 두 양자화 모델 모두 opencode 설정으로 생각 과정을 동적으로 켜고 끄면서 잘 작동함 (5단어짜리 스레드 제목 생성할 때 정말 빠름).
Level1techs의 Wendell 덕분에 96GB VRAM 장비에 접근해서 GGUF 양자화 모델을 벤치마킹할 수 있었음. 내 데일리 드라이버는 2x A6000 GPU (각각 48GB VRAM을 가진 3090과 비슷함)에서 완전히 오프로드된 Qwen3.5-122B였음. 이제 새로운 MiniMax-M2.7 양자화 모델이 나왔으니, 더 많이 양자화된 큰 모델이 더 나을지 결정해야 했음.
모든 복잡한 질문이 그렇듯, 답은 보통 "상황에 따라 다르다"임!
하지만 적어도 내 목적에는 추론 속도, 코드 품질, 전반적인 사용성 면에서 Qwen3.5-122B-A10B가 여전히 최고인 것 같음.
이 의견을 뒷받침할 데이터는 다음과 같음:
humaneval 벤치마크
빠르게 EvalPlus 파이썬 클라이언트를 코딩해서 ik_llama.cpp llama-server에서 실행 중인 두 양자화 모델에 164개 문제의 humaneval 벤치마크를 던져봤음.
|Metric|MiniMax-M2.7 IQ2_KS|Qwen3.5-122B-A10B IQ5_KS|
|:-|:-|:-|
|pass@1 (base)|**0.220**|**0.494**|
|pass@1 (base+extra)|0.220|0.482|
|Eval time|32:48|31:20|
이건 MiniMax 모델 카드에서 제안한 대로 temperature=1.0과 top_p=0.95를 사용했음. 공정하게 말하자면, 이건 빠르게 코딩한 테스트 도구라 뭔가 잘못되었을 수도 있음. 결과가 어떻게 나와야 하는지도 잘 모르겠음 하하... 하지만 Qwen3.5가 더 높은 점수를 받았음!
추론 속도
96GB VRAM을 거의 다 채우는 llama-server와 유사한 명령어를 사용하여 동일한 버전의 ik_llama.cpp에서 llama-sweep-bench를 실행했음. MiniMax-2.7이 더 멀리 갈 수는 있었지만, 기다리다 지쳐서 테스트를 강제 종료했음. 무슨 말인지 알겠지.
사용성
MiniMax-M2.7은 자체 추론 가속(self-speculative-decoding)을 지원하지만 Qwen3.5는 그렇지 않음 (재귀 모델). 하지만 160k kv-cache를 맞추기 위해서도 꽤 많이 양자화된 kv-cache가 필요함.


