Strix Halo에서 100k 컨텍스트로 Minimax 2.7 구동하기
Running Minimax 2.7 at 100k context on strix halo
핵심 요약
Strix Halo 하드웨어에서 Minimax 2.7 모델을 100k 컨텍스트로 안정적으로 구동하기 위한 최적화 설정 공유.
- 최적화 설정 — OOM 방지를 위한 --cache-ram 0 및 --kv-unified 등 llama.cpp 실행 옵션 공유
- 하드웨어 환경 — Strix Halo 시스템에서 Fedora Linux를 활용한 로컬 LLM 구동
- 모델 성능 비교 — Minimax의 코딩 직관력과 Qwen 27b의 범용성 간 장단점 분석
- 성능 이슈 — 100k 컨텍스트 사용 시 발생하는 프리필 속도 저하 및 캐시 관리의 중요성
여기까지 오기 위해 많은 조정을 거쳤기에 공유하고자 합니다:
llama-server -hf unsloth/MiniMax-M2.7-GGUF:UD-IQ3_XXS --temp 1.0 --top-k 40 --top-p 0.95 --host 0.0.0.0 --port 8080 -c 100000 -fa on -ngl 999 --no-context-shift -fit off --no-mmap -np 2 --kv-unified --cache-ram 0 -b 1024 -ub 1024 --cache-reuse 256
다양한 옵션에 대한 근거
--no-context-shift 컨텍스트가 오염되는 것을 모르고 방치하기보다, 컨텍스트가 부족해질 때 바로 알고 싶어서 사용함.
--no-mmap Donato가 추천함.
-np 2 최대 두 개의 동시 세션에 대한 컨텍스트를 유지함.
--kv-unified VRAM을 절약하기 위해 두 세션이 동일한 캐시를 공유하도록 함.
--cache-ram 0 캐시를 램으로 스왑하지 않고 VRAM에 유지함. 이 설정으로 OOM 문제를 많이 해결했음.
-b 1024 -ub 1024 프리필 성능을 향상시킴.
--cache-reuse 256 캐시를 "똑똑하게" 재사용하려고 시도함. 때로는 캐시 재처리를 피하는 데 도움이 되지만, 때로는 성능을 저하시킬 수도 있으니 본인의 판단하에 사용하길 바람.
추가 설정
Donato의 설정 가이드에 따라 Headless Fedora Linux를 사용함(toolbox는 제외). 또한 스왑 크기를 늘리고 시스템 서비스 파일에 OOMScoreAdjust=500을 설정하는 것을 추천함. 그렇지 않으면 램이 부족할 때 OOM 킬러가 중요한 프로세스를 종료시킬 위험이 있음.
지능
Minimax는 코딩에는 훌륭하지만 Qwen3.6 27b만큼 "다재다능"하지는 않음. 코딩 아키텍처 논의나 코드 리뷰에는 그다지 강하지 않음. Qwen은 코딩 외적인 부분에서도 더 강력할 수 있음.
Minimax가 빛을 발하는 곳은 코딩 "직관"임. 이 모델은 사용자를 "그냥 이해함". Qwen이 너무 문자 그대로 받아들이거나 핵심을 파악하지 못할 때, Minimax는 "의도"를 더 잘 이해함. 또한 파라미터 수가 더 많기 때문에 Qwen 27b보다 더 많은 "지식"을 가지고 있을 수도 있음.
성능


