Ninfer 3090을 포크해서 CMP170HX에서 돌아가게 만들었습니다 - Llama.cpp Qwen3.6-35B 성능 2배 향상
I forked Ninfer 3090 and converted it to run on the CMP170HX - doubled my Qwen3.6-35B from llama.cpp
핵심 요약
CMP170HX에서 Ninfer를 구동할 수 있도록 포크하여 Qwen3.6-35B 모델의 성능을 2배 향상시켰습니다.
- CMP170HX 최적화 — Ninfer를 포크하여 SM80 아키텍처에 맞게 컴파일러 플래그 및 커널 스케줄링 조정
- 성능 2배 향상 — Qwen3.6-35B 모델에서 262K 컨텍스트를 유지하며 2배의 처리 속도 달성
- 홈 어시스턴트 활용 — Jarvis(Alexa 대체)의 백엔드 모델로 사용하여 음성 인식 및 자동화 응답 속도 개선
- 하드웨어 가성비 — 1,000달러 미만의 CMP170HX 카드를 활용해 고성능 로컬 AI 환경 구축
다들 안녕! 내가 Ninfer를 CMP170HX로 포팅하면서 작업한 내용을 좀 공유하려고 해 (Github)
일단 Neroued, Sergiuszm, 그리고 특히 Don-Chad가 보여준 엄청난 작업에 먼저 박수를 보내고 싶어. vLLM, Llama.cpp, SGLang을 깎아내리려는 게 아니라, 우리 같은 일반인들이 집에서 하드웨어 성능을 쥐어짜 낼 수 있게 해준 거니까. 공짜 토큰은 언제나 환영이고, 이 사람들이 만든 작업물 덕분에 이번 포크가 100% 가능했어.
글 시작하기 전에 미리 말해두는데, 난 개발자나 코더 같은 거 아니야. IT 아키텍트라서 기술은 좀 알지만, 지난 1년간 여기 AI 커뮤니티에서 꽤 활발하게 활동했을 뿐이야. 이번 프로젝트는 Codex 기반의 Hermes랑 Ninfer 4090 포크를 돌리는 로컬 Qwen3.8-27B가 내 개발자 역할을 해줬고, 난 그냥 옆에서 가이드만 했어.
지난 일주일 동안 3090이랑 4090용 Ninfer를 가지고 테스트하고, 검증하고, Llama-swap이랑 돌아가게 설정하느라 바빴어. NInfer랑 llama-swap 사이의 텔레메트리 호환성 문제도 해결해서 llama-swap이 NInfer의 타이밍이랑 처리량 지표를 제대로 가져올 수 있게 만들었지. 근데 성능이 30~50% 이상 꾸준히 "공짜로" 튀어 오르는 걸 보고 진짜 감동받았다.
RTX 3090/3090Ti랑 CMP170HX가 사촌 지간이라, Don-Chad 레포랑 내 로컬 CMP170HX 인스턴스(CMPUnlocker로 언락함, 운 좋게 1000달러 미만에 구했어)를 가지고 테스트를 좀 돌려봤는데, 내부 구조가 거의 호환돼서 깜짝 놀랐어.


