Ninfer와 5090으로 돌리는 3.8 27B 모델, 너무 좋아서 눈물이 다 나네.
Ninfer and a 5090 with 3.8 27B is making me cry tears of joy it's so good.
핵심 요약
Ninfer와 RTX 5090을 활용해 LLM 추론 속도를 획기적으로 높인 사용자들의 경험 공유와 팁.
- 추론 성능 향상 — llama.cpp 대비 2배 이상의 처리량 달성함
- 설정 최적화 — Ninfer를 활용한 고속 추론 및 KV 캐시 관리 설정
- 다양한 하드웨어 지원 — 5090 외에도 4090, 3090 등 다양한 GPU용 포크 존재
- 멀티 에이전트 활용 — LiveCodeBench 접근 방식을 통한 작업 효율 극대화
최신 버전 빌드해서 돌려보니까 초당 220 토큰까지 찍히고 평균 170대 나오는데, 진짜 미쳤다. 믿기지가 않네.
이 프로젝트 참여한 사람들 있으면 진짜 개지린다, 박수 보낸다. 와, llama.cpp 쓸 때보다 처리량 두 배 넘게 뻥튀기된 거 실화냐?
내가 설정한 값은 이거임:
command: >
ninfer-serve /models/qwen3_8_27b_nvfp4.ninfer
--model-id qwen3.8-27b-nvfp4
--host 0.0.0.0
--max-context 240000
--kv-capacity 240000
--max-concurrency 2
--kv-dtype fp8
--host-kv-mib 16384
--spec mtp --draft-tokens 3
--lm-head-draft
--vision
--media-live-mib 2048

