16GB VRAM GPU용 Ninfer 4080을 직접 만들었습니다
I built Ninfer 4080 for 16GB class GPUs
핵심 요약
RTX 4080 16GB에서 Qwen 3.8 27B 모델을 100k 컨텍스트로 빠르게 구동하는 최적화 엔진을 개발했습니다.
- 성능 최적화 — 범용 엔진 대비 압도적인 프리필 및 토큰 생성 속도 달성함
- 하드웨어 활용 — RTX 4080 16GB 환경에 맞춰 KV 캐시 압축 및 추론 최적화 적용함
- 기술적 접근 — GPU 커널 개발 경험 없이 소프트웨어 공학적 관점에서 비즈니스 의사결정으로 프로젝트 수행함
- 커뮤니티 기여 — 오픈 소스로 공개하여 16GB GPU 사용자들과 성과 공유함
다들 안녕,
TL/DR
RTX 4080 16GB GPU에서 ISTA-DASLab-Qwen-3.8-27B-GSQ 모델을 100k 컨텍스트로 돌리려고 NInfer 4080을 만들었어. 하드웨어 성능을 최대한 쥐어짜서 (최대 성능: 프리필 2720 tok/s, 생성 262 tok/s) 뽑아냈고, 다른 사람들도 써먹으라고 공유한다.
https://github.com/roofkid/ninfer-4080
전체 내용
커뮤니티에서 Ninfer 5090, 4090, 3090 만드는 거 보면서 솔직히 16GB 메모리 달린 내 RTX 4080으로는 아무것도 못 한다는 게 좀 슬프더라고. DeepSeek 플랫폼에 13달러 정도 크레딧이 남아있었는데, 이걸 이렇게까지 쓸 줄은 몰랐지.
배경을 좀 설명하자면, 난 소프트웨어 엔지니어링이랑 아키텍처 쪽에서 20년 넘게 굴렀지만 GPU 커널 개발은 생판 처음이라 이번 프로젝트가 개인적으로도 꽤 흥미로운 경험이었어. C++ 코드를 읽고 이해할 수는 있어도 커널 코드를 직접 "판단"할 수준은 아니었거든. 그래서 철저하게 프로덕트 오너 입장에서 요구사항을 정의하고, 좋은 소프트웨어 엔지니어링 관행을 따르면서 "비즈니스적인 결정"만 내리는 방식으로 접근했지.
지난 2~3년 동안 로컬 LLM 커뮤니티를 계속 지켜보면서 웬만한 모델은 다 써봤고, 너희들처럼 발전 과정을 보면서 감탄하곤 했어.
핵심 원칙
-
RTX 4080 16GB GPU에 딱 맞출 것
-
ISTA-DASLab-Qwen-3.8-27B-GSQ 모델 사용 -> 이유는 ByteShape 아티클에 잘 나와 있는데, 이 사이즈에선 성능이 진짜 미쳤고 Unsloth UD 양자화보다 정확도가 더 좋다고 주장함: https://byteshape.com/blogs/Qwen3.8-27B/#96-gb-rtx-pro-6000 나도 실제로 써보니까 너무 좋아서 매일 이것만 쓰는 중임
-
DFlash2 추측 디코딩(speculative decoding) 사용
-
100k+ 컨텍스트 달성
-
llama.cpp나 vllm 같은 범용 추론 엔진보다 하드웨어를 더 잘 써먹을 수 있게 프리필 및 토큰 생성 속도를 대폭 개선할 것
-
변경 사항 적용 후 정확도 유지 여부 측정 (비교를 위해 M4 48GB로 더 높은 양자화 모델도 테스트해봤는데, 물론 속도는 훨씬 느림)
-
비용 효율을 위해 DeepSeek V4.1 Flash 사용
-
Pi를 하네스로 사용 (커스텀 확장 기능: hashline edit pro, 직접 짠 스킬로 로컬 SearXNG를 통한 인터넷 검색)
-
누구나 쉽게 돌릴 수 있게 Docker 이미지로도 배포
결과
| Depth | Prefill t/s (DFlash2) | MTP3 decode t/s | DFlash2 K=7 decode t/s |
|---|---|---|---|
| 8K | 2719.9 | 151.2 (100%) |


