V100에서 Qwen3.6 27B NVFP4 모델로 366 t/s 달성
366 t/s Qwen3.6 27B NVFP4 on v100s
핵심 요약
V100 GPU에서 NVFP4 가중치를 활용해 초고속 추론을 가능하게 하는 'v100-skinny' 커널을 개발했습니다.
- v100-skinny 커널 — V100(sm70) 아키텍처에서 NVFP4 가중치를 극도로 빠르게 처리함
- 성능 수치 — 단일 스트림 기준 366 t/s, 구조화된 생성 시 약 240 t/s 달성
- 기술적 차별점 — 기존 Marlin 커널 대비 대역폭 활용도를 12%에서 69%까지 끌어올림
- 오픈 소스 — 관련 커널 구현체는 GitHub를 통해 공개됨
이 수치들은 단일 스트림 기준입니다
V100에 관한 이전 게시물(여기)에 이어, 이 댓글(여기)에서 영감을 받아 sm70에서 Nvfp4 가중치를 위한 초고속 경로와 sm70에서 거의 공짜나 다름없는 딥 스펙큘레이션(deep speculation)을 가능하게 하는 커널 작업을 하기로 했습니다.
그 결과, 흥분되는 마음으로 “v100-skinny”(커널이 가벼워서 이렇게 이름 지었습니다)를 출시하게 되었습니다.
제 작업물은 여기서 확인하실 수 있습니다: https://github.com/dnv2003/v100-skinny
제목에 언급된 수치에 대한 많은 주의 사항이 레포에 적혀 있지만, 이는 mtp(multi-token prediction)의 절대적인 최상의 경우인 추출(extraction) 상황입니다. 하지만 JSON과 같은 구조화된 생성에서는 약 240 t/s, mtp 친화적인 코드(보일러플레이트, 패턴, HTML 등 “k=7의 플래그십 구성” 사용 시)에서는 200 t/s 정도를 기대할 수 있습니다.

