자체 CUDA 커널을 탑재한 Rust/C++ 추론 엔진 'Paddock' 오픈소스 공개 (MIT/Apache-2.0)
We open-sourced Paddock, our Rust/C++ inference engine with its own CUDA kernels (MIT/Apache-2.0)
핵심 요약
자체 CUDA 커널을 활용해 vLLM 및 SGLang 대비 성능을 최적화한 새로운 Rust/C++ 기반 추론 엔진 Paddock이 오픈소스로 공개되었습니다.
- 성능 최적화 — 자체 CUDA 커널을 통해 vLLM 및 SGLang 대비 우수한 추론 속도 달성함
- 기술 스택 — Rust와 C++로 작성되었으며 OpenAI 및 Anthropic 스타일 API를 지원함
- 지원 환경 — 현재 NVIDIA GPU(CUDA) 전용이며 Windows 및 Linux 환경에서 구동 가능함
- 제한 사항 — 단일 GPU당 모델 하나만 지원하며 텐서 병렬 처리나 파이프라인 병렬 처리는 미지원함
개발자 중 한 명임. 8월에 9월 중으로 오픈소스 하겠다고 했는데 어젯밤에 바로 올렸다. 라이선스는 MIT 아니면 Apache-2.0 중에 골라 써라. 지금 보는 레포가 우리 내부에서 쓰던 거 그대로 가져온 거라 커널까지 다 들어있음. 이제부터 모든 개발은 공개적으로 진행한다.
이건 Rust랑 C++로 짠 추론 엔진이고, 우리 자체 CUDA 커널을 씀. OpenAI나 Anthropic 스타일 API 지원하는 바이너리 하나로 돌아가고, GGUF랑 safetensors 다 불러올 수 있음. 우리 회사에서 연간 300B 토큰 정도 이걸로 돌리고 있다.
벤치마크 결과 좀 가져왔음. RTX PRO 6000 한 장에 Qwen3.8-27B FP8 올렸고, 모든 엔진에서 spec decoding은 껐음:
-
vs vLLM: 13개 항목 전부 다 이김, 1.02배에서 1.19배 정도 (엄청난 차이는 아님)
-
vs SGLang: 13개 중 10개 이기고, 2개는 밀리고, 1개는 비김
-
vs llama.cpp Q8_0: 13개 전부 다 이김, 1.5배에서 37배까지 차이 남
-
32 클라이언트, 1024 입력 / 1024 출력 기준: 1062 tok/s, vLLM 958, SGLang 844
전체 결과표는 여기: https://truespar.com/paddock/benchmarks/qwen38-27b
아직 안 되는 거: CUDA 전용이고, 윈도우랑 리눅스만 지원함. Blackwell(5090, RTX PRO 4500/5000/6000, B200)이랑 Ampere(A6000으로 처음 테스트했고 30시리즈도 잘 돌아감)에서 검증 끝냈음. Ada 커널도 들어있긴 한데 아직 테스트해 본 사람이 없어서 PADDOCK_UNVALIDATED_ARCH=1 설정 안 하면 엔진 실행 안 되게 막아놨다. Hopper랑 A100 커널도 코드엔 있는데 보드가 없어서 테스트 못 해봄. 맥, ROCm, Vulkan은 지원 안 함. GPU당 모델 하나만 올릴 수 있고, 텐서 병렬 처리도 아직 안 됨.
https://github.com/truespar/paddock
도움이나 의견 주면 진짜 고맙겠다!


