RTX Pro 6000에서 Ninfer로 Qwen 3.6 35b a3b 모델 돌리니 초당 600토큰 나오네. 컴캐스트 광고 중에 "stupid fast(미친 듯이 빠름)" 기억하는 사람?
600tok/s single request on qwen3.6 35ba3b with Ninfer on an RTX Pro 6000. Anybody remember that Comcast ad "stupid fast"?
핵심 요약
RTX Pro 6000 환경에서 Ninfer를 활용해 Qwen 3.6 35b a3b 모델로 초당 600토큰의 압도적인 추론 속도를 달성함.
- 성능 시연 — RTX Pro 6000 환경에서 초당 600토큰의 압도적인 추론 속도를 보여줌.
- 모델 활용 — Qwen 3.6 35b a3b 모델을 문서 검색 및 자동화 작업용으로 사용함.
- MoE의 장점 — dense 모델보다 빠른 MoE 구조를 통해 실용적인 속도를 확보함.
- 사용 사례 — 문서 분석, 일정 관리, 인용구 찾기 등 단순 반복 업무에 최적화함.

머리가 아주 좋은 놈은 아니지만, 읽고 찾기나 코딩 작업처럼 그냥 무식하게 밀어붙여도 되는 잡일용으로 새로 들인 모델이야. 토큰을 20배 더 잡아먹긴 해도 웬만한 로컬 모델보다는 훨씬 빠르거든. Cerebras급은 아니지만 그래도 굴리는 맛이 꽤 쏠쏠하네.


