Cursor가 개발한 B200용 고속 메가커널로 MoE 학습 속도 40% 향상
40% speedup of MoE training with faster megakernel, by cursor, of all people (for B200s)
핵심 요약
Cursor가 B200 GPU를 위한 MoE 학습용 오픈소스 메가커널을 공개하며 40%의 속도 향상을 주장함.
- 메가커널 공개 — Cursor가 B200 및 NVL72 시스템을 위한 MoE 학습 최적화 커널을 오픈소스로 배포함.
- 성능 향상 주장 — 엔드투엔드 기준 약 40%의 학습 속도 향상을 기대할 수 있다고 밝힘.
- 실제 성능 의문 — 네트워크 병목 현상 등으로 인해 실제 환경에서의 체감 성능은 다를 수 있다는 의견이 제기됨.
github.com
원문 사이트로 이동
벤치마크를 맹신하지 말고 직접 돌려보라는 건 매일 하는 말이지. 주장하는 엔드투엔드 속도 향상은 약 40%고, 포워드 패스는 140% 더 빠르다고 함.
누구나 짤 수 있는 단순한 커널과 비교하면 실제 엔드투엔드 속도는 10~20% 정도 빠를 거라고 장담함. 뭐, 아예 안 빠를 수도 있지만. 그래도 무료에 오픈소스잖아! Apache 2.0 라이선스임.


