Qwen, FlashQLA 공개
Qwen Introduced FlashQLA
핵심 요약
Qwen이 TileLang 기반의 고성능 선형 어텐션 커널인 FlashQLA를 공개하여 엣지 디바이스에서의 AI 성능을 대폭 향상함.
- FlashQLA 공개 — TileLang 기반으로 설계된 고성능 선형 어텐션 커널을 발표함.
- 성능 향상 — 기존 대비 2~3배의 순방향 속도와 2배의 역방향 속도 향상을 달성함.
- 엣지 디바이스 최적화 — 개인 기기에서의 에이전트 AI 구동을 위해 하드웨어 친화적으로 설계됨.
- 기술적 특징 — 자동 intra-card CP와 워프 특화 커널을 통해 SM 활용도를 극대화함.
TileLang 기반으로 구축된 고성능 선형 어텐션 커널인 FlashQLA를 소개합니다.
2~3배의 순방향 속도 향상. 2배의 역방향 속도 향상.
💻 개인 기기에서의 에이전트 AI를 위해 특별히 제작되었습니다.
핵심 통찰:
-
게이트 기반의 자동 intra-card CP.
-
하드웨어 친화적인 대수적 재구성.
-
TileLang 융합 워프 특화 커널.
FlashQLA는 자동 intra-device CP를 통해 SM 활용도를 높입니다. 이러한 이점은 TP 설정, 소형 모델, 긴 컨텍스트 작업에서 특히 두드러집니다.
전체 GDN 흐름을 단일 커널로 융합하는 대신, CP 및 역방향 효율성에 최적화된 두 개의 커널로 분리했습니다. 배치 사이즈가 클 때는 완전히 융합된 방식보다 메모리 I/O 오버헤드가 추가로 발생하지만, 엣지 디바이스와 긴 컨텍스트 작업에서는 더 나은 실질적인 성능을 제공합니다.
역방향 패스가 가장 어려운 부분이었습니다. 매우 제한된 온칩 메모리 제약 조건 하에서 16단계 워프 특화 파이프라인을 구축하여, 궁극적으로 2배 이상의 커널 수준 속도 향상을 달성했습니다.
커뮤니티에 유용하게 쓰이길 바랍니다!
더 알아보기:
