RTX 5070 Ti의 레이 트레이싱 코어를 LLM 라우팅에 활용하여 218배 속도 향상 달성
Used ray tracing cores on my RTX 5070 Ti for LLM routing — 218x speedup, runs entirely on 1 consumer GPU
핵심 요약
레이 트레이싱 하드웨어를 활용해 MoE 모델의 라우팅 효율을 극대화한 실험적 연구.
- RT 코어 활용 — 게임용 레이 트레이싱 하드웨어를 LLM의 MoE 라우팅 결정에 재사용함
- 성능 향상 — 218배 빠른 라우팅 속도와 731배 적은 VRAM 사용량 기록
- 전문가 모델 분석 — MoE 전문가가 주제가 아닌 구문 유형별로 전문화됨을 발견함
- 코드 공개 — 연구 결과와 구현 코드를 GitHub 및 Zenodo에 오픈 소스로 공개함
요약: 게임에서 레이 트레이싱에 사용되는 RT 코어를 활용해 MoE 모델의 전문가 라우팅을 처리하는 방법을 찾았습니다. LLM 추론 중에 이 코어들은 완전히 놀고 있는데, 일을 시키면 어떨까요?
작동 방식:
- MoE 모델의 라우팅 결정(어떤 전문가가 어떤 토큰을 처리할지)을 수행함
- 토큰을 3D 공간으로 투영함
- GPU의 전용 레이 트레이싱 하드웨어를 사용하여 올바른 전문가를 찾음
- O(N) 대신 O(log N) — 하드웨어 가속 방식
수치 (OLMoE-1B-7B, RTX 5070 Ti 16GB):
* 배치 1024에서 218배 빠른 라우팅
* 라우팅을 위한 VRAM 731배 절감
* 퍼플렉서티(perplexity) 저하 단 1.5%
* 라우팅 정확도 95.9%
뜻밖의 발견: MoE 전문가들이 실제로 주제별로 전문화되지 않는다는 사실도 발견했습니다. 3가지 모델(OLMoE, Qwen-MoE, DeepSeek-MoE)을 테스트했는데, 모두 주제가 아닌 구문 유형(내용어 vs 기능어 vs 구두점)별로 전문화되었습니다. "과학 전문가" 같은 건 신화입니다.
코드 저장소: https://github.com/JordiSilvestre/Spectral-AI 모든 논문은 Zenodo에서 전체 데이터 및 재현 지침과 함께 오픈 액세스로 제공됩니다: https://doi.org/10.5281/zenodo.19457288


