[논문] 소비자용 기기에서 CPU-GPU 하이브리드 LLM 추론을 위한 자동 텐서 스케줄링
[Paper] Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices
핵심 요약
소비자용 기기에서 텐서 단위로 CPU-GPU 오프로딩을 최적화하여 추론 성능을 대폭 향상시킨 ATSInfer 논문 소개.
- ATSInfer 시스템 — 텐서 단위의 세밀한 오프로딩으로 CPU-GPU 협업 효율 극대화함
- 성능 향상 — 기존 대비 프리필 처리량 최대 1.94배, 디코드 처리량 최대 3.29배 개선함
- 하드웨어 활용 — GPU 사용률을 높이고 PCIe 대역폭을 효과적으로 활용함
- llama.cpp 확장 — 기존 llama.cpp를 기반으로 15,000줄 이상의 코드를 추가해 구현됨
[블록 1/4] > 노트북이나 데스크톱 같은 소비자용 기기에서 거대 언어 모델을 실행하는 것은 모델 가중치가 종종 GPU 메모리 용량을 초과하기 때문에 어려운 일이며, CPU 메모리를 사용하여 모델의 유효 용량을 확장하기 위한 추론 오프로딩이 필수적입니다. 그러나 기존의 오프로딩 시스템은 일반적으로 거친 레이어 수준이나 전문가 수준의 스케줄링에 의존하며, 이는 동일한 레이어 내 텐서들 간의 상당한 이질성을 간과하고 해당 기기의 변화하는 하드웨어 부하 조건에 제대로 적응하지 못합니다. 본 논문에서는 텐서 단위로 오프로딩을 수행하는 소비자용 기기용 하이브리드 CPU-GPU 추론 시스템인 ATSInfer를 제시합니다. ATSInfer는 정적 텐서 배치와 부하 인식 동적 전송을 결합하고, 비동기식 CPU-GPU 조정을 도입하여 이기종 백엔드 전반에서 하드웨어 저장소, 데이터 이동 및 계산을 효율적으로 스케줄링합니다. 우리는 ATSInfer를 구현하고 밀집(dense) 모델과 MoE 모델을 모두 사용하여 대표적인 소비자 플랫폼에서 평가했습니다. 기존 시스템과 비교했을 때, ATSInfer는 프리필 처리량을 최대 1.94배, 디코드 처리량을 최대 3.29배 향상시켰으며, 동시에 GPU 활용도를 높이고 PCIe 대역폭을 더 효과적으로 사용했습니다. 이러한 결과는 ATSInfer가 개인용 소비자 기기에서 로컬 LLM 배포의 사용자 경험을 크게 향상시킬 수 있음을 보여줍니다.
[블록 2/4] arXiv : https://arxiv.org/abs/2607.10183
[블록 3/4] 전체 논문 : https://arxiv.org/pdf/2607.10183
[블록 4/4] 한동안 찾아봤지만, 이 프로젝트의 GitHub 레포는 찾을 수 없었습니다(아직 공개되지 않은 것 같습니다). 온라인에 올라오는 대로 GitHub 레포 링크를 추가하겠습니다.

