GPU 없이 26B LLM 로컬 구동하기
Running a 26B LLM locally with no GPU
핵심 요약
GPU 없이 CPU만으로 26B 모델을 쾌적하게 돌리는 놀라운 경험 공유.
- MoE 모델 효율성 — 4B 파라미터만 활성화하는 MoE 구조 덕분에 CPU에서도 빠른 추론 가능함.
- 추론 속도 논쟁 — 프롬프트 처리와 실제 생성 속도의 차이를 구분해야 정확한 성능 측정이 가능함.
- 하드웨어 제약 — 32GB RAM 환경에서 가상 메모리까지 활용하며 모델을 구동하는 기술적 한계가 존재함.
- 성능 비교 — dense 모델과 MoE 모델 간의 구조적 차이가 CPU 추론 속도에 큰 영향을 미침.
이거 진짜 미쳤음. 한동안 CPU로만 로컬 LLM을 돌려왔는데, i5-8500에 32GB RAM만으로도 12B 모델에서 아주 좋은 결과를 얻었거든. 근데 지금 같은 머신에서 Gemma4 26B 버전을 돌리고 있는데, 진짜 엄청 빠르고 전혀 버벅거리지도 않음.
GPU 없이도 이런 게 돌아간다는 게 그냥 놀라울 따름임.
