RAM 부자 vs GPU 부자, 누가 맞는 걸까?
Are the rich RAM /poor GPU people wrong here?
핵심 요약
고용량 RAM을 활용한 로컬 LLM 구동이 GPU 중심 환경보다 효율적인지, 아니면 여전히 고사양 GPU가 정답인지에 대한 고민.
- 하드웨어 구성 — 고용량 RAM과 저사양 GPU 조합 vs 고사양 GPU 중심의 로컬 LLM 구동 효율 비교
- 모델 선택지 — 100B급 MOE 모델을 위한 RAM 오프로딩과 24-32GB VRAM 내 밀집 모델 간의 성능 차이
- 실제 활용성 — 툴 호출이나 속도 측면에서 저양자화 모델의 한계와 대형 모델 구동의 현실적 제약
- 장비병 경계 — 하드웨어 업그레이드에 집착하기보다 현재 가진 장비로 모델을 직접 활용하는 태도의 중요성
여러분 안녕하세요.
로컬 모델에 대한 정의는 사람마다 다르겠지만, 저는 두 가지 '합리적인' 유형의 프론티어 로컬 모델이 있다고 봅니다.
하나는 GPU 부자들을 위한 24GB나 32GB VRAM에 간신히 들어가는 밀집(dense) 모델이고, 다른 하나는 100B 파라미터급 MOE 모델입니다. 100B급 파라미터 모델은 일반적인 메인보드 최대 지원 용량인 128GB RAM에서 하이브리드 오프로딩을 통해 적절한 속도로 구동할 수 있습니다. 자동차보다 싸니까 일반인도 감당할 수 있죠 😄.
Qwen 27B 같은 밀집 모델은 많이 보이지만, 100B MOE급은 Qwen 3.5 122B뿐이었고 3.6은 나오지도 않았습니다. 최고의 MOE 모델들은 보통 30-35B 범위에 있죠.
그럼 RAM은 많고 GPU는 부족한 사람들에겐 선택지가 별로 없고, 고사양 GPU가 유일한 정답인 걸까요?
물론 Q3로 Minimaxi를 쑤셔 넣거나 Q1으로 DeepSeek V3를 돌릴 순 있겠지만, 툴 호출이나 속도, 실사용 측면에서는 거의 쓸모가 없습니다.
저는 'RAM 대란' 전에 Strix Halo를 샀는데, 128GB RAM을 활용할 만한 사용처가 llama swap으로 여러 모델을 로드하는 것 외에는 딱히 안 보이네요.


