로컬 LLM을 위한 6만 달러짜리 맥 vs 10달러짜리 구독 서비스
$60k in Macs for Local LLM vs $10 Subscription
핵심 요약
로컬 LLM은 아직 상용 클라우드 서비스의 성능과 효율성을 따라잡지 못한다는 비판적 견해입니다.
- 하드웨어 한계 — 6만 달러 규모의 맥 클러스터도 클라우드 구독 서비스보다 성능이 떨어짐
- 생산성 격차 — 로컬 환경은 대규모 작업 처리 속도가 현저히 느려 실무에 부적합함
- 프라이버시 논쟁 — 데이터 보안을 위해 로컬을 고집할지, 효율을 위해 클라우드를 쓸지 의견이 갈림
- 모델 규모 차이 — 로컬에서 구동 가능한 모델과 클라우드 전용 대형 모델 간의 성능 차이가 존재함
내가 제일 좋아하는 유튜버 중 한 명인 Alex Zisking이 있는데, 이 양반이 로컬 LLM 관련 영상을 진짜 많이 올리거든. 초짜는 절대 아님.
이 영상에서 하는 말이 가관임: "Lee가 너희들한테 계속 진실을 말해왔던 거다. 로컬 LLM은 일반인 하드웨어에서 돌리기엔 아직 멀었다."
뭐 나를 언급한 건 아니지만, 내가 그동안 줄기차게 주장해온 내용을 그대로 짚어주더라고. "Anthropic에 매달 200달러씩 갖다 바치지 말고 무료 로컬 LLM 써라" 같은 소리는 다 조회수 빨아먹으려는 낚시질이지, 진실이 아님.
이 양반이 지금 현존 최강 오픈 웨이트 모델인 Kimi K3를 돌려봤거든. 사람들이 다들 Fable 5급 성능이라고 난리 치는데, 맞긴 함. 근데 그건 '니들' 하드웨어가 아니라 데이터 센터에서나 가능한 얘기지.
Alex는 Mac Studio 4대를 네트워크로 묶어서 램 2TB를 확보했어. 그래야 모델도 돌리고 긴 컨텍스트 윈도우까지 감당할 수 있으니까.
근데 결과가 어땠냐? 간단하면서도 꽤 괜찮은 웹 대시보드 하나 만드는 데 4시간 걸렸고, 속도는 17 tok/s 나왔음. 물론 작동은 잘 됐고 결과물도 깔끔했지. 근데 6만 달러짜리 하드웨어를 굴려도 10달러짜리 구독 서비스 성능의 발끝도 못 따라가는 게 현실임.
지금 나는 개발 프로젝트 두 개를 동시에 돌리고 있어. 벌써 6시간째 돌리는 중인데, 한 시간 정도 스프린트 돌리고 결과물 확인하고, 필요하면 피드백 주고 다시 다음 스프린트로 넘어가는 식으로 작업함.
내가 구독료로 10달러보다 훨씬 더 많이 내고 있긴 해. 근데 Mac 클러스터로 4시간 걸릴 작업이 클라우드에선 15분이면 끝나는 일임. 나는 지금 "하루 종일 여러 프로젝트"를 굴리고 있는데, 로컬 AI로는 이 수요를 도저히 감당할 수가 없음.
아직은 말이지.
아마 너희들한테도 마찬가지일걸.
영상 링크는 댓글에 달아둠.
