24GB M4 Pro Mac mini에서 Claude Code 워크플로우와 로컬 모델을 함께 사용할 수 있을까?
Testing whether a 24 GB M4 Pro Mac mini can support local models alongside a Claude Code workflow
핵심 요약
M4 Pro Mac mini에서 로컬 모델을 Claude Code와 병행하는 실험 결과와 활용 가능성에 대한 논의입니다.
- 성능 테스트 — M4 Pro에서 GPT-OSS 20B 모델이 초당 약 64토큰의 속도로 구동됨
- 로컬 모델 역할 — 코드 요약, 보일러플레이트 생성, 오프라인 실험 등 보조적 수단으로 활용
- 활성 파라미터 — 속도 측면에서 MoE 모델이 밀집 모델보다 효율적임
- 사용자 의견 — 로컬 모델의 코딩 능력에 회의적인 시각과 보조 도구로서의 가능성이 공존함
Claude Code를 아주 많이 사용하고 있는데, 개발 워크플로우 중에서 항상 최첨단 클라우드 모델이 필요하지 않은 부분에 내 책상 위의 M4 Pro Mac mini가 유용한 로컬 모델을 제공할 수 있는지 테스트해보고 싶었음.
놀라운 결과: MLX FP4로 구동되는 GPT-OSS 20B 모델이 16개 컨테이너가 돌아가는 OrbStack 랩 환경에서도 초당 약 63.9토큰을 생성함. 랩을 끄니까 초당 약 64.9토큰으로 살짝 올랐음. MLX가 GGUF보다 약 19% 더 빨랐는데, MLX 측정값이 좀 더 들쭉날쭉하긴 했음. 로컬 AI를 돌리려면 2TB 통합 메모리를 가진 Mac Ultra 4노드 클러스터가 필요할 줄 알았는데. 5만 달러 안 써도 돼서 다행임!
코드 워크플로우에서 로컬 추론은 Claude Code의 경쟁자가 아니라 보완재라고 생각함:
- 로컬/비공개 코드베이스 분류 또는 요약
- 빠른 보일러플레이트 생성 및 위험도가 낮은 변환 작업
- 프롬프트 및 에이전트 패턴에 대한 오프라인 실험
- Claude Code로 작업을 넘기기 전 전처리
- 로컬 백업 유지
핵심 교훈은 **활성 파라미터(active parameters)**가 속도에 중요하다는 점임. 20B+ MoE 모델이 9B 밀집 모델을 이긴 이유는 토큰당 파라미터의 일부만 사용하기 때문임.

여러분은 Apple Silicon에서 Claude Code와 어떤 로컬 모델 및 런타임을 함께 쓰고 있음?

