Apple Silicon Mac에서 API 키와 비용 없이 로컬 Gemma 4 또는 Qwen 3.6으로 Claude Code 실행하기
Run Claude Code against a local Gemma 4 or Qwen 3.6 - no API key, no cost, works on any Apple Silicon Mac
핵심 요약
Apple Silicon Mac에서 mlx-serve를 사용하여 로컬 LLM으로 Claude Code를 무료로 구동하는 방법을 소개합니다.
- 로컬 환경 구축 — mlx-serve를 통해 API 키 없이 로컬 모델을 Claude Code에 연결함
- 하드웨어 요구사항 — 모델 크기에 따라 RAM 용량이 중요하며 16GB 이상 권장됨
- 모델 성능 한계 — Sonnet이나 Opus 같은 대형 모델과는 성능 차이가 큼
- 개인정보 보호 — 로컬 실행 시 api.anthropic.com 연결을 차단하여 데이터 프라이버시 확보 가능
Apple Silicon Mac이 있다면 로컬 서버를 지정하여 Claude Code를 완전히 로컬에서(그리고 무료로) 실행할 수 있습니다. 방법은 다음과 같습니다:
설정 (2분 소요)
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve
brew install --cask mlx-core # GUI 메뉴 바 앱
brew install mlx-serve # CLI 서버 전용
mlx-serve run gemma-4-e4b-it # 서버 다운로드 및 시작 (GUI 사용 시 불필요)
그런 다음 Claude Code를 다음과 같이 실행하세요:
ANTHROPIC_BASE_URL=http://localhost:11434 \
ANTHROPIC_API_KEY=local \
ANTHROPIC_DEFAULT_MODEL=mlx-serve \
claude
이게 전부입니다. Claude Code의 스트리밍, 도구 호출, 사고 블록(thinking blocks), 멀티턴 대화 모두 Anthropic Messages API를 통해 로컬 모델에서 작동합니다.
로컬에서 잘 작동하는 모델
- Gemma 4 E4B 4-bit (추천 시작 모델, M4 Max에서 ~105 tok/s 디코드)
- Qwen 3.6 27B 4-bit (네이티브 MTP spec-decode 지원, ~36 tok/s, 코딩 작업에서 1.43배 빠름)
- Qwen 3.5 4B/9B (더 빠른 반복 주기)
코딩 작업에 가장 적합한 모델에 대한 전체 가이드 및 팁: https://mlxserve.com/claude-code-local/
서버는 mlx-serve를 사용하며 MIT 라이선스, Python 불필요, 단일 바이너리입니다. brew install mlx-serve

