48GB M5 Pro에서 Qwen3-Coder-30B-A3B + Pi 사용하기 — 구축 전 조언 구함
Qwen3-Coder-30B-A3B + Pi on a 48GB M5 Pro — looking for advice before I build this setup
핵심 요약
로컬 코딩 에이전트 구축을 위해 Qwen3-Coder 모델과 Pi 설정을 고민하는 사용자에게 최신 모델 사용을 권장하는 반응이 많습니다.
- 모델 선택 — 구형 모델 대신 Qwen 3.6/3.8 등 최신 버전 사용 권장됨
- 하드웨어 성능 — 48GB 메모리는 충분하지만 더 나은 모델을 활용할 여지가 있음
- 에이전트 전략 — 로컬 모델만으로는 한계가 있어 프론티어 모델과 병행하는 방식 제안됨
- 실행 환경 — oMLX나 Context7 MCP 등을 활용한 빠른 설정 및 최적화 강조됨
다들 안녕,
이제 Pi를 내 메인 로컬 코딩 에이전트로 세팅해보려고 하는데, 실제로 로컬에서 꽤 큰 모델들을 Pi랑 같이 돌려본 형들한테 조언 좀 구하고 싶어.
내 하드웨어 스펙은 이래:
-
MacBook Pro
-
Apple M5 Pro
-
48 GB 통합 메모리
-
18 CPU 코어
-
Metal / MLX
-
~307 GB/s 메모리 대역폭
내 주 목적은 단순히 토큰/초 속도를 뽑아내는 게 아니라 코딩 퀄리티랑 에이전트 신뢰도야. 실제 레포지토리 돌리면서 긴 시간 코딩 세션에 쓸 수 있는 놈을 원해.
내 머신에 맞춰서 llmfit 돌려보니까 이런 결과가 나오더라고:
llmfit --max-context 131072 recommend --use-case coding --runtime mlx
눈에 띄는 모델은 이거였어:
Qwen3-Coder-30B-A3B-Instruct
MLX 결과는 대충 이래:
-
30.5B 총 파라미터
-
3B 활성 파라미터 (MoE)
-
262K 네이티브 컨텍스트
-
131K 컨텍스트 (
llmfit추정치) -
~15.6 GB 모델 메모리 (8-bit 버전 기준)
-
툴 사용 지원
-
~132 tok/s (
llmfit이 131K 컨텍스트에서 추정한 속도)
내 48GB 머신에서 돌리기엔 하드웨어적으로 꽤 괜찮은 조합 같아.
지금은 8-bit 쪽으로 마음이 기우는데, 성능 쥐어짜는 것보다 코딩 퀄리티랑 추론 능력이 훨씬 중요해서 그래. 메모리도 넉넉해서 굳이 4-bit로 타협할 필요도 없고.
이제 고민인 건 이걸 Pi랑 어떻게 조합하는 게 최선이냐는 거야.
Pi 쓰는 형들한테 몇 가지 물어볼게:
1. Qwen3-Coder-30B-A3B랑 Pi 조합 괜찮아?
비슷한 사이즈의 MoE 코딩 모델을 로컬에서 쓰고 있는 형들 의견이 특히 궁금해.
2. 컨텍스트 윈도우는 실제로 어느 정도로 써?
모델은 262K까지 지원하는데, Pi를 128K나 256K로 돌리는 게 64K보다 실질적인 이득이 있을지 모르겠어.
그리고 Apple Silicon에서 KV-캐시 비용도 좀 이해하고 싶어. llmfit은 모델 메모리를 15.6GB 정도로 잡는데, 컨텍스트 늘어나면 런타임 메모리 점유율이 당연히 더 올라갈 거 아냐.
3. 8-bit로 갈까, 4-bit로 갈까?
내 우선순위는 이거야:

