로컬 코딩 에이전트를 위한 Qwen3.6-35B-A3B 구동: 내 설정 및 작동 구성
Running Qwen3.6-35B-A3B Locally for Coding Agent: My Setup & Working Config
핵심 요약
MacBook Pro에서 Qwen3.6-35B-A3B 모델을 활용해 로컬 코딩 에이전트를 구축하는 상세 설정 공유.
- 하드웨어 설정 — M2 Max 64GB 환경에서 Qwen3.6-35B-A3B 모델을 llama.cpp로 구동함.
- 에이전트 연동 — pi coding agent를 사용하여 로컬 모델과 OpenAI 호환 API로 통신함.
- 최적화 파라미터 — 128K 컨텍스트와 32K 출력 토큰을 설정하여 긴 코드 생성에 최적화함.
- 추론 성능 — unsloth의 권장 설정을 적용해 품질과 속도 사이의 균형을 맞춤.
하드웨어
| 구성 요소 | 세부 정보 |
|---|---|
| 머신 | MacBook Pro (Mac14,6) |
| 칩 | Apple M2 Max — 12-core CPU (8P + 4E) |
| 메모리 | 64 GB 통합 메모리 |
| 스토리지 | 512 GB SSD |
| OS | macOS 15.7 (Sequoia) |
AI 에이전트 설정
나는 pi coding agent를 주력 개발 보조 도구로 사용하고 있다. 이 도구는 llama.cpp를 통해 로컬 모델에 연결되는 로컬 우선 AI 코딩 에이전트다.
모델: Qwen3.6-35B-A3B (llama.cpp를 통해 구동)
pi가 llama-server에 연결되는 방식
pi 에이전트는 OpenAI 호환 API를 통해 llama-server와 통신한다. 설정은 ~/.pi/agent/models.json에 위치한다:
{
"providers": {
"llama-cpp": {
"baseUrl": "http://127.0.0.1:8080/v1",
"api": "openai-completions",
"apiKey": "ignored",
"models": [{ "id": "Qwen3.6-35B-A3B", "contextWindow": 131072, "maxTokens": 32768 }]
}
}
}
명령어
llama-server \
-hf unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q5_K_XL \
-c 131072 \
-n 32768 \
--no-context-shift \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--repeat-penalty 1.00 \
--presence-penalty 0.00 \
--chat-template-kwargs '{"preserve_thinking": true}' \
--batch-size 4096 \
--ubatch-size 4096
파라미터 분석
| 플래그 | 값 | 이유 |
|---|---|---|


