32GB Mac에서 Qwen3.6-35B-A3B-UD-Q4_K_M으로 실질적인 코딩 작업이 가능한가요?
Is anyone getting real coding work done with Qwen3.6-35B-A3B-UD-Q4_K_M on a 32GB Mac in opencode, claude code or similar?
핵심 요약
32GB RAM 환경에서 Qwen3.6-35B 모델을 구동 중이나, 컨텍스트 제한으로 인해 모델이 작업을 제대로 수행하지 못하는 문제에 대한 고민.
- 하드웨어 제약 — 32GB RAM 환경에서 Qwen3.6-35B 모델 구동 시 컨텍스트 윈도우 부족 문제 발생.
- 모델 성능 저하 — 컨텍스트 압축 과정에서 모델이 경로를 잊거나 환각 현상을 보임.
- 설정 최적화 — k:v 캐시 양자화나 모델 설정 변경을 시도했으나 근본적인 해결책은 찾지 못함.
- 커뮤니티 조언 — 더 작은 모델 사용, 하드웨어 풀링, 혹은 최신 설정값 적용 등을 제안받음.
저는 M2 Macbook Pro 32GB RAM에서 Qwen3.6-35B-A3B-UD-Q4_K_M을 실행하고 있습니다. llama.cpp와 opencode의 최신 빌드를 사용 중입니다.
llama-server가 메모리 부족으로 완전히 중단되는 것을 막기 위해 컨텍스트 윈도우를 32768 토큰으로 설정해야 합니다. 이것이 중요하다는 것을 알게 되었습니다.
합리적인 테스트를 위해, 이전에 Claude Code가 Opus 4.7로 완료할 수 있었던 작업을 opencode에 주었습니다. 프로젝트가 거대하지는 않지만, 작업에는 애플리케이션의 프론트엔드와 백엔드를 뒤져서 AI 이전의 개발자였던 저조차도 바로 알아차리지 못한 문제를 찾아내는 과정이 포함되어 있습니다.
결과는 정말 감질납니다. 모델이 버그의 핵심을 파악했다는 것을 알 수 있습니다. 하지만 구현 단계로 넘어가기 전에, 압축 과정에서 항상 너무 많은 정보를 버리는 것 같습니다.
서브 에이전트 사용을 비활성화하면, 두 개가 아닌 하나의 컨텍스트에 비용을 지불하기 때문에 작업이 어느 정도 온전하게 유지된 채로 첫 번째 압축 단계를 통과하곤 합니다.
하지만 두 번째 압축 단계에 도달하면, 거의 항상 정신을 놓아버립니다. 요약은 원래 프롬프트로 돌아가 버리고, 심지어 현재 작업 디렉토리 이름조차 기억하지 못합니다(!). 당연히 존재하지 않는 디렉토리 이름의 변형을 만들어내죠. 그 이후로는 사실상 게임 오버입니다.
Qwen이 RAM 요구 사항 면에서 대부분의 모델보다 실제로 더 낫다는 글을 많이 읽었고, 대부분의 작은 모델들은 제대로 코딩을 할 수 없다는 점을 고려할 때, 저는 (1) 32768이 적절하게 똑똑한 모델에서 제가 얻을 수 있는 최대 컨텍스트이며, (2) 그것만으로는 충분하지 않다는 결론에 도달했습니다. 이 게임을 하려면 더 강력한 장비가 필요합니다.
이러한 제약 조건이나 매우 유사한 조건에서 더 나은 결과를 얻은 분이 계신가요?
(면책 조항: 저는 Qwen이나 Mac, OpenCode를 비난하는 것이 아닙니다. 이 모든 것이 제 Mac에서 돌아간다는 것 자체가 놀랍습니다. 하지만 실제로 조금 더 유용하게 쓰였으면 좋겠습니다.)
감사합니다!
수정:
제 설정은 다음과 같습니다.
제 qwen-server 별칭:
alias qwen-server='llama-server -m ~/models/unsloth/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --host 0.0.0.0 --port 8080'
제 opencode 설정:
{
"$schema": "https://opencode.ai/config.json",
"tools": {
"task": false
},
"provider": {
"llama.cpp": {
"npm": "@ai-sdk/openai-compatible",
"name": "llama-server (local)",
"options": {
"baseURL": "http://127.0.0.1:8080/v1"
},
"models": {
"Qwen3.6-35B-A3B-UD-Q4_K_M": {
"name": "Qwen3.6-35B-A3B-UD-Q4_K_M"
}
}
}
}
}
M2 Macbook Pro, 32GB RAM.
수정: Claude가 지적하길, 이 모델의 공식 모델 카드에는 "기본 컨텍스트 길이는 262,144 토큰입니다. OOM 오류가 발생하면 컨텍스트 윈도우를 줄이세요. 하지만 Qwen3.6은 복잡한 작업을 위해 확장된 컨텍스트를 활용하므로, 사고 능력을 유지하려면 최소 128K 토큰의 컨텍스트 길이를 유지하는 것이 좋습니다."라고 적혀 있습니다.
그러니 '이 정도는 되어야 탈 수 있다'는 말이 딱 맞는 것 같네요. 어쩌면 그게 제 질문에 대한 답일지도 모르겠습니다.


