Qwen3.6은 OpenCode와 함께라면 정말 놀랍다!
Qwen3.6 is incredible with OpenCode!
핵심 요약
Qwen3.6-35B 모델이 복잡한 코딩 작업에서 Claude Code를 대체할 만큼 뛰어난 성능을 보여줌.
- 모델 성능 — 복잡한 RLS 구현 및 다중 언어 코드베이스 작업에서 뛰어난 결과 도출함.
- 로컬 환경 — RTX 4090 환경에서 llama.cpp를 통해 100tps 이상의 속도로 구동됨.
- 비교 평가 — Claude Code와 비교해도 손색없을 만큼 로컬 코딩 모델로서의 가능성을 보여줌.
- 최적화 설정 — OOM 방지를 위해 parallel 및 cache-ram 설정이 필수적임.
과거에 여러 로컬 모델(최근에는 gemma 4)을 시도해봤지만, 이번만큼 좋다고 느낀 적은 없었어. (아니면 내가 제대로 기회를 안 줬던 걸지도 모르니 여러분이 알려줘). 하지만 이건 Claude Code를 찾기보다 특정 작업에서 매일 사용할 수 있겠다는 생각이 드는 모델이야.
Rust, TypeScript, Python으로 작성된 여러 서비스가 포함된 꽤 큰 코드베이스에서 Postgres에 RLS를 구현하는 복잡한 작업을 맡겨봤어. 시작할 때는 기대치가 전혀 없었는데, 정말 놀라운 작업을 해냈어. PR: https://github.com/getomnico/omni/pull/165/changes/dd04685b6cf47e7c3791f9cdbd807595ef4c686e
물론 완벽과는 거리가 멀고, 큰 공백과 몇 가지 주요 버그가 있지만, 세상에, 이 모델 정말 좋아. Opus처럼 Rust를 한 번에 완벽하게 짜지는 못하지만, 컴파일러 에러를 보고 길을 잃지 않고 반복 수정할 수 있어.
계획 -> 빌드 -> 계획으로 이어지는 여러 라운드의 꽤 긴 코딩 세션을 가졌어. 한 시점에서는 모든 DB 쿼리에 RLS를 사용하도록 29개의 파일을 수정하는 방향으로 갔는데, 괜찮긴 했지만 내가 개입해서 변경 사항을 최소화할 다른 옵션을 찾아보라고 요청했어. 모델은 올바른 해결책을 찾아냈고, DB 연결을 획득하여 들어오는 요청의 시작 부분에서 사용자로 범위를 지정하도록 했어.
처음으로 진정으로 유능한 로컬 코딩 모델과 대화하는 기분이 들었어.
내 설정:
- Qwen3.6-35B-A3B, IQ4_NL unsloth quant
- llama.cpp를 통해 로컬 배포
- RTX 4090, 24 GB
- KV cache quant: q8_0
- Context size: 262k. 이 컨텍스트 크기에서 VRAM 사용량은 약 21GB
- Thinking 활성화, temp, min_p 등 권장 설정 사용
llama server:
docker run -d --name llama-server --gpus all -v <path_to_models>:/models -p 8080:8080 local/llama.cpp:server-cuda -m /models/qwen3.6-35b-a3b/Qwen3.6-35B-A3B-UD-IQ4_NL.gguf --port 8080 --host 0.0.0.0 --ctx-size 262144 -n 8192 --n-gpu-layers 40 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0 --cache-ram 4096
--parallel과 --cache-ram을 설정해야 했어. 그렇지 않으면 OpenCode가 프롬프트 캐시를 날려버리는 병렬 도구 호출을 많이 하기 때문에 llama.cpp가 OOM으로 충돌했거든. 이 설정으로 초당 100개 이상의 출력 토큰을 얻고 있어.
하지만 여러분, 이게 진짜일지도 몰라... 로컬 코딩의 성배! 아니면 적어도 아주 가까워지고 있는 것 같아.


