Qwen 3.6은 바이브 코딩에 진짜 쓸만하고, Claude보다 훨씬 저렴함
Qwen 3.6 is actually useful for vibe-coding, and way cheaper than Claude
핵심 요약
Qwen 3.6 모델을 로컬에서 구동해 Claude Code와 연동하여 비용 효율적으로 코딩하는 방법을 공유함.
- 로컬 모델 활용 — Qwen 3.6을 Claude Code와 연동해 API 비용을 획기적으로 절감함.
- 비용 효율성 — 3090 듀얼 구성으로 수개월 내에 하드웨어 투자 비용 회수가 가능함.
- 성능 검증 — Rust 기반 서버 개발 등 실무적인 풀스택 코딩 작업에서 충분한 성능을 보여줌.
- 모델 비교 — Qwen 3.5 대비 3.6 버전이 에이전트 작업에서 체감 성능이 훨씬 뛰어남.
Claude Code를 실행해서 내 로컬 Qwen에 연결해 봤는데, 음, 바이브 코딩이 아주 잘 돌아가네. 어제 Qwen3.6-35B-A3B (Q4)로 프로젝트를 시작했고, 오늘 아침에는 27B (Q8)로 바꿨는데 둘 다 잘 작동함!
200k 컨텍스트를 설정한 듀얼 3090 환경에서 구동 중. Unsloth Q_8 사용. 별다른 복잡한 설정 없이 Unsloth 퀵스타트 가이드를 따라 하고 컨텍스트만 높게 설정했음.
#!/bin/bash
llama-server \
-hf unsloth/Qwen3.6-27B-GGUF:Q8_0 \
--alias "unsloth/Qwen3.6-27B" \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
--ctx-size 200000 \
--port 8001 \
--host 0.0.0.0
#!/bin/bash
export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL="http://192.168.18.4:8001"
claude $@
가장 좋은 건 Claude Code의 비용 추정치를 보는 거임. 8시간 동안 API 호출했으면 142달러가 나왔을 텐데, 대신 전기료는 4달러도 안 나옴(내 장비가 1kW를 계속 썼다고 가정했을 때고, 실제로는 더 적게 나오겠지만 지금 전력 측정기가 없어서). 그러니까 "로컬은 가치가 없다"고 말하는 사람들에게 말하는데, 이 장비는 4500 뉴질랜드 달러(NZD) 들여서 맞췄고, Anthropic API 대신 이걸 쓰면 약 260시간 만에 본전을 뽑음.
본업으로 풀타임 돌리면 약 30일, 24시간 내내 다크 소프트웨어 팩토리 돌리면 10일이면 됨. 가끔 저녁에 프로젝트 시작하는 정도면, 뭐, 한두 달이면 본전 뽑지 않을까?
뭘 바이브 코딩했냐고? 별거 아님. 서버 리소스를 모니터링하고 SSE로 웹 대시보드에 노출하는 Rust 서버를 만들었음. 풀스택 개발을 로컬 모델로 끝까지 다 했음. 모델이랑은 한 5번 정도 상호작용했나. 처음에 프롬프트 넣을 때 한 번, 나머지는 UI/UX 변경이나 버그 리포트 때문에 4번 정도.
Codex 구독을 당장 취소할 것 같진 않지만(llama-server랑 Codex를 연동하는 법을 못 찾았음), 아마 오래 걸리진 않을 듯.

