Qwen-3.8-27B가 너무 좋아서 API 사용을 끊었다
Qwen-3.8-27B is good enough that I stopped using API
핵심 요약
Qwen-3.8-27B 모델의 뛰어난 코딩 성능 덕분에 유료 API 없이도 로컬 환경에서 복잡한 작업이 가능해졌다는 후기입니다.
- 로컬 모델 성능 — Qwen-3.8-27B가 복잡한 리팩토링을 스스로 수행함
- 추론 비용 절감 — API 대비 압도적으로 저렴한 운영 비용 달성
- 설정 최적화 — 추론 예산 및 온도 설정을 통해 과도한 생각 루프 방지
- 도구 활용 — Bash 및 파일 편집 도구를 조합해 로컬 에이전트 구축
Qwen-3.8에 대한 찬사가 자자한데, 나도 한마디 보태본다.
Qwen-3.8이랑은 시작부터 좀 삐걱거렸다. 생각이 너무 많거든. 일하는 꼴을 보고 있으면 속 터져서 그냥 안 보는 게 상책이다. 그냥 알아서 하게 내버려 둬야 함. 그래도 결과물은 확실하다. 복잡한 리팩토링도 혼자서 척척 해내고, 중간중간 판단도 꽤 괜찮게 내린다. 완벽하진 않지만, 뭐 API라고 완벽하겠냐.
모델 양자화는 Q4_K_S를 썼고, 컨텍스트는 Q8_0으로 양자화했는데 품질 면에서 딱히 문제없다. 난 공식 Qwen을 사용 중이다. Swift-Qwen도 잠깐 써봤는데 확실히 빠르긴 하더라. 근데 자꾸 루프에 빠지는 현상이 있어서 그냥 순정 Qwen을 쓴다. 순정은 그런 일이 거의 없거든.
난 Pi 에이전트에서 MCP 없이 최소한의 도구만 써서 Qwen-3.8을 돌린다. 사실 Bash 하나면 충분하긴 한데, 읽기(read), 쓰기(write), 편집(edit) 도구는 남겨뒀다. Pi의 편집 도구가 제일 문제인데, 모델이 들여쓰기를 자꾸 말아먹어서 수정을 여러 번 반복해야 할 때가 많다. 누가 좀 더 오류에 강한 편집 도구 안 만들어주나 싶다. 아마 언젠가 내가 직접 만들어야 할 듯.
샌드박스로는 docker를 쓴다. 내 Pi 에이전트는 Raspberry Pi 위에서 돌아가는데, 이름값 하는 것 같아서 마음에 든다.
내 하드웨어 환경이랑 거주 지역 기준으로 1M 토큰당 비용은 입력 2.4센트, 출력 70센트 정도 나온다. nano-gpt.com에서 제일 싼 업체들이랑 비슷한 수준이다.

