내 기준, Qwen3.5-27B가 Gemini 3.1 Pro나 GPT-5.3 Codex보다 낫다
FOR ME, Qwen3.5-27B is better than Gemini 3.1 Pro and GPT-5.3 Codex
핵심 요약
거대 모델의 과도한 자율성보다 Qwen3.5-27B의 정직한 실패가 코딩 작업에 훨씬 효율적이라는 평가.
- 모델 자율성 — 거대 모델이 문제를 스스로 해결하려다 엉뚱한 스크립트를 짜는 현상에 대한 불만.
- Qwen3.5-27B 장점 — 해결 불가능한 상황에서 무리하지 않고 즉시 포기하는 정직한 태도가 오히려 작업에 유리함.
- 학계 AI 교육 — 대학 내 AI 활용 교육이 실제 현장과 동떨어져 있고 벤더 계약에 휘둘리는 현실.
- 로컬 모델 활용 — 27B 모델의 계획 능력과 로컬 환경에서의 데이터 프라이버시 및 속도에 대한 긍정적 평가.
나는 거대 SOTA 독점 모델들에 대해 정말 싫어하는 점이 하나 있다. 프로그래밍을 모르는 사람들을 위해 더 좋게 만들려고, 모델들이 문제를 완전히 자율적으로 해결하도록 최적화되어 있다는 것이다. 그래, /r/ChatGPT 사람들은 파이썬 바이너리가 없다고 7z 파서를 짜주면 환장하겠지만, 나한테는 이게 오히려 모델을 쓰레기로 만든다. 뭔가 딱 들어맞지 않으면, Qwen3.5-27B는 그냥 포기해버린다. 만약 네가 대충 코딩하면서 시간을 때우려는 거라면 이게 짜증 나겠지만, 나한테는 이게 훨씬, 훨씬 낫다. 나는 대학에서 GitHub Copilot을 강제로 써야 하는데, 문제가 생길 때마다 완전히 궤도를 벗어나서 말도 안 되는 짓을 한다. 예를 들어, 권한이 깨진 파일(내 잘못이지만)에 쓰려고 할 때 계속 실패했다. 나는 Claude가 문제를 강제로 해결하려고 위험한 Perl 스크립트를 짜기 시작하는 걸 지켜봤다. 세션을 새로 파서 GPT-5.3 Codex로 시도해봤는데, 똑같이 Perl 스크립트를 짜더라. Perl 스크립트 짜지 말라고 해도, 이번엔 NodeJS 스크립트를 짜기 시작했다. 문제는 에이전트가 언제 궤도를 벗어나서 헛짓거리에만 몰두하는지 항상 알 수 없다는 거다. 그래서 아주 자세히 지켜보고 있더라도, 시간을 엄청나게 낭비할 수 있다. 반면에, 무슨 개판이 일어나면 Qwen3.5는 시도조차 안 하고, 그냥 왜 파일을 쓸 수 없는지 말해주고 포기한다.
제발, 연구소들아, 내가 원하는 건 이런 거다. 이런 걸 더 많이 만들어줘.

