의견: 로컬 LLM이 Opus를 대체하기까지 12~24개월 남았다
Opinion: Local LLMs are 12-24 months from replacing Opus
핵심 요약
로컬 LLM이 고성능 하드웨어와 결합해 코딩 업무를 대체할 날이 머지않았다는 분석.
- 로컬 LLM 성능 — Qwen3.6-35B 같은 모델이 복잡한 코딩 작업을 수행할 만큼 충분히 성장함.
- 하드웨어 접근성 — 고가의 서버 없이도 맥북 같은 고성능 노트북에서 로컬 추론이 가능해짐.
- 비용 및 프라이버시 — 토큰 제한이나 비용 걱정 없이 민감한 코드를 로컬에서 안전하게 처리 가능함.
- 기술적 한계 — Opus 대비 느린 속도와 컨텍스트 제한 등은 여전히 해결해야 할 과제로 남아 있음.
AI 구독료는 계속 비싸지고 있다. GitHub은 최근 Copilot을 요청 기반에서 소비 기반 요금제로 전환했고, 다른 서비스들도 대부분 같은 길을 걷고 있다. 한편, 로컬 모델이 노트북에서 돌릴 만큼 충분히 좋아졌다는 이야기를 계속 들었다. 그래서 직접 시도해보고 상황이 어떤지 확인해보기로 했다.
나는 64GB 통합 RAM을 탑재한 MacBook Pro M2 Max에서 Qwen3.6-35B를 돌리고 있다. 별다른 건 없다. 랙도 없고, 비싼 GPU를 얻으려고 NVIDIA에 매달릴 필요도 없다. 그냥 Aiven에서 업무용으로 이미 가지고 있던 (물론 좀 비싼) MacBook Pro일 뿐이다. 지난 한 달 동안 나는:
- 짧은 브리핑만으로 랜딩 페이지 전체를 한 번에 생성
- 여러 프론트엔드 + 백엔드 기능 구축
- 까다로운 백엔드 레이스 컨디션 버그 수정
1년 전만 해도 이런 하드웨어로는 꿈도 못 꿀 일이었다. 지금은 일요일 아침에 하는 일상이다.
솔직히 말해서, 전부 다 프로덕션에 적용된 건 아니다. 상당수는 평가 작업이었고, Qwen은 아직 내 일상적인 스택의 일부는 아니기 때문이다. 하지만 나에게는 이것이 고려해볼 만한 첫 번째 실질적인 단계였고, 동료들과 커뮤니티에 결과를 공유하고 싶었다.
솔직한 단점, 장밋빛만은 아니니까
Opus보다 느리다. Opus가 3~4분 만에 생성하는 랜딩 페이지를 내 M2 Max에서 Qwen은 8~9분 걸린다. 납득 못 할 수준은 아니지만, 경쟁 모델보다는 확실히 느리다. Sonnet/Opus의 지연 시간을 기준으로 벤치마킹한다면 (당분간은) 조금 실망할 것이다.
에이전트 루프에서 컨텍스트가 금방 터진다. 256K를 쓰더라도 최신 모델치고는 예상보다 훨씬 빨리 소모된다. 이 부분은 개선의 여지가 많다. 그리고 Claude Code 같은 에이전트로 Qwen3.6을 구동하면, 이 서브레딧의 다른 사용자들이 보고한 것처럼 (예시 스레드) 훨씬 더 빨리 채워진다.
작업별 품질 편차. Opus 같은 모델은 요즘 대부분의 작업을 한 번에 처리한다. Qwen3.6은 내 경우 75% 정도 성공한다. 나머지 25%는 근접하지만, 제대로 마무리하려면 몇 번의 반복이 필요하다.
장점, 분명히 존재한다
속도 제한 없음, 사용량 불안 없음. 토큰을 셀 필요가 없다. 토큰을 아끼거나 비용을 걱정하는 대신 구축에만 완전히 집중할 수 있다.
하드웨어 기준이 계속 낮아지고 있다. 1년 전에는 A100이 필요했다. 오늘날에는 64GB RAM을 탑재한 MacBook M2 Max 노트북에서 초당 약 27토큰으로 돌아간다.
도구 호출(Tool calling)이 실제로 작동한다. 이건 예전에 빠져 있던 중요한 조각이었다. 1년 전만 해도 로컬 모델은 도구 이름을 환각하거나 루프에 빠지곤 했다. Qwen3.6에서는 도구 호출이 그냥 잘 된다. 이게 에이전트 작업의 진짜 핵심이다.
프라이버시가 내장되어 있다. 민감한 코드, 내부 저장소, 다음 프론티어 모델을 학습시키고 싶지 않은 아이디어들. 그 무엇도 노트북을 떠나지 않는다. 개인 또는 비즈니스 코드가 해킹당할 수 있는 제3자 서버에 있지 않고 내 노트북에 안전하게 머물러 있다는 확신을 가질 수 있다.

