게임 끝. Pi에서 돌아가는 22GB 로컬 모델이 이제 학습 데이터 컷오프 이후의 실무 코딩 작업에서 Claude Code Opus 5 High를 능가함
Game over. 22GB local models run in Pi now outperform Claude Code Opus 5 High on real-world coding tasks published after training cutoffs
핵심 요약
로컬 LLM이 실무 코딩에서 Claude Opus 5의 성능을 앞질렀다는 주장에 대해 사용자들 간의 논쟁이 벌어짐.
- 로컬 모델 성능 — 22GB 모델이 실무 코딩에서 Claude Opus 5를 능가함.
- Claude 품질 저하 — 사용자들이 Opus 5의 성능이 예전만 못하다고 지적함.
- Pi 코딩 에이전트 — Claude Code와 유사한 오픈 소스 로컬 코딩 도구임.
- 구독 가성비 논란 — 로컬 AI와 클라우드 구독 서비스의 효용성을 두고 의견이 갈림.
최근에 나온 실제 코드 베이스 벤치마크로 Sharp 채팅 템플릿 테스트 좀 돌려봤음. 이거 쓰면 토큰 사용량 줄고 로컬에서 돌리는 Qwen3.x 모델 버그도 고쳐지거든. 재미 삼아 Opus 5 high랑 Sonnet 5 medium도 같이 벤치 돌려봤는데, 이제 진짜 실무 작업에서 로컬 모델 성능이 클로드 품질 하락세를 완전히 추월해버린 듯함. 참고로 나 클로드 Max 20배 구독 중인데, 이제 이것도 곧 해지할 거임 ㅋㅋㅋ.
Artificial Analysis 지수나 공개된 벤치마크 점수 같은 건 알 바 아님. 실제 코드 베이스에서 리그레션 없이 버그 고치는 실력으로 따졌을 때, 내 컴퓨터에서 돌리는 모델들이 Opus를 이겨버리면 그만임. 앤스로픽이 Fable 토큰 더 팔아먹으려고 Opus 품질을 몰래 낮추는 건지, 아니면 무슨 짓을 하는 건지 알 게 뭐야.

