LLM 모델 전쟁은 끝났다 - 모델에 집착할 때가 아니다
The LLM Model War Is Over - Time to stop obsessing over models
핵심 요약
저렴하면서도 뛰어난 성능을 갖춘 최신 모델들이 등장하며, 비싼 모델에만 의존하던 시대가 저물고 있습니다.
- 저비용 고성능 모델 — 6개월 전 최상위 모델을 능가하는 가성비 모델들이 대거 등장함
- 비용 효율성 — 토큰당 비용이 획기적으로 낮아져 실제 업무 활용도가 크게 향상됨
- 실제 체감 성능 — 최신 저가형 모델들이 기존 최상위 모델들과 거의 차이 없는 성능을 보여줌
- 하드웨어 한계 — 모바일 기기에서의 로컬 구동은 여전히 전력 소모 문제로 어려움이 있음
Codex 비즈니스 좌석 2개랑 100달러짜리 Claude Max 구독 중인데, 둘 다 한계까지 굴리는 중임. 근데 진짜 지난 2주 사이에 판도가 완전히 뒤집혔다. 다들 실질적인 지능을 갖춘 초저가 모델들을 쏟아내고 있거든. 이 모델들 전부 Openrouter에서 볼 수 있음.
| Model Name | Pricing (Input / Output per M) | Latency (p50) | Throughput (p50) |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.03 / $0.10 | 2.17 s | 9.0 tok/s |
| GLM 5.3 Flash | $0.075 / $0.25 | 4.96 s | 35.0 tok/s |
| Qwen3.8 Flash | $0.15 / $0.47 | 3.78 s | 53.0 tok/s |
| Muse Spark 1.2 Contributor | $0.10 / $0.20 | 4.22 s | 65.0 tok/s |
| GPT-5.6 Luna Pro | $0.20 / $1.20 | 13.42 s | 107.0 tok/s |
저가형 모델이라고 무시하기 전에 알아둬야 할 게, 이것들 벤치마크 점수가 불과 6개월 전 최상위 모델들(Opus 4.6, Gemini 3.1-Pro)보다 더 높음.
이제 돈도 아끼고 내 방구석에서 코딩하는 시간도 더 늘릴 수 있게 돼서 와이프도 훨씬 좋아할 듯.

