2년 전 1tk/s에서 이제는 20-100tk/s로, 거대 모델을 돌리기 정말 좋은 시대다
What a time to be alive from 1tk/sec to 20-100tk/sec for huge models
핵심 요약
과거 1.2tk/s로 겨우 돌리던 하드웨어로 이제는 최신 모델을 100tk/s로 돌리는 놀라운 기술 발전의 시대가 왔다.
- 기술 발전 — 2년 전과 비교해 로컬 모델 구동 속도가 비약적으로 향상됨.
- 모델 구조 — Dense 모델과 MoE 모델의 차이로 인해 속도 체감이 크게 달라짐.
- 실험 정신 — 비효율적이라 비판받던 시도들이 결국 로컬 LLM 생태계를 발전시킴.
- 하드웨어 성능 — 저렴한 비용으로도 최신 모델을 고속으로 구동할 수 있는 환경이 조성됨.
2년 전 Llama405b q4를 1.2tk/sec로 돌리는 것만으로도 흥분되던 시절이 있었지.
이제 같은 하드웨어로 최신 거대 모델들(kimik2.6, deepseekv4flash, minimax2.7, step3.5flash, qwen3.5-397b)을 30tk-100tk/sec로 돌리면서 llama405b를 압살할 수 있게 됐어. :-/
사람들이 왜 굳이 Llama405b를 1.2tk/sec로 돌리려 하냐고 묻던 게 기억나. 그때 내 대답은 AGI가 올 때를 대비하고 싶다는 거였어. 내 슈퍼 AI를 1tk/sec로라도 돌릴 수 있다면 그 선택지를 원했거든. 결과는 상상 이상이었어. 우린 진짜 슈퍼 AGI를 가졌고, 싸고 빠르게 돌릴 수 있게 됐으니까.
거대 모델은 차치하고서라도, 몇백 달러면 집에서 qwen3.6-36b를 50tk/sec로 돌릴 수 있어. 그러니 동료 로컬 llama 덕후들아, 계속 미쳐있고, 계속 실험해. 비관론자들은 무시해. 그 모든 '멍청하고', '시간 낭비' 같던 실험들이 결실을 맺고 있으니까.

