어느 정도 수준이 되면, 속도가 지능보다 중요하다
At a certain point, speed >> smartness
핵심 요약
에이전트 작업 시 모델의 지능보다 빠른 응답 속도가 생산성에 더 중요하다는 의견에 대한 논의입니다.
- 속도와 지능의 균형 — 에이전트 작업 시 너무 느린 모델은 반복 작업의 효율을 떨어뜨림
- 생산성 저하 방지 — 느린 모델을 기다리는 동안 발생하는 컨텍스트 스위칭이 작업 흐름을 방해함
- 하드웨어 제약 — 로컬 환경에서 고성능 모델의 느린 속도는 배터리 소모와 작업 지연을 유발함
- 오케스트레이션 전략 — 스마트한 모델과 빠른 모델을 조합하여 전체적인 작업 속도를 최적화함
이거 완전 지그재그 같은 느낌임. 에이전트 작업도 못 할 정도로 멍청한 모델은 쓰기 싫은데, 그렇다고 에이전트 돌릴 만큼 똑똑해지면 속도가 너무 느려서 뭐 하나 수정하는 데 몇 시간씩 걸리는 건 또 못 참겠거든.
내 기준에서 딱 적당한 스윗 스팟은 prefill ~500 tps, decode ~25tps 정도임. 내가 가진 하드웨어에서 이 정도 속도 안 나오면, 차라리 좀 멍청해도 빠른 모델 돌리는 게 훨씬 낫더라.
다들 어떻게 생각함?


