t/s가 충분히 낮으면 speculative decoding이 눈으로 보임
If your t/s is low enough, you can see speculative decoding with your own eyes
핵심 요약
저사양 환경에서 speculative decoding이 작동할 때 예측 가능한 문구가 즉각적으로 생성되는 현상에 대한 고찰.
- Speculative decoding — 저사양 환경에서 예측 가능한 문구가 즉각 생성되는 현상을 관찰함.
- MTP와 n-gram — 두 기술을 결합하여 추론 속도를 높이는 방식에 대한 논의가 이루어짐.
- TensorRT 구현 — NVIDIA의 TensorRT-LLM에서 이미 n-gram을 draft model로 활용 중임.
- 성능 체감 — 코딩 작업에서는 효과적이나 일반적인 에이전트 환경에서는 제한적일 수 있음.
며칠 전에 DS4 Pro 증류 모델을 좀 써봤는데, MTP가 포함되어 있더라고. 내 하드웨어에서는 속도가 진짜 개판이라 2~3 t/s 정도밖에 안 나왔음. 근데 가끔씩 속도가 확 튀는 구간이 있었는데, 보니까 이런 상황들이었음:
-
United States of America
-
First law of thermodynamics
-
The enshittification of the internet
결국 엄청나게 뻔한 문구가 나올 때마다 즉각적으로 팍팍 찍어내더라고. 보는 맛은 있더라.
근데 이걸 보니까 궁금해진 게 있음. MTP랑 n-gram을 같이 쓸 수 있을까? n-gram은 자동 완성 뒤에 있는 마르코프 체인이잖아. 이걸 추측 디코딩(speculative decoding)이랑 합치면 얼마나 효율이 나올지 궁금하네.


