드디어 내 하드웨어로 풀 정밀도 구동이 가능한 모델을 찾았다: 바로 나
Finally found a model my hardware can run at full precision: me
핵심 요약
사용자가 자신의 타이핑 속도를 측정해 LLM의 토큰 생성 속도(t/s)와 비교하는 웹 도구를 만들어 공유했습니다.
- 인간 TPS 측정기 — 사용자의 타이핑 속도를 토큰 단위로 변환해 LLM 성능과 비교함
- 성능 비교 놀이 — 2 t/s의 속도로 70B 모델을 능가하는 인간의 성능을 재치 있게 표현함
- 기능 확장 제안 — 읽기 속도를 prefill 시간으로 측정하는 모드 추가 아이디어가 호평받음
- 커뮤니티 반응 — 인간 모델의 할루시네이션과 낮은 정밀도를 농담하며 즐겁게 참여함
내 하드웨어에서 로컬 모델 돌리면서 마지막 t/s까지 쥐어짜느라 슬슬 지루해지길래, 그냥 내 손가락용 tps 카운터나 하나 만들었음 (물론 실제 토크나이저 썼지).
내 최고 기록은 2 t/s 정도임. 페이지 보니까 노트북 CPU로 70B 돌리는 것보단 빠르고, 4090으로 8B 돌리는 것보단 대충 76배 느리네. 뭐, 그렇다고.
LLM 답변 기다리면서 할 거 없는 놈들은 한번 해봐라!
https://homoagens.github.io/human-tps/
추신: 결과 공유도 가능함.. 누가 아냐, 내가 유명해질지 :)


