RTX 4090에서 로컬 의사결정 모델 실행 및 속도 비교
Running decision model locally on an RTX 4090 to find out which one is the fastest
핵심 요약
최근 등장한 오픈소스 의사결정 모델 4종의 성능과 속도를 RTX 4090 환경에서 비교 분석했습니다.
- 모델 성능 비교 — Laya, d1, Clef-Flash, Lev 모델의 속도와 정확도를 측정함
- 테스트 방식 — 위키피디아 지네 관련 단어 추출 작업을 통한 벤치마크 수행
- 결과 분석 — Laya가 가장 빠른 속도를 보였고, Lev는 속도는 느리지만 정확도가 가장 높음
- 실제 활용도 — 모델별 특성에 따른 fine-tuning 및 의사결정 도구로서의 가능성 탐색

최근 2주 사이에 오픈 디시전 모델들이 갑자기 쏟아져 나오길래(laya, liquid의 d1, cloudflare의 clef-flash, interfaze의 lev), 같은 GPU에서 얘네 성능 차이가 얼마나 나는지 직접 확인해봤음(물론 모델 크기가 깡패긴 한데, 그게 전부는 아니니까). 네 모델 전부 지네에 관한 위키피디아 문서 9개(9,534단어)를 단어 단위로 읽으면서 지네 이름이 나올 때마다 체크하는 똑같은 작업을 시켰음. 단어 하나당 /v1/systemone 호출 한 번씩, 답변 오자마자 바로 다음 단어 쏘는 방식으로 테스트함.
단어마다 보내는 요청:
{"state": "Word: \"Scolopendra\".", "questions": {"centipede": {"type": "noul", "instructions": "Does this word name a kind of centipede?"}}}
| model | weights | engine | per word (p50) | words in 32s | accuracy | centipede names caught | wrong picks |
|---|---|---|---|---|---|---|---|
| Laya | Laya-BF16.gguf | llama.cpp b11495 | 3.9 ms | 7,980 | 97.4% | 70% | 98 |
| d1 3B | d1-3B-AD-Q4_K_M.gguf | llama.cpp b11495 | 6.0 ms | 5,306 | 96.5% | 51% | 51 |
| Clef-Flash 9B | Clef-Flash-Q8_0.gguf | llama.cpp b11495 | 24.4 ms | 1,292 | 97.2% | 36% | 2 |
| Lev 4B | interfaze-ai/lev, bf16 | lev serve (PyTorch) | 51.0 ms | 626 | 98.9% | 83% | 4 |
laya랑 d1이 속도 면에서 다른 모델들 압살함. 정확도는 뭐 95%라고 찍히긴 하는데, 사실 "아니오"라고만 대답해도 정답 처리되는 구조라 정확도가 높게 나온 감이 있음. 다들 진짜 궁금한 건 각 모델이 자기 할 일을 얼마나 잘했냐는 건데, lev가 laya보다 13배나 느리긴 해도 지네는 제일 잘 잡아냄. lev가 llama.cpp가 아니라 자체 pytorch 서버에서 돌아가서 그런 것도 있음(다른 4090에서 쟀을 땐 68ms 나왔으니 CPU 영향도 좀 받는 듯). 결론적으로 Laya가 전체적으로 제일 빠르고, 어떤 용도로든 파인튜닝하기 개꿀이라 난 앞으로 이거 쓸 듯.


