Ornith-1.5-35B-A3B-NInfer - 250 tok/s, 5-8k prefill, 5090
핵심 요약
Ornith-1.5-35B 모델의 빠른 속도와 에이전트 작업 성능에 대한 사용자 경험 공유 및 기술적 논의.
- 모델 성능 — 5090 GPU에서 250 tok/s의 빠른 속도와 에이전트 작업 수행 능력을 보여줌.
- MTP 이슈 — 모델의 MTP head 초기화 문제와 그로 인한 성능 저하 가능성이 논의됨.
- 벤치마크 신뢰도 — 랩 테스트 결과와 실제 사용 성능 간의 괴리에 대한 의문이 제기됨.
- NInfer 활용 — Windows 환경에서 NInfer를 사용한 로컬 모델 구동 사례를 공유함.
huggingface.co
원문 사이트로 이동
어제 이 모델 써봤는데, 로컬 모델 중에서 대화형으로 쓰기엔 이게 단연 최고인 듯. 응답 속도랑 추론 속도가 미쳤고, 에이전트 작업도 꽤 잘 수행함. 속도 하나는 진짜 끝내준다.
Ninfer for Windows에서 돌리는 중임 - https://github.com/natpate/ninfer-windows

