IFM/K2-Horizon-7B-Uno · 허깅페이스 - 품질 저하 없는 5200tps
IFM/K2-Horizon-7B-Uno · Hugging Face - 5200tps with no quality loss
핵심 요약
IFM에서 품질 저하 없이 최대 5200tps를 구현한 확산 모델 기반 LLM인 K2-Horizon-7B를 공개함.
- 모델 성능 — 품질 저하 없이 5200tps라는 압도적인 속도 구현
- 기술적 특징 — 기존 LLM 구조에 확산 어댑터를 결합한 방식
- 실행 환경 — sglang 지원 및 llama.cpp 포크 버전 존재
- 벤치마크 의문 — 7B 모델치고 벤치마크 점수가 너무 높아 최적화 의혹 제기
huggingface.co
원문 사이트로 이동
IFM에서 K2-Horizon-7B를 출시했다. 무려 5200 tps까지 뽑아내는 diffusion augmented LLM인데, 성능 저하 없는 속도 향상을 보장한다고 주장하네.
causal LLM 아키텍처를 기반으로 autoregressive 가중치 옆에 플러그 앤 플레이 방식의 diffusion 어댑터를 추가한 구조야.


