IFM/K2-Horizon-MoVA-36B-A4B-GGUF · 허깅페이스
IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face
핵심 요약
IFM에서 공개한 36B MoE 모델 K2-Horizon-MoVA에 대한 커뮤니티의 관심과 성능 검증 논의.
- 모델 특징 — 36B 파라미터 MoE 구조에 4B 활성 파라미터와 512K 컨텍스트 지원함
- 오픈 소스 — 학습 데이터와 레시피, 코드까지 모두 공개하는 완전 오픈 모델임
- 성능 의구심 — 벤치마크 결과에 대한 신뢰성과 기존 모델 대비 성능 비교가 활발히 논의됨
- 다양한 라인업 — 0.9B부터 32B까지 다양한 크기의 모델이 함께 출시됨
huggingface.co
원문 사이트로 이동
더 많은 사이즈 (아직 업로드 중일 수도 있음):
https://huggingface.co/IFM/K2-Horizon-32B-GGUF
https://huggingface.co/IFM/K2-Horizon-7B-GGUF
https://huggingface.co/IFM/K2-Horizon-3.7B-GGUF
https://huggingface.co/IFM/K2-Horizon-0.9B-GGUF
IFM 제공:
K2-Horizon-MoVA-36B-A4B는 K2-Horizon 제품군의 스파스 모델이야. Mixture-of-Values attention(MoVA)을 적용한 Mixture-of-Experts 모델로, 파라미터는 36B인데 토큰당 4B만 써서 돌아감. 최종 체크포인트는 이미 풀었고, 중간 체크포인트랑 데이터, 학습 코드도 다 공개할 예정임.
K2-Horizon-MoVA-36B-A4B 주요 특징
-
4B 활성 파라미터로 보여주는 최상급 성능. 에이전트 및 추론 벤치마크에서 기존 오픈 웨이트 덴스 모델(대략 30B급)이나 자기보다 15배나 큰 MoE 모델들을 다 씹어먹음. 폐쇄형 최상급 모델들과 비교해도 꿀리지 않는 수준임 (벤치마크 결과 참고).
-
512K 컨텍스트. 학습 중간 단계부터 524,288 토큰 컨텍스트를 네이티브로 지원함.
-
중간 체크포인트 제공. 단순히 최종 결과물만 던져주는 게 아니라, 학습 과정에서 능력이 어떻게 변하는지 연구할 수 있게 중간 체크포인트도 다 풀 예정임.
-
완전 공개. 학습 데이터/레시피랑 학습 코드 전부 다 공개함.


