인텔, OpenVINO 2026.4 릴리스
Intel releases OpenVINO 2026.4
핵심 요약
인텔이 다양한 신규 모델 지원과 성능 최적화가 포함된 OpenVINO 2026.4 버전을 공개했습니다.
- 신규 모델 지원 — CPU, GPU, NPU 전반에 걸쳐 Gemma-3n, Kokoro-82M 등 다양한 최신 모델 지원 추가
- 성능 최적화 — Multi-Token Prediction 및 Tree Drafting 도입으로 추론 처리량 향상 및 지연 시간 감소
- NPU 기능 강화 — NPU 프로파일링 지원 및 비전 워크로드에 대한 동적 형상 지원 확대
- 개발자 편의성 — Node.js 환경의 ASRPipeline 지원 및 모델 서버의 유휴 모델 관리 기능 추가
UPDATE https://github.com/ggml-org/llama.cpp/pull/29009 MERGED
코드 수정 최소화하려고 Gen AI 커버리지랑 프레임워크 통합 더 늘렸다.
-
새로 지원하는 모델:
-
On CPU: Gemma-3n
-
On CPU, GPU: Kokoro-82M, Qwen3-VL-4B with eagle3, Qwen3-ASR, Muse Glimmer 30B, Qwen 3.8 27B, Gemma4 12B; Hy-MT2-1.8B, DeepSeek OCR-2, Granite 4.0 H Micro
-
On NPUs: FLUX.2-Klein 4B, Kokoro 82M
-
-
CPU랑 GPU에서 바로 써볼 수 있는 얼리 릴리스 모델 추가: Qwen-image, Z-Image-Turbo, Granite 4.0 H Tiny, Fun-ASR-Nano, LFM2.5-8B-A1B, MiniCPM5-2B, RF-DETR, BGE Reranker-V2-M3, BGE M3
LLM 모델 지원 범위 넓히고 모델 압축 기술도 더 챙겼음
-
OpenVINO™ GenAI에 Gemma 4, Qwen 3.5, Qwen 3.6용 Multi-Token Prediction (MTP) 추측 디코딩(speculative decoding) 추가함. CPU랑 GPU에서 정확도 안 깎아먹고 처리량은 높이고 지연 시간은 줄였다.
-
OpenVINO™ GenAI에서 이제 EAGLE3용 Tree Drafting (Top-K) 지원하니까, 개발자들은 Chain Drafting (Top-1) 쓸 때보다 VLM 파이프라인에서 처리량 더 뽑아낼 수 있음.
-
OpenVINO™ GenAI에 Xe3 내장 그래픽 최적화 들어가서, Intel® Core™ Ultra Series 3 프로세서에서 Gemma 4 모델로 긴 문맥 입력 처리할 때 AI 추론 성능 좋아짐.
-
OpenVINO™가 NPU까지 Instrumentation and Tracing Technology (ITT) 프로파일링 지원 범위를 넓혔음. 이제 개발자들은 Intel® VTune™ Profiler 하나로 CPU, GPU, NPU 실행 과정을 다 분석할 수 있다.
-
프리뷰: OpenVINO™ GenAI에 GPU용 Qwen 모델 DFlash 가속이랑, Intel® Core™ Ultra Series 3 프로세서에서 지연 시간 줄이고 GenAI 파이프라인 속도 올리는 비주얼 토큰 지원 추가됨.
엣지, 클라우드, 로컬 어디서든 AI 돌리기 좋게 이식성이랑 성능 강화
-
OpenVINO™ GenAI에 Node.js용 ASRPipeline 지원 추가됨. 이제 자바스크립트 개발자들도 C++나 Python이랑 비슷한 파이프라인 API 써서 스트리밍이랑 성능 지표 포함된 자동 음성 인식(Whisper나 Qwen3‑ASR 같은 거) 돌릴 수 있음.
-
프리뷰: NPU에서 동적 모양(dynamic-shape) 제한 지원이 이미지 초해상도 같은 비전 워크로드까지 확대됨. ESPCN 모델로 검증 끝났다.
-
프리뷰: OpenVINO™ Model Server에 유휴 모델 관리 기능 프리뷰로 들어감. 안 쓰는 모델은 메모리에서 내려서 메모리 사용량 줄여줌.
-
OpenVINO™ Model Server에 Muse Glimmer 30B나 Qwen3.8 27B 같은 새로운 에이전트 모델 지원 추가됨.

