jinfer: JVM용 오픈소스 AI 추론 엔진. 드디어, jar 파일로 즐기는 AI.
jinfer: An open-source AI inference engine for the JVM. Finally, AI in jar.
핵심 요약
JVM 환경에서 파이썬 의존성 없이 AI 추론을 실행할 수 있는 오픈소스 엔진 'jinfer'가 공개됨.
- JVM 네이티브 AI — 파이썬 런타임이나 ONNX 없이 JVM에서 직접 AI 추론 실행 가능
- 다양한 모델 지원 — GGUF 및 safetensors 형식을 지원하며 토크나이저와 행렬 연산 최적화 포함
- GraalVM 호환 — GraalVM Native Image를 통해 고성능 네이티브 실행 환경 제공
- 생태계 통합 — Spring AI 및 LangChain4j와 연동 가능하며 향후 GPU 지원 확장 예정
수년 동안 JVM은 AI 혁명을 그저 벤치에서 구경만 해왔지. 모든 모델, AI 프레임워크, 그리고 모든 혁신이 죄다 파이썬으로 만들어졌으니까.
jinfer는 JVM을 위해 처음부터 새로 설계한 추론 엔진이야. 채팅, 비전, 음성 인식, 임베딩, 리랭킹, TTS까지 다 지원해. 파이썬 런타임도, ONNX도, 사이드카 프로세스도, 래퍼도 필요 없어. 스택 전체가 JVM을 위해 만들어졌거든:
-
jinfer: JVM용 추론 엔진, 인기 있는 다양한 모델과 모달리티 지원.
-
Tok'n'Roll (toknroll): LLM을 위한 빠른 토크나이저, 순수 자바, 의존성 제로.
-
gguf / safetensors: 주요 모델 포맷에 대한 네이티브 읽기/쓰기 지원.
-
jam: 양자화된 행렬 곱셈 루틴 (Vector API + 선택적 네이티브 백엔드), CPU 환경에서 llama.cpp와 경쟁 가능한 수준.
-
jota: Java, C, CUDA, HIP, Metal, OpenCL, Mojo를 타겟으로 하는 텐서 API.
Spring AI 및 LangChain4j와 통합되고, GraalVM Native Image도 완벽하게 지원해.
현재 상황: 이제 막 나온 초기 버전이야. 지금은 CPU가 주력이고, 이미 llama.cpp랑 비벼볼 만한 수준이야. jota를 통한 GPU 지원은 작업 중이야.
실행 가능한 예제 + 벤치마크: https://qxotic.ai
Jinfer (Apache 2.0): https://github.com/qxoticai/qxotic/tree/main/jinfer
추신: 이 프로젝트는 내가 만들었고, llama3.java (2024)랑 gemma4.java도 내가 짠 거야.


