ImaJev-4b: 텍스트와 사진으로 비즈니스 의사결정을 내리는 4B 모델을 15일간 파인튜닝했고, JevBench에서 91개 모델 중 1위, DecisionBench에서 GPT-5.6 Luna를 앞섰습니다
ImaJev-4b: I spent 15 days fine-tuning a 4B model to make business decisions from text and photos, and it just ranked #1 of 91 on JevBench & ahead of GPT-5.6 Luna on DecisionBench
핵심 요약
비즈니스 의사결정에 특화된 4B 모델 'ImaJev'가 JevBench와 DecisionBench에서 뛰어난 성능을 입증하며 오픈소스로 공개되었습니다.
- 모델 성능 — JevBench 91개 모델 중 1위 달성 및 DecisionBench에서 상위권 기록함
- 기술적 구조 — Qwen3.5-4B 기반에 LoRA와 의사결정 헤드를 결합하여 구현됨
- 실제 활용성 — 텍스트와 사진을 입력받아 확률 기반의 의사결정 결과를 제공함
- 오픈소스 공개 — 데이터셋과 코드를 포함한 모든 프로젝트 결과물이 공개됨
일단 배경부터 좀 깔고 갈게.
난 프로세스 개선 및 비즈니스 컨설턴트로 일하면서 포춘 500대 기업들의 환불, 반품, 고객 지원 같은 프로세스 개선 작업을 해왔어.
이런 일들은 의사결정 과정이 존나 복잡해서, 프로세스 맵에 있는 거의 모든 결정/조건 노드를 사람이 직접 처리해야 했거든. 코드로 모호함을 다 처리하는 게 진짜 개빡세거든.
ImaJev의 아이디어
그래서 Jev가 나왔을 때 엄청 흥미로웠고, 복잡한 의사결정 워크플로우를 개선하는 데 딱이라는 게 바로 보이더라고.
근데 Jev는 이미지 지원이 안 되길래, 텍스트랑 이미지를 모델 하나로 다 처리하면 좋겠다 싶어서 시작한 게 바로 ImaJev야.
학습 과정
처음엔 진짜 개판이었어. 50만 개의 짧은 의사결정 데이터로 9B 모델을 처음 파인튜닝했을 땐 추론 능력이 오히려 떡락했거든. JevBench hard 기준 64.9에서 42.3까지 떨어짐. 그냥 패턴 매칭만 배운 꼴이 된 거지. 그래서 그다음 몇 주 동안은 오픈 웨이트 모델들로 어려운 질문들을 잔뜩 만들고, AI 모델 두 개가 답을 똑같이 맞춘 것만 골라내는 식으로 갈아 넣었어. 그러니까 다시 복구되더라.
결과
그렇게 해서 JevBench 결과는 91개 모델 중 1위를 찍었어 (v1.4.2.2, 9월 27일 기준, 67.37점 vs Jev 1.13.0은 63.29점).
같은 주에 DecisionBench에서는 GPT-5.6 Luna랑 DeepSeek V4.1을 제치고 56개 모델 중 3위를 먹었어.
솔직히 둘 다 이렇게까지 잘 나올 줄은 몰랐음.
공정하게 말하자면, 1위는 정확도, 보정, 속도, 비용을 똑같이 가중치 둬서 평가한 결과야. 정확도만 따지면 3위거든. 이 모델의 진짜 강점은 90%라고 말하면 진짜 90% 확률로 맞춘다는 거고, 모르면 그냥 찍지 않고 "모르겠다"고 답한다는 거야.
이게 대체 뭐냐면: Qwen3.5-4B에 LoRA랑 작은 의사결정 헤드(decision head)를 붙인 거야. 텍스트나 JSON 레코드, 사진 최대 두 장, 그리고 폐쇄형 질문을 던지면 돼.
한 번의 포워드 패스로 각 옵션에 대한 확률이랑 "알 수 없음"을 바로 뱉어내.
Mac에서 MLX로 돌리거나 GPU 하나만 있어도 잘 돌아가.
프로젝트 전체 비용은 GPU 대여료로 한 1200달러 정도 썼고, 시간은 엄청 갈아 넣었지 :P
-
Weights (Apache-2.0):

