지난주 TypeSafe AI가 Jev를 공개했다. Jev는 이들이 '시스템 원 모델(System One model)'이라 부르는 새로운 모델 범주의 첫 번째 사례다(Maggie Appleton의 시각에 동의하는데, '의사결정 모델'이 더 적합한 이름인 것 같다). Jev는 기존 LLM과 구별되는 흥미로운 변형 모델이다. 텍스트를 입력받는다는 점은 같지만, 텍스트를 출력하는 대신 카테고리 분류, 예/아니오 질문, 평점, 그리고 각각에 대한 신뢰도 점수를 부동소수점 값으로 돌려준다.
TypeSafe AI는 Jev를 이렇게 설명한다:
Jev는 프론티어급 지능을 갖춘 함수 호출이라 보면 된다. 비정형 상태(state)를 입력하면, 타입화된 확률적 결정값이 출력된다.
속도도 매우 빠르고, 가격도 상당히 저렴하다. 일반 LLM은 입력·출력 토큰 수 기준으로 요금이 책정되며, 출력 토큰에는 대체로 훨씬 높은 단가가 적용된다. Jev는 입력에 대해서만 과금하고 출력은 무료다. 첫 번째 모델의 입력 단가는 백만 토큰당 $0.042로, OpenAI의 GPT-5 Nano($0.05/백만 토큰)보다도 저렴하다.
Jev는 텍스트나 반정형 데이터에 대해 질문을 던질 수 있는 도구다. 먼저 문자열, 문자열 배열, 또는 이름-값 쌍의 집합을 담은 '상태(state)' 객체를 구성한다. 이 객체에는 기사, 고객 정보, 또는 임의의 레코드를 담을 수 있다. 이를 하나 이상의 질문과 함께 API에 전송하면 각 질문에 대한 답변을 돌려받는다.
질문은 세 가지 유형으로 구성된다:
Jev API는 하나의 문서('상태')와 컨텍스트 윈도우에 담을 수 있는 만큼의 질문을 한꺼번에 받을 수 있다. 질문은 병렬로 처리되므로, 여러 질문을 한 번에 보내더라도 하나만 보낼 때와 처리 시간이 크게 다르지 않다.
Jev 1.13 jaggedness 문서에는 Jev의 강점과 약점에 관한 유용한 안내가 담겨 있다. 현재로서는 숫자, 날짜, 그리고 '적대적 콘텐츠(adversarial content)' 처리에 다소 취약한 편이다.
의사결정 모델이라는 관점은 Jev를 어디에 활용할지 가늠하는 데 도움이 된다. 분류 작업으로 표현할 수 있는 모든 업무에 두루 적합하다. 스팸 탐지, 레이블 제안, 우선순위 지정, 랭킹 등이 대표적인 예다.
검색 리랭킹에도 활용해보고 있다. BM25 같은 저비용 알고리즘으로 상위 100개 후보를 추린 뒤, Jev가 원래 쿼리와의 관련성을 기준으로 이 100개 후보에 점수를 매기는 방식이다.
Jev에서 다소 불편하게 느껴지는 점이 있다면, 블랙박스 머신러닝 시스템으로 한층 더 깊이 회귀하고 있다는 것이다.
LLM은 이미 블랙박스다. 결정의 근거를 물어볼 수는 있지만, 그 답변이 유용하거나 정확하다는 보장은 없다.
Jev는 그마저도 없다. 텍스트를 아무리 많이 입력해도 돌아오는 것은 부동소수점 값 하나뿐이다. Jev가 무언가를 스팸으로 판정했다면, 어떤 콘텐츠 신호가 그 판단을 이끌어냈는지 알 길이 없다.
이는 편향(bias) 문제를 전면에 부각시킨다. Jev로 입사 지원자를 평가하는 사례가 생기지 않기를 진심으로 바란다. 부동소수점 값 하나에는 모델에 내재된 온갖 편향이 감춰질 수 있고, 실험을 통해 그 편향을 분리해내는 작업은 결코 만만하지 않다.
(실제로 한 가지 실험을 해봤다. 샌프란시스코 베이 에어리어의 모든 도시를 대상으로 "좋은 도시인가?"라는 예/아니오 질문으로 점수를 매겨봤는데, 쿠퍼티노(Cupertino)가 최상위, 이스트 팔로 알토(East Palo Alto)가 최하위로 나왔다. 흥미롭다.)
이 모든 사정을 고려하면, 평가(eval)와 체계적인 실험이 일반 LLM 프로젝트보다 훨씬 중요하다. 다행히 Jev는 매우 저렴해서, 수백에서 수천 건의 실험 프롬프트를 돌려도 비용은 몇 센트에 불과하다.
지난 며칠간 커뮤니티가 쏟아낸 Jev 활용 아이디어를 지켜보는 것이 꽤 재미있었다. 눈길을 끈 창의적인 사례 몇 가지를 소개한다:
오픈 웨이트 모델을 기반으로 Jev와 유사한 모델을 만들려는 프로젝트도 잇따르고 있다. Kev가 그 대표적인 사례로, Qwen 3.5를 활용해 0.8B, 4B, 9B 규모의 모델을 제공한다. 관련 Hacker News 스레드에서는 누군가가 'Jev급 의사결정 모델'을 비교하기 위해 새롭게 등장한 JevBench 벤치마크를 공유하기도 했다.
출시된 지 채 일주일도 되지 않았음에도, Jev를 둘러싼 활동량은 상당히 인상적이다.
2026년 9월 22일 업데이트: 내 LLM CLI 도구 및 Python 라이브러리에 Jev 지원을 추가하는 플러그인 llm-typesafe를 출시했다. 기본 사용법은 다음과 같다:
llm -m jev 'Please refund my last payment.' \
-s 'Does this message explicitly request a refund?'다른 쿼리 유형 예시는 README를 참고하자.
이 글은 블로그의 장문 아티클만 표시됩니다. 전체 포스트를 받아보려면 /atom/everything/를 구독하거나, 다른 구독 옵션을 살펴보세요.