JEV는 거의 끝났다: CLM vs JEV
JEV almost dead: CLM vs JEV
핵심 요약
Jev의 오픈 소스 대안인 CLM이 공개되었으나, Jev의 핵심인 제로샷 범용 지식 능력 부족에 대한 논쟁이 이어지고 있습니다.
- 기능적 호환성 — CLM은 Jev의 핵심 인터페이스인 Choice, Noul, Score를 완벽하게 지원함
- 성능 우위 — CLM은 상태와 액션 헤드를 분리하여 Jev 대비 4~13배 빠른 속도를 제공함
- 오픈 소스 장점 — 가벼운 가중치로 사용자 도메인에 맞춘 미세 조정이 가능함
- Jev의 강점 — 여전히 제로샷 범용 지식과 긴 컨텍스트 처리 능력에서 우위를 점함
https://www.reddit.com/r/LocalLLaMA/comments/1woscea/contrastive_language_models/
(미안, CLM이 받아야 할 주목을 제대로 못 받은 것 같아서 다시 올림)
이게 뭐냐면: Qwen3-8B를 위한 새로운 프로젝션 헤드임.
github: https://github.com/Contrastive-LM/CLM
hf: https://huggingface.co/Contrastive-LM
API랑 기능적 인터페이스 수준에서 보면, CLM은 Jev가 하는 모든 걸 지원함. 하위 호환 수준이 아님. 하지만 일반화 성능, 컨텍스트 규모, 아키텍처 측면에서 둘 사이에 중요한 트레이드오프가 존재함.
1. 기능적 동등성 (동일한 프리미티브)
CLM은 TypeSafe AI의 Jev를 대체할 수 있는 오픈 웨이트, 자체 호스팅 가능한 모델로 설계됐음. Jev의 핵심 질문 프리미티브 3가지를 그대로 구현한 "System One" 의사결정 인터페이스를 지원함:
-
Choice: 개별 후보군을 평가해서 카테고리별 확률 분포를 반환함.
-
Noul: 명제나 가드레일 체크에 대해 보정된 참/거짓 확률을 출력함.
-
Score: 정해진 루브릭이나 척도에 따라 입력을 점수화함.
TypeSafe Jev 클라이언트용으로 짠 코드는 clm-serve 엔드포인트에 바로 갖다 박아도 호환됨 (from clm import CLMClient, Choice, Noul, Score).
2. CLM이 Jev보다 나은 점
-
지연 시간 및 분리형 캐싱: Jev는 상태와 질문 선택을 한꺼번에 평가하는 폐쇄형 클라우드 모델임. 반면 CLM은 상태 헤드와 액션 헤드를 분리했음. 에이전트가 고정된 도구나 액션 세트를 쓴다면, CLM은 그 액션들을 한 번 임베딩해서 캐싱해버림. 인터랙티브 브라우저 에이전트나 게임(T-Rex, Super Mario) 같은 벤치마크에서 CLM이 Jev보다 4배에서 13배 더 빠름.
-
오픈 웨이트 & 파인튜닝 가능: Jev는 사용자 파인튜닝이 불가능한 닫힌 API임(상태랑 질문 지시사항으로 프롬프트만 넣을 수 있음). CLM 헤드는 오픈 웨이트에 용량도 75MB 정도로 작아서, 니가 직접 에이전트 궤적을 학습시켜서 파인튜닝할 수 있음.
-
코딩 벤치마크 검증기: 에이전트 궤적으로 파인튜닝하면, CLM은 **Terminal-Bench 2.1 (87.6%)**이랑 **DeepSWE (81.6%)**에서 SOTA급 검증 성능을 보여줌. 반면 제로샷 Jev는 같은 벤치마크에서 빌빌거렸음(DeepSWE 기준 약 71%).


