Jev vs. Kev: 오픈소스 Jev 대안 모델 비교 테스트
Jev vs. Kev: open-source Jev alternative tested side by side
핵심 요약
Jev와 Kev 4B 모델을 동일한 조건에서 비교한 결과, 정확도는 비슷하나 Jev가 패러프레이즈 탐지에서 더 우수한 성능을 보임.
- 성능 비교 — 두 모델의 정확도는 오차 범위 내에서 비슷하지만 Jev가 패러프레이즈 탐지에서 더 뛰어남
- 비용 문제 — Jev는 고정된 추가 입력 토큰을 계산하여 짧은 요청 시 비용이 최대 12배까지 비쌈
- 벤치마크 공개 — 테스트에 사용된 코드와 데이터셋은 GitHub를 통해 확인 가능함
opper.ai
원문 사이트로 이동
Kev 4B(Jared Palmer가 Qwen3.5-4B를 Apache-2.0으로 파인튜닝한 모델)를 호스팅해서 Jev랑 같은 엔드포인트에 놓고 비교해 봤음.
두 모델이 출시된 이후에 나온 362개의 새로운 데이터셋(최신 arXiv 논문, Stack Exchange 질문, GitHub 이슈)을 직접 만들어서 원문 기반으로 답을 뽑아봤다.
몇 가지 발견한 점:
- 모든 작업에서 정확도 차이가 2점 이내라 이 정도 샘플 사이즈에선 오차 범위 수준임.
- Jev가 보정(calibration)이 더 잘 되어 있고, 문장 재구성 탐지(PAWS 87.0% vs 74.5%)에서 앞서나감.
- 정가는 똑같은데, Jev는 요청당 고정적으로 ~257개의 입력 토큰을 더 잡아먹음(TypeSafe 직접 호출할 때랑 같은 수치). 그래서 짧은 요청 보낼 때는 비용이 최대 12배까지 더 나옴.
직접 돌려보고 싶은 사람들을 위해 벤치마크 코드랑 테스트 항목, 결과는 GitHub에 올려뒀음. 두 모델 다 내 스타트업인 Opper를 거쳐서 라우팅했음. 궁금한 거 있으면 더 물어봐.

