Jev 모델과 gpt-5.6-luna 벤치마크 비교
I benchmarked Jev aginst gpt-5.6-luna!
핵심 요약
텍스트 생성이 아닌 확률 기반 분류 모델인 Jev의 성능을 기존 LLM과 비교 분석한 결과입니다.
- Jev 모델 성능 — 49개 작업 중 42개에서 기존 LLM 대비 우수한 성능을 보임
- 비용 및 속도 — LLM 대비 훨씬 빠른 응답 속도와 저렴한 비용으로 효율성 입증
- 모델 한계 — 텍스트 생성이나 도구 호출이 불가능하며 분류 및 재순위 지정에 특화됨
- 활용 방안 — LLM 앞단에 배치하여 분류 및 관련성 판단을 수행해 비용 절감 가능
며칠 전에 TypeSafe에서 만든 Jev라는 모델을 써볼 기회가 생겼음. 이거 좀 특이한 놈인데, 텍스트를 아예 생성 안 함. 그냥 콘텐츠랑 유형이 정해진 질문(예/아니오, 보기 중 선택, 점수 매기기 등)을 던지면 확률값만 뱉어내는 식임.
테스트 환경: 49개 태스크, 약 8,200개 항목, 전부 공개된 라벨링 데이터셋(SST-2, MMLU, ARC, MS MARCO, XNLI, SQuAD, Banking77 등)에서 가져왔고, 코드로 정답을 계산하는 합성 테스트도 몇 개 섞었음. 두 모델 다 똑같은 질문 문구로 테스트함. 베이스라인은 추론 기능을 끈 gpt-5.6-luna랑, 추론 기능을 낮게 설정한 gpt-5.6-luna로 잡았음.
결과:
Jev가 49개 태스크 중 42개에서 베이스라인이랑 비슷하거나 더 잘했음!
서버 응답 속도 중앙값은 약 105ms vs 700-800ms
비용은 항목 1,000개당 약 $0.04 vs $0.16-0.19
보정 오차(calibration error)는 베이스라인의 절반 수준이라 확률값이 실제로 의미가 있음
제일 놀랐던 건 추론 능력임. LogiQA 0.77 vs 0.59, WinoGrande 0.89 vs 0.66, ARC-Challenge 0.97 vs 0.87, MMLU 0.94 vs 0.87 찍더라. 처음엔 벤치마크를 그냥 외운 거 아닌가 싶어서 Fable 5.1 스크립트로 수학 문장제 문제 120개를 새로 만들어서 돌려봤음. GSM8K에서 0.72 나온 거랑 비슷하게 0.75 나오더라. 참고로 추론 끈 Luna는 같은 문제에서 0.17 나옴.
리랭킹(Reranking) 성능도 압승이었음(NFCorpus nDCG@10 0.73 vs 0.63). Luna는 여기서 쿼리당 1~3초씩 걸렸는데 말이지.
밀린 부분:
리스트에서 개수 세기(Luna가 추론 모드 켜면 0.99 vs 0.87로 밀림)
77개 의도 중 하나 고르기(Banking77, 0.81 vs 0.87)
질문 하나 던지고 그 부정형 질문을 던졌을 때 확률 합이 1이 안 됨. 평균적으로 0.3 정도 오차가 있음
따로 진행한 비공개 테스트에서 문서 100개 정도를 한 번에 넣었더니, 전혀 상관없는 문서에 높은 연관성 점수를 주는 경우가 있었음. 깔끔한 벤치마크 데이터셋에선 안 보이던 문제임.
누가 물어볼 것 같아서 미리 말하는데, 이거 다 공개된 벤치마크라 어떤 모델이든 데이터 오염 가능성은 있음. 내가 새로 만든 수학 문제 세트가 그나마 유일한 통제 변수임. 베이스라인은 일부러 추론 기능을 끄거나 낮게 설정했음. 태스크당 200개 항목이라 0.05 미만 차이는 그냥 노이즈라고 보면 됨. 확실하게 오차 범위 밖인 건 7개 정도임. 그리고 이거 텍스트 생성도 못 하고, 툴 호출도 안 되고, 지가 왜 그런 답을 냈는지 설명도 못 함. 그러니까 LLM 대체재는 아님. 그냥 LLM 주변에서 돌아가는 작은 분류기나 리랭커, "이거 관련 있냐?"라고 묻는 용도의 대체재라고 보면 됨.
레포에 태스크 빌더, 러너, 스코어러, 항목별 원본 결과, 전체 테이블 다 올려놨음. 파이썬 표준 라이브러리만 썼음. 인자 하나만 넣으면 OpenAI 호환 모델 아무거나 베이스라인으로 추가해서 돌려볼 수 있음. 전체 결과는 여기:


