Jev는 LLM 킬러도, 단순 분류기도 아니다. 실제 사용자와 프로덕션에 적용해 본 결과
Jev isn't an LLM killer, and it isn't just a classifier. We put it in production with real users. Here's what we learned
핵심 요약
Jev를 활용해 LLM의 비효율적인 추론 과정을 줄이고, 에이전트의 의사결정 속도와 효율을 개선한 실무 경험 공유.
- 시스템 구조 — LLM과 Jev를 분리하여 의사결정 효율화함
- 성능 개선 — 단순 반복 작업에서 LLM의 추론 대기 시간을 제거함
- 실무적 한계 — 결정 모델의 판단 오류를 방지하기 위한 신뢰도 임계값 설정 필수
- 기술적 관점 — 시스템 1과 시스템 2의 개념을 에이전트 아키텍처에 구현함
에이전트 스타트업 창업자다. 우리 서비스에서 실제 유저들 대상으로 Jev를 돌려보고 있는데, 이건 이론적인 얘기가 아니라 실제로 겪은 경험담이다.
이번 주에 이 서브레딧 좀 둘러봤으면 Jev에 대한 두 가지 반응을 봤을 거다. 하나는 Jev가 LLM 시장을 끝장낼 거라는 거고, 다른 하나는 그냥 홍보 잘한 분류기(classifier)일 뿐이라는 거다. 둘 다 틀렸다. 애초에 Jev를 LLM이랑 비교하는 것 자체가 잘못됐거든. 그런 생각에 휘둘리지 마라.
Jev랑 LLM은 완전히 다른 시스템이다. Jev는 의미론적 의사결정 엔진(semantic decision engine)이다. 쉽게 말해서, 상황이랑 질문, 그리고 선택지들을 던져주면 각 옵션에 점수를 매겨서 확률이랑 같이 제일 좋은 걸 뱉어주는 놈이다. 그게 끝이다. LLM처럼 콘텐츠를 생성하지도 못하고, 코드를 짜거나 너랑 수다 떨지도 못한다. 텍스트 전용이라 화면을 볼 수도 없다.
근데 문장 하나 제대로 못 쓰는 놈이 어떻게 우리 하네스(harness)에서 가장 큰 업그레이드 중 하나가 됐을까?
컴퓨터가 행동하는 데 출력 토큰이 꼭 필요한 건 아니기 때문이다. 이게 TypeSafe의 베팅인데, 나도 한번 깨닫고 나니까 그 뒤로는 이것만 보이더라. LLM은 토큰을 하나씩 생성하고, 그걸 파싱해서 뭔가를 실행해야 한다. 에이전트가 하는 일들 중 상당수는 이게 과하다. 클릭할지, 스크롤할지, 타이핑할지 결정하는 데 굳이 장황한 추론 과정이 필요하냐? Jev는 같은 상태에 대해 여러 질문을 동시에 처리하고 바로 행동을 반환한다. 긴 추론 과정도 없고 파싱할 출력값도 없다. 게다가 네가 정의한 옵션 안에서만 고르니까, 있지도 않은 버튼을 만들어낼 일도 없다.
Vestra의 에이전트 하네스에서 우리는 이걸 툴 호출 게이팅, 가드레일 및 감독, 브라우징, 컴퓨터 제어에 쓴다. 하네스가 화면을 구조화된 리스트로 변환하면 Jev가 다음 행동을 고르고, 진짜 계획이나 작문이 필요할 때만 LLM이 나서는 식이다.
컴퓨터 제어 쪽에서 효과가 제일 컸다. LLM만 쓸 때는 속도가 느렸다. 클릭 한 번 할 때마다 모델이 혼자 생각하느라 시간을 다 잡아먹었거든. 지금은 내가 화면 보고 클릭하는 속도랑 거의 비슷해졌고, 우리 유저들도 매일 이걸로 실제 업무를 처리하고 있다. AI 에이전트를 쓰는 방식 자체가 바뀔 수도 있는 부분이다.
이제 실전에서만 배울 수 있는 팁이다.
이걸 결정론적인 분류기라고 생각할 만큼 순진하게 굴지 마라. Jev는 나름의 판단력을 가지고 있다. 그게 바로 이 녀석이 유용한 이유이자, 동시에 자신 있게 틀릴 수 있는 이유이기도 하다. "잘못된 옵션을 반환하지 않는다"는 게 "항상 정답을 고른다"는 뜻은 아니거든. 형식만 맞고 내용은 틀린 답은 에러 나는 것보다 조용해서 잡아내기도 더 힘들다. 우리는 이걸 신뢰도 임계값(confidence thresholds)으로 해결한다. Jev가 확신하고 위험 부담이 적으면 바로 실행하고, 확신이 없거나 리스크가 크면 LLM이나 사람한테 넘긴다. 완벽하진 않아도 아주 강력한 출발점이다.
내가 아직 확실하게 답을 못 내린 건 이거다. Jev가 사소한 결정들을 다 가져가면, 루프마다 LLM이 할 일은 줄어든다. 지금은 각자 잘하는 걸 하는 것처럼 보이지만, 1년 뒤에는 LLM이 저렴한 모델이 확신 없을 때만 호출되는 비싼 예비용으로 전락하는 거 아닐까? LLM 시장이 망할 거라곤 생각 안 하지만, 우리가 LLM에 돈을 쓰는 방식은 바뀔지도 모르겠다.
여기 에이전트 만드는 사람들한테 진짜 궁금한 게 있다. LLM이 굳이 안 해도 될 결정에서 LLM을 빼버린 경험이 있나? 그리고 Jev 써보다가 다시 LLM으로 돌아갔다면, 그 이유는 뭐였나?

