뜨거운 감자: Jev가 흥미로운 건 분류기라서가 아님. 우리가 LLM을 미친 듯이 비싼 if/else 문으로 써왔다는 게 흥미로운 거지.
Hot take: Jev isn't interesting because it's a classifier. It's interesting because we've been using LLMs as insanely expensive if/else statements
핵심 요약
LLM을 단순 의사결정용 if/else 문으로 사용하는 비효율성을 지적하며, 작고 빠른 모델로 대체하는 아키텍처의 중요성을 논함.
- LLM 과잉 사용 — 단순 의사결정까지 비싼 생성형 모델을 사용하는 비효율적 관행을 지적함.
- 분류기 모델의 가치 — Jev와 같은 작은 모델을 라우팅이나 게이팅에 활용하는 아키텍처의 잠재력을 강조함.
- 비용 최적화 — 큰 LLM은 생성이나 추론이 필요할 때만 호출하여 시스템 효율을 높여야 함.
- 아키텍처 재설계 — 에이전트 파이프라인을 작은 결정 모델과 큰 LLM의 조합으로 재구성할 필요성을 제기함.
아니 내가 뭘 놓치고 있는 건지 모르겠는데, 이틀 동안 Jev 관련 스레드만 한 20개는 읽은 것 같거든? ㅋㅋ
토론 절반은 이거야:
"야 이거 그냥 분류기(classifier)잖아"
나머지 절반은 아니라고, 일반적인 세계 지식도 있고 제로샷도 되고 특정 작업용 학습도 필요 없으니까 다르다고 싸우는 중임. 솔직히 나도 그쪽이었는데, 직접 한번 써보기로 했다. 내 생각은 이래.
양쪽 다 핀트를 잘못 잡고 있는 거 아님? 나한테 더 흥미로운 건, 우리가 생성 문제도 아닌데 얼마나 자주 풀 제너레이티브 LLM을 갖다 쓰고 있냐는 거거든.
보통 에이전트 파이프라인 생각해보자고.
툴 A를 쓸까 B를 쓸까? 이거 빌링 문제야, 서포트야, 환불이야? 이전 단계가 성공했나? 4B 모델한테 보낼까 70B 모델한테 보낼까? 이 답변이면 충분한가, 아니면 다시 시킬까? 이 PR이 사람이 검토해야 할 만큼 위험해 보이나?
근데 보통 어떻게 하지?
LLM 불러서 "추론"하게 시킨 다음에, true나 "tool_31414225" 같은 JSON 뱉으라고 하잖아.
이렇게 써놓고 보니까 진짜 멍청해 보이네. 체크박스 하나 체크할 때마다 소설가를 고용하고 있는 꼴이잖아. Jev(아니면 Laya든 뭐든 다음에 나올 모델들이든)에서 내가 흥미롭다고 느끼는 지점이 바로 이거임.
"와 2026년에 분류기가 발명됐네!" 이게 아니라... 지금 에이전트 아키텍처들이 죄다 거꾸로 돌아가고 있는 거 아닐까? 비싸고 큰 자기회귀 모델이 중간에 앉아서 사소한 결정까지 다 내리고 있는 게 문제 아닐까 싶음.
라우팅, 게이팅, 검증, 상태 전환 같은 건 아주 작은 결정 모델들이 처리하고, 진짜 생성이나 제대로 된 추론이 필요할 때만 큰 LLM을 깨우는 방식이 훨씬 낫지 않을까?
그러니까 원래는:
user -> LLM -> LLM -> LLM -> tool -> LLM -> LLM
이런 식이었다면, 이제는 이런 식으로 바뀌는 거지:
user -> cheap router -> tool/model -> cheap evaluator -> big LLM only if needed
만약 이런 "결정" 모델들이 작고, 로컬에서 돌아가고, 빠르기까지 하다면... 뭐, 꽤 쓸만해 보이는데.
아이러니하게도 사람들이 벌써 오픈 소스 버전 만들고 일반 LLM 로짓으로 비슷한 짓을 하고 있다는 거 보니까, Jev 자체가 엄청난 해자(moat)를 가졌다는 생각은 안 드는데, 이 패턴 자체가 중요하다는 확신은 더 드네. 근데 여기 실제로 에이전트 만드는 형들은 어때?
지금 LLM 쓰는 것 중에 그냥 비싼 예/아니오나 N개 중에 하나 고르는 결정 내리는 비중이 얼마나 돼? 내가 작업했던 시스템들 다시 보니까... 인정하기 싫을 정도로 많은 것 같네 ㅋㅋ

