12개의 LLM에게 1년간 스타트업 운영을 맡겨봤더니, GLM-5가 Claude Opus 4.6 성능을 11배 저렴한 비용으로 거의 따라잡음.
We gave 12 LLMs a startup to run for a year. GLM-5 nearly matched Claude Opus 4.6 at 11× lower cost.
핵심 요약
LLM의 스타트업 운영 능력을 평가하는 YC-Bench 결과, GLM-5가 가성비 면에서 Claude Opus와 대등한 성능을 보임.
- YC-Bench 벤치마크 — LLM이 1년간 스타트업 CEO 역할을 수행하며 장기적인 의사결정과 비용 관리를 평가함.
- GLM-5의 가성비 — Claude Opus 4.6과 유사한 성능을 내면서도 API 비용은 11배 저렴하게 운영됨.
- 스크래치패드 활용 — 성공한 모델들은 공통적으로 지속적인 메모장(scratchpad)을 활용해 학습 내용을 기록함.
- 장기적 일관성 — 피드백이 지연되는 환경에서 모델이 루프에 빠지지 않고 전략을 유지하는 능력이 핵심임.
우리는 LLM이 1년 동안 시뮬레이션된 스타트업의 CEO 역할을 수행하는 벤치마크인 YC-Bench를 구축했습니다(수백 번의 턴). 이 모델은 직원을 관리하고, 계약을 선택하고, 급여를 처리하며, 고객의 약 35%가 작업을 수락한 후 몰래 작업 요구 사항을 부풀리는 시장에서 살아남아야 합니다. 피드백은 지연되고 드물며, 도움을 주는 사람은 없습니다.
12개 모델, 각 3개의 시드. 리더보드는 다음과 같습니다:
- 🥇 Claude Opus 4.6 - 평균 최종 자금 $1.27M (API 비용 약 $86/회)
- 🥈 GLM-5 - 평균 $1.21M (약 $7.62/회)
- 🥉 GPT-5.4 - 평균 $1.00M (약 $23/회)
- 나머지 모델 - 시작 자본 $200K 미만. 여러 모델이 파산함.
GLM-5는 우리가 계속 주목하게 되는 발견입니다. 원시 성능 면에서 Opus와 5% 이내의 차이를 보이면서도 실행 비용은 훨씬 저렴합니다. 에이전트 파이프라인을 구축하는 사람이라면 누구나 이 비용 효율성 곡선이 실재한다는 것을 알 수 있으며, Kimi-K2.5는 실제로 API 달러당 수익 차트에서 다음 모델보다 2.5배 더 높은 성과를 냅니다.
이 벤치마크는 대부분의 평가가 놓치고 있는 것을 보여줍니다: 지연된 피드백 하에서의 장기적 일관성. 결정이 좋았는지 즉시 알 수 없을 때, 대부분의 모델은 루프에 빠지거나, 방금 작성한 전략을 포기하거나, 이미 나쁘다고 식별한 고객의 작업을 계속 수락합니다.
성공을 예측하는 가장 강력한 지표는 모델 크기나 벤치마크 점수가 아니라, 모델이 학습한 내용을 기록하기 위해 지속적인 스크래치패드를 적극적으로 사용했는지 여부였습니다. 상위 모델들은 실행당 평균 34번 노트를 다시 작성했습니다. 하위 모델들은 평균 0~2개의 항목을 기록했습니다.
📄 논문: https://arxiv.org/abs/2604.01212
🌐 리더보드: https://collinear-ai.github.io/yc-bench/
💻 코드 (완전 오픈 소스): https://github.com/collinear-ai/yc-bench
자유롭게 모델을 실행해 보시고, 질문이 있으시면 언제든 답변해 드리겠습니다!

