왜 거의 모든 새로운 벤치마크와 리더보드가 코딩에만 집중되어 있을까?
Why are almost all new benchmarks and leaderboards coding focused?
핵심 요약
LLM 벤치마크가 코딩 위주로 편향된 현상에 대해, 사용자들이 그 이유와 대안을 논의함.
- 코딩 중심 벤치마크 — 수익성과 결과 검증의 용이성 때문에 코딩 분야에 집중됨.
- 에이전트 활용성 — 에이전트가 데이터를 수집하고 처리하려면 코딩 능력이 필수적임.
- 지식 저장 논쟁 — LLM 가중치에 지식을 저장하는 것보다 외부 도구 활용이 효율적이라는 의견이 대립함.
- 시장 수요 — 소프트웨어 업계의 AI 구독료 지불 의사가 일반 사용자보다 훨씬 높음.
이 커뮤니티에서 LLM이 주로 코딩에 사용된다는 건 알지만, 코딩 외에도 다른 사용 사례들이 있고 그런 사례들도 테스트되어야 한다고 생각함. 벤치마크가 가끔은 점수 올리기(benchmaxxed)용으로 악용될 수 있고, 모델이 여전히 형편없을 수도 있다는 건 알지만, 특정 작업에서 모델이 어떻게 수행해야 하는지에 대한 좋은 지표가 될 수는 있음. 내가 최신 개발 동향을 잘 모르는 걸 수도 있지만, 다른 모든 사용 사례를 위한 벤치마크가 더 필요함. 나는 LLM을 주로 외국어 학습, 창의적 글쓰기, STEM/의학/생화학적 추론 및 질문에 사용하는데, 이런 분야에서 모델이 어떻게 작동할지 알려주는 새로운 벤치마크를 거의 찾을 수가 없음. MMLU-Pro-2나 언어 학습 성능을 알려주는 확실한 벤치마크가 있다면 내 사용 사례에 정말 좋을 것 같음. 하지만 전반적으로 다른 분야의 발전을 파악하기 위해 모델을 위한 더 다양하고 새로운 벤치마크가 필요함.

