현재 LLM 벤치마크가 실제 사용성을 제대로 반영하지 못하는 것 아닐까? (Gemma 4 vs. Gemini/Claude Opus)
Is it just me, or are current LLM benchmarks failing to capture actual usability? (Gemma 4 vs. Gemini/Claude Opus)
핵심 요약
LLM 벤치마크 점수와 실제 체감 성능 사이의 괴리에 대한 의문과 로컬 모델의 우수성에 관한 논의.
- 벤치마크 한계 — 기술적 지표가 실제 사용자의 작업 효율을 대변하지 못함
- 모델 성능 체감 — Gemma 4가 특정 작업에서 대형 모델보다 뛰어난 지시 이행력을 보임
- 평가 방식 의문 — 범용적인 벤치마크 대신 개인화된 작업 기반 평가의 필요성 대두
- AI 활용 논쟁 — AI로 작성된 글의 품질과 사용자의 직접적인 작문 능력 저하 우려
면책 조항: 이 글은 AI(Gemma 4)의 도움을 좀 받아서 썼는데, 결과물이 꽤 잘 나왔음. 내가 원하는 대로 딱딱 뽑아주고, 특정 부분을 다듬거나 개선해달라고 해도 다른 부분 망가뜨리거나 군더더기 붙이지 않고 깔끔하게 처리해주더라.
요즘 모델들이 기술적 리더보드에서 보여주는 성능이랑 실제 실무에서 체감되는 성능 사이에 괴리가 엄청나다는 걸 느끼는 중임.
최근에 이것저것 비교 테스트를 좀 돌려봤는데, **Gemma 4 (26B A4B)**가 실질적인 지시 이행 능력 면에서 Gemini 3.5 Flash나 심지어 Claude Opus 5 같은 "덩치 크고" "더 똑똑하다는" 모델들을 계속 압살하고 있음.
구체적인 사례 두 가지만 들어봄:
- 이메일 작성: Gemini한테 특정 아이디어를 포함해서 답장 메일 좀 써달라고 했더니, 지시 사항은 다 씹고 톤앤매너도 완전히 엇나감. Claude Opus 5도 써봤는데, 똑똑하긴 한데 결과물이 너무 조잡하고, 말만 길고, 딱 봐도 "AI가 쓴 티"가 너무 났음. 근데 Gemma 4는 미묘한 뉘앙스까지 다 잡아내더라. 내가 그냥 직설적으로 말하는 게 아니라 좀 돌려서 말하고 싶을 때, 그 속뜻이랑 의도까지 정확히 파악함.
- 프롬프트 수정 및 엔지니어링: Gemini한테 프롬프트 좀 다듬어달라고 했더니 매번 지시 사항을 제대로 못 지킴. 단순히 다듬는 수준을 넘어서, 새로운 프롬프트를 짤 때 *"X, Y, Z는 포함하고 A, B, C는 하지 마"*라고 지시하면 Gemini는 너무 멍청하게 그대로 받아들임. 그냥 *"X, Y, Z를 하고 A, B, C는 하지 마세요"*라고 출력해버리는 식임. 너무 어색하고 티가 남. 반면에 Gemma 4는 이걸 자연스럽게 처리함. A, B, C를 굳이 언급하지 않고도 그쪽으로 안 빠지게 프롬프트를 짜버림. 그냥 알아듣는 거임.
결론: Artificial Analysis 같은 사이트에서 쓰는 지표들이 실제 일반 사용자(혹은 개발자)가 필요로 하는 거랑은 영 딴판이라는 생각이 듦. 우리한테 필요한 건 수학이나 코딩 벤치마크 점수 따위가 아님. 진짜로 사람 말을 듣고, 뉘앙스를 파악하고, 간단한 지시 사항에서 헛소리 안 하는 모델이 필요하다고.
너희들 생각은 어때:
- 덩치 큰 모델들보다 작은 모델들이나 다른 모델들이 훨씬 똑똑하게 느껴지는 이런 "지능 격차"를 경험해본 사람 있음?
- 단순히 기술적 수치만 나열하는 거 말고, 실제 실무 활용도나 지시 이행 능력을 제대로 보여주는 리더보드나 벤치마크 아는 거 있음?
- 내가 Gemma를 좋아해서 무조건 쓰라는 소리를 하려는 게 아님. 나도 얘가 전체적으로 제일 "똑똑한" 모델은 아니라는 거 앎. 혹시 이런 미묘한 뉘앙스 파악이나 지시 이행 쪽에서 더 강력하거나 괜찮은 모델(ChatGPT 계열 같은 거?) 있으면 추천 좀 해줘.

