Gemini 3.5 Flash 벤치마크 결과: 기존 모델보다 성능이 떨어지네요.
I benchmarked the new release Gemini 3.5 Flash on ~10 saved evals. Using the exact same prompts.
핵심 요약
Gemini 3.5 Flash를 기존 평가 데이터로 테스트한 결과, 이전 모델보다 성능이 낮고 비용 효율성도 떨어지는 것으로 나타남.
- 벤치마크 결과 — 기존 Gemini 3.1 모델보다 감정 분석 성능이 저조함.
- 비용 효율성 — Flash Lite 대비 10배 비싸지만 성능은 오히려 낮음.
- 프롬프트 민감도 — 새로운 모델이 기존 프롬프트 구조와 잘 맞지 않을 가능성이 있음.
- 모델 교체 위험 — 출시 직후 모델을 바로 프로덕션에 적용하는 것은 위험함.
Gemini 3.5 Flash를 테스트해보고 프로덕션 모델 선택 결정에 사용하는 10개의 저장된 평가(evals)를 돌려봤습니다.
지금까지 결과는 예상과 다릅니다.
대부분의 작업에서 Gemini 3.5 Flash는 이전 Gemini 변형 모델들보다 성능이 떨어졌습니다. 아래 스크린샷은 모델당 5회 실행한 감정 감지 평가 결과입니다.
이 평가에서 3.5 Flash는 13위까지 밀려났습니다. 3.1-pro와 3.1 flash lite가 1, 2위를 차지한 것과 대조적이죠. 심지어 gemini 3 flash보다도 낮습니다. flash lite보다 10배나 비싼데 결과는 더 나쁩니다. 5회 실행 평균값이니 일시적인 오류도 아닙니다. 게다가 이건 비슷한 결과가 나온 10개의 벤치마크 중 하나일 뿐이고, 물론 이 경우가 가장 최악이긴 합니다.
====================================================================================================
LLM Benchmark Results - Emotion Detection - Increasing Complexity
====================================================================================================
Model Provider Avg Score Stability Rec. Temp Pricing Cost* Time Acc/$ Acc/min Completion
----------------------------------------------------------------------------------------------------------------------------------------------
gemini-3.1-pro gemini 80% (3.2/4.0) ±1.000 0.3 High $0.0292 23.48s 109.58 8.18 100.0%
gemini-3.1-flash-lite gemini 75% (3.0/4.0) ±0.000 0.3 Medium $0.00114 6.24s 2.63K 28.85 100.0%
gpt-5.4 openai 75% (3.0/4.0) ±0.000 N/A High $0.0128 8.45s 234.24 21.31 100.0%
claude-opus-4.6 anthropic 75% (3.0/4.0) ±0.000 0.3 High $0.0246 12.44s 121.73 14.46 100.0%
gemini-3-flash gemini 65% (2.6/4.0) ±1.000 0.3 Medium $0.00735 16.36s 353.81
총 테스트 모델: 15
저는 온라인 벤치마킹 도구를 통해 실행했습니다. Gemini 3.5 Flash가 전반적으로 나쁘다고 주장하는 건 아닙니다. 이건 제 개인적인 평가 데이터이고, Gemini를 포함한 모든 모델은 프롬프트에 민감할 수 있으니까요. 하지만 제 워크플로우에서는 안타깝게도 이 벤치마크 결과상 지금 당장 사용할 수는 없겠네요.
이전 출시 모델들 때문에 기대가 컸던 만큼, 이 상황이 바뀌길 정말 바랍니다. 저에게는 이번 결과가 인공적인 분석이나 일반적인 벤치마크가 모델 결정에 있어 얼마나 오해를 불러일으킬 수 있는지 보여주는 사례라고 생각합니다. 그들이 보여준 결과만 보고는 훨씬 더 나은 성능을 기대했거든요...

