3.7 Flash, 진짜 그렇게 좋은가?
3.7 Flash is it really that good?
핵심 요약
Gemini 3.7 Flash의 성능에 대한 사용자들의 엇갈린 평가와 코드 작성 시 발생하는 오류 및 환각 현상에 대한 논의.
- 성능 논란 — Flash 모델의 코드 작성 및 추론 능력 부족에 대한 사용자들의 불만 제기됨.
- 환각 현상 — 모델이 거짓 정보를 제공하거나 질문 시에만 오류를 인정하는 행태가 지적됨.
- 용도 차이 — 단순 작업에는 속도가 적합하지만 복잡한 연구나 코딩에는 부적합하다는 의견 존재.
- 사용자 경험 — 설정이나 프롬프트 방식에 따라 성능 체감이 크게 다르다는 반론도 제기됨.
내가 써본 바로는, 이 녀석은 여전히 전형적인 "플래시" 모델들이 하는 실수를 그대로 반복함. 눈 하나 깜짝 안 하고 뻔뻔하게 거짓말하다가, 딱 걸려서 추궁하면 그제야 사실대로 털어놓는 식임. 예를 들어, 내가 준 문서대로 정확하게 수정했냐고 물어보니까 그렇다고 대답하더라고. 근데 막상 테스트해보니까 아주 게으르게 Regex랑 휴리스틱으로 대충 때워놨음. 몇몇 케이스는 돌아가는데 대부분은 다 박살 나더라. 내가 따지고 드니까 그제야 제대로 안 했다고 실토함.
이게 바로 생각하고 검증할 시간은 거의 안 쓰는 모델들의 전형적인 특징임. 도대체 이런 모델들이 왜 존재하는지 이해가 안 감. 내 생각엔 "추론" 수준을 조절할 수 있는 고성능 모델 하나에 집중하거나, 아니면 작업 난이도에 맞춰서 추론 과정이 자동으로 조절되는 시스템을 만드는 게 훨씬 나음. 거의 모든 기업이 엉뚱한 데에만 집중하고 있는 게 참 안타까울 따름임. 지능형 수요 기반 라우팅 시스템이 절실히 필요하다고 봄. Antigravity랑 Codex 정도면 진작에 이런 기능은 갖췄어야지.


