Gemini 3.1 성능 저하 중, 구글이 몰래 모델을 quantization하고 있는 게 분명함. 3.0은 출시 때 훌륭했지만 멍청해졌고, 3.1도 처음엔 괜찮더니 지금은 재앙 수준임.
Gemini 3.1 is getting worse, they keep silently quantizing these models I'm sure of it by now. 3.0 was excellent at launch, then grew very dumb, 3.1 was kind of better, now it's a disaster.
핵심 요약
Gemini 3.1의 급격한 성능 저하와 hallucination 증가에 대한 사용자들의 불만과 의혹.
- quantization 의혹 — 구글이 비용 절감을 위해 모델을 몰래 quantization하고 있다는 주장이 제기됨.
- hallucination 심화 — 기차 시간표나 부품 정보 등 기초적인 사실 관계에서 심각한 오류가 빈번하게 발생함.
- 사용자 이탈 조짐 — 초기 성능에 만족했던 유저들이 최근의 게으름과 오류 때문에 Claude나 ChatGPT로 회귀를 고민함.
- 긴 문맥의 장점 — 성능 논란에도 불구하고 100만 토큰의 긴 context window와 적은 검열은 여전히 독보적인 강점으로 꼽힘.
나는 유튜브 영상 분석 도움부터 썸네일, 통계 확인 등 아주 긴 세션에서 Gemini를 사용함. 가끔은 복잡한 가상 현실을 이끄는 개인적인 프로젝트에도 씀.
2.5는 이런 긴 세션을 아주 잘 따라왔는데, 어느 순간부터 멍청해지더니 300k 토큰 미만 세션에서도 hallucination이 심해지기 시작함.
그들은 3.0을 출시했고 그건 한 달 뒤에 완전 쓰레기가 되기 전까지는 훌륭했음.
이제 3.1이 나왔는데, 처음엔 그저 그랬다가 지금은 매 답변마다 hallucination을 일으키거나 실수를 함. 잘못 해석하거나 분석한 부분을 지적하면, 지가 왜 틀렸는지 구구절절 설명하면서 수정하는데 그건 전혀 도움이 안 됨. LLM을 완전히 믿지는 않지만, 이 정도면 이제 아예 쓸모가 없는 수준임.
제대로 작동할 때는 엄청나게 도움이 됨. 2.5로 일본어 게임 매뉴얼 전체를 완벽하게 번역하기도 했음.
근데 지금은 기본적인 유튜브 분석이나 조언조차 믿을 수가 없음. 그 자리에서 무작위로 말을 막 지어냄.
이건 피드백이 아니라 그냥 관찰 결과임. 다른 사람들은 어떻게 생각하는지 궁금함.


