회사에서 10일 동안 새로운 제미나이 모델 테스트 중인데, 진짜 미칠 것 같음
Been testing the new gemini model at work for ~10 days, kinda losing my mind
핵심 요약
금융권 종사자가 새로운 제미나이 모델을 10일간 테스트한 후, 뛰어난 추론 능력과 낮은 환각 현상에 놀라움을 표함.
- 성능 향상 — 기존 모델 대비 압도적인 추론 능력과 현저히 낮은 환각 현상을 보임.
- 컨텍스트 처리 — 100만 토큰 컨텍스트 윈도우가 실제 업무에서 완벽하게 작동함.
- 속도 최적화 — 고성능 모델임에도 불구하고 플래시 모델 수준의 빠른 처리 속도를 보여줌.
- 업계 반응 — 모델의 성능에 대한 기대와 함께 마케팅 과장일 수 있다는 회의론이 공존함.
뻔한 이유로 계정 새로 팠다. 금융권(퀀트 리서치)에서 일하는데, 구글이 우리 팀 엔지니어 몇 명이랑 나한테 새 모델 액세스 권한을 줬거든. litellm이 vertex ai 관련 수정 사항을 배포할 때까지 기다려야 라우팅이 작동해서, 하마터면 써보지도 못할 뻔했다.
10일 정도 써봤는데, 광고쟁이처럼 보이지 않으면서 이 느낌을 어떻게 설명해야 할지 모르겠다. 근데 이건 진짜 다르다. 1M 컨텍스트 윈도우? 뭐, 그 숫자는 전에도 본 적 있으니까 별 감흥 없었지. 근데 이건 진짜로 작동한다니까? 코드베이스 전체랑 수년간 쌓인 내부 리서치 문서를 프롬프트 하나에 다 때려 박아도 필요한 내용을 정확히 뽑아낸다. 계속 '이제 슬슬 맛 가겠지' 싶어서 기다렸는데, 그냥... 안 그러더라.
근데 진짜 놀라운 건 환각 현상이다. 내 일 특성상 모델이 자신 있게 숫자 지어내는 건 쓸모없는 수준을 넘어 재앙인데, 얘는 그런 짓을 거의 안 한다. 물론 내가 멍청이도 아니고 다 더블 체크는 하지만, 에러율이 내가 써본 그 어떤 모델보다 눈에 띄게 낮다. 그냥 2배 더 좋은 수준이 아니라, 훨씬 더 압도적이다.
게다가 속도도 빠르다. gemini 3.8 flash랑 비교해도 불편할 정도로 빠르다. 결과물 퀄리티 생각하면 말이 안 되는 속도임.
어제 진짜 현타 온 게, 뭐 좀 확인하려고 opus 5.5로 돌아갔는데 그냥 다운그레이드한 느낌이더라. opus가 다운그레이드라니. 6개월 전이었으면 미친 소리라고 했을 거다.
아무튼 궁금한 거 있으면 물어봐라. 당연히 신상 털릴 만한 건 말 못 한다. 이거 가격 정책만 적당히 나와도 시장 판도 진짜 이상하게 돌아갈 거다.
추가 정보: opencode에서 사용 중이다. 원래 내 세팅은 구현용으로 4.1 flash deepseek 쓰고, gpt 6 astra(이전엔 5.6 sol) xhigh 쓸 계획이었다.

