Gemini 3.8 Flash로 전문 의료 지식 벤치마크 테스트 결과, Opus 5와 GPT-5.6 Sol보다 높은 점수 기록
Ran Gemini 3.8 Flash on an expert level medical knowledge benchmark. Scores higher than Opus 5 and GPT-5.6 Sol
핵심 요약
Gemini 3.8 Flash가 전문 의료 벤치마크에서 기존 모델들을 능가하는 성능을 보여주며 주목받고 있습니다.
- 의료 벤치마크 테스트 — MedXpertQA를 통해 Gemini 3.8 Flash의 전문 의료 지식 성능을 검증함
- 모델 성능 우위 — Opus 5 및 GPT-5.6 Sol보다 높은 점수를 기록하며 의료 분야에서의 경쟁력을 입증함
- 데이터 접근성 — 구글의 방대한 검색 엔진 및 파트너십 데이터가 모델의 지식 수준에 기여한 것으로 분석됨
- 향후 비교 계획 — Fable 5.1 및 GPT-6 Astra 모델과의 추가적인 성능 비교 테스트를 예고함
MedXpertQA라는 벤치마크가 있는데, 여기엔 의사 국가고시 수준의 의학 문제들이 장기 시스템별로 정리돼 있어.
이 벤치마크를 제미나이 최신 모델들에 돌려서 결과를 온라인에 공개한 건 내가 유일한 것 같네. 흥미로운 건 3.8 Flash가 다른 모든 LLM보다 점수가 높게 나왔다는 거야. 조만간 Fable 5.1이랑 GPT-6 astra도 돌려서 어떻게 비교되는지 확인해 볼 생각이야.
결과 확인이랑 장기 시스템별 필터링은 여기에서 할 수 있어.
궁금한 거 있거나 다른 모델로도 돌려보고 싶은 거 있으면 말해줘.


