배포 환경과 맞지 않는 벤치마크로 모델을 선택하고 있었다
Been picking frontier models on benchmarks that don't match our deployment conditions
핵심 요약
AI 모델의 성능을 '조사'와 '판단' 단계로 분리해 분석한 결과, 모델마다 강점이 다르다는 점을 밝혀냄.
- 성능 분해 분석 — 모델의 조사 능력과 판단 능력을 분리하여 벤치마크 성능을 평가함
- 모델별 강점 차이 — Opus는 조사 단계에, Gemini는 고정된 정보 기반의 판단 단계에 더 뛰어남
- 벤치마크 불일치 — 실제 배포 환경과 다른 벤치마크 지표가 모델 선택의 오류를 유발할 수 있음
- 단계별 모델 구성 — 조사와 판단을 분리하여 각 단계에 최적화된 모델을 사용하는 전략이 제안됨
알고 보니 Opus는 조사에 더 뛰어나고, Gemini는 판단에 더 뛰어나더군요!
각 모델이 1,417개의 질문으로 구성된 예측 벤치마크에서 예측을 내리기 전 스스로 웹 조사를 수행할 때, Opus가 더 뛰어난 성능을 보였습니다(Gemini의 0.143 대비 0.131 Brier 점수). 하지만 두 모델 모두 각 질문에 대해 동일한 사전 조사 자료(미리 수집된 문서)를 제공받았을 때는, Gemini가 같은 격차로 승리했습니다(Opus의 0.153 대비 0.141). 이는 Opus의 강점이 조사 단계, 즉 무엇을 검색해야 할지, 어떤 페이지를 읽어야 할지, 어떤 세부 정보가 중요한지를 파악하는 데 있음을 시사합니다. 그 단계를 제거하면 고정된 증거에 대한 Gemini의 판단력이 더 날카롭습니다.
보정 점수(Calibration scores)도 이를 뒷받침합니다. Opus는 더 이상 스스로 조사를 수행하지 않아도 될 때 보정 점수가 눈에 띄게 떨어집니다. 반면 Gemini는 표준화된 자료를 제공받았을 때 오히려 점수가 향상되는데, 이는 Gemini 자체 에이전트의 조사가 정보를 놓치고 있었음을 시사합니다. 이러한 비대칭성은 Opus가 검색 경로를 확률 할당을 위한 비계(scaffolding)로 사용하고 있을 가능성을 보여줍니다(즉, 검색 루프를 도는 행위 자체가 정보 표면화와는 별개로 인식론적 작업을 수행하고 있다는 뜻입니다).
이를 확인하기 위해 우리는 4개의 모델(Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, Grok 4.20)을 대상으로 2025년 10월~12월에 해결되는 1,417개의 이진 예측 질문 벤치마크를 두 가지 평가 조건에서 실행했습니다: 에이전트 방식(각 모델이 도구를 사용하여 직접 웹 조사 수행)과 고정 증거 방식(모든 모델이 동일한 약 12k 문자 분량의 조사 자료를 제공받음).
참고로, 한 가지 한계점은 고정 증거 자료 자체가 언어 모델에 의해 생성된 것이므로, 추상적인 판단력보다는 각 모델이 특정 표준화된 증거 버전을 얼마나 잘 해석하는지를 측정하고 있을 수 있다는 점입니다. 하지만 그렇다면 4개 모델 모두 같은 방향으로 편향되어야 합니다. 그렇지 않았습니다. GPT-5.4와 Grok 4.20은 조건 간에 거의 변화가 없었지만, Opus와 Gemini는 순위가 뒤바뀌었습니다(이는 잘못되거나 편향된 평가라면 발생할 수 없는 결과입니다).
우리는 그동안 실제 배포 환경과 일치하지 않는 벤치마크를 기준으로 프론티어 모델을 선택해 왔습니다. 그리고 제가 알기로는 이번 연구가 프론티어 모델의 성능을 조사 단계와 판단 단계로 분해하여 평가한 최초의 직접적인 사례입니다.
순위가 뒤바뀐 것은 우리가 측정한 특정 사례일 뿐이며, 아마 다른 사례들도 존재할 것입니다. 여러분의 배포 환경에서도 비슷한 분리 현상(검색 대 합성, 요약 대 추론 등 모델이 순차적으로 두 가지 다른 작업을 수행해야 하는 모든 경우)을 발견하셨다면, 어떤 현상을 보고 계신지, 그리고 어떻게 대응하고 계신지 듣고 싶습니다.

