폐쇄형 모델과 오픈 모델의 격차는 생각보다 작을 수 있음: 폐쇄형 모델 제공업체가 추론 외에 무엇을 하는지 모르기 때문
The gap between closed and open models might be much smaller than commonly assumed, because we don’t know what closed model providers do *in addition to* model inference
핵심 요약
폐쇄형 모델의 성능은 모델 자체보다 복잡한 파이프라인과 도구 활용 덕분일 가능성이 크며, 오픈 소스 진영도 이러한 파이프라인 구축이 필요하다는 의견입니다.
- 성능 격차의 원인 — 모델 자체의 우수성보다는 RAG, 프롬프트 처리 등 복잡한 파이프라인의 영향일 가능성
- 오픈 소스 과제 — 파이프라인 구축을 위한 표준화된 도구와 배포 환경의 부재
- 에이전트 워크플로우 — 모델 성능의 상당 부분이 에이전트 워크플로우와 도구 활용에서 기인함
- 데이터 통합 — 폐쇄형 모델은 사용자 데이터를 활용한 프로파일링과 추적을 통해 더 나은 결과를 제공함
Claude가 벤치마크에서 GLM-5.2를 압도할 때, 보통 사람들은 Anthropic이 더 우수한 모델 아키텍처, 더 뛰어난 학습 파이프라인, 그리고 경쟁사보다 모델을 더 좋게 만드는 고급 머신러닝 기술을 가지고 있다고 가정함.
하지만 사실 이건 논리적으로 맞지 않음. 벤치마크는 GLM의 모델 추론과 Claude라는 전체 제품을 비교하는 것이고, 우리는 그 제품이 내부적으로 무엇을 하는지 모르기 때문임.
Anthropic은 이미 추론 과정을 숨기고 있고 전체 대화에 대한 접근 권한을 주지 않음. 그들은 쉽게 다음을 사용하고 있을 수 있음:
- RAG/지식 주입 (예: 소프트웨어 문서화)
- 프롬프트 전처리
- 컨텍스트 의존적 시스템 프롬프트
- 숨겨진 내부 도구 호출
- "Clown-car MoE"/특수 전문가 모델로의 작업 위임
이 모든 것들은 모델 성능을 극적으로 향상시킬 수 있으며, API를 통해 이 모든 것을 "Claude"라는 이름으로 서비스할 수 있음. 당신은 그 사실을 알 수 없을 것이고, Claude를 오픈 모델과 벤치마크할 때 사실상 사과와 오렌지를 비교하는 꼴이 될 것임.
그들이 추론 결과가 오픈 모델을 능가하는 단일 모델을 가지고 있지 않을 가능성도 충분히 있음.

