12M 컨텍스트 윈도우, 그리고 약간의 거짓말?
12M Context Window and some some sprinkle of lies?
핵심 요약
SubQ의 12M 컨텍스트 윈도우 마케팅이 실제 성능과 괴리가 크다는 의혹 제기.
- 마케팅 과장 — 12M 컨텍스트 윈도우를 홍보하지만 실제 프로덕션 모델은 1M에 불과함.
- 성능 지표 왜곡 — 연구용 모델과 프로덕션 모델의 벤치마크 수치를 혼용하여 품질 저하를 은폐함.
- 비용 산정 불일치 — 홈페이지와 출시 스레드 간의 비용 절감 수치가 서로 다르게 표기됨.
- 기술적 의구심 — Sparse attention의 한계와 연구 결과의 실제 적용 가능성에 대해 강한 의문을 제기함.
오늘 SubQ 출시 내용을 좀 살펴봤는데, 앞뒤가 안 맞는 게 좀 있네.
트윗에서는 12M 컨텍스트 윈도우라고 광고하는데, 블로그에는 12M은 연구 결과일 뿐이고 프로덕션 모델은 SubQ 1M-Preview라고 적혀 있네. 둘이 다른 건데 벌써부터 감이 오지?
RULER는 128K라고 보고됐는데, 이건 Sparse attention이 실제로 검증되어야 할 수준보다 훨씬 아래야. 표준적인 긴 컨텍스트 평가라면 마케팅에서 광고하는 길이만큼은 돌려야지.
MRCR v2 1M 기준: 연구용 모델은 83, 프로덕션은 65.9네. 이 수치 하락만 봐도 서빙 과정에서 아키텍처가 어떻게 무너지는지 알 수 있지. 그리고 65.9는 같은 벤치마크에서 Opus 4.6(78.3)이나 GPT-5.5(74)보다도 낮아. 홈페이지에는 "품질 저하 없이"라고 적혀 있지만, 수치들은 그 주장에 전혀 부합하지 않아.
비교 대상 선정 문제도 있어. 블로그 본문에는 Opus 4.7이 32.2라고 인용되어 있는데, 홈페이지 표에는 Opus 4.6이 78.3이라고 적혀 있거든. 유리한 수치만 골라서 서술에 넣은 거지.
가격도 앞뒤가 안 맞아. 홈페이지에는 1/5 비용이라고 되어 있는데, 출시 스레드에는 Opus의 5% 미만이라고 적혀 있어. 둘 사이에 4배 차이가 나.
FlashAttention보다 52배 빠르다는 건 커널 수준 비교지, 엔드 투 엔드 추론 속도가 아니야. 아키텍처 자체의 결과로는 훌륭할지 몰라도, 명시하지 않으면 대부분은 실제 체감 속도로 받아들일 거야.
Sparse attention에는 알려진 실패 모드가 있지: 라우터가 가지치기한 연결에 작업이 의존하게 되면 속도가 느려지는 건데, 연구용 모델에서 프로덕션 모델로 넘어갈 때 MRCR 수치가 떨어진 게 딱 그 패턴이야!
연구 자체는 진짜일 수도 있고 팀원들도 스펙은 좋을 수 있어. 하지만 수치들이 아직 마케팅이랑 전혀 안 맞아. 내 감이 강하게 반응하고 있어. 피어 리뷰가 나오기 전까진 일단 걸러 듣는 게 좋을 것 같아.
기술 보고서는 언제 나오냐고? 모르지. 하지만 이번 건 내 bullshit 레이더가 아주 강하게 반응하고 있어.
