중국 AI 연구소들을 싸잡아 묶지만, 사실 그들은 각자 꽤 다른 전략을 취하고 있다. 나는 그중 한 곳에서 일한다.
The Chinese labs everyone lumps together are making four pretty different bets. I work at one of them.
핵심 요약
중국 AI 연구소들이 단순히 하나로 묶일 수 없는 각기 다른 전략과 목표를 가지고 있음을 내부자의 시각으로 분석함.
- 중국 AI 연구소 — 알리바바, 딥시크, 앤트 등 각기 다른 시장 전략을 구사함
- 앤트의 전략 — 롱 에이전트 루프를 저렴하게 돌리기 위한 비용 효율적 모델 설계
- 오픈 소스 영향력 — 중국 연구소들의 오픈 웨이트 공개가 로컬 추론 생태계를 크게 발전시킴
- 서구권과의 차이 — 폐쇄적인 정원(walled garden)을 구축하는 서구권과 달리 생태계 점유율을 노리는 중국
중국 연구소에서 모델 하나 나올 때마다 댓글창은 이미 누가 만들었는지 다 아는 놈들로 도배되고, 보통 알리바바라고 찍더라. 얼마 전에 여기 오픈소스 연구소랑 프론티어 연구소 차이가 뭐냐는 글 올라왔었는데, 댓글 60개 가까이 달리는 동안 오픈소스 쪽 연구소들 구분해서 말하는 놈은 거의 없었음. 걔네 다 같은 한통속 아니고, 그렇게 된 지 꽤 됐는데 말이야.
난 Ant에서 Ling 모델 작업하는 사람이라 나도 그 묶음에 포함되는 놈 중 하나임. 내 고용주에 대한 문단은 알아서 걸러서 들어라.
Qwen의 전략은 배포임. 알리바바는 모든 사이즈, 모든 양자화 버전으로 모델을 내놓고, 출시 첫날부터 대부분의 런타임에서 바로 돌아가게 만듦. 그 결과 사람들이 만드는 파인튜닝 모델 상당수가 Qwen 베이스로 시작하는 거지. 반면 DeepSeek는 아키텍처에 올인함. 논문이랑 가중치를 같은 날 공개해서 설계 자체가 성능을 증명하게 만드는 식임. Moonshot은 좀 더 멀리 보는 느낌인데, 당장 다음 릴리즈에서 좀 이상해 보이더라도 두 사이클 뒤에 이득을 볼 수 있다면 감수하는 쪽임. (Zhipu, MiniMax, StepFun도 각자 자기들만의 색깔이 있지만, 이 정도면 충분히 설명됐겠지.)
내 소속에 대해 확실히 말하자면, Ant의 전략은 '서빙 비용'임. Ant는 결제 시스템을 돌리는 곳이고, 알리바바랑은 별개 회사인데 사람들이 자꾸 헷갈려 하더라. 내가 작업하는 Ling-3.0-flash 모델은 총 파라미터 124B에 토큰당 활성 파라미터는 5.1B 정도고, KDA랑 MLA 하이브리드 어텐션에 262k 컨텍스트를 지원함. 이건 긴 에이전트 루프를 싸게 돌리려고 설계된 거지, 리더보드 1위 찍으려고 만든 게 아님. 우리가 1위라고 주장할 생각도 없고.
우리 방식에서 딱 하나 비판하자면 릴리즈 순서임. 우리는 발표 먼저 하고 가중치는 나중에 푸는 방식을 택했거든. SGLang은 첫날부터 지원해 줬는데, vLLM은 가중치 기다리고 있고, llama.cpp는 아직 PR 열려 있는 상태임. DeepSeek라면 가중치부터 던져놓고 서빙 스택이 따라오게 만들었을 거임. 우리 방식이 인프라 팀 입장에서는 안전한 순서긴 한데, 그 대가로 집에서 직접 돌려보려는 놈들의 호의를 잃는 거지.
그래서 궁금한 게 있는데, 너네는 중국 연구소에서 발표 나올 때 그게 어느 연구소인지 아는 게 글 읽는 방식에 영향을 줌? 아니면 그런 구분은 그냥 내부자들끼리나 흥미로운 얘기임?


