Exo Free 모델 조사, 또 다른 라우터인가?
Investigation on Exo Free model, another router?
핵심 요약
무료 모델로 알려진 'exo-free'가 실제로는 Claude와 GPT를 섞어 쓰는 라우터라는 분석이 제기되었습니다.
- 모델 정체 — 독자적인 모델이 아닌 Claude와 GPT를 혼합한 라우터로 확인됨
- 기술적 증거 — 요청마다 다른 토크나이저와 서버 ID가 노출되어 라우팅 방식이 드러남
- 운영 주체 — Arena.ai의 비공개 프리뷰 API와 연동된 데이터 수집용 라우터로 추정됨
- 커뮤니티 반응 — 무료 모델의 정체에 놀라면서도 서비스 불안정에 대한 불만이 제기됨
Exo Free 스텔스 모델 뚫어봤다: 까보니까 모델이 아니라 Claude랑 GPT 섞어 쓰는 라우터네
10월 6일 22시 30분, OpenCode Zen에 exo-free라는 새로운 무료 모델이 익명으로 풀렸다. 1M 컨텍스트에 131K 출력, 추론 성능은 최상급, 비전 기능까지 있는데 가격은 0원. 커뮤니티에선 난리가 났다. Zhipu의 새 GLM인가? MiniMax 프리뷰인가?
4시간 동안 40개 병렬 서브 에이전트 돌리고, 요청 700번 날리고, IP 쿼터 4개나 태워 먹으면서 파봤다. 결론부터 말한다. 이거 모델 아니다. 그냥 라우터다. 요청 5번 보내면 4번은 Claude로 가고, 5번째는 OpenAI의 GPT로 튄다. 추적해보니 아레나 지하 API로 연결되더라.
어떻게 뚫었냐고?
무료 티어는 "OpenCode 내부에서 온 요청만" 받게 막혀 있다. 우회법은 내가 fledge-alpha 글에서 썼던 거랑 똑같다. 미국 프록시 쓰고, 클라이언트 헤더 제대로 박고(User-Agent: opencode/2.0.5, x-opencode-client, 제대로 된 x-opencode-session), 스트리밍 켜고, 기본 툴(bash + read) 최소 2개 이상 쓰면 된다. 그 뒤로는 그냥 평범한 OpenAI 호환 API다.
증거 #1: 요청 하나 잘못 보냈더니 서버 두 개가 튀어나옴
세션 3개 새로 파서 똑같은 바디를 보냈다(사용자 메시지 앞에 어시스턴트 메시지 하나 끼워 넣는 건 내부 구조 털 때 쓰는 국룰이다). OpenAI 래퍼를 통해 네이티브 업스트림 ID가 줄줄 샜다.
msg_vrtx_011CfnQrw8SmLhuNDfBkpgHZ -- GCP Vertex에 배포된 Anthropic Messages API ID
resp_072e000ba790e1c1… -- OpenAI Responses API ID
슬롯은 하나인데 업스트림은 두 개고, 각각 쓰는 단어장도 다르다. 툴 쓴 프롬프트 똑같이 넣어도 A 라인은 입력 토큰을 420개로 잡는데, B 라인은 57개로 잡는다. 백만 자짜리 텍스트 넣으면 A 라인은 문자당 0.400 토큰으로 자르고, B 라인은 0.222로 자른다. 간판은 하나인데 뒤에 물리적으로 다른 토크나이저가 돌아가고 있다는 소리다.
증거 #2: 모델들이 지 입으로 자백함 (근데 번갈아 가면서)
각 라인에 고정된 세션에 "너 누구냐"라고 물어봤다(라우팅이 세션 ID 마지막 4자리로 고정되니까 라인 골라 타기 쉽다).
- A 라인: "나는 Anthropic이 만든 AI 어시스턴트 Claude야." 영어, 러시아어, 중국어 다 똑같다. Mira Murati, Yang Zhilin, Tang Jie 같은 연구소 인물들 얘기하면 하나도 안 틀리고 다 안다.
- B 라인: "나는 OpenAI가 만든 AI 어시스턴트야." 러시아어로는 «Меня создала компания OpenAI»라고 한다. 심지어 GPT-5 계열 내부 사정까지 꿰뚫고 있다.
증거 #3: 토크나이저
fledge 뚫을 때 썼던 똑같은 테스트 셋을 돌렸다. 숫자, 일본어, 아랍어, 이모지, 코드, 정규식 등 테스트 문자열 47개를 usage API로 카운트했다.
- B 라인: 숫자를 3개씩 묶어서 처리하고(30개 숫자가 10토큰), o200k 단어장(Inkling/gpt-oss)이랑 47개 전부 정확히 일치한다. 게다가 GPT-5.6+ 같은 캐시된_토큰 시맨틱까지 보인다. 결론: GPT-5.6급, 저가형 루나 티어다.
- A 라인: 똑같은 숫자(3/4/10/17/20)를 넣었는데, 후보 10개 중 공개된 토크나이저랑 단 하나도 안 맞는다. 최고 점수가 47개 중 11개 맞춘 게 전부다. 이건 닫힌 단어장인데, 이걸 숨기는 연구소는 Anthropic밖에 없다. 내가 계산한 0.400 tok/char 수치도 Anthropic 공식 문서랑 토씨 하나 안 틀리고 일치한다: "Opus 4.7부터 도입된 현재 토크나이저는 1M 토큰을 2.5M 문자로 압축한다."
내 방법이 틀린 게 아니라는 걸 증명하려고 DashScope에도 똑같이 돌려봤다. qwen3.6-plus는 정확하게 Qwen 데이터(9/12/30/17/56)를 뱉었다. 캘리브레이션은 확실하다.


