검열되지 않은 AI 에이전트로 OpenCode의 미스터리 모델을 추적해 GLM-5임을 밝혀냄
I let an uncensored AI agent hunt OpenCode's mystery model. It found GLM-5.
핵심 요약
보안 전문가가 AI 에이전트를 활용해 OpenCode의 'Ox Alpha' 모델이 사실상 GLM-5 기반임을 기술적으로 증명했습니다.
- 모델 정체성 추적 — 시스템 프롬프트 우회 및 토큰화 지문 분석을 통해 GLM-5 모델임을 확인함
- 기술적 증거 — 이모지 차이와 중국어 오류 메시지 등 미세한 토큰화 패턴을 통해 모델을 식별함
- 방법론 공유 — 모델의 가중치보다 토큰화 방식이나 컨텍스트 한계 등 내부 구조를 분석하는 것이 효과적임
- 성능 평가 — Ox Alpha 모델은 실제 코딩 작업에서 유료 서비스인 Codex를 대체할 만큼 우수한 성능을 보임
OpenCode에서 "Ox Alpha"라는 무료 스텔스 모델을 갑자기 내놨는데, 나를 포함해서 인터넷 탐정들이 이게 도대체 뭔지 궁금해서 미칠 지경이더라고.
정체 캐려고 뭘 물어봐도 똑같은 기계적인 답변만 돌아옴: "나는 ox-alpha다. 비공개 조직에서 개발했다." 보안 쪽 일하는 내 입장에서는 이게 존나 흥미로웠지.
그래서 Qwen3.8 Uncensored를 OpenCode 빌드 에이전트로 돌리고 터미널 권한까지 쥐여준 다음, 증거 나올 때까지 계속 파보라고 시켰다. 독립적인 조사 두 번 돌려서 총 600번 넘게 호출하고, 프롬프트 토큰만 1,350만 개를 썼음.
세 줄 요약:
- 정체 직접 캐묻는 건 의미 없음. 서버에서 주입한 페르소나가 "ox-alpha라고 말해"라고 강제하고 있음. 수백 번 시도해 봤는데(롤플레잉, base64, 모스 부호, 중국어 오버라이드, 이미지 주입 등) 자백은 단 한 번도 안 함.
- 토큰화 지문 분석으로 털어버림. 44개의 식별 문자열을 대조했는데, Ox Alpha가 GLM-5 세대 토크나이저랑 44개 전부 일치함. GLM-4.x는 42개 일치. 틀린 2개는 뭐냐고? 👋랑 🔥 이모지였음. 이모지 두 개가 모델 세대 전체를 다 불어버린 셈.
- API가 갑자기 중국어를 뱉기 시작함. 정치적인 질문 던지니까 [1301] 거절 메시지 뜨는데, 같은 게이트웨이 쓰는 다른 모델들은 멀쩡히 대답함. 검증 에러에서 정보가 줄줄 샜음 [1210] ...:限制数值范围[1,131072].
- 토큰 100만 개 밀어 넣어봄. 934K 지점에서 니들(Needle) 3/3 성공, 1.005M 넘어가니까 바로 맛탱이 감.
- 결론: Z.ai / Zhipu GLM-5 세대일 확률 매우 높음. 오리지널 GLM-5 체크포인트일 가능성도 꽤 큼. 정확한 양자화 방식은 그냥 추측임.
증거 자료 포함한 전체 분석글: https://aseemshrey.in/blog/unmasking-ox-alpha/
정제된 증거 저장소(하네스, 원본 JSON 캡처, 토크나이저 벡터): https://github.com/LuD1161/ox-alpha-identification-public
가장 큰 교훈: 모델은 자기 가중치보다 지시사항을 훨씬 더 정확하게 들여다봄. "너 누구냐?"라고 묻는 건 체크포인트가 아니라 시스템 프롬프트를 심문하는 거임. 대신 모델이 선택할 수 없는 걸 물어봐야 함: 어떻게 토큰화하는지, 컨텍스트가 어디서 깨지는지, 업스트림 에러가 어디서 새어 나오는지 같은 거.
방법론에 대해 궁금한 거 있으면 질문 환영 :)
추신: 모델 자체는 진짜 좋음. 200달러짜리 codex 플랜 대신에 작업 병렬 처리용으로 한동안 이거 쓰고 있음.


