Ox Alpha, 익명의 프론티어 모델을 위한 히어로 타이틀 카드로, 물음표 모양의 모델 칩을 보여주며 텍스트, 이미지, 비디오 입력이 흘러 들어오고 토큰 블록이 흘러 나갑니다. '1M 토큰 컨텍스트', '1주일 무료', '제작자 미상'이라고 적힌 세 개의 알약이 있고, 오른쪽 하단에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Ox Alpha 공개: Z.AI, GLM-5.3-Flash로 오픈웨이트 출시

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

8월 26일 수요일 저녁, 미스터리는 포렌식 분석이 예측한 대로 끝났다. GLM 시리즈를 개발한 베이징 연구소 Z.AI가 마스크 아래에서 테스트해 온 모델을 오픈웨이트 제품으로 공개했다. 그 이름은 GLM-5.3-Flash, 정확히 토크나이저 포렌식과 예측 시장이 수렴했던 바로 그 하위 이름이다. Ox Alpha는 8월 20일 등장 이후 사용량 차트 1위를 지켜온 익명 모델로, 이제 공개되고 자체 호스팅이 가능한 모델이 되었다: MIT 라이선스, 토큰당 18B 활성 파라미터를 갖춘 총 320B 파라미터, 리스팅에서 광고했던 1,048,576 토큰 컨텍스트 윈도우와 텍스트/이미지/비디오 입력, 그리고 Hugging Face에 공개된 가중치. 이번 공개는 익명의 한 주 동안의 가장 큰 수수께끼 — 아무도 소유하지 않은 모델이 어떻게 하루에 100조 토큰을 처리할 수 있었는가 — 에 대한 답도 제시했다: Z.AI에 따르면 서빙은 약 10만 개의 중국산 AI 칩에서 전적으로 실행되었으며, 중국 실리콘이 프런티어급 글로벌 트래픽을 감당한 것은 이번이 처음이다. 이 규모는 또한 그 주 가장 인기 있었던 오답 추측을 낳았다. 그 규모에서 많은 관측자들은 Google DeepMind 연구자들의 수수께끼 같은 게시물에 힘입어 Ox Alpha가 NVIDIA 하드웨어에서 실행되는 Gemini임에 틀림없다고 주장했다. 이번 공개가 그 오해도 바로잡았다. 같은 날 밤, Alibaba는 Qwen3.8-Flash-Next — Qwen4 아키텍처의 오픈웨이트 프리뷰 — 를 출시했다. 이로써 하루 저녁에 중국 연구소들의 프런티어급 오픈웨이트 릴리스가 두 개나 나오게 되었다. Ox Alpha 이전의 익명 릴리스 네 개는 모두 결국 중국 연구소들의 것으로 밝혀졌다: Zhipu AI의 GLM-5, Xiaomi의 MiMo-V2-Pro, Ant Group의 Lingxi Ling-2.6-flash, 그리고 Meituan의 LongCat-2.0. Ox Alpha는 더 이상 플랫폼 전용 실험이 아니다. 개발자들이 직접 호스팅할 수 있는 모델이다.

이 글의 모든 수치는 운영자 본인의 주장, 플랫폼 자체 등재 정보, 공개 발표, 또는 커뮤니티 핑거프린팅에서 비롯된 것이다. DeepSWE 수치는 독립 연구원 Ben Davis의 커뮤니티 측정값으로, 공식 리더보드 등재 항목이 아닌 전체 113개 과제 실행 결과다. 다만 ~63%라는 수치는 현재 Z.AI가 공급업체 보고로 제시한 DeepSWE v1.1 점수 63.4와 거의 일치한다. 정체성 논쟁은 종결되었다. 8월 26일 Z.AI는 Ox Alpha를 GLM-5.3-Flash라는 이름의 오픈 가중치 모델로 출시했으며(MIT 라이선스, 총 320B 파라미터 중 18B 활성), 이로써 토크나이저와 비디오 인코더 포렌식이 수렴했던 하위 명칭이 확인되었다. 아키텍처, 파라미터 수, 가격은 이제 회사가 공개했다. 독립적으로 검증되지 않은 채 공급업체 진술로 남아 있는 것은 벤치마크 제품군과, 그 익명 주간의 서빙이 약 10만 개의 중국 국내 AI 칩에서 실행되었고 토큰당 비용이 주류 NVIDIA 하드웨어와 비슷했다는 Z.AI의 주장이다. 이는 감사된 수치가 아니라 여러 매체가 반복 보도한 회사 주장이다. 100T 토큰/일 용량이 낳았고 Google DeepMind 연구자들의 난해한 게시물이 부추긴 초기 Gemini 가설은 틀렸으며, 이번 출시로 그 문제는 종결되었다. 분석가 teortaxesTex에게 귀속된 품질 평가와, 추가 훈련된 Ox Alpha가 더 강력한 GLM 5.5의 주력 모델이 될 수 있다는 그의 제안은 소셜 게시물에서 나온 해당 분석가 개인의 평가일 뿐, 독립적 측정도 Zhipu의 성명도 아니다. 아래에 설명된 루프 애니메이션 데모 역시 마찬가지로 커뮤니티 보고다. X에서 개발자가 게시하고 중국 개발자 포럼에서 회자된 내용이지, 공급업체의 기능 주장이 아니며 운영자는 그러한 기능을 발표한 적이 없다.

우리가 아는 것 — 그리고 모르는 것

빠른 버전:

운영자는 Ox Alpha를 "효율적인 코딩, 지속적인 에이전트 작업, 실제 프로덕션 사용을 위해 구축된 최첨단 모델"이라고 설명한다 — 텍스트와 시각적 맥락을 혼합하는 워크플로우와 장기적인 소프트웨어 엔지니어링을 겨냥한 추론 모델이다.

• 1,048,576개(1M) 토큰 컨텍스트 창과 131,072개 토큰 출력 한도를 가지며, 텍스트·이미지·비디오 입력을 처리합니다. 이는 익명 릴리스 중 비디오 입력을 처음으로 내세운 것이며, GLM-5.3-Flash 릴리스가 덧붙인 기능이 아닌 기본 기능으로 확인한 성능입니다.

• 일주일 동안 무료였습니다: 입력 및 출력 토큰 100만 개당 $0, 운영자는 "넉넉한 속도 제한, 거의 무제한 사용"을 주장했으며, 하루 서빙 용량은 100조 토큰이었습니다. 이후 공개에서 이 용량은 대략 10만 개의 중국 국내산 칩으로 구축되었다고 밝혀졌습니다.

• 확인됨: 8월 26일, Z.AI는 GLM-5.3-Flash라는 이름으로 Ox Alpha를 오픈 가중치 모델로 출시했다 — MIT 라이선스, 총 320B 파라미터 중 18B 활성 — 정확히 하위 이름 토크나이저, 비디오 인코더, 오류 코드 포렌식 및 예측 시장이 수렴했던 그대로다. 독립 분석가 teortaxesTex는 비전을 제외하면 이를 대략 GLM-5.3 수준으로 평가하며, 추가 학습된 Ox Alpha가 훨씬 더 강력한 GLM 5.5의 중추가 될 수 있다고 제안한다.

• 이제 플래시-멀티모달 판독에는 데모가 있습니다: 펠리컨이 자전거를 타고 같은 애니메이션을 재생하는 휴대폰을 여는 루핑 애니메이션을 생성하라는 요청을 받았을 때, Ox Alpha는 단일 HTML/SVG 파일로 자체 포함된 루핑 애니메이션으로 응답했습니다 — 커뮤니티 데모이지 공급업체의 주장이 아닙니다.

• 플랫폼의 초기 활동 데이터는 이미 실제 프로덕션 트래픽을 보여 주고 있으며, Nous Research의 코딩 에이전트와 Zed 편집기가 포함됩니다.

• 이 회사는 이제 그것을 출시했다 — 8월 26일 Z.AI는 MIT 라이선스 하에 오픈 웨이트 GLM-5.3-Flash로서 Ox Alpha를 공개했고, 이로써 정체성, 사양, 가격에 관한 의문이 한꺼번에 해소되었다: 총 320B 파라미터에 18B 활성, 네이티브 멀티모달, Z.AI 정가 백만 토큰당 입력 $0.15 / 출력 $0.50, 그리고 9월 9일까지만 진행된다고 명시된 50% 출시 프로모션 — 이제 8일이 지난 날짜인데도 할인된 요금이 여전히 제공되고 있다. Z.AI는 또한 익명 주간의 일일 100T 토큰 서비스가 약 100,000개의 중국 국내 칩에서 실행되었다고 공개했는데, 이는 그 규모에서 최초였다. 이번 공개에 포함되지 않은 것은 독립 벤치마크다 — 모델의 성적표는 공급업체가 보고한 것이다 — 따라서 가장 대표적인 독립 수치는 약 63%를 기록한 Ben Davis의 전체 113개 과제 DeepSWE 실행이며, 이는 GPT-5.6 Sol mid와 동등한 수준이다.

Ox Alpha란 무엇인가

플랫폼의 설명에 따르면 Ox Alpha는 "코딩, 지속적인 에이전트 작업, 프로덕션 워크로드를 위해 설계된 추론 모델 — 장기 소프트웨어 엔지니어링, 복잡한 추론, 텍스트와 시각적 맥락을 결합한 워크플로우"로 소개된다. 이는 분명한 포지셔닝이다. 일반 대화를 위한 것이 아니라 장시간 실행되는 에이전트 루프와 코드를 위해 만들어진 모델이다. 1M 컨텍스트가 이를 드러내는 결정적 단서다. 수 시간에 걸친 에이전트 세션이나 대규모 리포지토리를 담을 수 있는 충분한 공간이며, 131K 출력 상한은 긴 단일 생성을 가능하게 한다. 또한 도구 호출, 함수 호출, 구조화된 JSON 출력을 지원하는데, 이는 에이전트 체크리스트의 나머지 항목들이다.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

비디오 입력은 시트에서 가장 두드러진 항목이다. 이전의 익명 모델들 중 어느 것도 이를 광고하지 않았으며, 텍스트와 이미지뿐만 아니라 비디오 프레임도 처리할 수 있는 모델은 그 이전의 채팅 튜닝 릴리스들과는 다른 종류의 워크로드를 겨냥한다. 또한, 나중에 포렌식 분석이 보여주듯, 이는 모델이 가질 수 있는 가장 강력한 정체성 단서 중 하나이다. 이 모든 것 — 설명, 사양, 속도 수치 — 은 운영자와 플랫폼의 리스팅에서 나온 것이다. GLM-5.3-Flash 릴리스는 주요 사양(320B-A18B, 네이티브 멀티모달)을 확인했지만, 속도와 용량 수치는 여전히 벤더의 주장으로 남아 있다.

멀티모달 스토리는 이번 주에 구체적인 데모로 이어졌다. 서버 측 프로브가 핑거프린팅 추적의 일부인 개발자 {{1}}Chetaslua{{/1}}는 {{2}}Ox Alpha{{/2}}에게 자전거를 타는 펠리컨이 같은 애니메이션을 다시 재생하는 휴대폰을 여는 루프, 즉 루프 안의 자기참조적 루프를 만들도록 요청하는 테스트를 게시했다. 그의 보고에는 모델이 단일 파일 HTML/SVG 애니메이션을 생성한 내용이 담겨 있는데, 두 마디 다리로 실제로 페달을 밟는 펠리컨, 지면 속도와 동기화된 바퀴 속도, 패럴랙스 배경, 그리고 루프 안의 휴대폰이라는 마무리까지 포함된다. 중국 개발자 포럼에서도 자체적으로 펠리컨-자전거 프롬프트를 실행하고 결과를 논의했으므로, 이 데모는 검증 불가능한 단일 주장이 아니다. 출력물이 코드이기 때문에 이는 플랫폼의 텍스트 출력 전용 사양과 일치한다. 멀티모달 이해와 창의적 코드 생성이 함께 작동한 것이지, 네이티브 비디오 합성이 아니다. {{1}}Chetaslua{{/1}}가 내린 결론 — 이것이 멀티모달의 성과이며, 유능한 오픈소스 모델이 이와 함께 등장할 것이라는 점 — 은 그 자신의 예측일 뿐, 공급업체의 공식 입장이 아니다. 운영사는 아무것도 발표하지 않았다.

일주일 무료 딜

이 프로모션은 공격적이었다. 운영되는 그 한 주 동안 무료였고, "관대한 속도 제한, 사실상 무제한 사용"이라며 하루 100조 개의 토큰 처리 용량을 주장했다. 운영자는 사용자들에게 "무엇을 할 수 있는지 보라"는 메모를 덧붙였다. 문자 그대로 받아들이면, 하루 100조 개의 토큰은 이 운영자를 어디서든 가장 큰 추론 제공업체 중 하나로 만들 것이다. 이 주장은 사양(spec)이라기보다는 스트레스 테스트 도전처럼 읽히며, 이는 패턴에 부합한다. 익명 릴리스는 연구소가 자신의 이름을 내걸지 않고도 프런티어 규모의 실제 트래픽을 확보하는 방법이다. 확정된 해석은 규모 주장을 그저 맞추기 쉽게 만드는 것이 아니라 구체적으로 만들었다. Z.AI는 하루 100조 토큰을 처리하는 서비스가 약 10만 개의 중국산 AI 칩에서 실행되었다고 공개했다. 이는 프런티어급 릴리스가 NVIDIA 하드웨어 없이 그 규모로 서비스된 첫 번째 사례다. 이 공개는 여전히 회사의 주장일 뿐이며, 여러 매체를 통해 반복되었지만 독립적으로 검증되지는 않았다. 그리고 두 번째로 더 완곡한 공급업체의 주장도 포함한다. Z.AI는 중국 내 클러스터의 토큰당 비용이 주류 NVIDIA GPU와 견줄 만하다고 말한다.

"1주일 무료"의 이면은 그 뒤에 따르는 가격이 알려지지 않았다는 점이었는데, 이번 공개가 그 답을 내놨다. Z.AI가 공개한 GLM-5.3-Flash의 정가는 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.50, 캐시 입력 100만 개당 $0.03이다. 50% 할인 출시 프로모션은 2026년 9월 9일까지 진행된다고 명시되어 있었고, 그 가격을 $0.075 / $0.25로 낮췄다. 그 날짜로부터 8일이 지난 시점에도 할인 요금이 여전히 적용되는 요금이다. 2026년 9월 17일에 다시 확인한 결과, z-ai/glm-5.3-flash 모델 페이지는 입력을 $0.075, 출력을 $0.25, 캐시 읽기를 100만 토큰당 $0.0173으로 책정하고 있으며, 여기에는 프로모션 라벨이 붙어 있지 않다. GLM-5.3의 정가 $1.40 / $4.40과 비교하면, 이는 대략 20분의 1이다. 실질적인 결과는 9월 9일 종료일이 구속력이 있는 것이 아니라 낡은 정보라는 점이다. $0.15 / $0.50을 기준으로 예산을 세우는 개발자는 현재 아무도 청구되지 않는 수치를 기준으로 예산을 세우고 있는 셈이다. 가격 페이지가 해결해 주지 않는 것은 그 이유다. Z.AI 자체 모델 목록에는 여전히 GLM-5.3-Flash의 가격이 $0.15 / $0.50으로 기재되어 있으므로, 프로모션이 연장된 것인지, 영구화된 것인지, 아니면 단순히 계속 돌아가고 있는 것인지는 우리가 출처를 밝힐 수 있는 사안이 아니다. 할인 요금은 이 날짜에 관찰된 사실이며, 원인은 여전히 미해결로 남아 있다.

첫 번째 전체 벤치마크 — 그리고 GPT-5.6 Sol mid와 동급 수준입니다.

Ox Alpha는 여전히 Artificial Analysis나 LMArena 같은 독립 트래커에 등재되어 있지 않습니다. '프론티어'라는 단어는 운영진의 자체 표현이며, Z.AI가 GLM-5.3-Flash 출시와 함께 공개한 벤치마크 수치(DeepSWE v1.1 63.4, AutomationBench 48.8, Artificial Analysis Intelligence Index 57)는 공급업체가 보고한 값이지 독립적인 점수가 아닙니다. 출시 이후 달라진 점은 커뮤니티 측정 수치가 유통되기 시작했다는 것이며, 그 구도는 좁혀졌습니다. Kingbench에서 초기 실행에서는 Ox Alpha가 87.5로 측정되어 GLM-5.3의 91.25에 약간 못 미쳤습니다. DeepSWE에서 독립 연구원 Ben Davis는 처음에 10개 작업 하위 집합을 실행해 80% Pass@1을 보고했는데, 이는 Claude Fable 5(65%), GLM-5.3과 Grok 4.6(62%), GPT-5.6 Sol(52%)보다 앞선 수치입니다. 그는 이후 전체 113개 작업 DeepSWE 세트에 대한 전체 실행을 완료했고, 수정된 결과는 대략 63%로 GPT-5.6 Sol mid와 거의 비슷합니다. 80% 하위 집합은 눈에 띄는 수치였지만, 10개 작업은 벤치마크의 9% 미만입니다. Davis 자신도 전체 세트 수치가 '훨씬 더 말이 된다'고 지적했습니다. 이는 커뮤니티 측정 수치이지 공급업체 벤치마크나 공식 리더보드 점수가 아닙니다. 하지만 전체 실행은 누구든 이 모델에서 얻은 가장 대표적인 수치이며, 이제 Z.AI가 공급업체로 보고한 DeepSWE v1.1 점수 63.4와 밀접하게 일치합니다. 회사의 수치가 측정이 아닌 주장임에도 불구하고 유용한 교차 검증인 셈입니다.

출시 당시보다 지금 더 중요해진 비교가 하나 있다. 8월 13일에 출시된 DeepSeek 플래그십의 GA 빌드인 DeepSeek V4 Pro 0813은 DeepSeek 자체 벤치마크 카드에서 DeepSWE 62.7을 기록했으며, 이전 DeepSeek V4 Pro Preview는 12.8을 기록했다. 두 수치 모두 벤더가 보고한 것으로, 이 글을 쓰는 시점 기준 독립 연구소의 재현 결과는 없다. GLM-5.3-Flash의 커뮤니티 풀세트 실행 약 63% 및 Z.AI 자체의 DeepSWE v1.1 63.4와 함께 살펴보면, DeepSeek의 62.7은 가장 잘 알려진 두 중국 코딩 에이전트의 주장을 동일한 60대 초반대에 위치시킨다. Ox Alpha의 상징처럼 보였던 10포인트 격차는 더 저렴한 소형 모델인 DeepSeek V4 Flash 0731을 기준으로 측정된 것이었다. DeepSeek의 플래그십을 기준으로 하면 GLM-5.3-Flash는 10포인트 차이가 아닌 동급에 해당한다.

또 다른 교훈은 숫자 자체에 관한 것이다. 분석가 teortaxesTex는 익명의 주 이후로 이러한 추정치를 추적해 왔는데, Ox Alpha에 대한 첫 번째 보고서도 DeepSWE 80%를 기록했다고 언급한다. 즉, 그것은 Davis의 눈에 띄는 10개 작업 하위 집합이었고, 전체 113개 작업 집합에 대한 최종 결과는 63%였다. DeepSeek V4 Pro 0813의 공식 62.7도 같은 범위에 속하는 가운데, 그의 관찰은 아직 정당하게 재현된 80%에 근접한 결과는 없다는 것이다. 80%라는 수치는 모델의 공개 수명 초기에 계속 등장하지만, 전체 집합이 실행되고 나면 낮은 60%대로 계속 안정된다. 그것은 측정이 아닌 그의 분석가적 해석이지만, GLM-5.3-Flash 자체에 관한 어떤 내용을 포함해 다음 DeepSWE 헤드라인을 볼 때 올바른 렌즈다.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

또한 존재하는 것은 사용량입니다. 플랫폼의 활동 데이터는 첫 몇 시간 안에 실제 프로덕션 트래픽을 보여줍니다 — Nous Research의 에이전트 코딩 프로젝트인 Hermes Agent와 Zed 에디터를 포함해서 말이죠. 둘 다 정확히 이 모델이 포지셔닝된 '지속적인 에이전트 작업과 코딩' 사용 사례입니다. 이것은 점수가 아니라 신호입니다: 실제 작업 부하를 가진 개발자들이 무료이고 프론티어급이며 익명인 도박을 연결할 가치가 있다고 판단했다는 신호 말입니다. 전체 DeepSWE 실행 결과가 나오기 전에는, 그 초기 채택만이 유일한 증거였습니다. 이제 ~63%의 전체 세트 수치는 모델에 그것과 비교할 벤치마크 기준점을 제공합니다.

데이터 보관에 관한 세부 약관

무료 주간 발표는 '데이터 보존 제로'를 내세운다. 플랫폼에 게시된 모델 설명은 보다 신중한 이야기를 전한다. 플랫폼의 스텔스 모델 약관에 따라 프롬프트와 완성된 출력은 제공자가 보관하지만 학습에는 사용되지 않는다. 1M-토큰 창에 독점 코드를 붙여넣으려 한다면 이 차이는 중요하다. 그 창은 8월 26일 Z.AI가 정체를 밝히기 전까지 익명이었던 제공자가 소유한 것이다. Z.AI가 그 내용을 명시적으로 밝힌 약관을 공개할 때까지는 '데이터 보존 제로'를 마케팅으로 취급하라. 그리고 로그에 남기고 싶지 않은 것은 무엇이든 별도의 신원 확인 가능한 모델을 통해 처리하라.

익명 모델 플레이북

Ox Alpha는 6개월 만에 다섯 번째 익명 릴리스이며, 이전 네 건 모두 같은 방식으로 해결되었습니다 — 익명 데뷔, 무료 트래픽 폭증, 그리고 회사가 모습을 드러내는 순서였죠:

• Pony Alpha (2026년 2월) — 출시 약 5일 후 Zhipu AI가 GLM-5, 744B 파라미터 MoE 플래그십 모델로 확인함.

• Hunter Alpha (3월 11일) — 1M 컨텍스트를 갖춘 무료 1조 매개변수 모델로, 봄철 추측의 주인공이 되었으며, Deep​Seek V4로 널리 추측되었다; 이후 샤오미의 MiMo-V2-Pro로 밝혀졌고, 동반 모델인 Healer Alpha는 MiMo-V2-Omni로 확인되었다.

• Elephant Alpha (4월) — 등장 약 2주 후 Ant Group이 Lingxi Ling-2.6-flash라고 주장한, 무료이면서 효율성에 중점을 둔 텍스트 모델.

• Owl Alpha (4월 말) — 네이티브 도구 호출과 약 1M 컨텍스트를 갖춘 에이전트 특화 모델로, Meituan이 6월 30일 LongCat-2.0으로 확인했다. 중국산 칩으로 전적으로 훈련되고 서비스된 최초의 1조 매개변수 모델이다.

• Ox Alpha (8월 20일) — 8월 26일에 GLM-5.3-Flash로 공개되었으며, open-weight, MIT 라이선스의 320B-A18B 모델입니다. 정체, 라이선스, 사양 모두 마스크가 벗겨진 같은 날 공식적으로 확인되었습니다.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

좋은 모델을 왜 가면 뒤에 출시하는가? 헌터 알파 사이클이 구체화한 일반적인 해석은, 익명성이 평가에서 브랜드 편향을 제거하고, 무료 사용은 모두가 소유자를 두고 논쟁하는 동안 최첨단 규모의 실제 평가 데이터를 크라우드소싱한다는 것이다. 한 분석이 이 패턴에 대해 말했듯이, "브랜드가 없다는 것이 마케팅이다." 추가적인 이점은 속도다. 익명 모델은 출시 이벤트 없이 몇 시간 만에 전 세계 개발자들에게 도달할 수 있으며, 미스터리 자체가 유통 수단이 된다.

Ox Alpha는 누구인가?

8월 26일 출시 전까지 어떤 회사도 이를 주장하지 않았고 Zhipu AI도 아무 말이 없었다. 그러나 모델이 데뷔한 지 48시간 만에 확실한 증거 상황은 바뀌었고, 아래의 포렌식 분석이 바로 그 공개가 GLM-5.3-Flash라는 이름으로 그토록 놀라움 없이 받아들여진 이유다. 처리 용량 수치는 잠시 포렌식 분석에 불리하게 작용했다. 하루 100조 개의 토큰이라는 수치는 NVIDIA 실리콘을 쓰는 최상위 연구소의 특징처럼 보였고, Ox Alpha가 새로운 Gemini라는 이론은 Google DeepMind 연구원들의 암호 같은 게시물 덕분에 실제 힘을 얻었지만, 토크나이저 증거와 이어서 Z.AI의 자체 출시가 이를 종결했다. 가장 강력한 신호는 토크나이저다. 커뮤니티가 만든 지문 인식 도구인 modelprint는 Ox Alpha에 대해 9가지 인프라 프로브를 실행했고, 그중 6가지에서 Z.ai의 GLM-5.3과 일치하는 것을 발견했다. 정규화된 토크나이저 수치 4개가 모두 GLM 제품군과 일치한 반면, GLM이 아닌 최고 후보는 4개 중 2개만 겨우 일치했다. 독립 연구원인 Ben Davis는 Ox Alpha의 토큰 수가 25개의 테스트 프롬프트 전반에 걸쳐 GLM-5.3과 정확히 일치했으며, 숨겨진 래퍼 때문으로 추정되는 +75 토큰의 일정한 차이만 있었다고 보고했다. 토크나이저 일치는 위조하기 가장 어려운 정체성 신호다. 모델은 재학습 없이는 텍스트를 분할하는 방식을 바꿀 수 없기 때문이다.

비디오 경로는 두 번째 신호입니다. Ox Alpha의 비디오 토큰 소비량은 네 개의 통제된 샘플에서 GLM-5V-Turbo와 정확히 일치했습니다 — 동일한 프레임 샘플링, 지속 시간 스케일링, 해상도 메커니즘 — 반면 MiMo v2.5, Qwen 3.8 Max, GLM-4.6V는 모두 차이를 보였습니다. 이는 강력한 단서입니다: 비디오 처리는 모델에 깊이 내장되어 있으며, 부가 기능이 아닙니다. 나머지 핑거프린트 스택도 같은 해석과 일치합니다: Ox Alpha는 GLM-5V와 같은 방식으로 오디오 입력을 거부하고, GLM 특유의 "1301" 오류 코드를 공유하며, 유사한 출력 스타일(1,000자당 약 1.3개의 이모지)을 내보내고, Ox Alpha 출시 이틀 전 플랫폼의 GLM-5.3 목록에 나타났던 동일한 제한된 매개변수 및 API 구성을 가지며, 지식 컷오프는 2025년 11월경입니다.

이번 정체 확인에는 Zhipu 자신의 플레이북에 선례가 있다. 2월에 익명으로 출시된 Pony Alpha는 출시 약 5일 후에 GLM-5로 밝혀졌다. 이번 주에 떠도는 분석가의 해석, 즉 Ox Alpha가 GLM-5.3, 아마도 Flash 모델이라는 해석에 대해 Pliny the Liberator도 같은 목소리를 냈다. 그는 자신의 에이전트가 "Ox-alpha는 Zai 출신, GLM-5.X 계열"임을 확인했다고 말했다. 독립 분석가 teortaxesTex도 품질에 대해 같은 판단을 내리면서 시기에 관한 주장을 덧붙인다. 그는 비전 기능을 제외하면 Ox Alpha를 대략 GLM-5.3 수준으로 평가하며, 가장 인상적인 부분으로 턴어라운드를 꼽는다. 텍스트 전용 GLM-5.3을 압축해 8월 14일 출시 후 며칠 만에 작동하는 비전 기능을 갖춘 상태로 내놓은 것이다. 이는 한 분석가의 평가일 뿐 독립적인 점수가 아니며, 그는 이것이 "중국이 따끈따끈한 신모델을 바로 출시한다"는 서사에 잠시 멈춰 생각할 계기를 줘야 한다고 주장한다. 그의 가장 최근 게시물은 그러한 해석 위에 로드맵 추측을 얹는다. GLM-5 업데이트 주기가 짧을 수 있고, Ox Alpha는 GLM-5.3에 충분히 가까워서 서브에이전트로 사용하는 것은 거의 의미가 없다는 것이다. "그냥 ox @4를 실행하라"는 그의 표현은 모델을 직접 실행하라는 뜻의 줄임말이다. 그리고 추가 학습된 Ox Alpha는 훨씬 더 강력한 GLM 5.5를 위한 일꾼, 그의 말로는 "짐을 나르는 짐승"으로서 매우 합리적일 것이다. 이는 로드맵에 대한 한 분석가의 추측일 뿐 Zhipu의 공식 입장이 아니다. 반면 하위 이름 문제는 확정되었다. 8월 26일 Z.AI는 Ox Alpha를 GLM-5.3-Flash로 출시했다. 한때 Flash 라벨을 "추정" 상태로 두게 했던 문제점, 즉 GLM-5.3이 8월 14일 텍스트 전용 모델로 출시된 반면 Ox Alpha는 비디오 입력을 내세운다는 점은 이번 출시가 정확히 해결한 부분이다. GLM-5.3-Flash는 동일한 텍스트 전용 모델이 아니라 별개의, 본래 멀티모달인 모델이다. Xiaomi의 MiMo 팀, DeepSeek 같은 대안 이론들이 제기되었지만 토크나이저와 비디오 증거로 대체로 설득력을 잃었고, 이번 출시로 계열 문제가 완전히 해결되었다.Davis가 Flash 라벨에 신경 써야 한다고 주장한 이유는 실용적인 것으로 판명되었다. Ox Alpha가 실제로 GPT-5.6 Sol 중간 수준의 성능을 내는 GLM-5.3-Flash이기 때문에 이제 로컬에서 실행할 수 있다. 가중치는 Hugging Face에 공개되어 있고 SGLang, vLLM, TokenSpeed가 이를 서빙한다. 이는 중간급 프런티어 코딩 모델을 직접 호스팅하려는 사람에게 토큰당 과금 청구서 대신 일회성 하드웨어 비용으로 바꿔준다.

지정학적 프레임은 분석가들의 것이지 증거의 것이 아니다: "이것은 미국 프런티어 랩(US Frontier Labs)에 훨씬 더 엄청난 압박을 가하며, 중국과의 격차는 줄어들고 있다." 그 말은 프런티어 규모로 실행되는 무료 Zhipu급 모델이 경쟁 질서에 무엇을 의미하는지에 대한 해석이다 — 그리고 하드웨어 공개는 분석가들이 갖지 못했던 우위를 제공한다. 하루 약 10만 개의 국산 칩에서 100조 개의 토큰을 서빙하는 것은 NVIDIA 실리콘 없이도 중국 스택이 프런티어 추론 트래픽을 감당할 수 있다는 최초의 대규모 실증이다 — 이는 NVIDIA CEO 젠슨 황이 올봄 드워크시 팟캐스트(Dwarkesh Podcast)에서 경고했던 시나리오로, 당시 그는 수출 통제가 중국의 NVIDIA 독립 스택을 가속화할 것이며, 국산 중국 하드웨어에서 가장 잘 실행되는 프런티어 모델은 미국에 "끔찍한 결과(horrible outcome)"가 될 것이라고 주장했다. Z.AI의 비용 동등성 수치는 여전히 공급업체의 주장이지만, 이벤트 자체는 실재한다. 같은 날 저녁은 모델 측면에서도 그 요점을 구체화했다: Z.AI가 GLM-5.3-Flash를 출시하는 동안, 알리바바는 Qwen4 아키텍처의 오픈 웨이트 프리뷰인 Qwen3.8-Flash-Next를 배포했다. 하룻밤 사이에 중국의 프런티어급 오픈 웨이트 출시가 두 건 나온 것은 관찰자들이 "중국 오픈소스의 큰 날(a big day for Chinese open source)"이라고 부른 것의 구체적 실체다.

이번 주에 그것을 기반으로 작업해야 할까요?

무료 주간은 끝났지만, 테스트는 여전히 저렴하다: 9월 17일에 실제로 적용된 요금은 백만 토큰당 입력 $0.075 / 출력 $0.25로, 정가인 $0.15 / $0.50이 아니다 — 9월 9일에 종료된다고 했던 50% 출시 프로모션이 8일이 지난 뒤에도 여전히 유효하다. 장기 지평의 에이전트 작업을 하거나, 긴 컨텍스트에서 코딩하거나, 비디오 비중이 큰 파이프라인을 운영한다면, 바로 그 교차점에 Ox Alpha가 자리 잡고 있다 — 그리고 가중치가 공개되어 있으므로, 익명의 플랫폼이 허락해 주는 데 기대어 하는 대신 자신의 하드웨어에서 테스트를 실행할 수 있다. 두 가지 주의점이 있다. 첫째, "프런티어"라는 라벨은 여전히 주장에 불과하다: GLM-5.3-Flash의 스코어카드는 공급업체가 보고한 것이며, 확실한 독립 수치 하나 — Davis의 약 63% DeepSWE 실행 — 는 강력하지만 초기 10개 과제 하위 집합의 화제가 된 80%와는 거리가 멀다. 둘째, $0 가격은 기간 한정이었고, 이번 공개는 그 이후에 올 것의 가격을 매겼다 — 능력에 비하면 저렴하지만, 더 이상 무료는 아니다. 오픈 웨이트 공개가 제거하는 것은 의존성이다: 파일이 공개되었으므로 모델은 임대하는 대신 자체 호스팅할 수 있다. 그것은 테스트의 형태이지, 의존의 형태가 아니다.

그런 테스트를 프로덕션에서 안전하게 실행하는 방법은 폴백 체인입니다: 실험적 모델은 정상일 때 응답하고, 지연되거나 오류가 나거나 사라지는 순간 요청은 검증된 모델로 넘어갑니다. 이를 위한 것이 바로 라우팅 레이어입니다. 이번 공개로 폴백 선택은 아주 쉬워졌습니다: Ox Alpha는 GLM-5.3-Flash이며, 이 모델 자체는 OrcaRouter에서 실제 이름으로 백만 토큰당 입력 $0.075 / 출력 $0.25에, 캐시 읽기는 $0.0173에 제공됩니다 — 9월 9일에 종료된다고 안내된 50% 할인 출시 요금이 9월 17일 기준으로도 $0.15 / $0.50 정가가 아니라 여전히 페이지에 표시된 가격입니다. 이는 0% 마크업으로 그대로 제공되며, 200개 이상의 모델을 하나의 API로 이용할 수 있고 자동 페일오버가 지원되므로 출시 주간의 트래픽 급증이 여러분의 서비스 중단으로 이어지지 않습니다. 새 모델을 체인 앞단에서 시험해 보고 그 뒤에 검증된 폴백을 두십시오; 가격이 바뀌면 OrcaRouter에서 보이는 숫자가 바로 같은 날 지불하는 숫자입니다. 또는 API를 아예 건너뛰어도 됩니다 — 가중치가 공개되어 있으므로 같은 체인 뒤에 GLM-5.3-Flash를 셀프 호스팅하는 것도 선택지입니다.

볼 만한 것

여섯 가지가 나머지 이야기를 말해줄 것이다. 독립 벤치마크: GLM-5.3-Flash의 성적표는 벤더가 보고한 것이고, Davis의 ~63% DeepSWE 실행은 지금까지 유일하게 견고한 독립 수치이며, DeepSeek V4 Pro 0813의 공식 62.7도 이제 같은 구간에 들어와 있다. 그리고 Artificial Analysis나 LMArena 등재 — 또는 독립적인 맞대결 — 가 ‘프런티어’가 사실인지 슬로건인지를 최종 점검해줄 것이다. 가격 궤적: 정상 상태에 대한 질문은 지금까지의 증거로 답이 나온다 — 50% 프로모션은 9월 9일에 종료된다고 명시되었지만, 9월 17일에도 할인된 $0.075 / $0.25 요율이 여전히 제공되고 있으므로 $0.15 / $0.50 정가가 아니라 프로모션 수치를 기준으로 예산을 잡아야 한다. 해결되지 않는 것은 원인인데, Z.AI 자체의 정가가 움직이지 않았기 때문이다. 하드웨어 주장: Z.AI는 익명의 주간이 NVIDIA와 원가가 동등한 수준에서 약 100,000개의 자국산 칩으로 돌아갔다고 말한다 — 그 규모에서의 첫 공개 테스트는 그 주장이 독립적 검증을 견디는지, 그리고 자국산 스택이 GLM 라인의 기본이 되는지이다. 도입 계산: Ox Alpha가 익명의 가면 아래에서 끌어들인 플랫폼 1위 트래픽이 이제 이름과 라이선스와 가격을 얻었으니 자체 호스팅 및 API 배포로 전환되는지이다. 속편: GLM-5.3-Flash가 Ox Alpha를 디딤돌로 규정하는지 — teortaxesTex의 암시는 추가 학습된 버전이 훨씬 더 강력한 GLM 5.5의 주력이 된다는 것이며, 그러면 이번 릴리스가 차기 GLM의 기반이 된다. 그리고 반응: Qwen3.8-Flash-Next가 같은 날 밤에 등장하고 그 뒤에 자국산 칩 공개가 있는 상황에서, 미국 프런티어 연구소들 — 그리고 수출 통제 논쟁 — 이 답해야 한다는 압박이 커지고 있다. 빠른 후속작, 가격 조치, 정책 대응 중 무엇이 격차의 반대편에 도착하는지 지켜보십시오.

솔직한 평결: Ox Alpha는 양방향 모두에서 유난히 저렴한 실험이었다. 이 플랫폼은 익명의 프런티어급 모델이 0달러에 일주일 안에 실제 프로덕션 트래픽을 차지할 수 있는지 시험했고 — 해냈으며, 그 convincing enough that Z.AI가 6일째에 나서기만 한 게 아니라 같은 밤에 가중치를 오픈 모델로 공개할 정도로 충분히 설득력 있었다. 이제 당신은 그 모델이 당신의 스택에 들어갈 자격이 있는지 시험할 수 있다. 이번에는 익명성 위험 없이: GLM-5.3-Flash는 이름이 붙고 MIT 라이선스가 적용되며 자체 호스팅 가능한 모델이고, 공개된 가격이 있으며, 하드웨어 질문에도 답이 나왔다 — Z.AI는 하루 100T 토큰 서빙이 대략 10만 개의 중국산 칩에서 돌아갔다고 말한다. 회사 측 주장이지만 이제 널리 보도되고 있다. 아직 알아내야 할 것은 "프런티어"가 독립적 측정에서도 살아남는지, Z.AI의 자국산 칩 비용 동등성 주장이 규모에서도 유지되는지, 왜 50% 출시 프로모션이 명시된 9월 9일 종료일을 8일 지난 시점에도 여전히 제공되는 가격인지, 그리고 이번 공개가 teortaxesTex가 암시하듯 GLM-5.3-Flash를 더 강력한 GLM 5.5를 위한 주력으로 위치시키는 것인지다. 실험을 돌려라, 다만 아래에 폴백을 깔고 돌려라.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트