「Ox Alpha(匿名のフロンティアモデル)」のヒーロータイトルカード。クエスチョンマークの形をしたモデルチップが描かれ、テキスト・画像・動画の入力が流れ込み、トークンブロックが流れ出る様子が示されている。『100万トークンのコンテキスト』『1週間無料』『製作者不明』という3つのピルが付き、右下にはOrcaRouterのロゴが合成されている。
Guides & Insights

Ox Alphaの正体が明らかに:Z.AI、GLM-5.3-Flashとしてオープンウェイトで公開

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

8月26日(水)の夜、その謎はフォレンジック分析が予告したとおりの結末を迎えた。GLMシリーズを手がける北京の研究所Z.AIは、身元を隠してテストしていたモデルをオープンウェイト製品として公開した。その名もGLM-5.3-Flash——トークナイザーのフォレンジック解析と予測市場がともに収斂していた、まさにそのサブネームである。Ox Alphaは、8月20日に出現して以来、利用チャートのトップを走り続けてきた匿名モデルだ。今や正式公開され、セルフホスト可能なモデルとなった。MITライセンス、総パラメータ320B(1トークンあたり18Bがアクティブ)、1,048,576トークンのコンテキストウィンドウ、リストに記載されていたテキスト・画像・動画の入力に対応し、ウェイトはHugging Faceで公開されている。今回の公開は、匿名の1週間における最大の謎——誰の所有でもないモデルが、どうして1日100兆トークンを処理できたのか——にも答えを出した。Z.AIによると、そのサービングはすべて中国国産の約10万枚のAIチップ上で実行されており、中国製シリコンがフロンティア級のグローバルトラフィックを担ったのはこれが初めてだという。この処理能力は、今週最も広まった誤った推測も生んでいた。この規模なら、Google DeepMindの研究者たちの謎めいた投稿に後押しされた多くの観測筋が、Ox AlphaはNVIDIAハードウェア上で動作するGeminiに違いないと主張するのも無理はない。そして今回の公開はその誤解も正した。同じ夜、AlibabaはQwen3.8-Flash-Nextをリリースした。Qwen4アーキテクチャのオープンウェイトプレビュー版である。ひと晩のうちに、中国の研究所からフロンティア級のオープンウェイトモデルが2件リリースされたことになる。Ox Alpha以前に登場した匿名リリース4件は、最終的にすべて中国の研究所によるものと判明した。Zhipu AIのGLM-5、XiaomiのMiMo-V2-Pro、Ant GroupのLingxi Ling-2.6-flash、そしてMeituanのLongCat-2.0である。Ox Alphaはもはやプラットフォーム限定の実験ではない。開発者がセルフホストできるモデルなのだ。

この記事内のすべての数値は、運営者自身の主張、プラットフォーム公式の掲載データ、公開発表、またはコミュニティによるフィンガープリンティングに基づくものである。DeepSWEの数値は、独立系研究者であるBen Davis氏によるコミュニティ測定値であり、公式リーダーボードへの登録ではなく、全113タスクを実行した結果である。もっとも、約63%という数値は、Z.AIがベンダーとして報告したDeepSWE v1.1のスコア63.4と現在ほぼ一致している。正体をめぐる疑問は解決済みである。8月26日、Z.AIはOx AlphaをGLM-5.3-Flashという名称でオープンウェイトモデルとしてリリースした。MITライセンス、総パラメータ数320B(うちアクティブ18B)であり、トークナイザーとビデオエンコーダーのフォレンジック分析が収束していたサブ名称を裏付けるものとなった。アーキテクチャ、パラメータ数、価格は現在、企業が公表済みである。独立した検証ではなくベンダー表明のまま残っているのは、ベンチマークスイートと、「匿名週」の推論処理が約10万枚の中国国産AIチップ上で実行され、トークンあたりのコストが主流のNVIDIAハードウェアと同等だったとするZ.AIの主張である。これは監査済みの数値ではなく、複数のメディアが繰り返し報じてきた企業主張にすぎない。1日あたり100T(100兆)トークンの処理容量が生み出し、Google DeepMind研究者らによる謎めいた投稿が後押ししていた初期のGemini仮説は誤りであり、今回のリリースによって決着がついた。アナリストteortaxesTex氏に帰属される品質評価、および「さらに訓練を施したOx Alphaが、より強力なGLM 5.5の主力モデルになり得る」という同氏の示唆は、ソーシャル投稿における同アナリスト自身の評価であり、独立した測定結果でもZhipu(智譜)の公式声明でもない。後述のループアニメーションデモも同様にコミュニティの報告であり、X上の開発者による投稿が中国の開発者フォーラムで拡散されたものであって、ベンダーの機能主張ではない。運営者もそのような機能については一切発表していない。

我々が知っていること ― そして知らないこと

簡潔版:

• 運営元はOx Alphaを「効率的なコーディング、持続的なエージェント作業、そして現実世界でのプロダクション利用のために構築されたフロンティアモデル」と説明している。これは、長期的なソフトウェアエンジニアリングや、テキストと視覚的コンテキストを組み合わせたワークフローを対象とした推論モデルである。

1,048,576トークン(100万)のコンテキストウィンドウ、131,072トークンの出力制限を備え、テキスト・画像・動画の入力に対応——動画入力を宣伝する匿名リリースとしては初めてであり、GLM-5.3-Flashリリースは、この機能が後付けではなくネイティブであることを裏付けている。

• 1週間無料だった:入力・出力ともトークン100万個あたり0ドルで、運営者は「寛大なレート制限、ほぼ無制限の利用」を謳い、1日あたり100兆トークンの処理能力を備えていた — この能力は、後の発表で約10万枚の中国国産チップ上に供給されていたと説明されるものだ。

確認済み:8月26日、Z.AIはオープンウェイトモデル「Ox Alpha」を「GLM-5.3-Flash」という名称でリリースした。MITライセンス、総パラメータ320B、アクティブ18B。これは、サブネーム、トークナイザー、ビデオエンコーダー、エラーコードフォレンジックス、そして予測市場が収束していた内容と正確に一致する。独立系アナリストのteortaxesTexは、視覚性能を除けばほぼGLM-5.3の水準だと評価しており、さらに訓練を重ねたOx Alphaが、はるかに強力なGLM 5.5を支える主力モデルとなり得ると示唆している。

• フラッシュ・マルチモーダル・リーディングには、現在その裏付けとなるデモがあります。ペリカンが自転車に乗って、同じアニメーションを再生する電話を開くループアニメーションの生成を依頼されたところ、Ox Alphaは単一のHTML/SVGファイルとして自己完結型のループアニメーションで回答しました。これはコミュニティによるデモであり、ベンダーの主張ではありません。

・プラットフォーム上の初期のアクティビティデータは、Nous ResearchのコーディングエージェントやZedエディタを含む、実際の本番トラフィックをすでに示している。

• 同社はついにそれを世に出した——8月26日、Z.AIはOx AlphaをオープンウェイトのGLM-5.3-FlashとしてMITライセンスで公開し、アイデンティティ、スペック、価格に関する疑問に一度に終止符を打った。総パラメータ320B、アクティブ18B、ネイティブにマルチモーダルで、Z.AIの定価は100万トークンあたり入力$0.15/出力$0.50、50%のローンチプロモは9月9日までの実施とされていた——その日は今や8日過ぎているが、提供されているのは今も割引料金のほうだ。Z.AIはまた、匿名だった1週間の1日100Tトークン提供が、中国国産チップ約10万枚で稼働していたことも明かした。これはその規模では初めてだった。この公開に含まれていなかったのは独立系ベンチマークだ——モデルのスコアカードはベンダー報告であり——したがって最も代表的な独立系の数値は、依然としてBen Davisによる113タスク全部のDeepSWE実行の約63%で、GPT-5.6 Sol midと同等だ。

Ox Alphaとは

プラットフォームの説明では、Ox Alphaは「コーディング、持続的なエージェント作業、そして本番ワークロード向けに設計された推論モデル — 長期的なソフトウェアエンジニアリング、複雑な推論、テキストと視覚的文脈を組み合わせたワークフロー」と記述されています。これは特定のポジショニングです。長時間実行されるエージェントループとコード向けに構築されており、一般的なチャット向けではありません。1Mコンテキストがその決定的な手がかりです。これは、数時間にわたるエージェントセッションや大規模なリポジトリを収容するのに十分な余地であり、131Kの出力上限により、長い単一生成が可能です。また、ツール呼び出しと関数呼び出し、構造化されたJSON出力をサポートしており、これがエージェントのチェックリストの残りを満たしています。

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

ビデオ入力は、このシート上で最も特徴的な項目です。初期の匿名モデルはどれもそれを宣伝しておらず、テキストや画像に加えてビデオフレームも処理できるモデルは、それ以前のチャット調整済みリリースとは異なる種類のワークロードを対象としています。また、後のフォレンジック調査が示すように、これはモデルが持ち得る最も強力な身元特定の手がかりの一つでもあります。これらすべて—説明、仕様、速度数値—は、オペレーターとプラットフォームのリストからのものです。GLM-5.3-Flashのリリースは主要仕様(320B-A18B、ネイティブマルチモーダル)を確認しましたが、速度と容量の数値はベンダーの主張のままです。

今週、マルチモーダルの物語は具体的なデモを得た。開発者Chetaslua(そのサーバーサイドのプローブはフィンガープリンティングの証跡の一部を構成している)は、Ox Alphaに、ペリカンが自転車に乗り、同じアニメーションを再生する電話を開くというループ、つまりループの中の自己言及的なループを作成するよう依頼したテストを投稿した。彼の報告によれば、モデルは単一ファイルのHTML/SVGアニメーションを生成した。それは、2セグメントの脚で実際にペダルをこぐペリカン、地面の速度に同期した車輪の速度、パララックス背景、そしてループ内の電話というオチを備えている。中国の開発者フォーラムでも独自にペリカンの自転車プロンプトを実行し、その結果について議論した。したがって、このデモは単独の検証不可能な主張ではない。出力はコードであるため、これはプラットフォームのテキスト出力のみという仕様と整合的である。すなわち、マルチモーダル理解と創造的なコード生成が連携しており、ネイティブなビデオ合成ではない。Chetasluaの結論、つまりこれがマルチモーダルの成果であり、それとともに能力の高いオープンソースモデルが登場するだろうというのは、彼自身の予測であり、ベンダーの声明ではない。運営者は何も発表していない。

1週間無料のキャンペーン

このプロモーションは攻撃的だった。実施期間中の1週間は無料で、「寛大なレート制限、ほぼ無制限の使用」を謳い、1日あたり100兆トークンの処理能力を主張し、運営者はユーザーに「何ができるか見てみろ」というメモを添えていた。文字通りに受け取れば、1日100Tトークンという数字は、この運営者を世界最大級の推論プロバイダーの一角に位置づけることになる。この主張は仕様書というよりは、ストレステストへの挑戦状のように読める。そしてそれはパターンに合致する。匿名でのリリースは、ある研究所が名前を表に出さずにフロンティア規模の実世界トラフィックを獲得する方法なのだ。確認された解釈によって、規模の主張は単に辻褄が合いやすくなるだけでなく、具体的なものになった。Z.AIは、1日100Tトークンのサービスが約10万枚の中国国内製AIチップ上で稼働していたことを開示した。フロンティアクラスのリリースがNVIDIAハードウェアなしでその規模で提供されたのは初めてのことだ。その開示は依然として企業の主張に過ぎず、現在は複数のメディアが報じているものの、独立した監査は受けていない。また、この開示には2つ目の、より控えめなベンダー主張が付随している。Z.AIは、国内クラスターでのトークンあたりのコストは主流のNVIDIA GPUに匹敵すると述べている。

「1週間無料」のもう一面は、その後に続く価格が不明だという点だった — その明かされた内容がそれに答えた。Z.AI が公表している GLM-5.3-Flash の定価は、入力100万トークンあたり $0.15、出力100万トークンあたり $0.50、キャッシュされた入力100万トークンあたり $0.03 だ。50%オフのローンチプロモが2026年9月9日まで実施されるとされ、それによって $0.075 / $0.25 に下がるとされていた。その日から8日過ぎた時点でも、割引価格が依然として適用されている料金である。2026年9月17日に再確認したところ、z-ai/glm-5.3-flash のモデルページでは入力 $0.075、出力 $0.25、キャッシュ読み取り $0.0173/100万トークンと価格が表示されており、プロモーションの表示は付いていない。GLM-5.3 の定価 $1.40 / $4.40 と比べると、およそ20分の1だ。実務上の帰結は、9月9日という終了日が拘束的というより陳腐化しているということだ — $0.15 / $0.50 で予算を組んでいる開発者は、現在誰も請求されていない数字で予算を組んでいることになる。価格ページが解決していないのは、その理由だ。Z.AI 自身のモデル一覧には今も GLM-5.3-Flash の価格として $0.15 / $0.50 が記載されている。したがって、プロモが延長されたのか、恒久化されたのか、それとも単にそのまま続けられているだけなのかは、我々には情報源を確認できない。割引価格はこの日付における観測された事実であり、原因は未解決のままだ。

最初の完全なベンチマーク — そしてそれはGPT-5.6 Sol midと同等の性能を発揮します

Ox Alphaは、Artificial AnalysisやLMArenaといった独立系トラッカーにまだエントリーがない。「フロンティア」という言葉は事業者自身のものであり、Z.AIがGLM-5.3-Flashのリリース時に公表したベンチマーク数値(DeepSWE v1.1 63.4、AutomationBench 48.8、Artificial Analysis Intelligence Index 57)はベンダー報告によるもので、独立したスコアではない。ローンチ以降変わったのは、コミュニティ計測の数値が出回り始めたことだ。そしてその姿はより具体的になってきた。Kingbenchでは、初期の実行結果でOx Alphaは87.5となり、GLM-5.3の91.25にわずかに及ばなかった。DeepSWEでは、独立系研究者のBen Davis氏がまず10タスクのサブセットを実行し、80%のPass@1を報告した。これはClaude Fable 5(65%)、GLM-5.3とGrok 4.6(62%)、GPT-5.6 Sol(52%)を上回る結果だった。その後、同氏は113タスクからなるDeepSWEの全セットに対する実行を完了し、修正後の結果はおおよそ63%となった。これはGPT-5.6 Sol midとほぼ同等だ。80%というサブセットの数字は目を引くものだったが、10タスクはベンチマーク全体の9%未満である。Davis氏自身も、全セットの数値のほうが「はるかに理にかなっている」と指摘している。これらはコミュニティ計測の数値であり、ベンダーのベンチマークでも公式のリーダーボードスコアでもない。しかし、この全セット実行は、これまでに誰かがこのモデルから得た中で最も代表的な数値であり、Z.AIが自社報告したDeepSWE v1.1スコアの63.4とほぼ一致する。これは有用なクロスチェックだ。たとえ同社の数値が測定ではなく主張に過ぎないとしても。

ひとつの比較が、ローンチ時よりも今、より重要になっている。DeepSeek V4 Pro 0813 — 8月13日にリリースされたDeepSeekフラッグシップのGAビルド — は、DeepSeek自身のベンチマークカードでDeepSWE 62.7を報告しており、初期のDeepSeek V4 Pro Previewは12.8だった。どちらの数値もベンダー報告によるもので、本稿執筆時点では独立したラボによる再現はされていない。GLM-5.3-Flashの約63%のコミュニティによるフルセット実行と、Z.AI自身のDeepSWE v1.1の63.4と並べて読むと、DeepSeekの62.7は、中国のコーディングエージェントで最もよく知られた2つの主張を同じ60点台前半の帯域に置くことになる。Ox Alphaの代名詞のように見えた10ポイントの差は、より安価な小型モデルであるDeepSeek V4 Flash 0731に対して測定されたものだ。DeepSeekのフラッグシップに対しては、GLM-5.3-Flashは同等の水準に収まり、10ポイントも差をつけてはいない。

もう一つの教訓は、数字そのものについてである。アナリストのteortaxesTexは、匿名の週以来これらの見積もりを追跡してきたが、Ox Alphaに関する最初のレポートも80% DeepSWEを示していたと指摘する。それはDavisの目を引く10タスクのサブセットであり、全113タスクのセットでの最終結果は63%だった。DeepSeek V4 Pro 0813の公式62.7も同じ範囲にあるが、彼の観察によれば、正当に再現された80%に近づいたものはまだない。80%という数字はモデルの公開初期に繰り返し現れ、完全なセットが実行されると60%前半に落ち着く傾向がある。それは彼のアナリストとしての読みであり、測定ではないが、次のDeepSWEの見出し、特にGLM-5.3-Flash自体に関するものを見るための正しいレンズである。

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

さらに、使用状況も存在します。プラットフォームのアクティビティデータには、最初の数時間以内に実際の本番トラフィックが確認できます。これには、Nous Researchのエージェント型コーディングプロジェクトであるHermes Agentや、Zedエディタが含まれます。これらはどちらも、このモデルが想定している「持続的なエージェントワークとコーディング」というユースケースにぴったり合致します。これはスコアではありませんが、シグナルではあります。実際のワークロードを抱える開発者たちが、無料で最先端クラス、匿名性のある賭けに接続する価値があると判断したのです。完全なDeepSWE実行が完了する前は、その初期採用が唯一の証拠でした。現在では、フルセットで約63%という数値が、モデルに比較衡量するためのベンチマーク基準を与えています。

データ保持の細則

無料週間の告知は「データ保持ゼロ」を謳っている。しかし、このモデルのプラットフォーム上の掲載情報は、より慎重な内容を伝えている。すなわち、プロンプトと応答はプロバイダーによって保持されるが、トレーニングには使用されない——プラットフォームのステルスモデル規約のもとで、である。Z.AIが8月26日に名乗り出るまで匿名だったプロバイダーが所有する1Mトークンウィンドウに、企業秘密のコードを貼り付けようとしているなら、この違いは重要だ。「データ保持ゼロ」は、Z.AIがその旨を明言する規約を公表するまでは、マーケティング文言として扱え——そして、ログに残されたくないものはすべて、別の属性が明確なモデル経由で送るようにせよ。

匿名モデルのプレイブック

Ox Alphaは6ヶ月間で5番目の匿名リリースであり、過去4件も同じように展開しました — 匿名でのデビュー、無料トラフィックの急増、そして企業が名乗り出る、という流れです:

• Pony Alpha(2026年2月)— 発売から約5日後にZhipu AIによってGLM-5として確認された、744BパラメータのMoEフラッグシップです。

• Hunter Alpha(3月11日)— 無料で1兆パラメータ、1Mコンテキストを備えたモデルで、春の憶測の中心となった。広くDeep​Seek V4と推測されていたが、XiaomiのMiMo-V2-Proであることが明らかになり、付随するHealer AlphaはMiMo-V2-Omniと特定された。

• Elephant Alpha(4月)— 登場から約2週間後にAnt GroupがLingxi Ling-2.6-flashだと主張した、無料で効率性に特化したテキストモデル。

• Owl Alpha(4月下旬)— ネイティブなツール呼び出しと約1Mのコンテキストを備えたエージェント特化型モデル。Meituanが6月30日にLongCat-2.0として確認したもので、完全に中国国産チップ上でトレーニングおよび提供された初の1兆パラメータモデルです。

• Ox Alpha(8月20日)— 8月26日にGLM-5.3-Flashとして公開。オープンウェイト、MITライセンスの320B-A18Bモデルであり、正体、ライセンス、仕様はすべて、その仮面が外れた当日に公式に発表された。

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

なぜ優れたモデルを仮面の背後で公開するのか?Hunter Alphaサイクルが具体化した標準的な解釈は、匿名性が評価からブランドバイアスを除去し、誰もが所有者について議論している間に、無料利用がフロンティア規模で実世界の評価データをクラウドソースする、というものだ。このパターンに関するある分析が述べたように、「ブランドがないことがマーケティングである」。さらなる利点はスピードだ。匿名モデルはローンチイベントなしで数時間のうちに世界中の開発者に届き、ミステリー自体が流通手段となる。

Ox Alphaは誰ですか?

8月26日のリリースまでは、どの企業もそれを名乗り出ておらず、Zhipu AIも何も語っていなかった。しかし、モデル登場から48時間以内に確固たる証拠の状況は一変した。以下のフォレンジック解析こそが、GLM-5.3-Flashとしての公表がこれほど驚きなく受け入れられた理由である。処理能力の数値は一時的にフォレンジックに不利に働いた。1日100兆トークンという数字は、NVIDIA製シリコン上でトップクラスの研究所が示す特徴のように見え、Ox Alphaが新しいGeminiだとする説(Google DeepMindの研究者らによる謎めいた投稿に後押しされていた)は、トークナイザーの証拠が現れるまで、そしてその後にZ.AI自身がリリースで幕を閉じるまで、現実味を帯びていた。最も強いシグナルはトークナイザーである。コミュニティ製のフィンガープリンティングツール「modelprint」がOx Alphaに対して9つのインフラストラクチャ検査を実行したところ、そのうち6つでZ.aiのGLM-5.3と一致した。正規化されたトークナイザーのカウントは4つすべてがGLMファミリーと一致した一方、GLM以外の最有力候補は4つのうち2つしか一致しなかった。独立系研究者のベン・デイビスは、Ox Alphaのトークン数が25のテストプロンプト全体でGLM-5.3と完全に一致し、隠されたラッパーに起因するとされる一定の+75トークンの差があるだけだったと報告した。トークナイザーの一致は、偽造が最も困難な同一性シグナルである。モデルは再トレーニングなしにはテキストの分割方法を変更できないからだ。

動画パスは2つ目のシグネチャです。Ox Alphaの動画トークン消費量は、4つの制御されたサンプルにわたってGLM-5V-Turboと完全に一致しました — フレームサンプリング、時間スケーリング、解像度のメカニズムが同一 — 一方、MiMo v2.5、Qwen 3.8 Max、GLM-4.6Vはすべて異なっていました。これは強い手がかりです: 動画処理はモデルの奥深くに組み込まれており、後付けではありません。フィンガープリントスタックの残りも同じ読み取りと一致しています: Ox AlphaはGLM-5Vと同じように音声入力を拒否し、GLM特有の"1301"エラーコードを共有し、同様の出力スタイル(1,000文字あたり約1.3個の絵文字)を示し、Ox Alphaのローンチ2日前にプラットフォームのGLM-5.3リストに表示されていたのと同じ制限付きパラメータとAPI構成を備え、知識カットオフは2025年11月頃です。

このモデルの特定には、Zhipu自身の手口に前例がある。2月に匿名でリリースされたPony Alphaは、リリースから約5日後にGLM-5であると判明した。今週出回っているアナリストの解釈、すなわち「Ox AlphaはGLM-5.3であり、おそらくFlashモデルだ」という見方は、Pliny the Liberatorも同調しており、彼は自身のエージェントが「Ox-alphaはZai製で、GLM-5.Xファミリーだ」と確認したと述べた。独立アナリストのteortaxesTexも品質に関して同じ見解を示し、さらにタイミングに関する主張を加えている。彼はOx Alphaを、ビジョン(視覚機能)を除けばほぼGLM-5.3の水準だと評価し、最も印象的なのはそのターンアラウンドの速さだと述べている。つまり、テキストのみのGLM-5.3を短期間で仕上げ、8月14日のリリースから数日以内に動作するビジョン機能を付けて出荷した点だ。これは一人のアナリストによる評価であり、独立したスコアではない。彼は、これが「中国はモデルを出来立てのままリリースする」というナラティブに待ったをかけるべきだと論じている。彼の最新の投稿では、その解釈にロードマップの推測を重ねている。GLM-5の更新サイクルは短いかもしれない。Ox AlphaはGLM-5.3に十分近いため、サブエージェントとして使うのはほぼ意味をなさない。彼はモデルを直接実行することを「代わりにox @4を直接実行すればいい」という省略表現で示している。さらに、追加トレーニングを施したOx Alphaは、彼の言葉を借りれば「beast of burden(荷役動物)」として、より強力なGLM 5.5の主力モデルとして大いに理にかなっている。これは一人のアナリストによるロードマップの推測であり、Zhipuの公式発表ではない。対照的に、サブ名の問題は解決済みだ。8月26日、Z.AIはOx AlphaをGLM-5.3-Flashとしてリリースした。かつてFlashラベルを「推定」の域に留めていた問題点、すなわちGLM-5.3は8月14日にテキストのみのモデルとしてリリースされた一方、Ox Alphaは動画入力を謳っている、という点は、まさに今回のリリースによって解消された。GLM-5.3-Flashは、同じテキストのみのモデルではなく、別個のネイティブなマルチモーダルモデルなのである。代替説として、XiaomiのMiMoチームやDeepSeekなどが浮上したが、トークナイザーと動画の証拠によってほぼ否定され、今回のリリースでファミリーの問題は完全に決着した。Davis氏がFlashラベルを重要視する理由は、実際的なものであることがわかった。Ox Alphaは実際にGPT-5.6 Sol midレベルの性能を発揮するGLM-5.3-Flashであるため、今やローカルで実行できる。ウェイトはHugging Faceにあり、SGLang、vLLM、TokenSpeedがそれに対応している。これにより、中級クラスのフロンティアコーディングモデルは、ホストしたいと望む者にとって、トークンごとの課金ではなく、一度きりのハードウェアコストになる。

地政学的な枠組みはアナリスト側のものであって、証拠そのものではない。「これにより、米国のフロンティア研究所への圧力はさらに大きくなり、中国との差は縮まりつつある」——これは、フロンティア規模で稼働する無料のZhipuクラスのモデルが競争秩序にとって何を意味するかについての解釈であり、ハードウェアの開示はアナリストが持っていなかった優位性をそこに与えている。約10万枚の国内チップで1日100兆トークンを処理することは、NVIDIAシリコンを使わない中国製スタックがフロンティア推論トラフィックを担えることを示す初の大規模デモンストレーションである——この春、NVIDIA CEOのジェンセン・フアンがDwarkesh Podcastで警告したシナリオだ。彼はその場で、輸出規制が中国のNVIDIA非依存スタックを加速させ、国内の中国製ハードウェアで最もよく動作するフロンティアモデルが米国にとって「恐ろしい結果」になると主張していた。Z.AIのコスト同等性の数字は依然としてベンダーの主張に過ぎないが、イベント自体は本物である。同じ夜、モデル側でもその点が具体的に示された:Z.AIがGLM-5.3-Flashをリリースすると同時に、AlibabaはQwen4アーキテクチャのオープンウェイトプレビュー版であるQwen3.8-Flash-Nextを出荷したのだ。一夜で中国のフロンティア級オープンウェイトモデルが2件リリースされたことは、観測筋が「中国のオープンソースにとって大きな一日」と呼んだものの具体的な形である。

今週、それを基に構築すべきですか?

無料週間は終わったが、テストは依然として安い。9月17日に実際に適用された料金は100万トークンあたり入力$0.075/出力$0.25で、定価の$0.15/$0.50ではない。9月9日で終了するとされていた50%のローンチプロモが、8日経った今もなお有効なのだ。長期的なエージェント作業、長いコンテキストでのコーディング、動画中心のパイプラインを回すなら、そこはまさにOx Alphaが位置づけられている交差点であり、しかも重みがオープンなので、匿名のプラットフォームの気まぐれに頼るのではなく、自分のハードウェアでテストを実行できる。ただし注意点が二つある。第一に、「フロンティア」というラベルは依然として主張にすぎない。GLM-5.3-Flashのスコアカードはベンダー報告であり、確固たる独立系の数字は一つだけ――Davisによる約63%のDeepSWE実行――で、それは強いが、初期の10タスク部分集合で話題になった80%には遠く及ばない。第二に、$0という価格は期間限定で、その後の価格が明らかになった。能力に対しては安いが、もはや無料ではない。オープンウェイトの公開が取り除くのは依存性だ。ファイルが出ているので、モデルはレンタルではなくセルフホストできる。それは依存の形ではなく、テストの形である。

そのようなテストを本番で安全に実行する方法はフォールバックチェーンだ。実験的モデルは健全なときに応答し、リクエストは応答が止まったり、エラーになったり、消えたりした瞬間に、実績のあるモデルへロールされる。それがルーティング層の役割だ。この種明かしでフォールバックの選択は自明になる。Ox Alpha は GLM-5.3-Flash であり、そのモデル自体は OrcaRouter 上で本来の名前のまま、100万トークンあたり入力 $0.075 / 出力 $0.25、キャッシュ読み取り $0.0173 で稼働している。これは9月9日に終了するとされていた50%オフのローンチ料金で、9月17日時点でも、$0.15 / $0.50 の定価ではなく、依然としてページ上の価格のままだ。これは0%のマークアップでパススルーされ、200以上のモデルをまたぐ1つの API で利用でき、自動フェイルオーバーを備えているので、ローンチ週のトラフィック急増があなたのサービス停止になることはない。新しいモデルをチェーンの前面で試し、その背後に実績のあるフォールバックを置く。価格が変わったとき、OrcaRouter 上で目にする数字が、その同じ日に支払う数字だ。あるいは API を完全に省くこともできる。重みはオープンなので、同じチェーンの背後で GLM-5.3-Flash をセルフホストすることも選択肢に入る。

何を見るべきか

残りのストーリーを語るのは6つの要素だ。独立系ベンチマーク:GLM-5.3-Flashのスコアカードはベンダー自己申告であり、Davisの約63%というDeepSWE実行が今のところ唯一の堅牢な独立系数値で、DeepSeek V4 Pro 0813の公式62.7も同じ帯域に入った。Artificial AnalysisやLMArenaへの掲載、あるいは独立した直接対決が、「フロンティア」が事実なのかキャッチコピーなのかを最終確認するものになる。価格の推移:定常状態の問いには、これまでの証拠から答えが出ている。50%プロモは9月9日に終了するとされていたが、9月17日時点でも割引後の$0.075 / $0.25のレートが依然として提供されている。したがって予算計上すべき数値は、$0.15 / $0.50の定価ではなく、プロモ価格の方だ。未解決のままなのはその原因である。Z.AI自身の定価は動いていないためだ。ハードウェアに関する主張:Z.AIは、匿名の週はNVIDIAとコスト同等で、およそ100,000個の国内チップ上で稼働していたと述べている。これを大規模に公開する最初の試金石は、この主張が独立した精査に耐えるかどうか、そして国内スタックがGLMシリーズのデフォルトになるかどうかだ。採用の計算:仮面の下でOx Alphaが集めたプラットフォーム首位級のトラフィックが、名前とライセンスと価格を得た今、セルフホストとAPIデプロイに転換するかどうか。続編:GLM-5.3-FlashがOx Alphaを踏み台として位置づけるかどうか。teortaxesTexのヒントは、さらに訓練を重ねたバージョンが、はるかに強力なGLM 5.5の主力となり、それによってこのリリースが次期GLMの基盤になるというものだ。そして反応:Qwen3.8-Flash-Nextが同じ夜に登場し、その背後に国内チップのお披露目があるなか、米国のフロンティアラボには——そして輸出管理の議論にも——応答するよう圧力がかかっている。ファストフォローか、価格の動きか、政策対応が、そのギャップの反対側に着地するかを見守ろう。

正直な結論:Ox Alphaは、双方にとって異例なほど安価な実験だった。プラットフォームは、$0の匿名フロンティア級モデルが1週間で実際の本番トラフィックを獲得できるかを試した——そして成功し、その説得力は十分で、Z.AIは6日目に名乗り出ただけでなく、同じ夜に重みをオープンモデルとして公開した。あなたは、そのモデルが自分のスタックに居場所を持つ価値があるかどうかを、今度は匿名性リスクなしに試せる。GLM-5.3-Flashは名前が明かされ、MITライセンスで、公開価格でセルフホスト可能なモデルであり、ハードウェアの疑問にも答えが出た——Z.AIによれば、1日100Tトークンのサービスは約10万個の中国国産チップで稼働していた。これは会社の主張だが、今では広く報道されている。残る解明点は、「フロンティア」が独立した測定に耐えるか、Z.AIの国産チップによるコスト同等性の主張が規模拡大しても成り立つか、なぜ50%のローンチプロモーションが、明示された9月9日の終了日を8日過ぎてもなお提供価格であり続けているのか、そしてteortaxesTexが示唆するように、この公開がGLM-5.3-Flashをより強力なGLM 5.5の主力機として位置づけるのか、である。実験を実行せよ、ただしその下にフォールバックを備えて実行せよ。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新