記事「Ox Alpha」のヒーロータイトルカード。サブタイトルは「Z.aiのGLM-5.3-Flashの背後にあるステルスエイリアスに関する決定版リファレンスページ」、チップは「2026年8月20日よりOx Alphaとしてプレビュー」「2026年8月26日に公開」「合計320B/アクティブ18B、1Mコンテキスト」「MITライセンス、オープンウェイト」、フッター行は「エンベロープ、モダリティ、料金表、エンドポイントの公開範囲、ベンチマーク - 2026-09-28に検証済み」。OrcaRouterのロゴは右下隅に合成されています。
Guides & Insights

Ox Alpha:ステルスモデルの完全スペックシート、現在GLM-5.3-Flashとして提供開始

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ox Alpha は、GLM-5.3-Flashがプレビュー公開されたときの匿名名称であり、2026年8月26日に明らかになったもので、今日呼び出せるモデルではありません。Ox Alpha という名前を掲げていたプレビュー掲載は、もはやこのモデルを提供していません。その下にあるモデルには、ベンダーページ、MIT ライセンスの重み、公開された料金表、文書化された API サーフェスがあり、それらはすべて Z.ai のものです。本ページはそのモデルのリファレンスです — エンベロープ、モダリティ、料金表、エンドポイントサーフェス、公開されているすべてのベンチマーク数値とそれに付随するリビジョンやハーネス、そして、このエイリアスが依然として内容の薄い紛らわしい検索結果を返すため、どこにも文書化されていない事柄についての率直な説明を扱います。以下はすべて 2026年9月28日 時点で、Z.ai 自身のモデルドキュメントと料金ページ、Hugging Face 上の Z.ai モデルカード、Artificial Analysis、そして当社自身のカタログから読み取ったものです。ベンダーが公表した数値と独立した第三者が測定した数値は別々に表示しており、ここにある内容は類似性から推測したものではありません。

Ox Alphaという名前が現在何を指しているのか

そのエイリアスは廃止されており、廃止したのはベンダー自身だ。Z.ai による GLM-5.3-Flash の公式ドキュメントには、このモデルがリリース前に ox-alpha という名前で匿名でテストされ、ユーザーのフィードバックを集めたこと、そしてその匿名での運用がその週で最も人気のあるモデルになったことが記されている。日付を特定できる手がかりは短く、具体的だ。ステルス出品では Ox Alpha が2026年8月20日にリリースされたと表示され、その正体の公表は8月26日に行われた。これは Z.ai のドキュメントページに記載されている日付と同じであり、私たち自身のカタログが z-ai/glm-5.3-flash について記録しているリリース日とも同じである。

そこから二つのことが導き出され、そのどちらも、その名前を検索した読者にとって重要である。

• エイリアスはルートではない。当社のカタログは stealth/ox-alpha の照会に対して「モデルが見つかりません」を返す(2026-09-28 時点で確認)。その名前で呼び出せるものは何もない。なぜなら、ベンダーの製品はベンダーの名前を冠しているからだ。

• この別名にもベンダー所有の重みリポジトリは存在しません。Hugging Faceでox-alphaを検索すると、2026年8月下旬のステルス期間中に作成されたコミュニティアップロードに加えて、重みを含まずZ.aiの公式リリースを指し示す2026年9月27日付のカードのみのリポジトリが返されます。リポジトリ名はアップローダーが選んだラベルにすぎず、何かを裏付ける文書ではありません。Z.ai自身の組織は、モデルを次の名前で公開しています:zai-org/GLM-5.3-Flash。リポジトリはUTCで2026-08-25に作成されています。

匿名週間を席巻したプロバイダー問題は決着し、その決着はありふれた形だった。あるラボが名乗り出て、そのモデルに自らの名を付けたのだ。残るのは仕様であり、このページで扱うのはそれだ。発見に至る物語——公表に先立つフィンガープリンティング、それが属する匿名モデルの系譜、そしてそれに伴うサービングハードウェアの開示——はOx Alpha 調査に関する以前の記事にあり、このページではそのいずれも蒸し返さない。

ベンダーのドキュメントに記載されているとおりのエンベロープ

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

これらはZ.aiが報告した数値で、2026年9月28日にベンダー自身のドキュメントページから読み取ったものであり、4つのエンベロープ次元のうち3つは独立に裏付けられている——Artificial Analysisのモデル記録にも同じ320B総パラメータ、18Bアクティブ、1,000,000トークンコンテキスト、MITライセンスが記載されており、当社自身のカタログカードにもコンテキストと出力上限が記載されている。

• コンテキストウィンドウ — 1,000,000トークン(Z.aiのドキュメント、Artificial Analysis、1,000,000と記載された当社独自のカタログカード)

• 最大出力 — 128Kトークン(Z.aiのドキュメント)。当社のカードには128,000と記録されています

• 入力 — テキスト、画像、動画、ファイル(Z.ai ドキュメント、2026-09-28 閲覧);当社のカードにはテキスト、画像、動画が記載されており、ファイル入力については記載していません

• 出力 — すべてのソースでテキストのみ

• パラメータ — 総320B、トークンあたり18Bが活性化(Z.aiのドキュメントとモデルカード;Artificial Analysisは独自に320Bと18Bを記録)

• ライセンス — MIT、ウェイトはHugging Faceで公開(ベンダーのモデルカード、Artificial Analysisはこのモデルを寛容なライセンスの下でのオープンウェイトとして分類)

• アーキテクチャ — スパースアテンションとリニアアテンションのハイブリッド。Z.ai によれば、この2つを組み合わせた初のオープンソースのフロンティアモデルであり、GLM-5.3 と比較してアテンション計算を 3.01 倍、KV キャッシュを 4.44 倍削減する。さらに、長いコンテキストにおいて 4 つのインデクサーキーベクトルを 1 つに圧縮する IndexPool ステップ、そしてスケーリング効率のための Manifold-Constrained Hyper-Connections を備える。いずれもベンダーによる主張であり、引用できる独立したアーキテクチャ監査は存在しない。

• 事前学習 — 30兆トークンのマルチモーダルコーパス(Z.aiが公表)。ベンダーは、320B/18Bという見出し数値以外に、総学習コンピュート量の数値も、層別のパラメータ内訳も公表していない。

一つの包括的な主張はローンチ以降に狭まっており、引用すべきは現在のドキュメントだ。8月に出回ったサービング用ハードウェアに関する開示では、名を伏せた週のキャパシティは中国国産チップ約10万個とされていた。今日時点のZ.aiのドキュメントには、モデルは「数万基の国産アクセラレータにまたがって」提供されたと書かれており、同一ハードウェア上でのベンダー自身のベースラインに対するエンドツーエンドのサービング改善は3倍、ベンダーが主流のNVIDIA GPUと同等だと説明するトークンあたりコストを伴うという。現在ページに書かれているのは数万であり、より大きな数字はローンチ当時のものだ。どちらも企業の主張であり、いずれも独立した監査を受けておらず、修正の方向は下向きである。

料金表、そしてなぜ配信された数値こそが重要なのか

Z.aiの料金ページには、GLM-5.3-Flashが入力トークン100万あたり$0.15、キャッシュ済み入力トークン100万あたり$0.03、出力トークン100万あたり$0.50と記載されており、同系列のFlashXティアは$0.37 / $0.075 / $1.25です。これはベンダーの定価であり、2026-09-28にベンダー自身のページから読み取ったものです。

本日の当社ルートで実際に適用された料金はより低く、これが本節の実践上の要点です。2026-09-28時点で、z-ai/glm-5.3-flash の OrcaRouter カードでは、入力が$0.075/100万トークン、出力は$0.25/100万トークン、キャッシュ読み取りは$0.0173/100万トークンです。これは同じモデル、同じ日のベンダー定価の半額です — 見出し価格ではなく割引後の数値で、カードにプロモーション表示はありません。本モデルに関する以前の記事でも、明示されたプロモーション期間の終了後に同じ乖離を指摘しました。その観察は今日もなお当てはまり、依然として理由を特定できないため、当社は実際に適用された数値を報告し、原因については未解明のままにします。

キャッシュ済み入力は、3つの情報源が明らかに食い違っている箇所であり、表にある「$0.03」が必ずしも誰かが実際に支払う価格とは限らないことを思い出させてくれる有用な例です。ベンダーのページには、キャッシュ済み入力トークン100万あたり$0.03と記載されています。Artificial Analysis のモデル記録には、キャッシュヒット価格として $0.026 が記載されています。当社のルートでは、キャッシュ読み取りを $0.0173 で提供しています。3つとも2026-09-28当日またはその直前に読み取ったもので、いずれもベンダーまたはプラットフォームによる報告値です。当社は、ベンダーのリスト価格はリスト価格として、実際に提供されている価格は呼び出し元が実際に請求される額として示しています。

代表的なエージェントジョブで計算してみましょう — 入力トークン100,000、出力トークン10,000、キャッシュヒットなしの場合:

• ベンダーリスト料金の場合 — 100,000トークン × $0.15/1M = $0.015、さらに10,000 × $0.50/1M = $0.005、つまり1回の呼び出しあたり$0.020

• 現在私たちのルートが提供している料金では — $0.0075 + $0.0025、つまり1回の呼び出しあたり $0.010、ちょうど半分

ワークロードの規模を決める前に、リスト価格ではなく実際に提供される価格を確認すべきなのは、まさにこのためです。1日に何千回もの呼び出しを実行する長期間稼働のエージェントでは、その2つの数値の差が、2つの予算の差になります。OrcaRouter はプロバイダーのリスト価格を0%のマークアップでそのまま通しているため、ベンダーが実施している割引は、途中のどこかで吸収されるのではなく、当社の料金表に反映されるのです。

モダリティとエンドポイントサーフェス

ベンダーは 1 つのインターフェース形式と 2 つのモデルコードを文書化しています: glm-5.3-flashおよびglm-5.3-flashx。どちらも Chat Completion API 経由で提供されます。画像は、メッセージの content 配列上で type が image_url のコンテンツブロックとして入力されます。このブロックは、URL(ベンダーが推奨)または base64 データ URL のいずれかを受け付けます。また、1 つのメッセージで複数の画像ブロックを送信できます。ストリーミングはサポートされており、Z.ai はストリーミングリクエストでは stream と tool_stream を一緒に有効にすることを推奨しています。ツール呼び出し、コンテキストキャッシュ、構造化 JSON 出力はいずれも文書化された機能です。thinking はサポートされていますが、次のセクションで説明するように、任意ではありません。

FlashX は別個の機能ではなく、同じモデルの別個のサービング階層です。Z.ai は毎秒 200 トークンと文書化しており、GLM Coding Plan ではまだ利用できないと述べています。それは当社のカタログが扱う階層ではなく、このページの数値が説明しているものでもありません。

当社のルートでは、エンドポイントサーフェスはより狭く、正確に述べておく価値があります。z-ai/glm-5.3-flash のカードは POST /v1/chat/completions を公開しています。これはチャット補完のみで、第2のプロトコルエンドポイントはありません。また、reasoning、reasoning_effort、include_reasoning、tools、tool_choice、response_format、stream、temperature、top_p、max_tokens、stop を受け付けます。カード上の機能チップはビジョン、ツール、JSON、推論です。コンテキストは 1,000,000 トークン、最大出力は 128,000 で、ベンダーのドキュメントと一致しています。

Effortとthinking:あらゆるベンチマーク数値を決定づける設定

これは、スコアの読み方を最も大きく変える仕様の部分であり、ベンダーはそれを正確に文書化しています。GLM-5.3-Flash はreasoning_effortパラメータを 3 つのレベル — low、high、max — で受け取り、何も渡さない場合、または low でも high でもない値を渡した場合は、デフォルトで max になります。Thinking はオフにできません。ベンダーは thinking.type が enabled のみをサポートすると述べています。チャットテンプレートの clear_thinking フラグはデフォルトで false になり、Z.ai はチャットシナリオでは明示的に true を渡すことを推奨しています。ベンダー推奨のサンプリング設定は temperature 1 と top_p 0.95 で、ベンチマークおよびリーダーボードの再現ではデフォルトの max effort を維持すべきだと明言しています。

これら2つの事実を合わせて読めば、数値を比較する誰にとっても避けられない帰結が導かれる。エフォートレベルを伴わずに示されたスコアは完全な測定ではない。なぜなら low、high、max の各設定は同じモデルの異なる動作点であり、デフォルトはその3つの中で最も高コストだからだ。私たちのカードは、対応パラメータの中に reasoning と reasoning_effort を公開しているので、この設定はベンダー経由だけでなく、このルートからも到達できる。

改訂版が添付されたベンチマークシート

Z.aiはGLM-5.3-Flashのベンチマーク表を公開しているが、これは完全にベンダー報告によるものであり、Artificial Analysisの独立した記録にはこれらの行は再現されていない。ベンダーの看板となるコーディングおよびエージェント性能の数値は、DeepSWE v1.1が63.4(GLM-5.2は46.2)、AutomationBench v1.0.6が48.8(GLM-5.2は26.2)である。シートの残りの部分は、当社自身のカタログがZ.aiを明示的な出典として掲載しているとおり、Humanity's Last Exam(ツール使用)55.3、Agents' Last Exam 26.3、NL2Repo 56.3、Chartography(ツール使用)78、CharXiv推論(ツール使用)89.4、そしてビジョン側ではMMVU 80.5、MVBench 77.8、BabyVision 53.4である。

ベンダーによる2つの行は、その脚注を文中に持ち込む価値がある。なぜなら、読者が最も脚注なしで引用しがちな項目だからだ。Z.aiの社内コーディング評価であるZ.ai Code Bench v1.0では、最大努力時のGLM-5.3-Flashが29.0、Claude Opus 4.8が29.5とされている。ベンダー自身のハーネス上でほぼ互角の結果であり、Claude Code 2.1.207で実行され、ベンダーによって報告されたものである。これは独立した比較ではなく、第三者によって実施された条件を揃えた比較でもない。Z.aiが自社の評価において自社モデルを競合と比較しているにすぎないのだ。そしてベンダーは、Artificial Analysis Intelligence Indexが57、タスクあたり$0.045であると引用し、そのリビジョンをv4.1.1と明記している。

その最後の数値は、Artificial Analysis が今日公表しているものとは切り離して扱う必要がある。というのも、両者を一つの動きとして横に並べることはできないからだ。Artificial Analysis の GLM-5.3-Flash のページ(2026-09-28 閲覧)が報告する Intelligence Index は41.8は Index v4.3.2上で、最大エフォートで記録されている。v4.3.2 には10の評価 — AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 — が組み込まれており、v4.1.1 には組み込まれていなかった。二つのインデックス改訂、二つのタスクセット、二つの数値。どちらも誤りではない。両者は同じ測定ではなく、あたかもモデルが動いたかのように 57 を 41.8 の隣に並べて引用するのは、どちらの方向であれ誤りだろう。

独立した記録が裏付けるのは、スコアではなくモデルの基本的な枠組みのほうだ。Artificial Analysisは独立して、総パラメータ数320B、活性化パラメータ18B、100万トークンのコンテキストウィンドウ、MITライセンス、オープンウェイト、2026-08-26のリリース日を記録し、ベンダー価格として100万トークンあたり入力$0.15、出力$0.50、キャッシュヒット時$0.026を掲載している。ベンダーがスコアを公表していて独立系が公表していない場合は、その旨を明記する。独立系が仕様を確認している場合、それはこのページで最も強い分類の事実である。

ここには条件を揃えた直接対決は存在せず、存在しないと言うほうが、無理に一つ作るより有益だ。GLM-5.3-Flashを、明示されたエフォートで共通のハーネス上においてClaude Opus 4.8、GPT-6 Sol、Grok 4.7に対して実行した結果を公開した者は誰もいない。Z.ai自身の比較は自社ベンチ上で、最大エフォートで、競合のデフォルトに対して行われたものだ。それが変わるまで、このモデルと他の何かとの正直な比較は、価格、エンベロープ、エンドポイント表面で行うしかない。それはこのページにある、誰もが同じ数値から読み取れる3つの事柄だ。

文書化されていないこと、率直に言えば

情報量の乏しいモデルのリファレンスページは、欠けている部分について正直であってこそ役に立つ。そして、このページには欠けている部分がいくつかある。

• ベンダーによる知識カットオフはありません。Z.aiのドキュメントおよびHugging Faceのモデルカードには記載されておらず、Artificial Analysisの記録では該当欄がnullのままです。ステルスウィンドウからの推定値はコミュニティによるもので、ベンダーの数値ではありません。また、本ページでは、それをあたかもベンダーの数値であるかのように繰り返してはいません。

• ベンチマークシートの大部分には、ハーネスに関する脚注がない。モデルカードには、HLEのツール併用実行(temperature 1.0、top_p 0.95、最大生成長163,840トークン、コンテキスト管理戦略を用いて最大300,000トークンのコンテキストでの評価、および判定モデルとしてmedium effortのGPT-5.6 Luna)に関する脚注と、NL2RepoおよびDeepSWE(ベンダーによればmini-swe-agentハーネスで実行された)に関する脚注が記載されている。残りの行は、ハーネスやeffortが付記されていない、単なるパーセンテージである。

• キャッシュ入力の価格差についての説明がない。同じモデルの同じ数量に対して3つの数値が示されているが、なぜ異なるのかを説明している情報源はない。

• 匿名提供期間に関する独立したベンチマークは存在しない。ステルス掲載は消えており、それが測定したものは何であれ、再び測定することはできない。また、それが稼働していた間に、第三者がそのエイリアスに対して実行した結果を公開することはなかった。

• 上述の理由により、同等の労力をかけた第三者による比較は行わない。

• 発売当初のチップ数についてベンダーによる確認はない。ドキュメントには数万基の国産アクセラレータと記載されているが、10万という数字はそのページには見当たらない。

結論から言うと:私たちのカタログが提供するもの、本日時点で確認済み

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Ox Alpha の背後にあるモデルは、当社のカタログに独自の名前で掲載されており、推測ではなく本日確認済みです。2026-09-28 に z-ai/glm-5.3-flash の OrcaRouter モデル API を読むと、モデルカードが完全な形で返されました。1,000,000 トークンのコンテキスト、最大出力 128,000、テキスト・画像・動画入力とテキスト出力、機能チップはビジョン、ツール、JSON、推論、リリース日は 2026-08-26、非推奨でも掲載終了でもなく、価格は入力 100 万トークンあたり $0.075、出力 100 万トークンあたり $0.25、キャッシュ入力 100 万トークンあたり $0.0173、単一のエンドポイント POST /v1/chat/completions 経由です。

そのカードでの当社自身による7日間のプレイグラウンド測定では、同じ期間について、毎秒61.8出力トークン、初回トークンまでのp50時間7.39秒、エラー率1.47%という結果でした。これらは当社のサービングに関するファーストパーティの数値であり、ベンダーが公表した数値でも独立系ベンチマークでもありません。そのため、このページに掲載している速度の数値はこれらだけです。

エイリアス自体はルート上にありません。Ox Alphaを検索してここにたどり着いた場合、呼び出すべきモデルはz-ai/glm-5.3-flashであり、リクエストの形式は上記のとおりです。これはカタログ内の他のすべてと同じキー上にあります — 200以上のモデルをまたぐ単一のAPI、プロバイダーの価格は上乗せなしでそのまま、そしてプロバイダーが停滞した場合の自動フェイルオーバー。つまり、試しているモデルが本番パスで依存するモデルである必要はありません。

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

このページが何であるかについて、ひとつ説明しておきたい。モデル名そのものからこのページにたどり着く読者には、それだけの説明が必要だからだ。これはすでにカタログに載っているモデルのリファレンスページであり、ローンチレポートではない。GLM-5.3-Flash は2026年8月26日付のもので、ここに置かれているのは、Ox Alpha という名前が、専用の着地ページもないまま検索され続けているという事実によるものであって、このリリースが新しいことによるものではない。上の日付は、ニュースとしてではなく、モデルの日付を示すために使われている。このページを変えることになるのは、次の四つのうちのひとつだ — 明示されたエフォートで実行された独立系ベンチマーク、ベンダーが明言した知識カットオフ、提供レートの変化、あるいはローンチ当時のチップ数が実際にいくつだったかを Z.ai が明言するという決定。それらのどれかが実現するまで、上記の仕様がベンダーによって文書化されているすべてであり、前節に挙げた欠落も、数値と同じくらい答えの一部である。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新