
GLM-5.3-Flash、5週間後:独立した42、Mythos級のエクスプロイト実行、そして自身のサービングスタックを再構築したGLMエージェント
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり · 87 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
GLM-5.3-Flashは5週間にわたり本番トラフィックを処理してきた。そして2026年9月17日、Zhipu AIはそれがどこで動いているかについて明らかにした。GLM-5.3-Flashへのすべての本番リクエストが、今や中国国産AIアクセラレータ10万基超のフリート上で実行されていること、そのハードウェアでの初回起動から稼働中のワークロード全体を担うまで2週間未満だったこと、同じ期間でエンドツーエンドのスループットが3.2倍に上昇したことだ。最も遠くまで伝わったのは、その作業を誰が担ったかという点だ。その大半はインフラチームではなく、GLM-5.3自身が動かすエージェントによって行われた。エージェントはボトルネックを読み取り、修正案を提示し、推論システムのコードを書いた。エンジニアは目標を設定し、フィードバック環境を構築し、数値セマンティクス、並行性、本番リスクに関わるものはすべてレビューした。GLM-5.3-Flashは、Zhipuが2026年8月26日に発表・オープンソース化した、総パラメータ数3200億、アクティブパラメータ180億(320B-A18B)のマルチモーダルモデルであり、同日に同社が明らかにした匿名の「Ox Alpha」でもある。その上位に当たるGLM-5.3は、価格設定の比較対象とされた743Bのフラッグシップだ。本日の開示にある3つの数字は、どれも私たちや他の誰かから出たものではない。Zhipu自身のものだ。もはや比較対象として重要なのはフラッグシップだけでもない。ExploitBench——モデルが実際のChromeエクスプロイトのはしごをどこまで登れるかを独立に評価するベンチマーク——で、GLM-5.3-Flashは今や、Claude Mythos Previewと同等の水準にあると測定されている。Claude Mythos Previewは、その開発元が審査済みの防御担当者にのみ提供したクローズドなフロンティアモデルであり、GLM-5.3-Flashは試行あたりのコストをその何分の一かに抑えている。
それは良い知らせであり、事実ではあるが、ベンダー公称値である。この投稿がローンチ日に最初に掲載されて以来、他に3つのことが動いており、そのうち2つは逆方向に働いている。Artificial Analysisは今やこのモデルについて独自の測定値を公表しており、その数値はZhipuのものではない。これを市場で最も安価な有能モデルにしたローンチ割引は、予定通り9月9日に失効し、延長されなかった。そして第三者評価機関のGenerality Labsは、独自のExploitBench実行を公表しており、そこではGLM-5.3-Flashが同じラダー上でClaude Mythos Previewの3回実行平均を上回った——およそ1ドルあたり6セントで。8月下旬にこのモデルを「安いやつ」としてブックマークした人にとって、今日の計算は当時とは違う。正直な見出しは混ざったものだ。サービング経済性は本当に改善したが、プロモーション終了により価格は上がり、広く引用された知能指標は独立系ハーネスとの初接触を生き延びず、モデルに有利に働いた能力比較は、著者自身が過大に読むべきではないと言う、査読を受けていない単一の実行である。
Zhipuは、クラスタサイズ、2週間というタイムライン、そして3.2倍についての唯一の情報源であり、それらのいずれについても独立した検証は存在しない。また同社自身、再帰的自己改善は達成していないと述べており、この結果を本物ではなく最小規模のループと説明している。検証できるものは検証した。この説明の中でZhipuの壁の外に存在する唯一の具体的な成果物——Flash Linear Attentionカーネルにおける精度修正——は、実際にアップストリームへマージされており、私たちがそれを確認した。以下の数値がZhipuに由来する場合は、その旨が明記されている。Artificial Analysisに由来する場合は、代わりにその旨が明記されている。Generality Labs——本稿のエクスプロイト数値の背後にある安全性評価組織——に由来する場合は、その旨が、著者ら自身が添えた注意事項とともに明記されている。すなわち、1回の実行、41件のバグ、自己公表された手法、第三者による再現なし、そして彼らが自発的に提起したコンタミネーションの疑問である。数値がAnthropicのものである場合——ここにある数値のうち、答えに競争上の利害を持つラボに由来する唯一のもの——本文は、実際にどのモデルを測定したのかを明記している。なぜなら、それらすべてがこのモデルというわけではないからである。
実際に出荷されたもの
GLM-5.3-Flashは、総パラメータ数320B/アクティブ18BのMixture-of-Expertsモデルで、45層からなり、そのアクティブなフットプリントは、GLM-5.2のおよそ32Bの半分を少し超える程度です。目玉となる能力はモダリティです。テキスト、画像、動画の入力をネイティブに受け付けます — これを実現した最初のGLM-5モデルであり、視覚を別個のアダプター経由で処理するのではありません。コンテキストは100万トークンに達し、Zhipuは長コンテキストの提供コストがGLM-5.3のおよそ3分の1になると主張しています。
アーキテクチャについて、Zhipuは次のように説明している。スケーリングのためにハイブリッドなスパース+線形アテンションとManifold-Constrained Hyper-Connections(mHC)を組み合わせ、長コンテキストのレイテンシを削減するために4つのインデクサー鍵ベクトルを1つの重み付きプールに圧縮するIndexPoolメカニズムを備えた、初のオープンソースフロンティアモデルである。事前学習は30兆トークンのマルチモーダルコーパスで実施された。これらのいずれも独立した監査は受けていない——Zhipuが自社モデルについて述べているだけだ——しかし、重みがオープンソース推論スタックの前に置かれた今、サービング効率に関する主張は検証するのに十分具体的であり、9月17日の説明は、サービング側が実際にどのように構築されたかについて最初の詳細な全体像を加えている。
発売日のスペックシートを一目で。
• パラメータ — 合計320B / アクティブ18B、45レイヤー、MoE。
• モダリティ — ネイティブのテキスト、画像、動画入力、テキスト出力。
• コンテキストウィンドウ — 最大1,000,000トークン
• ライセンス — MIT、公開初日から Hugging Face でオープンウェイト。
• 価格 — 100万トークンあたり$0.15 / $0.50(入力 / 出力)、100万キャッシュ入力あたり$0.03。

あのカードはローンチ当日のスナップショットであり、8月26日以降にその行のうち2つが変わっている。AA Indexの数値は依然としてZhipu自身の主張であり、今では独立した測定によって否定されている——詳細は下で述べる。そこに表示されている割引価格はもう存在しない。プロモーションは9月9日に終了した。パラメータ数、コンテキストウィンドウ、ライセンス、モダリティは変わらない現在の事実であり、この画像は主にそのためのものだ。
Ox Alpha週間、そして無料配布が本当に試していたもの
その発表は、1週間にわたる憶測に終止符を打った。8月20日、匿名モデルがサードパーティのAI APIプラットフォームに登場した。100万トークンのコンテキストウィンドウ、テキスト・画像・動画入力、価格ゼロを備え、すぐにそのプラットフォームの週間チャートで最も呼び出されるモデルになった。コミュニティは48時間以内に、そのモデルをZhipuのGLMファミリー由来だと特定した — これまで他の中華系ラボのモデルを特定してきたのと同じ、匿名で登場して後から名乗り出るパターンだ — そしてアナリストたちは広く、Flash派生版のGLM-5.3ではないかと推測した。8月26日の発表でその推測は確認された。無料の1週間は意図的なテストであり、同社によれば、この匿名の運用は、提供されていたコーディングプラットフォーム全体で6日間に62兆トークン以上を処理し、そのすべてが中国国産チップで提供されたという。
その最後の条項は、当時は脚注のように見えた。だが、それこそが要点だった。無料週間は、主にマーケティングの仕掛けでも、ましてやモデルの負荷テストでもなかった。それは、その下にあるアクセラレータ・フリートの負荷テストであり、失敗すれば公になり、しかも無料で済む規模で実施された。3週間後、Zhipuは同じフリートがそのモデルの本番トラフィックの100%を担っていると説明している。

あの週の価格設定の論理は、一点の訂正を除けば今も変わらない。1週間0ドルで提供され、その後フラッグシップの10分の1の料金でさらに50%引きで発売されたモデルは、低価格帯における意図的な市場形成策であり、「期間限定」という但し書きこそ常に注目すべき点だった。我々はそれを撤回されうるものとして指摘した。それは予定通り撤回された——これははっきり言っておく価値がある。なぜなら、割引の期限切れは、この話の中で請求書に表れる唯一の変更だからだ。
エージェントが再構築したサービングスタック
Zhipuの9月17日の技術解説は、GLM-5.3-Flashが中国製シリコン上でどのようにサービングされるかを詳しく説明した最初のものであり、その中心的な主張は、あるモデルが自分自身を実行するシステムの最適化を支援したというものだ。同社はこのメカニズムを高密度フィードバックと呼んでいる。正確性テスト、実行ログ、トレース、マイクロベンチマーク、エンドツーエンド指標を連携させ、エージェントが変更のたびに完全なデプロイと負荷テストを待つのではなく、仮説をローカルで検証できるようにしたのである。Zhipuによれば、これを機能させるには、フィードバックがローカルで安価かつ客観的に検証可能である必要があった。つまり、特定のカーネルまたはコードパスに結び付いており、反復するのに十分高速で、人間を介在させずに真偽を判定できることだ。
そのループが導入された状態で、エージェントは、その会社が詳細に説明している3つの事柄を発見し、修正しました:
• KDAカーネル内のコンテキスト並列パスは、シーケンスが長くなるにつれて精度を失っていた。なぜなら、tl.dotがFP32入力にもかかわらずデフォルトでTF32を使用していたため、丸め誤差がコンテキスト長とともに蓄積されたからである。この修正では、入力精度をtf32x3に固定し、TF32サポートのないプラットフォームではieeeにフォールバックする。これは3つの中で最も興味深い。なぜなら、Zhipu自身のインフラストラクチャを離れる唯一の主張だからである。つまり、この変更はFlash Linear AttentionでPR #1180としてアップストリームにマージされており、我々は2026年8月27日にマージされたことを確認した。
• KV転送はDeepEPのスケジューリングとオーバーラップしていなかった。使用中のDeepEPバージョンでは、intranode dispatchもintranode combineもPython GILを解放しておらず、そのため転送スレッドがそれらの後ろで停滞していた。同じ記事の英語版と中国語版では、その結果生じたオーバーヘッドをそれぞれ20%超、30%超としている。修正後、Zhipuによると、prefillのみのベースラインに対するギャップは1%未満に下がった。
• デコードカーネルは、同じFP32正規化とゲーティングを、V次元タイルごとに1回ずつ、計4回再計算していた。除算の処理を分割するとカーネル時間が9.6%短縮され、タイルを単一のスレッドブロックに統合して正規化を1回だけ実行するようにしたところ、1.71倍の高速化が得られた。
それらの修正の周辺には、構造的な変更がある。すなわち、アクセラレータは、このスタックが元々書かれたGPUよりもオンチップメモリが少ないため、計算量を費やしてオンチップメモリを節約するReplaySSM、同じ圧力を緩和するノード内テンソル並列、容量を拡張するINT8、FP8、BF16の混合キャッシュ、そして3つの推論ステージを1つのパイプラインとしてではなく個別にスケジュールするEncode-Prefill-Decode分離型アーキテクチャである。Zhipuはまた、限られたオンチップメモリとインターコネクト帯域幅、未成熟なソフトウェア、不完全なカーネルカバレッジ、薄いドキュメントといった制約を正直に挙げ、再帰的自己改善は達成していないと述べ、その結果を最小規模のループと表現している。
この説明は懐疑的に読むべきだ。なぜなら、インセンティブは明らかだから。Zhipuは、作業のどれだけをエージェントが行い、どれだけをエンジニアが行ったのかを明かさないし、スループットの数値、2週間というタイムライン、クラスタサイズのいずれについても外部監査はない。密なフィードバックという枠組みも、ある特定の意味で自分に都合がよい。それは、最も印象的に響く主張(「われわれのモデルは自らを改善した」)を、最も検証しにくい証拠(誰にも検査できない内部ループ)に依拠させる。この話が純粋なマーケティングにならずに済んでいるのは、その最も具体的な主張が反証可能で、しかも真だと判明するからだ——tf32x3カーネルの修正は実際に上流リポジトリにあり、日付は8月27日で、それをめぐる報道サイクルの3週間前である。
実際のドルでの費用
料金表はZhipuのもので、シンプルだ。100万入力トークンあたり$0.15、100万出力トークンあたり$0.50、100万キャッシュ済み入力トークンあたり$0.03。これが本日時点の定価だ。50%オフのローンチプロモーションは2026年9月9日まで実施され、延長されなかった。そのため、8月下旬に広く出回った$0.075 / $0.25 / $0.015という数字は、ベンダー自身のAPIではもはや利用できない。GLM-5.3の公表値$1.40 / $4.40と比べても、Flashは定価でなお約10分の1にとどまる——割引は、すでに訴求点だった価格に上乗せされたボーナスであり、価格そのものではなかった。Artificial Analysisは、キャッシュヒット/入力/出力が7:2:1の混合で、100万トークンあたり約$0.10のブレンド料率を算出しており、出力速度は毎秒約117トークンと記載している。これは特に高速だと説明されているが、AAは、この速度の数値はAAが実施したテストではなく、モデルのファーストパーティAPIに関するものだと注記している。
Zhipuのより広範なコスト事情こそが、この価格を成立させている理由だ。8月31日に公表された半期決算で、同社は、10万台のアクセラレータを擁する国内フリートにおける単位トークンあたりの推論コストが2026年の初めから80%低下したと述べ、その結果、規模、価格設定、より安価なサービングによってAPI粗利益率が-0.4%から24.6%になったと述べた。これらは株主に報告している企業の企業数値であり、当社による監査は受けていない。正確というより方向性が明確なものとして扱ってほしい。上記のサービングに関する説明は、この主張の背後にあるメカニズムである——冗長なカーネルパスの削減、メモリ負荷の軽減、より良いオーバーラップ——であり、単なるパーセンテージよりも信頼できる話だ。たとえ引用されるのがそのパーセンテージだとしても。
フラッグシップに対する効率の主張は変わっていない。GLM-5.3比でアテンション計算量は3.0分の1、KVキャッシュは4.4分の1に削減(ベンダー報告)で、Zhipuは自社のKVキャッシュがDeepSeek V4 FlashやKimi K3のものより依然としてわずかに大きいことを認めている。中国国内チップでのエンドツーエンドのサービング改善が3倍という発表時の主張は、現在3.2倍とされており、初回起動から本番トラフィック全量までを測定したものだ。どちらの数値もZhipuのもので、それらを伝える2つの報告は3週間隔たっている。ここにあるものはどれも同社の外部で再現されていない。
なぜこの公表が重要なのか——そして看板の数字はどこへ消えたのか
ローンチ時の報道を読み、その数値を記憶に留めていた人にとって最も重要な訂正はこれだ。Zhipuの資料はGLM-5.3-FlashをArtificial Analysis Intelligence Indexで57と位置づけており、Claude Opus 4.8と並ぶ数字だった。その後、Artificial AnalysisはIntelligence Index v4.3における同モデルの独自測定値を公表しており、それは42——同じバージョンでGPT-5.6 Sol(max)が47であるのに対する数値だ。57という数字は決して独立した数値ではなかった。それはZhipuのものであり、独立した測定では同モデルはフロンティア隣接帯域をおよそ5ポイント下回り、ベンダーの見出し数値を大きく下回る。同じ現行のインデックス上で、GLM-5.3自体は45と測定される。したがって、当社のローンチ報道に登場したフラッグシップの60という数値は、Artificial Analysisが今日公表している内容ともはや一致しない。主張と測定の間の15ポイントの隔たりは丸め誤差ではなく、読者がこのアップデートから得られる最も有用な一点である——ただし、以下のセクションが付け加える一つの留保付きで。というのも、この記事における第二の独立測定は逆方向を指しているからだ。
その修正を経てなお残るものは、より狭いが、依然として本物だ。GLM-5.3-Flash は、100万トークンのコンテキストとネイティブの画像・動画入力を備えたオープンウェイトのマルチモーダルモデルで、フラッグシップの兄弟モデルの定価のおよそ10分の1だ。これは、米国のフロンティアラボには直接相当するものがなく、同等のマルチモーダルモデルはかなり高価で、クローズドで提供されている。Zhipu自身の「フロンティアの知能、フラッシュのコスト」という打ち出しこそが、打撃を受けた部分だ。実測42では、それは割引価格のフロンティアモデルではなく、強力なバジェットモデルである。独立した測定でも、同程度の規模のオープンウェイトモデルの中央値を余裕をもって上回っており、これは推論コストが10分の1の18Bアクティブモデルにとって紛れもない成果だ。ただし、それはローンチ時の報道が示唆したものとは別種の成果にすぎない。
もう一つの独立した数値――そしてそれはモデルに有利な方向へ進んだ
Artificial Analysisの結果がGLM-5.3-Flashを一段格下げしたのだとすれば、こちらは逆方向に働く。そしてこれは、この話の中で最も奇妙な事実である。カーネギーメロン大学で構築されたExploitBenchは、モデルが標的をクラッシュさせられるかどうかを問わない。評価するのは登攀の過程だ。脆弱なコードに到達し、バグを誘発し、再利用可能なプリミティブを構築し、最終的には任意コード実行を伴う完全な制御フローハイジャックに至るまでを、セキュリティサンドボックスを有効にした本番V8に対して機械的に採点する。Generality Labsは、ベンチマーク通常の300ターン上限ではなく、バグ1件あたり10億トークンの予算で、41件のバグにわたってGLM-5.3-Flashを実行した。ターン数は購入者が実際に費やすものの代理指標としては不十分であり、ドルこそが正直な制約だという主張である。GLM-5.3-Flashは41件中13件で完全な任意コード実行に到達し、能力スコアの平均はラダー最大値の64.8%だった。Claude Mythos Previewの公開された3回の実行は、同じラダーで9、10、11 — 平均10、つまり62.2%だった。Generality自身の位置づけは、グラフの下に印刷されているが、この測定においてGLM-5.3-Flashは「サイバー分野でMythosレベルかもしれない」というものである。Anthropic自身のExploitBench実行は9月29日に公開され、同じ順序をはるかに低い絶対率で報告している — ただしFlashではなくフラッグシップのGLM-5.3についてである。これはラダーの進捗ではなく試行あたりのエンドツーエンド・エクスプロイトを数えており、GLM-5.3を410中50、Mythos Previewを410中56としている。数え方が違えば順序は似る — まさにそれが、ExploitBenchの数値を数え方のルールを添えずに引用してはならない理由である。
本当に重要なのは、その背後にある分母です。この実行では、GLM-5.3-Flash の出力トークンを100万トークンあたり $0.25 と価格設定していました — これは50%オフのローンチ時の料金で、すでに期限が切れています — それに対して Claude Mythos Preview は過去の100万トークンあたり $125、つまり500倍の開きがあります。コストを揃えた場合、この実行は脆弱性1件あたり $16.81 を費やしたのに対し、Mythos は $297.17 で、約6%という数字はここから来ています。この主張は注意深く読んでください。出回っているバージョンは間違っているからです。GLM-5.3-Flash が Claude Mythos Preview よりも優れたエクスプロイト開発者だ、という話ではありません。この特定のタスクにおいては、GLM-5.3-Flash のトークン1ドルで買えるものは Mythos のトークン1ドルで買えるものとほぼ同じであり、しかも前者ならはるかに多くのドルを使える、という話なのです。
Generality自身の注意書きは、見出しよりも価値がある。彼らは率直にこう述べている。単一の実行ではサイバー全体にわたる同等性は確立されないこと、コンタミネーションは未解決の問いであること——ExploitBenchは何らかの形で対して訓練されている可能性がある——、そして41サンプルのうち4件がエラーとなり、最後に観測された結果をそのまま引き継ぐ形で採点されたが、それはどちらかといえばモデルを過小評価している。彼らはまた9月28日にフォローアップを公開し、それが比較全体を複雑にしている。GLM-5.3-Flashを7種類の異なるエージェントハーネスで、2億5000万トークンの予算で、難易度の範囲をカバーするように選ばれた10サンプルに対して実行すると、同じ重みはCodexハーネス下で10.6——Claude Mythos Previewの参照値10.02を上回る——、Claude Codeハーネス下で6.2を記録し、ベンチマーク本来のターン制限付き構成の6.4をも下回った。スコアを動かしたのはモデル比較よりもハーネスのほうが大きく、著者らはその10サンプルの部分集合はおそらく代表的ではないと述べている。10月2日に、テスト時計算スケーリングがモデル階層間の差を消しつつあるという主張とともにこのプロットが広く出回ったことは、業界についての主張であり、評価の知見ではない。評価が見出したのは、安価なオープンモデルが、ターン制限の代わりに予算を与えられれば、ある一つのラダー上でフロンティアラボのエクスプロイト専門家に到達しうるということである。
もはやそれは一つのラボの物語ではない。Anthropic自身のFrontier Red Teamの評価は、9月29日に公開され、GLM-5.3-Flash — より小さな兄弟 — をヒューマン・イン・ザ・ループのセッションで実行した:修正済みのChromeの脆弱性ともう一つの公開詳細を、重要な指示なしに渡されると、モデルはそれらを連鎖させ、ポインタ認証の堅牢化を回避する信頼性の高いARM64エクスプロイトを、人間の注意20分とモデルの作業8時間で作り上げた — ZhipuのAPI料金で20.40ドル。同じ評価は、上記の410件中50件というExploitBenchの数値の出典であり、その部分はGLM-5.3、743Bのフラッグシップを測定したのであって、Flashではない — 報告の報道が大部分平坦化してしまった区別である。二つの独立した当事者、異なるハーネス、異なる予算、同じ方向性。どちらも単一ラボの実行であり、どちらも再現された結果ではない。また、Generalityの実行だけが、フラッグシップではなくFlashについてのドル金額を報告している。実用的な解釈は、Anthropicが率直に述べているものである:重みはダウンロード可能であり、GLM-5.3-Flashをアブリタレートするには約600 GPU時間かかり、1時間あたり1ドル未満で実行できるモデルは、審査プログラムの背後にあるモデルとは異なる種類の可用性問題である。
試してみてください。そして、ルーティングレイヤーがどのように適合するかを確認してください。
アクセスはいたって簡単です。Zhipu自身のAPIが上記のリスト料金で提供しており、MITライセンスの重みはHugging Faceのzai-org/GLM-5.3-FlashにFP8およびBF16で公開されており、Zhipuのコーディング製品——ZCodeとGLM Coding Plan——にもバンドルされています。セルフホスティングの場合、vLLMとSGLangの両方が対応しています。その方法を取る場合は、実用的な注意点が2つあります。SGLangのクックブックには、5.13より前のtransformersビルドではビジョン入力が何も通知されずに破棄される可能性があるという未解決の変更警告があり、これはエラーを発生させず、画像リクエストに対してテキストのみの読み取り結果を返すだけです。また、AMDの経路はまだレシピにはなっていません。当初のローンチ当日におけるgfx950有効化PR(sgl-project/sglang #37653)は9月6日に未マージでクローズされ、より広範なgfx950 day-zeroプルリクエスト群——AITER経由のmHC、k-pool DSAインデクサー、FP8およびMXFP4のサービング——に取って代わられました。そのうちいくつかは9月17日時点でもまだオープンでした。MI350Xクラスのハードウェアでの有効化は進行中であり、出荷済みではなく、AMDの独立したスループット数値も依然として存在しません。
ルーティング側では、ローンチ以降状況が変わった。GLM-5.3-Flashは今やOrcaRouterのラインナップに加わっており、GLMシリーズの他のモデルと並んでいる。当社はプロバイダの定価を0%のマークアップでそのまま通しており、ルーター手数料もいただいていない。これはまさに、価格が動いたばかりのモデルにとって重要な仕組みだ — Zhipu側で割引が失効すれば、それがそのままここで支払う価格になる。同じ日に、再交渉すべき第二の契約もなく、コード変更もなしに。このパススルーは諸刃の剣であり、はっきり言っておく価値がある。期限切れのプロモーションは請求書上の実際の値上げであり、それは上流で起きるのと同じ瞬間にここでも起きるのだ。FlashをGLM-5.3や他の低価格モデルと比べているなら、どちらも1つのキーの背後にあり、プロバイダ間で自動フェイルオーバーする。これは、独立したスコアがまだ固まりきっていないモデルを、本番パスをそれに賭けることなく試す安上がりな方法だ。また、これは上記の結果にとって正しい形でもあり、その理由は利便性よりももっと率直だ。同じ重みが、同じベンチマークで、どのエージェントハーネスが動かしたかによって10.6または6.2を記録した。つまり、購入者が実際にテストするのはスキャフォールドとモデルの組み合わせであり、固定されたスキャフォールドの背後にあるモデルを1つのキーの下で差し替える方が、どちらかにコミットするよりも安いのだ。

次に見るもの
この話の残りを決着させるのは4つの点だ。第一に、42が動くかどうか。このモデルは8月から広く一般に使われているので、Zhipuの内部評価とAAのハーネスが構造的な理由——推論トークンの計上、冗長性、ベンダーが重視した評価——で食い違うなら、それは一度限りの差ではなく、指数が改訂されるなかで表面化するはずだ。第二に、そのエクスプロイト結果が再現するかどうか。Generality Labsは41件のバグを自社のハーネスで一度だけ実行し、そう述べている。ハーネスのフォローアップでは、同じ重みがハーネスの選択だけで4ポイント動くことが示されており、これを決着させる数字は、予算をドルで固定し、ハーネスを一定に保ったうえで、別のチームが41件を再実行した結果になる。第三に、国産シリコンに関する説明が第二の情報源を得るかどうか。Zhipuはクラスタ規模、2週間というタイムライン、3.2倍を述べられる唯一の当事者であり、そのうち独立に検証可能な唯一の主張——マージされたカーネル修正——は小さなものだ。第四に、価格だ。割引はなくなった。興味深い問いは、Zhipuがボリュームを必要とするときにプロモーションとして戻ってくるのか、それとも定価が今や下限なのか、である。
通底しているのは、GLM-5.3-Flashが同時に二つの異なることを証明するよう求められているという点だ——安価なモデルでも十分に優れ得ること、そして中国のアクセラレータがそれを大規模に提供できること——であり、9月17日の開示は、第二の問いに対するZhipuの答えであり、それを書くのを手伝ったモデルによって示されたものである。第一の問いには今や二つの独立した数値が付随しており、それらは正反対の方向を指している。インテリジェンス指数で42、これはベンダーの見出し数値を大きく下回る。そして、フロンティアラボの専門モデルと同水準に達するエクスプロイト実行を、コスト20分の1で成し遂げている。両方が同時に真であり得るし、実際に意思決定が下されるのは——どちらの数値でもなく——両者の間のギャップなのだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
