
Ling-3.1-flash 対 GLM-5.3-Flash:インデックス1ポイントと引き換えに4倍のスループット
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Ling-3.1-flashとGLM-5.3-Flashは、Artificial Analysis Intelligence Indexで1点差につける——41対42——そのため、同じ判断を二度繰り返しているように見える。そうではない。GLM-5.3-FlashはZ.ai自身のAPIで毎秒53.0トークンの出力を生成し、Ling-3.1-flashはInclusionAIのAPIで毎秒211.0トークンを生成する。これはスループットにして4倍の差であり、インデックスが両者を分けているどの差よりもはるかに大きい。一方のモデルは、ほぼすべての品質軸でより高性能で、MITライセンスの下でオープンである。もう一方は、先に処理を終えるモデルであり、クローズドで、公開された価格もライセンスもチェックポイントもない。両者を選ぶことは、あなたのワークロードが何を待っているかという問いなのだ。
軸のLing-3.1-flashが圧勝する
同じ能力レベルのモデルを選ぶ場面では、速度は決して補足事項ではない。そしてここでは、それがAntモデルを選ぶ理由のすべてになっている。
• 出力スループット — InclusionAI の API では Ling-3.1-flash が毎秒 211.0 トークン、Z.ai では GLM-5.3-Flash が毎秒 53.0 トークン。生成速度は 4 倍。
• 初回トークンまでの時間 — Ling-3.1-flash は 1.80 秒、GLM-5.3-Flash は 3.18 秒。Z.ai モデルがまだ思考している間に Ant モデルは応答を開始しており、これはインタラクティブおよびストリーミングでの利用においてスループットよりも重要です。
• Intelligence Index タスクあたりの所要時間 — Ling-3.1-flash は約357秒、GLM-5.3-Flash は約979秒。1つの評価タスクをエンドツーエンドで処理するのに、GLM-5.3-Flash はほぼ3倍の時間がかかる。トークンあたりの速度も、起動も遅いためだ。
12回の逐次呼び出しを行うエージェントループや、人がトークンの到着を眺めているプロダクトにとって、それは決め手の一つではない——あるモデルを選ぶ理由そのものだ。GLM-5.3-Flash はスペック上は優れたモデルであり、リクエスト経路では遅い方のモデルだ。
GLM-5.3-Flashが単純に優れている点
それ以外のあらゆる場面では、そしてそのリストは、スループットの優位性が自らの居場所を勝ち取らねばならないほど長い。
• 知識の信頼性 — GLM-5.3-FlashはAA-Omniscienceで+7.47を記録し、3つのFlashティアモデルの中で最高で、回答した質問におけるハルシネーション率は27.6%だった。Ling-3.1-flashは+2.22で、ハルシネーション率は37.9%だった。拒否よりも捏造を重く罰する指標では、この差は実在し、指数と同じ方向を示している。
• 科学的知識 — GLM-5.3-FlashはGPQA Diamondで0.912を記録。Ling-3.1-flashはGPQA Diamondの行が公開されていない。DeepSeek V4.1 Flash (Max)にもGPQA Diamondの行は公開されていない。大学院レベルの科学問題で0.91を出すモデルは、それらで測定されていないモデルとは別の計器である。
• モダリティ — GLM-5.3-Flashはテキスト、画像、動画を扱える。Ling-3.1-flashはテキストのみだ。これはベンチマークで埋められる性能差ではなく、そもそも欠けている能力である。
• 重みとライセンス — GLM-5.3-Flash は MIT の下でオープンウェイトであり、ダウンロード可能でセルフホスト可能です。Ling-3.1-flash はチェックポイントもライセンス条文も公開しておらず、プロプライエタリとして分類されています。
• エージェント型ナレッジワーク — AA-Briefcase v1.1 における GLM-5.3-Flash の Elo は 1,453.73 で、Ling-3.1-flash の 1,400.35 を上回る。これはターミナル操作ではなく、ナレッジワークタスクを中心に特化して構築されたベンチマークでの結果。
• 価格 — GLM-5.3-Flash は Z.ai の API で、入力100万トークンあたり $0.15、出力100万トークンあたり $0.50 で公開されており、Ling-3.1-flash の $0.30 と $0.90 と対比されます。入力単価は半分、出力単価もおよそ半分で、しかもインデックススコアがより高く、オープンウェイトのモデルによるものです。

Antモデルが返答する行
Ling-3.1-flash はそのすべてにおいて打ち負かされているわけではない。エージェント型ターミナル作業ではわずかに優位に立ち、コーディングサイエンスでは互角だ:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 対 GLM-5.3-Flash 0.328。実質的に互角で、両者ともフロンティア層を下回っています。
• SciCode — Ling-3.1-flash 0.541 対 GLM-5.3-Flash 0.516。僅差での勝利。
• AutomationBench-AA — 0.617 対 0.604。また僅差の勝利。
• GDPval-AA — Ling-3.1-flash の 1,621.75 Elo 対 GLM-5.3-Flash の 1,646.86。今回は GLM がこれを取り返す。
4行をまとめて読めば、形は明らかだ。2つのモデルをそもそも切り離せるとしても、その分離は単一の評価実行のノイズの内側にある。両者間の1ポイントの指標差はランキングではなく、信頼性の行によってわずかにGLM寄りに重み付けられたコイントスにすぎない。コイントスではないのは、4×のスループット差と2×の価格差であり、どちらも逆の方向を指している。
また、指摘しておく価値のあるサービング上の詳細があります。というのも、それはモデルをどこで呼び出すかによって、そのスループット差の大きさを変えるからです。Z.ai自身のAPIでは毎秒53.0トークンと測定されています。私たち自身のカタログにおける、私たちのルートでのGLM-5.3-Flashの7日間測定では、出力が毎秒150.6トークン、初回トークン遅延の中央値は4.2秒です。同じ重みを別のデプロイメントから提供すると、3倍近く速く動作します。ベンダーのスループット数値は、モデルの特性ではなく、プロバイダーの特性です。
仕様、1行ずつ
各行の先頭に件名:
• サイズ — Ling-3.1-flash は合計560B/アクティブ25B、GLM-5.3-Flash は合計320B/アクティブ18B。
• 公称コンテキスト — 両者とも100万トークン。GLM-5.3-Flashの長文脈推論の行はAA-LCRで0.80、Ling-3.1-flashは0.83を記録。どちらもDeepSeek V4.1 Flash (Max)の0.84に近く、つまりこの階層では長文脈推論はもはや差別化要因ではない。
• 出力上限 — 当社のカタログでは GLM-5.3-Flash が 128,000 トークン、それに対し Ling-3.1-flash は公表された上限がありません。このうち一方は長文生成に合わせて設計できますが、もう一方はできません。
• インデックス — 41 対 42。
• スループット — 毎秒211.0トークン、ベンダーAPIでは53.0、当社のルートでは150.6を計測。
• 重み — ライセンスなしのプロプライエタリ vs MIT の下でオープン。
• モダリティ — テキストのみ 対 テキスト、画像、動画の入力。
• 価格 — 入力 / 出力 100万トークンあたり $0.30 / $0.90、Z.ai の API では $0.15 / $0.50。
この比較を実際に実行する方法
GLM-5.3-Flashは現在OrcaRouterのカタログに掲載されており、入力100万あたり$0.075、出力100万あたり$0.25、キャッシュ読み取り100万あたり$0.0173と表示されています — この段落ではなくライブカードを確認してください。提供レートは変動し、また、パススルーの取り決めにより、プロバイダーの価格変更が同日に当社側へ反映されるからです。この特定の組み合わせにとってその取り決めが価値を持つのは、GLM-5.3-Flashのオープン性と価格上の優位性が、これを妥当な既定の選択にしている2つの点であり、クローズドな0%マークアップのルートが、ベンダー関係を追加することなくLing-3.1-flashをそれと比較し続ける方法だからです。
Ling-3.1-flash は当社のカタログにはありません — 公開モデル API を照会しても、InclusionAI 配下のそのモデルは not-found が返り、本記事は当社がそれを提供しているかのようには示しません。これは Ant 自身の API と、このリリースを扱う第三者プラットフォームを通じて動作しており、それがその可用性の誠実な範囲です。
この比較の生産的な形は二者択一ではない。GLM-5.3-Flashはオープンで、最も安価で、マルチモーダルで、知識に関する質問でより信頼性が高く、23のプロバイダーから利用できる——それが既定のルートだ。Ling-3.1-flashの強みはエージェントループにおけるスループットとTTFTであり、その代償は、クローズドで、テキスト専用で、より高価で、より少ない入口からしかたどり着けないことだ。インタラクティブでレイテンシに敏感な作業は高速モデルへ回し、バッチ処理、知識重視、マルチモーダルの作業はオープンなモデルに任せ、両者の間にフォールバックを置くことで、遅い上流が遅い製品になるのを防ぐ。
どちらを選ぶべきですか
評価基準が能力、コスト、オープン性、モダリティであれば、この対決はGLM-5.3-Flashの勝ちであり、しかも接戦ですらない——より高いインデックススコア、同クラス最高の知識信頼性プロファイル、0.912のGPQA Diamond、MITライセンスの重み、動画入力、半額の価格、そして23社のプロバイダーが背後についている。基準にユーザーの待ち時間や、タスクが実行できる逐次呼び出しの回数が含まれるなら、最後まで走り切るのはLing-3.1-flashであり、その4倍の生成速度はエージェントループにおいて丸め誤差では済まない。
決め手となるのは、どちらのベンダーも比較可能な形では公表していない配信上の詳細、つまりあなたのワークロードにおいて、あなたのプロバイダー経由で実際に得られるスループットだ。両モデルは同じOpenAI互換のchat-completions形式に応答するため、切り替えは移行ではなく設定変更で済む — そして、インデックス1ポイントと速度4倍の差で隔てられた2つのモデルにとっては、その1つの数値を自らのトラフィックで測るほうが、もう1行ベンチマークを読むより午後の有効な使い方になる。


この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
