「Ling-3.1-flash vs GLM-5.3-Flash」のヒーロータイトルカード。サブタイトルは「4倍のスループット、インデックスは1ポイント差」。2つの角丸カードが明確な間隔を空けて並んでいます。左側は「Ling-3.1-flash」とラベル付けされ、「速度: 211 tok/s」「AA Index: 41」「ライセンス: 未公開」と表示されています。右側は「GLM-5.3-Flash」とラベル付けされ、「速度: 53 tok/s」「AA Index: 42」「ライセンス: MIT」と表示されています。フッターには「スループットは各ベンダー自身のAPIによるもの、インデックスはArtificial Analysisによるもの」と書かれています。OrcaRouterのロゴが右下隅に合成されています。
Guides & Insights

Ling-3.1-flash 対 GLM-5.3-Flash:インデックス1ポイントと引き換えに4倍のスループット

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ling-3.1-flashとGLM-5.3-Flashは、Artificial Analysis Intelligence Indexで1点差につける——41対42——そのため、同じ判断を二度繰り返しているように見える。そうではない。GLM-5.3-FlashはZ.ai自身のAPIで毎秒53.0トークンの出力を生成し、Ling-3.1-flashはInclusionAIのAPIで毎秒211.0トークンを生成する。これはスループットにして4倍の差であり、インデックスが両者を分けているどの差よりもはるかに大きい。一方のモデルは、ほぼすべての品質軸でより高性能で、MITライセンスの下でオープンである。もう一方は、先に処理を終えるモデルであり、クローズドで、公開された価格もライセンスもチェックポイントもない。両者を選ぶことは、あなたのワークロードが何を待っているかという問いなのだ。

軸のLing-3.1-flashが圧勝する

同じ能力レベルのモデルを選ぶ場面では、速度は決して補足事項ではない。そしてここでは、それがAntモデルを選ぶ理由のすべてになっている。

• 出力スループット — InclusionAI の API では Ling-3.1-flash が毎秒 211.0 トークン、Z.ai では GLM-5.3-Flash が毎秒 53.0 トークン。生成速度は 4 倍。

• 初回トークンまでの時間 — Ling-3.1-flash は 1.80 秒、GLM-5.3-Flash は 3.18 秒。Z.ai モデルがまだ思考している間に Ant モデルは応答を開始しており、これはインタラクティブおよびストリーミングでの利用においてスループットよりも重要です。

• Intelligence Index タスクあたりの所要時間 — Ling-3.1-flash は約357秒、GLM-5.3-Flash は約979秒。1つの評価タスクをエンドツーエンドで処理するのに、GLM-5.3-Flash はほぼ3倍の時間がかかる。トークンあたりの速度も、起動も遅いためだ。

12回の逐次呼び出しを行うエージェントループや、人がトークンの到着を眺めているプロダクトにとって、それは決め手の一つではない——あるモデルを選ぶ理由そのものだ。GLM-5.3-Flash はスペック上は優れたモデルであり、リクエスト経路では遅い方のモデルだ。

GLM-5.3-Flashが単純に優れている点

それ以外のあらゆる場面では、そしてそのリストは、スループットの優位性が自らの居場所を勝ち取らねばならないほど長い。

• 知識の信頼性 — GLM-5.3-FlashはAA-Omniscienceで+7.47を記録し、3つのFlashティアモデルの中で最高で、回答した質問におけるハルシネーション率は27.6%だった。Ling-3.1-flashは+2.22で、ハルシネーション率は37.9%だった。拒否よりも捏造を重く罰する指標では、この差は実在し、指数と同じ方向を示している。

• 科学的知識 — GLM-5.3-FlashはGPQA Diamondで0.912を記録。Ling-3.1-flashはGPQA Diamondの行が公開されていない。DeepSeek V4.1 Flash (Max)にもGPQA Diamondの行は公開されていない。大学院レベルの科学問題で0.91を出すモデルは、それらで測定されていないモデルとは別の計器である。

• モダリティ — GLM-5.3-Flashはテキスト、画像、動画を扱える。Ling-3.1-flashはテキストのみだ。これはベンチマークで埋められる性能差ではなく、そもそも欠けている能力である。

• 重みとライセンス — GLM-5.3-Flash は MIT の下でオープンウェイトであり、ダウンロード可能でセルフホスト可能です。Ling-3.1-flash はチェックポイントもライセンス条文も公開しておらず、プロプライエタリとして分類されています。

• エージェント型ナレッジワーク — AA-Briefcase v1.1 における GLM-5.3-Flash の Elo は 1,453.73 で、Ling-3.1-flash の 1,400.35 を上回る。これはターミナル操作ではなく、ナレッジワークタスクを中心に特化して構築されたベンチマークでの結果。

• 価格 — GLM-5.3-Flash は Z.ai の API で、入力100万トークンあたり $0.15、出力100万トークンあたり $0.50 で公開されており、Ling-3.1-flash の $0.30 と $0.90 と対比されます。入力単価は半分、出力単価もおよそ半分で、しかもインデックススコアがより高く、オープンウェイトのモデルによるものです。

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Antモデルが返答する行

Ling-3.1-flash はそのすべてにおいて打ち負かされているわけではない。エージェント型ターミナル作業ではわずかに優位に立ち、コーディングサイエンスでは互角だ:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 対 GLM-5.3-Flash 0.328。実質的に互角で、両者ともフロンティア層を下回っています。

• SciCode — Ling-3.1-flash 0.541 対 GLM-5.3-Flash 0.516。僅差での勝利。

• AutomationBench-AA — 0.617 対 0.604。また僅差の勝利。

• GDPval-AA — Ling-3.1-flash の 1,621.75 Elo 対 GLM-5.3-Flash の 1,646.86。今回は GLM がこれを取り返す。

4行をまとめて読めば、形は明らかだ。2つのモデルをそもそも切り離せるとしても、その分離は単一の評価実行のノイズの内側にある。両者間の1ポイントの指標差はランキングではなく、信頼性の行によってわずかにGLM寄りに重み付けられたコイントスにすぎない。コイントスではないのは、4×のスループット差と2×の価格差であり、どちらも逆の方向を指している。

また、指摘しておく価値のあるサービング上の詳細があります。というのも、それはモデルをどこで呼び出すかによって、そのスループット差の大きさを変えるからです。Z.ai自身のAPIでは毎秒53.0トークンと測定されています。私たち自身のカタログにおける、私たちのルートでのGLM-5.3-Flashの7日間測定では、出力が毎秒150.6トークン、初回トークン遅延の中央値は4.2秒です。同じ重みを別のデプロイメントから提供すると、3倍近く速く動作します。ベンダーのスループット数値は、モデルの特性ではなく、プロバイダーの特性です。

仕様、1行ずつ

各行の先頭に件名:

• サイズ — Ling-3.1-flash は合計560B/アクティブ25B、GLM-5.3-Flash は合計320B/アクティブ18B。

• 公称コンテキスト — 両者とも100万トークン。GLM-5.3-Flashの長文脈推論の行はAA-LCRで0.80、Ling-3.1-flashは0.83を記録。どちらもDeepSeek V4.1 Flash (Max)の0.84に近く、つまりこの階層では長文脈推論はもはや差別化要因ではない。

• 出力上限 — 当社のカタログでは GLM-5.3-Flash が 128,000 トークン、それに対し Ling-3.1-flash は公表された上限がありません。このうち一方は長文生成に合わせて設計できますが、もう一方はできません。

• インデックス — 41 対 42。

• スループット — 毎秒211.0トークン、ベンダーAPIでは53.0、当社のルートでは150.6を計測。

• 重み — ライセンスなしのプロプライエタリ vs MIT の下でオープン。

• モダリティ — テキストのみ 対 テキスト、画像、動画の入力。

• 価格 — 入力 / 出力 100万トークンあたり $0.30 / $0.90、Z.ai の API では $0.15 / $0.50。

この比較を実際に実行する方法

GLM-5.3-Flashは現在OrcaRouterのカタログに掲載されており、入力100万あたり$0.075、出力100万あたり$0.25、キャッシュ読み取り100万あたり$0.0173と表示されています — この段落ではなくライブカードを確認してください。提供レートは変動し、また、パススルーの取り決めにより、プロバイダーの価格変更が同日に当社側へ反映されるからです。この特定の組み合わせにとってその取り決めが価値を持つのは、GLM-5.3-Flashのオープン性と価格上の優位性が、これを妥当な既定の選択にしている2つの点であり、クローズドな0%マークアップのルートが、ベンダー関係を追加することなくLing-3.1-flashをそれと比較し続ける方法だからです。

Ling-3.1-flash は当社のカタログにはありません — 公開モデル API を照会しても、InclusionAI 配下のそのモデルは not-found が返り、本記事は当社がそれを提供しているかのようには示しません。これは Ant 自身の API と、このリリースを扱う第三者プラットフォームを通じて動作しており、それがその可用性の誠実な範囲です。

この比較の生産的な形は二者択一ではない。GLM-5.3-Flashはオープンで、最も安価で、マルチモーダルで、知識に関する質問でより信頼性が高く、23のプロバイダーから利用できる——それが既定のルートだ。Ling-3.1-flashの強みはエージェントループにおけるスループットとTTFTであり、その代償は、クローズドで、テキスト専用で、より高価で、より少ない入口からしかたどり着けないことだ。インタラクティブでレイテンシに敏感な作業は高速モデルへ回し、バッチ処理、知識重視、マルチモーダルの作業はオープンなモデルに任せ、両者の間にフォールバックを置くことで、遅い上流が遅い製品になるのを防ぐ。

どちらを選ぶべきですか

評価基準が能力、コスト、オープン性、モダリティであれば、この対決はGLM-5.3-Flashの勝ちであり、しかも接戦ですらない——より高いインデックススコア、同クラス最高の知識信頼性プロファイル、0.912のGPQA Diamond、MITライセンスの重み、動画入力、半額の価格、そして23社のプロバイダーが背後についている。基準にユーザーの待ち時間や、タスクが実行できる逐次呼び出しの回数が含まれるなら、最後まで走り切るのはLing-3.1-flashであり、その4倍の生成速度はエージェントループにおいて丸め誤差では済まない。

決め手となるのは、どちらのベンダーも比較可能な形では公表していない配信上の詳細、つまりあなたのワークロードにおいて、あなたのプロバイダー経由で実際に得られるスループットだ。両モデルは同じOpenAI互換のchat-completions形式に応答するため、切り替えは移行ではなく設定変更で済む — そして、インデックス1ポイントと速度4倍の差で隔てられた2つのモデルにとっては、その1つの数値を自らのトラフィックで測るほうが、もう1行ベンチマークを読むより午後の有効な使い方になる。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新