「Ling-3.1-flashがAA Intelligence Indexで41を記録」のヒーロータイトルカード。サブタイトルは「Ant Groupによる560B総パラメータ/25BアクティブのMoE」。大きな角丸カードに数字「41」とラベル「Artificial Analysis Intelligence Index v4.3.2」を表示。その下にある2枚目の小さなカードには「vs 20」とラベル「Ling-3.0-flash」を表示。フッター行には「指数の数値はArtificial Analysisによって独自に測定。モデルは2026-10-01にリリース」と記載。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Ling-3.1-flashがArtificial Analysis Intelligence Indexで41を達成:560B MoEは前世代の2倍

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ant Groupの5600億パラメータのMixture-of-ExpertsであるLing-3.1-flashは、今や自社の研究所が記したものではない数字を掲げている。Artificial Analysis Intelligence Indexで41だ。このインデックスは独立した評価者によって、評価者が管理するハードウェア上で、固定されたスイートに対して運営されており、同じインデックスで依然として20に位置する直接の前身であるLing-3.0-flashより、同モデルを21ポイント上に位置づけている。Antは2026年9月末にLing-3.1-flashを発表し、Artificial Analysisはリリースを10月1日としている。そして、それは自らのスコアを2倍にするモデルより3か月新しい。

その差こそが物語だ。10種類の異なる評価が寄与する複合指標での21ポイントの変動は、ベンダーのチャートが偽装できるようなものではないし、このブログが2週間前に記事にできたようなものでもない。当時、Ling-3.1-flashについて存在した唯一の測定値は、Ant自身のベンチマークカードだった。GDPval-AA v2.1で1,673 Elo、FrontierSWEで75.16、HealthBench Professionalで65.35。それらの数値は実在するラボによる実際の主張だったが、再現されていなかった。41は質的に異なる。これは今回のリリースで、第三者に検証を求めることのできる最初の数字だ。

41が実際に測定するもの

Artificial Analysis Intelligence Index v4.3.2 は、10 の評価による加重合成指標です:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。合成指標を単独で読むのは誤りであり、そのため評価ごとの行はヘッドラインよりも重要です:

• GDPval-AA — Ling-3.1-flash は 1,621.75、Ling-3.0-flash は 948.35。これはこのセットで最大の単一の跳躍であり、指数の動きの大半が依拠しているものである。

GDP.pdf — オールパス 0.100、0.054 から上昇。絶対値では依然として低いが、ほぼ倍増。

• AA-LCR v1.1 長文脈推論 — 前世代の0.73に対し0.83、そしてDeepSeek V4.1 Flash(Max)の0.84と同等です。

• SciCode — 0.541 対 0.420。コーディング科学における向上であり、チャット品質の向上ではない。

• CritPt 物理推論 — 0.180、以前の 0.017 に対して。小規模なベースで前世代の 10 倍。

• AA-Omniscience — +2.22、Ling-3.0-flash の −17.88 に対して。これは見出しに反するため、以下で論じる。

Ling-3.0-flashはこれらの行でLing-3.1-flashに単に負けただけではない。そのうち2つでは崩壊した。AutomationBench-AAでは0.032、Terminal-Bench 4.0ではちょうど0.000を記録した。これが、41を読むべき文脈である——前身は、エージェント的ターミナル能力を事実上まったく持たない、効率的で安価なオープンウェイトモデルだった。

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

利益の源泉:会話ではなくエージェント型の作業

Ling-3.1-flash のインデックスへの寄与を、最も頻繁に並べられる2つのFlashティアモデルと比較すると、集計値では隠れているパターンが浮かび上がる。DeepSeek V4.1 Flash (Max) は同じインデックスで39を記録し、GLM 5.3 Flash は42を記録するため、3つとも3ポイント幅の帯の中に収まる。しかし、そこに至る道筋はそれぞれ異なる。

• エージェント型ターミナル作業 — Terminal-Bench 4.0 では Ling-3.1-flash が 0.333、DeepSeek V4.1 Flash(Max)が 0.268、GLM 5.3 Flash が 0.328。

• エージェント型の実世界作業 — GDPval-AA における Elo は、Ling-3.1-flash が 1,621.75、DeepSeek V4.1 Flash (Max) が 1,600、GLM 5.3 Flash が 1,646.86。

• AutomationBench-AA — Ling-3.1-flash 0.617、DeepSeek V4.1 Flash(Max)0.689、GLM 5.3 Flash 0.604。

• コーディング科学 — Ling-3.1-flash は SciCode で 0.541、DeepSeek V4.1 Flash (Max) は 0.519、GLM 5.3 Flash は 0.516。

狭義の解釈では、Ling-3.1-flash はエージェント型ベンチマークで競争力があり、SciCode ではわずかに先行している。有用な解釈では、多くの人が「ツールループを回せるか」と言うときに指す2つのエージェント型ターミナル指標において、3つの中で最も強い一方、知識信頼性指標ではその2つに後れを取っている。それは全般的な勝利ではなく特定の形の強みであり、誰かが指標の数値だけを頼りにワークロードを購入する前に、明言しておく価値がある。

より大きなモデルに伴って届く請求書

Ling-3.0-flashは、Ant自身のAPIで100万入力トークンあたり0.07ドル、100万出力トークンあたり0.22ドルに設定され、MITのもとでオープンウェイトでした。Ling-3.1-flashはまだそのどちらでもありません。Artificial Analysisは、その実行コストを100万入力あたり0.30ドル、100万出力あたり0.90ドルと記録しています — キャッシュヒット時は0.06ドルで、入力から80%の割引 — これは提供プロバイダーとしてInclusionAI自身のAPIを基準に測定されたものです。これは、それが置き換えるモデルと比べて入力価格がおよそ4倍になることを意味し、その代わりに得られるのはインデックスの21ポイント向上です。

そのトレードオフが良いかどうかは、ワークロード次第であり、インデックス自体がそれに価格を付けられる。それらの料金で、Ling-3.1-flashに対して10個すべてのIntelligence Index評価を実行すると約960ドルかかり、それに対してDeepSeek V4.1 Flash (Max)は約477ドル、GLM 5.3 Flashは280ドルである。理由は料金表だけではない。Ling-3.1-flashは非常におしゃべりな推論モデルである——インデックスを処理するのに2億2000万の出力トークンを消費し、これはその価格帯の中央値をはるかに上回る。また、その評価実行は1タスクあたり平均約357秒で、DeepSeek V4.1 Flash (Max)は285秒、GLM 5.3 Flashは979秒である。1タスクあたりでは、Ling-3.1-flashは約0.99ドルかかり、DeepSeekは0.27ドル、GLM 5.3 Flashは0.25ドルである。

これらはどれも41からは見えないが、そのすべてが請求書にのしかかる。モデルはインデックスに勝っても、予算を失うことがある。

見出しと矛盾する2つの数字

第一は知識の信頼性だ。Ling-3.1-flashは、モデルが自分が知っていることを知っているかを測定するAA-Omniscienceで+2.22を記録する。正解は加点、ハルシネーションは減点、拒否は無減点だ。その正確率は29.1%、ハルシネーション率は37.9%である。同門モデルと並べると、これはグループ内で最も弱いプロファイルだ——GLM 5.3 Flashはハルシネーション率27.6%で+7.47、DeepSeek V4.1 Flash (Max)は回答した質問におけるハルシネーション率が驚異の96.5%で−5.30だ。総合スコアは、Ling-3.1-flashが示す能力を評価しており、それを示す際の信頼性を評価しているわけではない。そして、自ら主張することの3分の1を捏造するモデルは、本番環境ではその周囲に検索を必要とする。

2つ目はコンテキストです。Artificial Analysis は Ling-3.1-flash を 1,000,000 トークンのコンテキストウィンドウとして掲載しています。Ant 自身のリリース資料も目標として 1M を挙げています。しかし、ファミリーのウィンドウをモデルごとに列挙している Ant の開発者ドキュメントでは、Ling-3.0-flash はネイティブ 256K で 1M まで拡張可能とされており、Ling-3.1-flash の項目はまだ一切ありません。実際に測定された特徴的な長コンテキスト行——AA-LCR は 0.83——は、長コンテキスト上での推論スコアであり、提供ウィンドウの測定値ではありません。1M は宣言された上限として扱い、それを前提に設計する前に、独自の長コンテキストリクエストで実際に提供されるウィンドウを検証してください。

仕様表での比較

次元ごとの全体像を、各行で主語を先頭にして:

• 総パラメータ数 — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B。

• トークンあたりのアクティブパラメータ数 — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B。Ling-3.1-flash は最も多く活性化するため、そのサービングコストが現在の水準にある理由の一つです。

• 重みとライセンス — Ling-3.1-flash は未公開(プロプライエタリ、ライセンス条項なし)である一方、DeepSeek V4.1 Flash (Max) は MIT でオープン、GLM 5.3 Flash は MIT でオープン。

• 公称コンテキスト — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M。3つとも同じ上限を主張しているが、それに対して検証できるダウンロード可能なチェックポイントがあるのは、そのうち2つだけだ。

• モダリティ — Ling-3.1-flash はテキスト入力・テキスト出力、DeepSeek V4.1 Flash (Max) はテキストおよび画像入力、GLM 5.3 Flash はテキスト、画像、動画入力。これは Ling-3.1-flash が単純に後れを取っている唯一の軸であり、それを補うベンチマークの行はない。

• ベンダーAPIでの価格 — Ling-3.1-flash は入力/出力100万トークンあたり $0.30 / $0.90、DeepSeek V4.1 Flash (Max) は $0.30 / $1.20、GLM 5.3 Flash は $0.15 / $0.50。

• インデックススコア — 41 対 39 対 42。三者比較で3ポイントの差は順位付けではない。それは、読者のワークロードがたまたまどの評価に似ているかで決着がつく同点にすぎない。

それを呼び出せる場所

Ling-3.1-flash は本日時点で OrcaRouter のカタログには掲載されていません — 当社の公開モデル API で InclusionAI 配下のこのモデルを照会しても not-found が返りますし、そうでないかのように示唆することはいたしません。現時点では Ant 自社の API と、このリリースを提供しているサードパーティのプラットフォーム上で動作しており、それがこのモデルの可用性の正直な範囲です。上記の3モデルを比較する方にとって注目に値するのは、残りの2つは今すぐルーティング可能だという点です。DeepSeek V4.1 Flash と GLM 5.3 Flash はどちらも OrcaRouter のカタログに、各プロバイダーの定価のままマークアップなしで掲載されており、1つの API キーで利用でき、両者間で自動フェイルオーバーが働きます。上記の比較から、あなたのワークロードがエージェント的なターミナル作業よりも知識の信頼性を重視していることが読み取れるなら、試すべきは GLM 5.3 Flash です — そして、2つ目の契約も新しいクライアントコードの一行も必要とせず、同じキーで DeepSeek V4.1 Flash と比較しながら試すことができます。

41が変えるもの、そして変えないもの

変わるのは、このリリースの位置づけだ。Ling-3.1-flash はもはや、ベンダーのチャートが添えられた仕様ではない。独立に測定された位置を持つモデルであり、その位置は Ling-3.0-flash に対するエージェント能力の真の世代飛躍だ——同じレシピに計算資源を積み増すのではなく、設計変更から生まれる類の跳躍である。調達面では何も変わらない。重みは依然として非公開で、ライセンスは依然として明文化されておらず、モダリティは依然としてテキストのみで、価格は前世代のおよそ4倍であり、その見返りとしての向上はエージェントおよびターミナルタスクに集中している。

エージェントループ、ツールの駆動、長いツールチェーンがあなたの仕事であるなら、41はこのモデルについてこれまでに公表された数値の中で最も意味のあるものであり、可用性がまだ拡大しているうちに真剣に検討する価値がある。あなたの仕事がマルチモーダル、あるいは知識が決定的に重要な質問応答、あるいは予算に敏感な大量推論であるなら、41はあなたの問題には届かない——そして、すでにルーティング可能で、すでにMITのもとでオープンにされ、出力価格が半分のGLM 5.3 Flashこそが、この3つの中でより適した位置にあるモデルだ。この指標はLing-3.1-flashがどこに位置するかを教えてくれる。しかし、あなたが気にするべきかどうかは教えてくれない。その問いに答えるのは、あなたが何を作っているかである。

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新