「Ling-3.1-flash:発表済み、オープンではない」というタイトルで、サブタイトルが「~560B 総パラメータ · トークンあたり ~25B アクティブ · 最大1Mコンテキスト」の編集用ヒーローカードを生成しました。3枚のラベル付きカードには「重み:まだ提供されていない」「ベンチマーク:ベンダー報告のみ」「ライセンスなし · モデルカードなし · ダウンロード不可」と書かれています。
Guides & Insights

Ling-3.1-flash が発表、オープンではない:約560Bパラメータ、100万トークンのコンテキスト、そしてAntだけが実行したチャート

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ant GroupのLingチームは2026年9月30日、次期高速ティアモデルの数値を公表し、同時に、まだ利用することはできないと述べた。Ling-3.1-flashは約5600億パラメータのMoEで、トークンあたり約250億パラメータを活性化し、最大100万トークンのコンテキストウィンドウを備える。これは、Antが自社の@AntLingAGIアカウントから公開したモデル発表による。このリリースを決定づける一文は、仕様の後に続くものだ。「近くモデルをオープンソース化する予定です」。本日時点で、Hugging FaceにLing-3.1-flashのリポジトリはなく、ライセンスもなく、ダウンロード可能な重みファイルもなく、Ant Group外部による評価もない。存在するのは、ベンチマークチャートと、稼働中のプロダクト画面と、約束だけだ。

その区別こそがすべてであり、それについては率直に言う価値がある。というのも、多くの人に真っ先に届く捉え方――中国から出た、フロンティアのすぐ近くに着地する500B級オープンウェイト公開――は、まだ起きていないことを述べているからだ。Ling-3.1-flashはオープンな公開ではない。発表されたものだ。両者は近くなどなく、その隔たりこそ、読者が痛い目を見るまさにその場所だ。まだ存在しないオープンウェイトを前提に、キャパシティを計画し、パイロットの予算を組み、調達メモを書くなら、あなたはプレスリリースに向けて計画していることになる。

発表に実際に何が含まれているか

この投稿は短く、そこに示される数値は具体的だ。Antは、総パラメータ数が約5,600億、トークンあたりのアクティブが約250億、比率は約22分の1で、自身が後継するLing-3.0-flash世代よりわずかに高密度だと述べている。そのモデルは総計124Bに対しアクティブ5.1B、約24分の1で、本体サイズは4分の1未満だ。コンテキストは「最大1Mトークン」と引用されており、Ling-3.0-flashファミリーが現在提供する262,144トークンのウィンドウの4倍にあたる。3つの主要スコアが添えられている。GDPVal-AA v2.1でElo 1,673、FrontierSWEで75.16、HealthBench Professionalで65.35。

それらの数値はすべてベンダー申告で、ファーストパーティによるもので、第三者が再実行できるいかなる形でも公開されていない。評価ハーネスも、プロンプトセットも、実行構成も、シードもない——そして、より根本的には、それらを実行するための重みもない。Antの数値が正しければ、このモデルは中国のオープンモデル公開の最上位層に位置する。だが現時点では、それらが正しいかどうかを確かめる方法はない。

そのチャートと、それに織り込まれた注意点

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant は Ling-3.1-flash を、フロンティアおよび準フロンティアのモデル群——GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM ファミリーからの2つのエントリ、そして DeepSeek-V4.1-Flash——の中に位置づける、複数パネル構成のベンチマークカードとともに公開した。各パネルを通じて、Ling のバーはエージェント系およびコーディング系の指標では最上位かその付近にあり、マルチターン系およびドメイン固有の指標では中位に位置している。これをあるがまま——すなわち、汎用エージェント作業、コーディング、銀行業務ドメインのタスク、医療を含むスイートからベンダー自身が選んだタスク——として読めば、信頼できそうに見えるカードだ。

ただし、そこに何が載っているかを見ると、一つ際立つ点がある。Antが選んだフロンティアの比較相手はGPT-5.6 SolとClaude Opus 5だ。この両モデルは今や一世代前のものになっている。Opus 5.5とGPT-6 Solはいずれも2026年9月22日に、同じ日に公開され、どちらも今日ルーティング可能だ。Antがカードに載せなかった最新モデルこそ、読者が測定対象として望むものまさにそれであり、これはこのリリースに関する最初の一連の論評で浮上した不満と同じである——10月に登場したモデルが、7月のフロンティアではなく10月のフロンティアとベンチマーク比較されていたらよかったのに、という願いだ。これはモデルを貶すものではなく、モデルは十分に持ちこたえるかもしれない。これはカードを裁定ではなく方向性を示す主張として扱い、Antが選んだ比較が結果をよく見せるというよりむしろ結果を古く見せていると指摘すべき理由である。

触れられる場所、そして説明のない脚注がひとつ

Ling-3.1-flashが現在ユーザー向けに動いている場所は、ただ一つだけだ。Ant自身の製品である。ling.tbox.cnのLing Studioインターフェースは、モデルセレクターにLing-3.1-flashを掲載しており、アプリ自体によるこのモデルの説明はベンチマークカードよりも広範だ。「汎用エージェント、検索、日常的なオフィス業務、ソフトウェア/コード開発」向けとして打ち出しており、これはこのティアでよく見られる位置づけだ。つまり、ファミリー内で最も深く推論するモデルではなく、常に安価に呼び出されることを想定したモデルである。

そのサーフェスには、このリリースで最も気まずい細部も含まれている。ベンチマークカード自体の脚注には、HealthBench Professional — 発表文にある3つの数値のうちの1つである65.35 — が「AQ環境で評価された」と記されており、さらにLing-3.1-flashのヘルスケア機能は「現時点ではAQでのみ体験できる」と付け加えられている。カード上のどこにもAQが何であるかを説明するものはなく、我々が見つけられた公開ドキュメントにもそれを定義したものはない。環境名が明かされないまま、環境修飾子が付いた見出しスコアは、再現可能な結果ではない。それは数字を横に添えた製品デモにすぎない。

何が知り得るもので、何がそうでないものか

このリリースをそれら2つのバケツに仕分けることが、読者が今日それを使ってできる最も有用なことだ。

現時点で判明していること:ベンダーが明示したパラメータ、アクティブ数、コンテキストウィンドウ;ベンダーによる3つのベンチマーク;Ant自身の製品内にこのモデルが存在すること;Antが選んだ比較対象セット;重み、ライセンス、モデルカードのいずれも公開されていないという事実;そして、前世代を独自にスコアリングした Artificial Analysis に Ling-3.1-flash のページが存在しないという事実。本稿執筆時点で、Ling-3.0-flash の Intelligence Index における20ポイントという数値を読み取れるようにした独立系スコアリングパイプラインは、3.1 について何も一切公開していない。

今は知りようがない。重みが実際にオープンになるのか、そしてどのライセンスで公開されるのか;アーキテクチャがLing-3.0スタックを拡大したものなのか、それとも新しいものなのか;APIを通すといくらかかるのか、そもそもAPIがあるのか;長いコンテキスト下で実際にどう振る舞うのか、ウィンドウがどう規定されているかとは対照的に;そして、Ant以外の誰かが同じタスクを実行したときに、ベンチマークの差が保たれるのかどうか。これらはそれぞれ、モデルなら初日に答える問いであり、発表されたモデルなら、まだ予定もされていない後日のいつかに答える問いである。

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

こんな日をどう読むか

このパターンは今や名前を付けられるほど一般的だ。実績豊富な中国のラボがモデルカードとベンチマークチャートを公開し、数値はフロンティア付近に並び、コミュニティがその数値に反応し、数週間後に重みが届く——あるいは届かない。Ling-3.0-flashはこの夏、まさにその展開をたどった。そして、それがどう決着したかを覚えておく価値がある。Antは2026年7月24日、ライセンス表示も独立したベンチマークもないAPI専用モデルとしてそれを発表し、MITライセンスの重みは発表から2週間後の8月7日までHugging Faceに現れなかった。Ling-3.1-flashは初日の時点で、その流れの相当する地点にあり、さらに今回は、オープンソース化の約束が推測ではなく発表の中で明示されているという違いがある。

アントが比較対象として選んだモデルは、いずれも記事の主題として当社のカタログには載っていない——Ling-3.1-flash、Ling-3.0-flash、Ling-3.0-flash-VL はすべて 本日の OrcaRouter カタログで not-found を返す。そして我々はそうでないふりはしない。だが、あのチャート上の比較相手のうち3つは今すぐルーティング可能だ。Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4.1-Flash はいずれも単一のキーの背後にあり、プロバイダの定価でマークアップはゼロ、しかもそれらの間で自動フェイルオーバーが働く。このことは、今週のような週には見た目以上に重要な意味を持つ。なぜなら、発表されたモデルを評価する誠実な方法とは、アントが誘っている比較——実際に呼び出せるモデルとの比較——を、比較の対象がまだチャートでしかないうちに実行することだからだ。

重みが公開されたとき、有用な問いはLing-3.1-flashが1つのEloレーティングでOpus 5を上回ったかどうかではない。約560BのMoE(アクティブ約25B)が、そのスパース性に見合う価格で1Mトークンのコンテキストを維持できるかどうか、そしてライセンスがセルフホストできるほど寛容かどうかだ。これらはこの発表が答えていない2つの問いであり、これが人々がその上に築くモデルになるのか、誰かの次のプレゼンの1枚のスライドになるのかを決める唯一の問いだ。今のところ:名前は実在し、数字はAntだけのもので、重みはまだ一文にすぎない。

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".