
Ling-3.1-flash vs Ling-3.0-flash:100万トークンウィンドウと4.5倍のパラメータが実際に変えるもの
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 262 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
Ant GroupのLingファミリーに新しい高速ティアが加わった。しかも今回は、登場からまだ一文の長さしか経っていない。Ling-3.1-flashは2026年9月30日に発表された——総パラメータ数はおよそ5,600億、トークンあたりのアクティブは約250億、コンテキストウィンドウは最大100万トークンとされ、そこに定型文が添えられている。「近くモデルをオープンソース化する予定だ」。高速ラインの頂点でこれに置き換わるモデル、Ling-3.0-flashは、あらゆる意味で別物だ。総パラメータ数は1,240億、トークンあたりのアクティブは51億、提供コンテキストは262,144トークン、8月7日からHugging FaceでMITライセンスの重みが公開されており、独立系のArtificial Analysis Intelligence Indexは20。このモデルのうち片方は、今日ダウンロードできる。もう片方は、記事で読むことしかできない。両者を比較することは本当に有用だが、それは比較がそこから始まる場合に限る。
見出しの計算は簡単で、やや誤解を招く。Ling-3.1-flashの総パラメータ数はLing-3.0-flashの約4.5倍、アクティブパラメータ数は約4.9倍 — トークンあたり25B対5.1Bだ。軽く読むと「ずっと大きなモデル、だからずっと賢いモデル」となる。より注意深く読むと、Antは本体をスケールさせつつスパース性の比率をほぼ維持しており、それによって得られるのは容量であり、必ずしもトークンあたりの推論深度ではない。各トークンで560Bのうち25Bをルーティングするモデルは、5.1Bをルーティングするモデルよりもトークンあたり多くの仕事をしているが、そうするためにトークンあたり約5倍の計算量も支払っている。そのトレードオフがどこに落ち着くかは、Antのアーキテクチャが追加パラメータを効率的に扱えるかどうかに完全にかかっている — そしてそれは、この発表が答えていない問いである。
二つのモデルを並べて
公表された事実を並べれば、各世代はきれいに分かれる。以下の各行は、Ant または独立した評価者が実際に公表した内容を示している。数値が欠けている場合、それは誰も公表していないからである。
• 総パラメータ数 — Ling-3.1-flash: 約560B(ベンダー)。Ling-3.0-flash: 124B(モデルカード)。
• トークンあたりのアクティブパラメータ数 — Ling-3.1-flash: 約25B(ベンダー)。Ling-3.0-flash: 5.1B(モデルカード)。
• コンテキストウィンドウ — Ling-3.1-flash: 最大100万トークン(ベンダーによる)。Ling-3.0-flash: ネイティブ256K、262,144で提供(モデルカードおよび推論レシピ)。
• 重みとライセンス — Ling-3.1-flash: 未公開。リポジトリもライセンスもなし(2026年9月30日および10月1日に確認)。Ling-3.0-flash: MIT、2026年8月7日以降、Hugging Face に inclusionAI/Ling-3.0-flash として、また ModelScope にて公開。
• 重み形式 — Ling-3.1-flash:提供なし。Ling-3.0-flash:ラボ提供のBF16(約255GB)とFP8(約128GB)、およびコミュニティによる量子化版。
• ベンチマークの出所 — Ling-3.1-flash:完全にベンダー報告であり、公開ハーネスも、再実行するための重みもない。Ling-3.0-flash:Artificial Analysis によって独立に採点され、Intelligence Index は20で、測定済みの出力速度とトークン生成量も併せて公開されている。
• 提供状況 — Ling-3.1-flash:Ant自身のLing Studio製品のみ。Ling-3.0-flash:セルフホスト可能で、さらにAntの開発者APIを通じて呼び出し可能。

余分な容量はおそらく何のためか
Ant自身によるLing-3.1-flashの一行説明は、今回のリリースで最も情報量が多い。Ling Studioアプリはそれを「汎用エージェント、検索、日常的なオフィス業務、ソフトウェア/コード開発」向けとして売り込んでいる——推論ベンチマーク向けの枠組みではなく、オフィス業務とエージェント的な枠組みだ。これはこのファミリーの構成方法と一致している。Lingは汎用のテキスト&ツール系、Ringは推論系、Mingはマルチモーダルを担当する。Ling-3.0-flashは一世代前に同じ位置を占めており、フラッグシップではなく、明確に高速で安価な階層だった。
その観点でこのスケールアップを読めば、納得がいく。エージェント型およびツール呼び出しのワークロードは長く、反復的で、コンテキストを大量に消費する。単一のエージェントループは、行動を起こす前に、蓄積されたツール出力で数万トークンを消費しうる。したがって、100万トークンのウィンドウは、スペック表の飾りではなく、機能上の要件である。総パラメータ数を増やしつつ、アクティブなパラメータの割合を大きく保つことこそ、ループ内に収まるのに十分な速さをなお備えなければならないモデルに、世界知識と指示追従の深さを加える方法だ。Antはここで、より遅く、より賢い旗艦を構築しているのではない。より大きな高速ティアを構築しているのだ。
反論はコストであり、それは反対方向からやってくる同じ計算だ。追加の容量は推論時に無料ではない——トークンごとに支払われるものであり、AntはLing-3.1-flashの価格を一切公表していない。APIの料金表も、キャッシュ割引も、前世代が記載する100万トークンあたり$0.075/$0.22に匹敵するものもない。それこそがこの比較を決めるはずの欠けた数値であり、それが欠けている。
ベンチマーク、そしてそれを実行したのは誰か
Ling-3.1-flashは、単独で見れば強く見える3つのスコアを携えて登場する。GDPVal-AA v2.1でElo 1,673、FrontierSWEで75.16、HealthBench Professionalで65.35だ。3つともAnt自身のもので、発表から引用されたものであり、外部ラボによって再現されたものは一つもない。実用的な帰結として、これらは他のベンダーの数値とは比較できるが、独立系の数値とは比較できない——そして、Artificial AnalysisによるLing-3.0-flashの20点のIntelligence Indexは、異なる尺度上の独立した数値であり、両者を並べることは測定値と主張を比較することになる。執筆時点で、Artificial AnalysisにLing-3.1-flashのページは存在しない。
Ant自身のチャートにある脚注が一つ、それ自体として指摘する価値がある。そのカードには、HealthBench Professionalの結果は「AQ環境」で評価されたと記載されており、Ling-3.1-flashのヘルスケア能力は現在AQでしか体験できないとされている。AQとは何なのかを説明する公開ドキュメントはない。名前の明かされていない環境条件を伴う見出しのスコアは、たとえ重みが存在するようになっても、外部チームが再現できるものではない。
今週は実際にどれを使うべきか
何世代のモデルを選ぶかという問いは、今日何を必要としているかによって答えが変わり、ほぼすべての人にとって、今の答えは新しいモデルではない。
今週中に何かを動かす必要があるなら、2つのうち使用可能な形で存在するのは Ling-3.0-flash だけです。セルフホストできる MIT ウェイト、より小さなフットプリントを望むなら FP8、ファーストパーティ API の料金公開、そして何が得られるかを教えてくれる独立したスコアがあります。これはその階層では本当に優れたモデルです — 独立系評価は、総パラメータ数に対する知能の点でそれをオープンウェイトのパレートフロンティア上に位置づけ、速度も高く評価しました。ただし、異常に冗長で、評価中に約2億6000万トークンを生成したという注意点があります。中央値は約1億トークンでした。
今後6か月の計画を立てているなら、Ling-3.1-flash は進むべき方向であり、まだコンポーネントではありません。それがコンポーネントになる前に注視すべき具体的な点は、重みが実際にオープンになるのか、どのライセンスで公開されるのか、提供されるウィンドウが本当に 1M なのか、それともより短いネイティブコンテキストの拡張なのか、100万トークンあたりのコストはいくらか、そして独立したラボが FrontierSWE の 75.16 を再現するかどうかです。これらのいずれかが実現すれば、比較を再実行する理由になるでしょう。まだどれも実現していません。

これがルーティングセクションのどこに位置するか
当社のカタログにLingモデルは現在掲載されていません — Ling-3.0-flash、Ling-3.0-flash-VL、Ling-3.1-flashはいずれもnot-foundを返します OrcaRouterのモデルAPIに対して。つまり「そちら経由で呼び出せますか」という問いに対する正直な答えは、今のところ「いいえ」です。こういう週にルーティングレイヤーが実際に役立つのは、問題のもう半分、すなわち候補モデルを比較評価する際に相手側となるモデルです。Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4.1-Flashはいずれもプロバイダー定価・マークアップなしで利用できる稼働中のルートであり、それらを1つのキーの背後にまとめ、自動フェイルオーバーを備えたルーターがあれば、4つの連携を保守することなく、評価ハーネスを動く標的に向け続けられます。Ling-3.1-flashの重みが公開され、ライセンスが読めるようになったときも、判断の形は同じです。スタックを作り直すのではなく、エンドポイントを1つ追加するのです。
世代別の要約は短い。Ling-3.0-flash は出荷済みで、独立に評価され、寛容なライセンスで提供され、現在セルフホストできるモデルだ。Ling-3.1-flash は、より大規模で、より長いコンテキストを持ち、実行コストがより高いという約束であり、Ant は開発者が使えるいかなる形でもまだそれを提供していない。2番目を1番目のアップグレードとして扱うことが、このリリースが招く誤りであり、数値はまだそれを裏付けていない。

