生成された編集用ヒーローカード、タイトルは「Ling-3.1-flash が公開、2週間無料」、サブタイトルは「560B MoE が今日実際に提供するもの」。4枚の角丸カードには「パラメータ:総計560B / アクティブ約25B」「コンテキスト:262,144トークン」「出力上限:32,768トークン」「重み:未公開」とあり、その下のフッター行には「ベンダー公称仕様;トライアル後の価格は未公表。」とある。
Guides & Insights

Ling-3.1-flashが公開、2週間無料:560B MoEが実際に提供するものとは

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ling-3.1-flashは、Ant GroupのinclusionAIラボが2026年9月29日から30日にかけて発表した約5600億パラメータのMixture-of-Expertsモデルだが、今週、プレスリリースの段階を終えた。今や商用のライブAPIでリクエストに応答している。このモデルはサードパーティの推論ゲートウェイで2週間の無料トライアルとして稼働しており、Ant自身のLing Studio製品にも登場している。これにより、疑問は「存在するのか」から「実際に何を提供しているのか」へと移る。答えは、見出しの数字が示唆するよりも限定的だ。Ling-3.1-flashはテキスト入力・テキスト出力であり、発表では最終目標として100万トークンが挙げられているが、実際に提供するコンテキストは262,144トークン(256K)だ。出力は32,768トークンに上限が設けられている。そして、無料期間が終了し、重みも後に続くことになっている15日目に支払う価格を公表した人は誰もいない。

発表カードと実際に動いているエンドポイントの間にあるこのギャップこそ、手放さずに握っておくべき有益なものだ。というのも、仕様書はまるでモデルが今日それを出荷するかのように読めてしまうからだ。実際、そう読める。Ling-3.1-flash は、このラボが3か月のうちに送り出した2番目のモデルであり、独立系トラッカー LLM Releases が「weights not released」と端的に分類する形で登場した。そして、Ant がこのモデルはこうだと語るものと、開発者が今すぐ呼び出せるものとの差こそ、予算やパイロットが静かに狂いやすいところなのだ。

発表時点と今日の間で何が変わりましたか

発表そのものは仕様を述べた投稿でした。総パラメータ数は約560B、トークンあたり約25Bがアクティブ、最大100万トークンのコンテキスト、主要な評価数値が3つ、そして「近日中にモデルをオープンソース化する予定です」という約束です。それらのどれも変わっていません。変わったのは利用可能性です。発表から1日も経たないうちに、モデルは商用エッジ上で利用可能になり、無料トライアルは有料版が使うのと同じ本物のエンドポイントを利用可能にします。同じAPIサーフェス、同じテキスト専用モダリティ、長期的なエージェント作業のための同じ思考モード切り替えです。

エンジニアリング時間をそこに費やすべきか判断しようとしている人にとって、今週はトライアルがすべてであり、それは諸刃の剣だ。2週間の無料推論は、自分のプロンプトでモデルがどう振る舞うかを確かめるための本当に安上がりな方法であり、この規模のモデルでは珍しい。しかし無料はプロモーション上の状態であって、価格ではない。Ling-3.1-flashのトライアル後料金表はまだどこにも公開されていない。だから無料枠を前提に組み立てるコストモデルは、Antとそのホスティング事業者が数字を出すまでの暫定的なものにすぎない。

スペック表、そしてまだ約束にとどまっている3つの数字

• パラメータ — 総計560B、トークンあたり約25Bが有効。ベンダー公表値で、前世代の総計124B/有効5.1Bのほぼ4倍。スパース率は約22分の1前後を維持しているため、有効化される部分が劇的に軽くなったわけではなく、単に後継元のモデルよりずっと大きいだけだ。

• コンテキスト — 本日時点では262,144トークンで提供されています。「最大100万」はウィンドウが有効化された後の目標であり、トライアルエンドポイントが提供するものではありません。そして、これがこのリリースで最もよくある誤読です。

• 出力 — 最大32,768トークン。エージェントループには妥当だが、長いドキュメントを一度に生成するつもりなら厳しめ。

• モダリティ — テキスト入力、テキスト出力。これはテキストモデルです。ビジョン、音声、ファイル入力は今回の提供開始には含まれておらず、それらについての時期も示されていません。

• 推論 — 明示的な思考モード切り替えを備えたハイブリッドスタックで、前世代が採用したのと同じパターンであり、単一ターンのチャットではなく、多段階のエージェント作業やツール呼び出しを対象としています。

• 重みとライセンス — 未公開。これが最も重要でありながら、まだまったく値のない項目です。Hugging Face リポジトリも、ライセンス文も、ダウンロード可能なチェックポイントも、本日時点では存在しません。

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

ベンチマークカード——必要な割引を適用して読むもの

Ant自身の報告では、Ling-3.1-flashは5つのエージェントベンチマークにわたる総合で81.0となっており、Terminal-Bench 4.0で40.4%、SWE-Atlasで55.9%、HealthBench Professionalで65.35%です。同社自身の説明ではさらに、GDPVal-AA v2.1で1,673 Elo、FrontierSWEで75.16を加えています。これらの数値はすべて自社によるものです。第三者がこのスイートを再実行するためのハーネスも、プロンプトセットも、重みも存在しません。これはこの段階のモデルに付きものの標準的な注意点です。そしてここで率直に言っておく価値があります。再現されていないベンダースコアは、モデルについての主張であって、モデルの測定値ではありません。

このカードは、制作者が意図していなかったかもしれない形でも示唆に富んでいる。Terminal-Bench 4.0 の40.4%という結果は、フロンティア層には遠く及ばない。Claude Sonnet 5.5 は旗艦ではなく中量級モデルだが、そのベンチマークの同じバージョンで70.6%を記録している。正直に読めば、Ling-3.1-flash が弱いということではない — 40.4%は、コスト重視の位置づけにあるモデルとしては、エージェント型ターミナルとして立派な数字だ — そうではなく、発表日にソーシャルメディアで流布した「主要ベンチマークでフロンティアに近い」というフレーミングが、個別の行を突き合わせた時点で通用しなくなるということだ。モデルが最も強く見えるベンチマーク、HealthBench Professional の65.35もまた、厄介な脚注を抱えている。Ant は、AQ と呼ぶ環境で評価されたと述べており、またこのモデルのヘルスケア能力は「現在は AQ でしか体験できない」としているが、AQ とは何なのかは公の場のどこでも定義していない。名前のない環境が付随する見出しスコアはデモであり、再現可能な結果ではない。

なぜ大規模モデルが試用版として登場することが本当のニュースなのか

ここでより興味深い動きは、パラメータではなく順序のほうだ。Ling-3.0-flash はまっすぐオープンウェイトへ進んだ。今回のモデルはトライアル先行で登場しており、ウェイト、ライセンス、公式価格はいずれも保留され、無料期間が終わって初めてオープンソースにするという公約が示されている。それは、オープンモデルの発表を装った商用リリースの手口であり、追跡する価値のある本物の変化だ。もしウェイトが寛容なライセンスで提供されれば、コミュニティはファインチューニングと蒸留に使える560Bのベースモデルを手に入れる。もし商用条件が付いて提供されるなら、2週間のトライアルこそが製品であり、「オープンソース」という文言はマーケティングだったことになる。いずれにせよ、その選択はトライアル期間内に下される。そして、個々のベンチマークの行ではなく、注目すべきなのはまさにそれだ。

どこで動作するのか、そして正直なルーティングの全体像

現時点では、Ling-3.1-flash はベンダー自身のプロダクトサーフェスと、トライアルを提供しているサードパーティ推論プラットフォームを通じて利用可能であり、現状はそれだけです。本日時点で OrcaRouter のカタログには掲載されていません。当社の公開モデル API に対して Ling-3.1-flash、Ling-3.0-flash、および Ling-3.0 vision variant を照会しても、すべて not-found が返ります。そして、そうでないふりをするつもりはありません。Ant エンドポイントが一般提供に達し、定価リストが公表されたとき、OrcaRouter が採用しているパススルーモデル——プロバイダーの定価をマークアップなしでそのまま転送するため、ベンダーの値下げが同日に当社側で反映される——は、価格がまだ未定のモデルにまさに適した仕組みです。

ライセンスの決定を待たずに今日できるのは、実績のないモデルにとって本当に重要な比較を実行することです。つまり、今すぐ呼び出せるFlashティアのモデルと比較して測定することです。 Gemini 3.8 FlashとDeepSeek-V4.1-Flashはどちらも、各プロバイダーの定価で当社のカタログに掲載されており、1つのAPIキーで利用でき、両者間で自動フェイルオーバーが行われます。重みと料金表の両方が不明な無料トライアル中のモデルにとって、それが賢明な扱い方です。トライアルが続く間はルーティングできるもう1つの候補であり、15日目に何が起こるかに依存しない本番パスです。

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

今週やること

そのモデルがあなたの業務に関係するなら、オープンウェイトの疑問が解決するのを待つよりも今動く理由になるのはトライアルです — 560B MoE での2週間の無料推論は、あなたが得られる最も安価な評価であり、「自分のプロンプトで通用するか」への答えは今日得られますが、「自分でセルフホストできるか」への答えはまだ得られません。ウィンドウが開いている間に確認すべき3つのことを、順に:

• ベンチマークカードではなく、自分のワークロードを実行しよう。公表されている数値はAntが選んだタスクにすぎず、あなたのスタックを決めるのはあなた自身のプロンプトです。

• 実際に使うコンテキストでテストすること。このエンドポイントが提供するのは262,144トークンであり、1Mではない。より大きなウィンドウを前提に設計するなら、それは約束に頼った設計をしていることになる。

• 「無料」を前提にコストモデルを構築しないこと。「無料」は2週間だけの状態だ。料金表が公開されるまでは、デフォルトとして有償のFlashティアモデルに戻す計画を立て、Ling-3.1-flashは追加キャパシティとして扱うこと。

発表は本物で、モデルも動いている。1週間前には到底言えなかったことだ。だが、リリース済みでオープンであることと、試験運用中であることは別の状態であり、今回のこれは紛れもなく後者だ — 560B仕様、256Kエンドポイント、ベンダー提供のみのベンチマークカード、そしてリリース全体で唯一の確定した締め切りである2週間というタイムリミット。

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新