
Ling-3.0-flash: Ant Groupのオープンウェイト高速ティアMoEについて現在判明していること
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ant GroupのInclusionAIラボは、Ling-3.0-flashを正式にリリースしました。2026年7月24日に発表され、8月7日にMITライセンスでオープンソース化されました。7月にここで公開したプレビュー以来、状況は大きく変わりました。これは、合計パラメータ124B、トークンあたりのアクティブパラメータわずか5.1Bのネイティブなハイブリッド推論型Mixture-of-Expertsモデルであり、Lingファミリーの高速かつ低コストなティアとして構築されています。すべてを変えた2つの数字:Artificial Analysisは現在、インテリジェンス指数で38点(前世代の高速ティアであるLing-2.6-flashから24点上昇)を付け、さらにインテリジェンスと総パラメータの観点でオープンウェイトのパレートフロンティアに位置付けています。ウェイトはHugging FaceとModelScopeで公開中です。
このモデルを7月24日に初めて取り上げたとき、正直な要約は「APIのみ、ウェイトなし、ライセンス表明なし、独立したベンチマークなし」というものでした。その4つの記述はすべて、現在では古くなっています。Antは8月7日にウェイトをMITライセンスでオープンソース化し、Artificial Analysisはその後、完全な独立評価を公開しました。今回の更新は、それに応じて元の概要を修正するものです。「未検証」というラベルは7月の投稿では目立っていましたが、今ではモデル全体ではなく、主にAntのピーク速度の数値といった、はるかに限られた主張にのみ適用されます。
TL;DR.Ling-3.0-flash は Ant Group の高速ティア向けオープンウェイト MoE です:合計 124B / アクティブ 5.1B、MIT ライセンス、ネイティブコンテキスト 256K(提供時 262K)。Artificial Analysis のインテリジェンス指数は 38 — 前世代の Ling-2.6-flash から 24 ポイント上昇し、インテリジェンス対総パラメータ数のオープンウェイトパレート最前線に位置します — 測定された出力は約 368 トークン/秒です。ウェイトは Hugging Face と ModelScope で MIT ライセンスの下に公開されています。まだベンダー提供のみ:1,100+ トークン/秒のピークスループットの主張、100ms 未満のタイム・トゥ・ファースト・トークンの数値、モデルカードのベンチマーク表。ファーストパーティ API の価格は 1M トークンあたり入力 $0.075 / 出力 $0.22(キャッシュヒット時 80% オフ)。ローンチ時の無料ティアは 8 月 3 日に終了しました。
重要なポイント
• 高速/低コストのグレードであり、フラッグシップではありません。 前世代の1TパラメータのフラッグシップはInclusionAI最大のモデルのままです。Ling-3.0-flashは、大量テキスト処理とツール呼び出しに特化した、より小型で高速な兄弟モデルです。
• ウェイトは現在MITライセンスで公開されています。 ウェイトは8月7日、MITライセンスのもとでHugging Face(inclusionAI/Ling-3.0-flash)とModelScopeに公開されました。これは7月時点の「APIのみ」という状況からの転換です。
• ついに独立したスコアを得た。 Artificial Analysis は Intelligence Index を38と測定し、Ling-2.6-flashより24ポイント向上したとし、このモデルをオープンウェイトにおける知能対総パラメータ数のパレートフロンティアに位置付けている。
• 速度は現在部分的に測定されています。AAは約368トークン/秒の出力と約1.98秒のファーストトークン時間を記録。Antが宣伝する1,100+トークン/秒のピーク値は依然としてベンダー提供のみです。
• 価格は設定済みで、無料ローンチは終了しました。 ファーストパーティAPIの料金は100万トークンあたり入力$0.075 / 出力$0.22で、キャッシュヒット時は80%割引となります。ローンチ時の無料ティアは8月3日に終了しました。
• これは3モデルからなるファミリーの1つです。InclusionAIはラインアップを、Ling(汎用テキスト・ツール向けMoE、本モデル)、Ring(推論)、Ming(マルチモーダル)の3つに分けています。
このアップデートの読み方についての注記:これは7月24日プレビューの改訂版であり、ウェイトが公開され、最初の独立したスコアが登場した後に執筆されました。以下のすべての仕様、ベンチマーク、価格には出典が明記されています。Ant Groupが唯一の情報源である場合(ピーク速度の主張とモデルカードのベンチマーク表)、その旨を明確に述べます。Artificial Analysisが独立に測定した場合は、その情報源を引用します。
私たちが実際に知っていること
アーキテクチャは現在、モデルカードに完全に文書化されています。Ling-3.0-flashは、ネイティブなハイブリッド線形アテンション・スタック——Kimi Delta Attention(KDA)とGated MLAレイヤーが5:1の比率で交互に配置され(KDA 35層+MLA 7層)、KDAの細粒度対角ゲーティングを備える——を1/64スパースMoE(512個のルーティング・エキスパート、トークンあたり8個がアクティブ)の上に載せています。これにより、総パラメータ数124Bでありながら、アクティブなパラメータはわずか5.1Bとなっています。コンテキストウィンドウはネイティブで256Kであり、推論レシピでは262,144トークンで提供されます。Antは、このアーキテクチャが1Mまでスケールすると主張しています。最大出力長は開示されていません。このモデルはテキストのみで、ツール呼び出しに対応しています。マルチモーダル入力は、別のMingシリーズに搭載されています。
研究所は2つの重み形式を公開しています — BF16(約255GB)とFP8(約128GB)— そして、コミュニティによる量子化バリアントはすでにモデルカードからリンクされています。研究所自身のデプロイメントレシピはSGLangとvLLMを対象としています。
利用可能性: MITライセンスの下でのオープンウェイト
8月7日、Ant GroupのInclusionAIチームは、MITライセンスのもとでウェイトをHugging Face(inclusionAI/Ling-3.0-flash)とModelScopeでオープンソース化しました。これは寛容で商用利用可能なライセンスであり、Ling 2.0およびLing 2.6と同じものです。つまり、API経由でレンタルするのではなく、Ling-3.0-flashを自分でセルフホスト、ファインチューニング、デプロイできるということです。このモデルは、Ant自身の開発者APIや複数のサードパーティプラットフォームからも呼び出せます。この価格帯の高速モデルとしては、セルフホスト(FP8なら約128GBで動作)するか、APIに留まるかがより興味深い論点です。

独立スコア: AA Intelligence Index 38
7月の投稿からの最大の変化は、独立した数値が存在するようになったことです。Artificial AnalysisにはLing-3.0-flashのページがあり、Intelligence Indexで38と測定しています。これは、前の高速層世代であるLing-2.6-flash(14)より24ポイント高く、MiMo-V2.5やQwen 3.6 27Bと同等でありながら、それらのパラメータのごく一部しか活性化しません。Artificial Analysisはまた、このモデルを、知能対総パラメータ数におけるオープンウェイトのパレート最前線に位置付けています。すなわち、総パラメータ数がより少ないオープンウェイトモデルで、より高いスコアを出すものはありません。AAにおけるフラッシュ層のオープンウェイトリーダーであるDeepSeek V4 Flashは、依然としてより高いスコアを出しています(最大推論努力時のIndex 52)。
{{1}}エージェント型および長文コンテキストの結果も、方向性としては堅調です。{{/1}}{{2}}AAのτ3-Bench Bankingスイートでは、Ling-3.0-flashは27%のスコアを記録し、フラッシュ層のオープンウェイトモデルの中でDeepSeek V4 Flash(39%)に次ぐ2位となりました。{{/2}}{{3}}GDPval-AA v2ではElo 1108に達しており、Ling-2.6-flashの545から上昇しています。{{/3}}{{4}}Antは10,000以上の対話型環境(ベンダー報告)でモデルをトレーニングし、{{/4}}{{5}}エージェントワークフローの実行ノードとして位置づけています——高速・低コスト・使い捨て可能で、重量級の推論はより大きなフラッグシップモデルに委ねるという設計です。{{/5}}
情報源について1つ注意点:Antのモデルカードのベンチマーク表 — SWE-Bench Pro 56.6、SWE-bench Multilingual 72.4、MathArena AIME 2026 93.2、HLE 22.7 — はベンダー報告によるもので、まだ独立に再現されていません。これはラボ自身の主張として、以下のピーク速度の数値と同じカテゴリで扱ってください。
速度:まず測定、それから主張
速度をめぐる話は今や2つの異なるストーリーに分かれている。独立した計測として、Artificial AnalysisはファーストパーティAPI上で、出力速度が約368トークン/秒、タイム・トゥ・ファースト・トークンが約1.98秒と測定している。5.1BアクティブのMoEとしては確かに速く、このクラスの速度ランキングで上位に入るのに十分な数値だ。一方、Ant Groupは、指定のGPU構成において平均出力速度が1,100トークン/秒を超え、SGLang HiCacheとMooncakeを基盤とするクラスターレベルの階層キャッシュ層により、タイム・トゥ・ファースト・トークンが100ms未満と主張している。この2番目の数値群はベンダー独自のもので、Antが管理するハードウェアとバッチ設定で測定されており、独立した再実行結果は公開されていない。計画立案にはAAの数値を使うこと。1,100+トークン/秒はマーケティング上の上限値と見なし、自社のワークロードで検証すべきだ。

料金: 安い、そしてプロモーションは終了しました
Artificial Analysisは、ファーストパーティAPIを100万入力トークンあたり0.075ドル、100万出力トークンあたり0.22ドルと記載しており、キャッシュヒットは0.015ドル(−80%)となっている。すべてベンダー設定の価格だ。ローンチ時の無料ティア(1日あたり50万無料トークン、無料APIアクセス)は8月3日に終了し、AntはLing Studioで2026年8月31日までの一時的な75%オフ期間を実施した。その後は定価が適用される。定価でも、0.075ドル/0.22ドルという価格は、インデックス38のモデルとしてはLing-3.0-flashを間違いなく低価格帯に位置づける。
これだけ価格が低いと、トークン単価よりも乗り換えコストの方が重要になります。OrcaRouterは、その乗り換えを安価にするために存在します:200以上のモデルに対応する単一API、プロバイダーの定価を0%マークアップでそのまま透過、プロバイダー間の自動フェイルオーバー。つまり、今回のように新しくオープンしたモデルが理論上は良さそうに見えても、追加の契約なしで実際のワークロードでテストでき、特定のタスクで期待を下回った場合は、同じキーの背後で別のモデルにフォールバックできます。
Ling家 / Ring家 / Ming家
Ling-3.0-flashは単独で存在しているわけではない——InclusionAIはリリースを3つの名前付きファミリーに整理しており、それぞれ異なる役割を担っている。Lingは日常的なテキスト生成とツール呼び出しのための汎用MoEラインであり、Ling-3.0-flashはその高速・低コスト寄りの端に位置し、前世代の1Tパラメータのフラッグシップより一段下にあたる。Ringは推論に特化したラインで、多段階のチェーン・オブ・ソート(思考連鎖)向けに構築されている。Mingはマルチモーダルラインである。タスクにより高度な推論や画像入力が必要なら、適切なInclusionAIモデルはおそらくLing-3.0-flashではない——それはテキストとツールの領域で量と速度のために作られているのだ。
対象者: 3つのシナリオ
1. 高ボリュームでレイテンシーに敏感なテキストまたはツール呼び出しパイプライン
これがこのモデルの本拠地です。独立したIndexが38、MITライセンス、そして測定値で約368 tok/sという条件下で、高速ティアの賭けはもはや仮説ではなくテスト可能なものになりました。独自の評価セットを実行することも、重みを取得してセルフホストすることもできます。ただし、ベンダーが主張する1,100+ tok/sの上限を基準に構築しないでください。実際にあなたのワークロードで測定するまで、その数字に依存するのは危険です。
2. 予算に制約があるが長いコンテキストが必要なチーム
256Kのネイティブコンテキスト(提供時262K)で、1Mへの道筋が示されており、$0.075/$0.22という価格は、検索多用や文書処理の作業にとって魅力的な組み合わせです。モデルカードの長文コンテキストの数値はベンダー報告によるものなので、確立された長文コンテキストのオプションと比較検討し、コミットする前に自社のコーパスで検証してください。
3. 中国のMoE情勢とInclusionAIのロードマップを追跡するウォッチャー
7月の問い——InclusionAIはオープンであり続けるのか——に、今答えが出た:イエス、MIT、そして速い。Ling-3.0-flashが5.1BのアクティブパラメータでAA Pareto frontierに到達したことは、中国のラボが生のパラメータ数ではなく効率で競争しているのを追跡する誰にとっても、一つのデータポイントだ。
まだ検証されていないものは何ですか
大きなギャップが埋まったので、短いリストを挙げる。ベンダーのピーク速度の主張(1,100+ tok/s、100ms未満のTTFT)には、独立した再測定がなされていない。モデルカードのベンチマーク表はベンダー報告によるものだ。FP4/INT4バリアントと単一DGX-Spark展開パスは、ベンダーの表明による。そして知識に関しては、AAのOmniscience Indexは、前世代からの改善が主に棄権(回答拒否)によるものであることを示している。幻覚は減少し(97%→44%)、正確性はわずかに上昇した(16%→18%)— したがって、見出しとなる指数の飛躍を、全面的な知識の飛躍と誤解してはならない。
使用すべきでない場合
マルチモーダル作業にはLing-3.0-flashをスキップしてください。それはMingラインです。高速な実行役ではなく重量級の推論フラッグシップが必要なら、それもスキップしてください。それはRingの担当です。自社ホストを計画しているなら、実際のハードウェアを予算に組み込んでください。BF16はおよそ255GB、FP8はおよそ128GBです。そして、主張が重要なら、検証してください。ピーク速度と長文コンテキストの数値は、独立した研究所が再実行するまでAntのものです。
よくある質問
Ling-3.0-flashはオープンウェイトですか?
はい。ウェイトは8月7日にMITライセンスのもとでオープンソース化され、Hugging Face(inclusionAI/Ling-3.0-flash)とModelScopeで公開されました。これは寛容で商用利用可能なライセンスであり、Ling 2.0およびLing 2.6がリリースされた際と同じものです。
Ling-3.0-flashはベンチマークでどのような性能を示しますか?
Artificial Analysis は、Ling-2.6-flash より24ポイント高い知能指数38を測定し、このモデルを、知能対総パラメータ数のオープンウェイト・パレートフロンティア上に位置づけている。Ant のモデルカードにあるベンチマーク表(例:SWE-Bench Pro 56.6)はベンダーによる報告であり、独立に再現されていない。
実際にはどのくらい速いのですか?
Artificial Analysisは、ファーストパーティAPIでの出力速度を約368トークン/秒、TTFT(最初のトークンまでの時間)を約1.98秒と測定している。一方、Antは指定のGPU構成においてピークスループット1,100+トークン/秒、100ms未満のTTFTを主張しているが、これらはベンダー発表の数値であり、独立した再測定は行われていない。
Ling-3.0-flashの料金はいくらですか?
AAは、ファーストパーティAPIを入力トークン100万個あたり0.075ドル、出力100万個あたり0.22ドルで提供しており、キャッシュヒット時は80%割引となります。ローンチ時の無料枠は8月3日に終了し、Ling Studioでは2026年8月31日まで一時的に75%オフの期間が設けられています。
コンテキストウィンドウはどのくらいの大きさですか?
ネイティブで256K、262,144トークンで提供されます。Antは、このアーキテクチャが1Mまでスケールすると主張しています。最大出力長は非公開です。
Ling、Ring、Mingの違いは何ですか?
LingはInclusionAIの汎用テキストおよびツール呼び出し対応MoE系統であり、Ling-3.0-flashはその高速・低コスト寄りの位置づけです。Ringは推論に特化した系統です。Mingはマルチモーダルタスクを担当します。これらは1つのモデルの階層ではなく、用途に応じた別々の系統です。
Ling-3.0-flashは従来の1Tフラッグシップと同じものですか?
{{1}}いいえ。Ling-3.0-flashは、より新しく、より小型の高速ティア版リリースです(合計124B / アクティブ5.1B)。{{/1}}{{2}}従来世代の1Tパラメータのフラッグシップは、依然としてより大きなモデルです。{{/2}}
今日、本番環境でLing-3.0-flashを使用すべきですか?
7月時点のものよりも正当化しやすくなった。独立したスコアとMITライセンスが得られたからだ。まず自前の評価セットを実行し、ベンダーの速度主張を自社のワークロードで検証して、APIとセルフホスティング(FP8は約128GBで動作)のどちらかを決定すること。残りのベンダー専用の数値は、計画を立てられる程度に絞られている。
結論
Ling-3.0-flashは、「スペックシートとベンダーの主張」から「オープンウェイトかつ独立評価済み」へと、わずか2週間で移行した。5.1BのアクティブパラメータでAAインテリジェンス指数38を達成し、オープンウェイトのパレート最適フロンティア上に位置する。MITライセンス、価格は$0.075/$0.22。これは現在利用可能な中で最も効率的なオープンウェイトモデルの一つであり、しかも実際に自分で実行できるモデルだ。注意点は以前より限定的になっている。ピーク速度とモデルカードの数値は、独立した研究所が再現するまでは依然としてAnt社の公称値である。この価格帯で高ボリュームのテキスト処理やツール呼び出しを行う用途において、真の評価に値する実績を獲得している。

