
Ling-3.1-flash 対 Gemini 3.8 Flash:256K のトライアルモデルと 1M トークンの実運用モデルの対決
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Ling-3.1-flash と Gemini 3.8 Flash を並べてみると、その不一致は知能の話ではなく、状態の話だ。Ling-3.1-flash は、Ant Group が2026年9月29日から30日に発表した約560Bパラメータの Mixture-of-Experts で、2週間の無料トライアル、提供コンテキスト256K、出力上限32,768トークン、テキストのみの入力、そして公開された重み・ライセンス・価格はない。Gemini 3.8 Flash は、Google が2026年9月2日にリリースした Flash ティアの推論モデルで、一般提供のAPI、フル1,048,576トークンのウィンドウ、65,536トークン出力、マルチモーダル入力、公開料金表を備える。机上では、それは2つのモデルの比較だ。実際には、今日その上に構築できるモデルと、今月テストできるだけのモデルの比較なのだ。
それはLing-3.1-flashを切り捨てる理由にはならない。エージェント寄りの無料560B MoEなら、誰であれ2週間の評価時間をかける価値がある。しかし、それは直接対決の目的を変える。「どちらを標準採用すべきか」ではなく、「試用モデルは、15日後の結論に保険をかけるべきかどうかを判断できるほど十分に良いか」である。これらは別の問いであり、以下のあらゆる軸で異なる答えを持つ。
ベンチマークが決める前に、それを決める3つのこと
ほとんどの比較はスコアから始まる。これは可用性から始めるべきだ。そこにある隔たりは程度の問題ではないからだ。
• 料金 — Ling-3.1-flash はトライアル期間中は無料で、トライアル後の料金表は一切公開されていません。Gemini 3.8 Flash はプロモーション期間中、入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルで、2027年1月1日に1.50ドル/7.50ドルに戻ります。ベンダー報告による定価であり、いずれも変更される可能性があります。
• 背景 — Ling-3.1-flash はトライアルで262,144トークンを提供し、最終的な目標として1,000,000が挙げられています。Gemini 3.8 Flash は現在、完全な1,048,576トークンを提供しています。ワークロードが100万トークンのウィンドウに依存しているなら、この2つのうち今それを備えているのは1つだけです。
• 重み — Ling-3.1-flash は何も公開していません。リポジトリも、ライセンスも、チェックポイントもなく、トライアル後にオープンソース化するという意向が示されているだけです。Gemini 3.8 Flash はクローズドで、今後もずっとそうですが、今日すぐに曖昧さなく呼び出せるマネージド API です。
まとめて読むと、それら3つは1つの点を示している。Lingモデルの目玉となる利点は宣伝的(無料)か将来的(100万コンテキスト、オープンウェイト)であるのに対し、Geminiモデルの利点は契約上のものだ。この非対称性は、この後に続くすべてに通底している。
Lingモデルが真に勝る点
二つの場所、どちらも実在する。
第一は、評価中のコストだ。この規模のモデルでの2週間の無料トライアルは、一蹴して片付けられるマーケティング上の小細工ではない。560Bのmixture-of-expertsがあなたのプロンプトを扱えるかどうかを見極める、最も安上がりな方法なのだ。Gemini 3.8 Flashは、価格がいくらであれ無料ではなく、数千回の呼び出しにわたる本格的な評価には実際の金がかかる。
2つ目はオープン性の軌道です。Ling-3.1-flashは、MITライセンスの重みを実際にリリースしたモデルの後継であり、Antはこれもオープンソース化する意向を公に表明しています。もしそれが寛容なライセンスで実現すれば、Gemini 3.8 Flashが決して提供できないものを得られます:560Bのベースモデルをセルフホスト、ファインチューニング、または蒸留する選択肢です。落とし穴は最も重要なものです — あなたは約束に賭けているのであり、前世代の約束は保証ではなく2週間の遅延で果たされました。
Gemini 3.8 Flashが負けそうにないところ
トライアルとオープン性の問題を取り除いてしまえば、運用面での比較はGoogle側に大きく傾いている。
• 入力 — Gemini 3.8 Flash はテキスト、画像、動画、ファイル、音声を受け取ります。Ling-3.1-flash はテキストを受け取り、テキストを返します。ドキュメント、スクリーンショット、動画のワークフローにとって、これは好みの問題ではなく、能力の境界です。
• 出力上限 — 65,536トークン対32,768。レポート、コードファイル、または長い構造化出力を一度のパスで生成するまさにその瞬間に関わってきます。
• スループット — 独立系テストでは、Gemini 3.8 Flash の出力速度の中央値は毎秒約249トークンで、OrcaRouter 自身の7日間テレメトリでは毎秒552トークン、初回トークンまでの p50 は4.95秒と測定されています。Ling-3.1-flash のトライアルホスティングは毎秒約63トークンと報告されています。Gemini モデルは速度クラスが別格です。
• 参照の深さ — Gemini 3.8 Flash には、独立した測定による裏付けが蓄積されている。一方、Ling-3.1-flash の数値はすべてファーストパーティによるもので、真新しいエンドポイント上のものであり、第三者による再検証はまだ行われていない。
• マルチモーダルエージェント — スクリーンショット、PDF、録音された通話を読まなければならないものは何であれ、品質によってではなく構造上Geminiのタスクである。

ベンチマーク、そして2つのセットが実際には比較にならない理由
Ling-3.1-flashについてベンダーが報告した根拠は、5つのエージェントベンチマークにわたる81.0の総合値であり、Terminal-Bench 4.0では40.4%、SWE-Atlasでは55.9%、HealthBench Professionalでは65.35%となっている。Ant自身の説明では、GDPVal-AA v2.1で1,673 Elo、FrontierSWEで75.16が加わる。それらはすべてAnt自身の測定値である。公開されたハーネスはなく、さらに重要なことに、誰かがそのスイートを再実行するための重みも存在しない。
Gemini 3.8 Flashの様相は根本的に異なる。Artificial Analysisの現在のIntelligence Indexビルド(v4.3.2)では、推論エフォート高で40.9、中で39.8、低で33.5を記録する。そして、このインデックスは最近改訂されたため、秋口にこのモデルについて公表された数値は別のビルドで算出されたものであり、これらと直接比較することはできない点は指摘しておく価値がある。Google自身によるこのモデルの主張には、H-Verifiedでの54.9や、Terminal-Bench 2.1での80点台後半という強い結果が含まれる。独立機関とベンダー、両者を並べて見るべきであり、どちらも正当だが、互いに置き換え可能なものではない。
実施する価値のある明快な横断比較が1つある。なぜなら両者は同じベンチマークファミリーに属しているからだ。Terminal-Bench 4.0では、Ling-3.1-flashのベンダー公表値は40.4%だ。Claude Sonnet 5.5——フラッグシップではなくミッドティアのモデル——は、同じバージョンで70.6%を獲得している。そのたった1行こそ、Antのカードを「フロンティア隣接」と読むことに対する最も強い反論だ。このモデルは、Antが強調するために選んだエージェント的指標では競争力があり、外部の数値が存在するターミナルコーディング指標では明らかに後れを取っている。

選択の実際的な形
今後2週間で何かを作る必要があるなら、答えは明白であり、それはLing-3.1-flashを貶めるものではない。Gemini 3.8 Flashだけが、この2つのうち、安定したエンドポイント、公開価格、100万トークンのフルウィンドウ、マルチモーダル入力、そして読むことができるライセンスを提供する唯一の存在だ。これはプロダクション向けFlashティアのモデルである。
Ling-3.1-flashは評価対象です。現時点でのその価値は、評価が無料であることと、モデルが興味深いことにあります。560B MoEでトークンあたり約25Bしかアクティブでないのはスパース性への賭けであり、AntはまさにFlashティアのモデルが競合するエージェント、検索、オフィス自動化のワークロード向けにそれを位置付けました。トライアル期間中に自分のプロンプトをそれに通してみる価値があるのは、Antの外部でまだ誰もそれをやっていないからです — あなたはベンダー以外の意見を持つ最初の一人になるでしょう。
今月、理にかなう判断ツリーはこうだ。本番は Gemini 3.8 Flash に回し、無料トライアルは最も難しいプロンプトに対して Ling-3.1-flash を走らせることに使い、オープンウェイトの問いは本当の分岐点として保留する。もしウェイトが寛容な条件で登場し、価格が Flash ティア並みに着地すれば、Ling-3.1-flash は真の第2の選択肢になる——自分でホストできる選択肢であり、Gemini がそうなることは決してない。もしひも付きで登場するなら、トライアルは終わり、比較も終わる。
1つのキーで両方を実行し、欠けているものについては正直に言う
Gemini 3.8 Flash は本日より OrcaRouter のカタログにモデル ID google/gemini-3.8-flash で掲載されており、Google 自身の定価そのまま、マークアップはゼロです。そのため、1 月にプロモーション料金が終了しても、ここで支払う価格は自動的にそれに追従し、新たな契約を結ぶ必要はありません。同じ実験で測定する価値のあるもう一つの低価格な Flash ティアモデル、DeepSeek-V4.1-Flash も同じカタログにプロバイダーの定価で掲載されているため、試用モデルと既存の Flash ティアの選択肢を比較する三者間テストは、単一の API キーの背後で 自動フェイルオーバー を挟んで実行できます。
Ling-3.1-flash は当社のカタログにはなく、当社の公開モデル API に対する照会でも、これと前世代については not-found が返ります。したがって正直な枠組みとしては、トライアルは提供されている場所で、ベンダー自身のサーフェスおよびサードパーティの推論プラットフォームを通じて実行され、当社がそれをホストしているとは主張しない、ということです。これがこの比較の中で最も急速に変わりうる部分です。未公表の価格で無料トライアル中のモデルは、まさに Ant とそのホスティング事業者が料金表を公開した瞬間にルーティング層に載る類のものであり、ゼロマークアップのパススルーとは、そうなった日にはここでの価格は先方での価格になるということを意味します。
つまり、結論としての差は、パラメータ数が示唆するほど大きくはない。Ling-3.1-flash はより野心的なモデルであり、研究結果としてはより興味深い。Gemini 3.8 Flash は実際にリリースできる方だ。ライセンスと価格が存在するようになるまでは、それが違いのすべてだ——そしてそれは、ベンチマークの1行では決着がつかないものだ。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
