
Ling-3.1-flash vs DeepSeek V4.1 Flash:インデックス2ポイント、請求額は3倍
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Ling-3.1-flash と DeepSeek V4.1 Flash(Max)は、Artificial Analysis Intelligence Index でわずか2ポイント差 —— 41 対 39 —— だが、価格はまったく似ても似つかない。このインデックスを構成する10の評価を各モデルに対して実行すると、Ling-3.1-flash は1タスクあたり約 $0.99、DeepSeek は $0.27 かかる。どちらも約5,500億パラメータの Mixture-of-Experts モデルで、100万トークンのコンテキストを謳っている。一方は Ant Group の InclusionAI 研究所によるクローズドなテキスト専用モデルで、2026年10月1日にリリースされ、いまだに重みもライセンスも公開されていない。もう一方は 2026年9月10日から MIT ライセンスでオープンであり、テキストだけでなく画像も扱い、23のプロバイダーで動作し、ほとんどのチームがすでに設定ファイルに入れているであろうモデルだ。ほとんどの軸において、この比較は互角とはほど遠い。興味深いのは、そもそもなぜこの2ポイントの差が存在するのか、という点である。
Ling-3.1-flashが真に優位に立つ点
ターミナルを操作し、実際に動くコードを書くことを測る評価では優位に立っており、その差は、総合値がそれを覆い隠してしまうからこそ、正確に述べる価値がある。
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 対 DeepSeek V4.1 Flash (Max) 0.268。どちらも絶対値としては控えめな数字だが、その差は DeepSeek のスコアの 4 分の 1 にあたる。
• SciCode — 0.541 対 0.519。
• CritPt 物理推論 — 0.180 対 0.143。
• GDPval-AA エージェント型実世界ワーク — 1,621.75 Elo 対 1,600 Elo。
その4つのうち2つはほぼ互角で、1つは僅差の勝利であり、シードを変えてもその差が残る唯一の行は Terminal-Bench 4.0 だけだ。これと対比すべきは、DeepSeek が勝っている領域である:AA-Briefcase v1.1 のエージェント型ナレッジワークで 1,420.47 Elo 対 1,400.35、AutomationBench-AA で 0.689 対 0.617、AA-LCR の長コンテキスト推論で 0.84 対 0.83、そして——本番環境で最も重要な行——ハルシネーションが拒否よりも悪いとされる指標における AA-Omniscience では、−5.30 対 Ling-3.1-flash の +2.22 だ。そこでの DeepSeek の精度は 46.4% で、回答した質問におけるハルシネーション率は 96.5% である。Ling-3.1-flash は 29.1% を正しく回答し、ハルシネーション率は 37.9% だ。どちらも、検索を前段に置かずにナレッジベースへ向けるようなモデルではない。
価格差は指数差よりも大きく、それは単に料金表だけの問題ではない。
主要な料金はほぼ同じに見える。Artificial Analysisは両方とも100万入力トークンあたり$0.30と記録している。しかし、他の2つの数値では大きく異なる:
• 出力 — Ling-3.1-flash は100万あたり$0.90、対する DeepSeek V4.1 Flash (Max) は100万あたり$1.20。ここでは Ling-3.1-flash のほうが25%安く、断然低コストなモデルです。
• キャッシュ読み取り — Ling-3.1-flash は100万あたり$0.06 対 DeepSeek V4.1 Flash (Max) は100万あたり$0.006、98%の割引に対し80%の割引。ここが、この2つのモデルが比較にならなくなる点です。
7:2:1 のキャッシュヒット/入力/出力の混合におけるブレンドレートは、Ling-3.1-flash が $0.192、DeepSeek V4.1 Flash (Max) が $0.184 となり、ほぼ互角です。しかし、このブレンドはモデルの使い方についての仮定であり、その仮定が大きな役割を果たしています。プロンプトの再利用が多いワークロード——長いシステムプロンプト、検索用の前置き、毎ターン蓄積されたコンテキストを再送するエージェントループ——では、実効的な混合はキャッシュ読み取りに寄り、そこでキャッシュ価格の10倍の差が支配的になります。トークン量も同じように複合的に効いてきます。Ling-3.1-flash はおしゃべりな推論モデルで、インデックス評価全体で2億2,000万の出力トークンを生成しており、これは DeepSeek の2億5,000万に対するものです。また、評価タスクあたり平均約357秒かかり、DeepSeek の285秒に対してです。回答ごとにより多くの思考を行い、その分時間がかかります。

実例:どちらも同じエージェントループ
ツールを駆使するエージェントが、1タスクあたり100万入力トークンを処理し、その90%がキャッシュから提供され、20万出力トークンを返すとする。上記の数値でLing-3.1-flashの場合、90万のキャッシュ済み入力トークンに$0.06、10万の新規入力に$0.30、20万の出力に$0.90を適用すると、1タスクあたり約$0.26になる。同じループをDeepSeek V4.1 Flash(Max)で回すと約$0.14 — ほぼ半分だ。
次に、DeepSeekのスケジュールを適用しよう。ここがほとんどの比較で飛ばされる部分だ。DeepSeekのオフピーク料金は上記のとおりで、オフピークは週末と1日の大半をカバーする。しかし平日の2つの時間帯、01:00–04:00と06:00–10:00 UTCでは、入力とキャッシュの料金が2倍になる。同じループをピーク時間帯に移すと、DeepSeekのコストはおよそ$0.28になる——その時点で、Ling-3.1-flashの定額で高めの料金表のほうがその1時間については安い選択肢になり、10×のキャッシュ割引は時計によって無効化されてしまう。
その判断全体は、たった1組の数値に集約される。エージェントのトラフィックがキャッシュ主体で、スケジュールを調整できるなら、2ポイントの指標差で DeepSeek V4.1 Flash (Max) のコストは Ling-3.1-flash のおよそ半分になる。エージェントのトラフィックがキャッシュ主体で、DeepSeek のピーク時間帯に当たるなら、両モデルのコストはほぼ同じになり、Ling-3.1-flash のわずかに優れた terminal-agent 行が決め手になる。
比較する対象がない軸
3つの次元は互いに近くはなく、そしてそれらこそが、価格が議論される前にアーキテクチャを決定づける傾向があるものだ。
• 重みとライセンス — Ling-3.1-flash は重みを公開しておらず、ライセンス本文もなく、Artificial Analysis はそれをプロプライエタリとして扱っている。DeepSeek V4.1 Flash (Max) は MIT の下でオープンウェイトで、Hugging Face からダウンロード可能、商用利用も許可されている。このうち一方はセルフホスト、ファインチューニング、エアギャップ環境で利用できるが、もう一方はできない。
• モダリティ — Ling-3.1-flash はテキスト入力、テキスト出力です。DeepSeek V4.1 Flash (Max) はテキストと一緒に画像を受け付け、マルチモーダルベンチマークで評価されます。パイプラインのどこかでモデルにスクリーンショット、チャート、スキャンを渡す場合、比較はそこで終わります。
提供サーフェス。DeepSeek V4.1 (Max) は、OrcaRouter を含む23のプロバイダーを通じて利用できます。Ling-3.1-flash はベンダー自身のAPIとサードパーティの提供サーフェスで動作します。本番運用の経路としては、プロバイダー数はレジリエンスの特性であり、人気コンテストではありません。
さらに、それらのどのリストにも現れない非対称性がもう1つある。DeepSeek V4.1 Flash (Max) は、1回の応答で384,000出力トークンを公開している。AntはLing-3.1-flashの最大出力長をまだ公開していないため、長文生成ワークロードをそれに照らしてサイジングすることはまだできない。公開された上限がないことは、上限が小さいことと同じではないが、設計の基準にできる数値でもない。
両方を実行すること、そしてそれが実際にどのようなものか
Ling-3.1-flash は本日時点で OrcaRouter のカタログにはありません — 当社の公開モデル API に照会しても、InclusionAI 配下のこのモデルは not-found を返し、この記事はそうではないふりをしません。DeepSeek V4.1 Flash は現在、プロバイダーのリスト価格、マークアップゼロでルーティング可能です。したがって、ベンダーの価格変更はそれが反映された当日に当社側でも有効になり、カタログのほかのモデルと同じ単一の API キーの背後にあり、上流プロバイダー間で自動フェイルオーバーします。
その非対称性には実用的な形がある。一方のモデルがクローズドで、価格が前身の約4倍で、単一ベンダー経由で利用できるという比較を維持する賢明な方法は、オープンで広く提供されているモデルをデフォルト経路として保ち、挑戦者側をコミット先ではなくテスト対象として扱うことだ。DeepSeek V4.1 Flash (Max) は今日、本番ループを担える——オープンウェイト、画像入力、384K 出力、98% のキャッシュ割引——一方で、Ling-3.1-flash には、Terminal-Bench と SciCode での優位が実際に効くエージェント固有の作業を任せる。両方とも OpenAI 互換の chat-completions 形式に対応しているため、その分割は統合プロジェクトではなくルーティングの判断だ。1つのエンドポイント、1つのキー、そして各モデルが測定可能なほど得意とするタスクを振り分けるルールである。
評決
利用可能な証拠に基づくと、DeepSeek V4.1 Flash(Max)がこの対決を制し、その勝因の大半は、Indexの2ポイントとは無関係な点にある。MITライセンスのオープンウェイト、画像入力、384,000出力トークン、98%のキャッシュ割引、そしてフェイルオーバー先となる23のプロバイダーだ。Ling-3.1-flashの主張はより限定的だが、本物である。すなわち、この2つの中ではより優れたターミナル兼ツールエージェントであり、両者で唯一、ピーク時間帯の割増率を織り込んだ料金表を公開していないのだ。
この評価を変える可能性のあることが2つある。Antが寛容なライセンスの下で重みを公開すれば、オープン性の差は埋まり、比較は純粋に能力とコストの話になる。そして、Antが提供する長文脈ウィンドウが、両モデルが宣言する100万トークンで検証されれば、コンテキスト同等性という主張はもはや主張ではなくなる。それまでは、正直な要約はこうだ——あるモデルはエージェント的ベンチマークの1行で勝ちながら、評価全体では負けることがありうる。そして、これらのモデル間の2ポイントの指数差は、タスクあたりコストのおよそ3.6倍に値し、それは特定のワークロードだけが引き受けるべきトレードオフである。


