「Claude Haiku 5.5 vs Ling 3.1 Flash」という見出しのヒーローカードで、その上には「560Bパラメータ、重みなし」という行があり、Index 対 AutomationBench の対比は 0.3541 対 0.6174、コスト行は 1タスクあたり $0.21 対 $0.99、時間行は 1タスクあたり 424.6s 対 360.4s を示している。
Engineering & Research

Claude Haiku 5.5 対 Ling 3.1 Flash:回答あたり4倍のコストがかかる5600億パラメータモデル

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

両者を隔てるのはわずか6日。InclusionAIがLing 3.1 Flashを2026年10月1日に投入し、ベンダーはClaude Haiku 5.5を10月7日に投入した。どちらもフラッシュ層のモデルとして売り出され、どちらも100万トークンのコンテキストウィンドウを備え、両方を走らせた唯一の独立系ボードの推論の行では、両者はその差がノイズの範囲に収まるほど近接している。ところが、エージェントが実際に仕事を仕上げるかどうかを測る行に来ると、両者は26ポイント離れており——さらに、仕上げた仕事のコストを測る行では、5,600億パラメータのモデルが、パラメータ数を誰も公表していないモデルの4.5倍の価格になっている。

どちらの料金表もそれを予測していない。Ling 3.1 Flashは100万入力トークンあたり$0.30、100万出力トークンあたり$0.90で掲載されている。Claude Haiku 5.5は100,000トークンまでのプロンプトで$0.10と$0.50、それを超えると$0.50と$2.50に段階的に上がる。トークンあたりの価格として読めば、Lingは入力で3倍、出力で2倍弱のコストであり、これは一行で比較に終止符を打つ類の差だ。

それでこれが終わるわけではない。なぜなら、料金表はトークン単位で価格設定され、意思決定はタスク単位で価格設定されているからだ。それら2つの数値は、この対決から逆の符号で出てくる。そしてその理由は冗長さではない。

終わったタスクにかかるコストであり、トークンにかかるコストではない

Artificial Analysis Intelligence Index v4.3.2では、インデックスタスクを1件完全に完了するのにかかる実測コストは、Claude Haiku 5.5が$0.21、Ling 3.1 Flashが$0.99です。これは4.6倍の差であり、3倍の入力比率よりも大きく、しかも同じ方向にあります。

明白な説明——高価なモデルの方が多く話している——は間違っている。Ling 3.1 Flash はインデックスタスクあたり 100,671 個の出力トークンを生成したが、Claude Haiku 5.5 は 162,164 個を生成した。安い方のモデルの方が、60% 以上もおしゃべりなのだ。つまり、お金もまた、料金表が示唆するようには流れていない。

タスクごとのコストを分解すると、それはインデックスの方法論が実際に支出している場所に落ち着く。Claude Haiku 5.5の$0.21のうち、約62%が入力側であり、Ling 3.1 Flashの$0.99のうち、約91%がそうだ。これらはキャッシュを多用する推論実行であり、両ベンダーはキャッシュされた入力トークンの価格設定が大きく異なる。Claude Haiku 5.5は100万あたり$0.01、Ling 3.1 Flashは100万あたり$0.06 — 請求額を支配する単一の項目で6倍の開きだ。公表されている料金表は$0.10と$0.30を比較している。請求書を決める項目は$0.01と$0.06を比較している。

当社独自のカタログは、プロバイダーの定価を0%のマークアップでそのまま通しています。だからこそ、モデル上の請求ではなく実際の請求書でこの2つの状況を見分けられるのです。Ling 3.1 Flash は、当社が解決できたベンダーパスのどの表記でもカタログに載っていません — InclusionAI でも、Ling でも、試した8つの形式のいずれでも — したがって上記の $0.30 と $0.90 はベンダー自身が公表している料金であり、本日当社があなたのためにルーティングできるものではありません。Claude Haiku 5.5 もカタログには載っていません。これは Anthropic 自身の API を通じて動作します。この比較の近傍でカタログに実際に載っているのは、GLM 5.3 Flash、DeepSeek V4.1 Flash、Qwen3.8 Flash、Gemini 3.8 Flash で、いずれもプロバイダーの定価に0%のマークアップを加えた価格です。したがって、ベンダーの料金変更はベンダー側に届く同じ日に当社側にも届きます。以下の調査結果が、Ling 3.1 Flash のエージェント向けプロファイルこそあなたのワークロードに必要だというものであるなら、実用的な次のステップは当社が実際にルーティングしているエージェント対応モデルとの直接比較を、1つのキーで 自動フェイルオーバーを下に置き、コスト上限をアプリケーションコードではなくルートに持たせるべき場合はルーティング DSL を使って行うことです。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

両方とも測定された7行

Artificial Analysisは両方のモデルを実行した唯一のボードであり、その重なりは狭いが示唆に富む。各行は互いに一致しておらず、不一致の方向はランダムではない。

• インテリジェンス指数 v4.3.2 — Claude Haiku 5.5(Max)の43.40に対し、Ling 3.1 Flashは41.09。Anthropicに2.31ポイントのリード。

• 完了した Index タスクあたりのコスト — 同じボード上で $0.99 に対して $0.21。

• Indexタスクあたりの時間 — Claude Haiku 5.5 は 424.6秒、Ling 3.1 Flash は 360.4秒。ここが予想の崩れる行だ。5600億パラメータモデルの方が、インデックス全体では2つのうち速い方であり、約15%速い。

• Terminal Bench 4.0 — 0.3283 対 0.3333。Ling 3.1 Flash が 0.5 ポイント上回っているが、両ベンダーが引用するベンチマークではこれは引き分けだ。

• SciCode — 0.5498 対 0.5405。Claude Haiku 5.5 を 0.9 ポイント上回る。これも同点。

• Humanity's Last Exam、ツール不使用 — 0.4439 対 0.3943。Claude Haiku 5.5 が 5 ポイント差で、初めての実質的な差。

• AutomationBench、部分スコア — 0.3541 対 0.6174。Ling 3.1 Flash は26ポイント差をつけており、しかもその差はこのリスト上の他のすべての差を合計したものよりも大きい。

その共有セットの外側にもう2行あり、掲載する価値がある。なぜなら、購入者が最も目にするのはそれらだからだ。Artificial Analysisが44の職種にわたって実施しているGDPval-AAでは、両者は1620.05と1621.75で、統計的には互角だ。Elo評価による長文の専門業務評価であるAA-Briefcase v1.1では、Claude Haiku 5.5が1577.72、Ling 3.1 Flashが1400.35で、Anthropicに有利な177ポイント差だ。これは、ボード上のどこにおいても、両者間の非エージェント型の差として最大である。

これらの会話の大半を決めるはずのたった1行

インデックスレベルの平均値は、時間と費用が実際にどこへ費やされたのかを覆い隠してしまう。そしてこのペアは、このバッチの中でその最も明白な例だ。Terminal Bench 4.0 の評価ごとの数値は、スコア以外のどの次元でも互いに近くはない。

• Terminal Bench 4.0、Ling 3.1 Flash — タスクあたり5.49ドル、タスクあたり1,283秒で0.3333。

• Terminal Bench 4.0、Claude Haiku 5.5 — タスクあたり0.65ドル、タスクあたり908秒で0.3283。

両者を隔てるのは、スコアわずか0.005点。コストは8.4倍、実時間は1.4倍。ベンチマーク表を読んで0.3333を記録したモデルを選ぶチームは、Artificial Analysis自身の勘定によれば、同じ答えに1分の3分の1だけ遅れてたどり着くために8倍の代価を払うことを選んだことになる。

これは、スコアが無意味だという主張ではない。スコアとは、試みた作業に対する達成した作業の比率であり、そこに至るまでに消費したリソースについては何も語っていないという主張である。エージェントによるタスク完了のベンチマークは、まさにこの区別が最も厳しく効いてくる場面である。なぜなら、再試行するエージェントは、再試行のたびに全額を支払うエージェントであり、1回あたりのコストが8倍かかるモデルは、再試行ループを予算項目に変えてしまうからだ。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

ダウンロード不要の5600億パラメータ

これがLing 3.1 Flashのスペックシートの中で本当に異例な部分であり、それはサイズのことではない。

Ling 3.1 FlashはスパースなMixture-of-Expertsモデルであり、総パラメータ数は5,600億、トークンあたりの活性パラメータ数は250億で、Artificial Analysisはこれをプロプライエタリと分類している。重みもライセンスファイルもリポジトリも存在しない。このような形の大規模スパースモデルは通常、オープンリリースとして登場する。このティアの他のモデルはそうしているからだ。GLM 5.3 Flashは総パラメータ数3,200億、活性パラメータ数180億でMITライセンスの重みを公開し、DeepSeek V4.1 Flashは総パラメータ数5,520億、活性パラメータ数160億でMITライセンスの重みを公開している。Ling 3.1 Flashは同じ規模の同じアーキテクチャクラスでありながら、APIのみとして公開されている。

その選択には、ベンチマークの行には表れない帰結がある。アクティブ250億のモデルはどこかでサービングされなければならず、チェックポイントを保持できなければ、どこで、どのくらいのマージンで動かすかを選べない — そのモデルのベンダーによるサービングを借りることになる。上の Terminal Bench タスク価格 $5.49 は、主にトークン単価の人為的な産物ではない。それは、それを実行できる唯一の当事者から大規模スパースモデルを借りるのにかかる費用だ。このティアのオープンウェイトの同系統モデルは、その数値を自分で動かす選択肢を与えてくれる。

逆もまた然りで、同じ正直さが当てはまります。オープンなリリースが自動的に優れた製品というわけではありません。重みと一緒に、サービングの負担、量子化の選択、そして終わりのないアップグレードの負担を引き継ぐことになり、ライセンスファイルはサポート契約ではありません。AnthropicはClaude Haiku 5.5について、システムカードを備えたファーストパーティAPI上で、2027年10月7日より早くは廃止しないというコミットメントを公表しています。その2つの取り決めのどちらを望むかは、どちらのモデルについての問いではなく、あなたのチームについての問いです。

Ling 3.1 Flashは何のためのものか

プロファイルを全体として読めば、それは妥協の産物ではなく、一貫した製品を描写している。大規模でスパースな長コンテキストモデルであり、自律的なマルチステップワークフローを、この価格帯で測定された他の何よりも見事に完遂し、難しい単発推論では目立ったところがなく、しかもプロンプト長による急な料金跳ね上がり(崖)のない定額でそれを実現する。AutomationBenchでは、Claude Haiku 5.5を26ポイント上回り、AA-Briefcaseスコアは、この比較の中で、それが集団の前方ではなく中位より後方に位置する唯一の項目だ。

それはバッチ型エージェントワーカーの擁護可能な説明だ。構造化されたジョブのキューに向け、それぞれを完了しなければならず、タスクは分単位で測られると受け入れ、閾値ステップが罰則的になるほどプロンプトを長く保ち、フィニッシュラインでの信頼性を単一トークンのコストより重んじる、というものだ。それが向いていないのは、フラッシュティアのモデルが通常は買われる目的のものだ。テキストのみを受け付け、画像入力は一切ない。一方、Claude Haiku 5.5 はテキストと画像を扱う。そのインデックスタスク時間はより短いが、Terminal Bench タスク時間はより長く、完了したインデックスタスク1件あたり$0.99 に対し $0.21 で、ほぼ同じ総合スコアに到達するのに4.5倍の額を費やしている。

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

存在する証拠に基づけば、その二つのうちどちらか

あなたの仕事がテキスト入力・テキスト出力で、大量利用時にトークン単位で課金されるものなら、Claude Haiku 5.5 は請求書に載るあらゆる項目でこの比較に勝利します。インデックスタスクコストが低く、エージェントにとって最も重要なベンチマークでの実タスクコストも低く、総合スコアは高く、長文のプロフェッショナル業務スコアも優れ、忠実性も高く、さらに相手モデルにはまったく提供されていない画像入力にも対応しています。

もしあなたの仕事が、多段階のワークフローを完了しなければならない無人エージェントなら、まさにそれを測定する唯一の共通ベンチマークで、Ling 3.1 Flash は Claude Haiku 5.5 を26ポイント上回るスコアを出しています。そしてそれは、価格だけを理由に切り捨てるのではなく、テストする価値があります。この表ではなく、自分のトレースでテストしてください——そして、テストのコストは完了したジョブごとに見積もってください。なぜなら、エージェントが再試行するときに動くのはその数字だからです。

ウェイトを手元に置く必要があるなら、この2つのどちらもあなたの求めるモデルではありません。Ling 3.1 Flashは5600億パラメータのプロプライエタリです。Claude Haiku 5.5はプロプライエタリで、公開されたパラメータ数はありません。このティアのオープンな公開版はボードの別の場所にあり、その比較はまったく異なる行の集合から始まります。

コンポジットは2.31ポイントと言っている。エージェント型ベンチマークは逆方向に26と言っている。レートカードは入力で3倍と言い、完了タスクのコストはカードと同じ方向で4.6倍と言っている。4つの数値、2つの方向——だからこれを決着させる唯一信頼できる方法は、両方を自分の作業のトレースに対して実行し、トークンではなく完了したジョブからコストを読み取ることだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新