見出しが「Claude Haiku 5.5 vs Qwen3.8-Flash-Next」のヒーローカード。Claude Haiku 5.5は入力$0.10、出力$0.50、コンテキスト1Mであるのに対し、Qwen3.8-Flash-Nextは入力$0.15、出力$0.47、コンテキスト256K。中央の行は「3:1 ブレンド $0.20 vs $0.23」、最下行は「Index v4.3.2 - 43.40 vs 39.82 - タスクあたり$0.21 vs $0.37」と表示。
Engineering & Research

Claude Haiku 5.5 対 Qwen3.8-Flash-Next:トークンあたり3セントの差、完了したジョブ1件あたりでは78の差

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つの料金表を並べてみると、同じ会議から出てきたように見える。Claude Haiku 5.5は入力$0.10、出力$0.50。Qwen3.8-Flash-Nextは入力$0.15、出力$0.47。そのベンダーのモデルは入力が3分の1安く、出力が6パーセント割高だ。どちらのベンダーも、その形を偶然に作ったわけではないし、何を狙っていたのかを説明する比較メモも公表していない——だが、3:1の混合ワークロードの算術が意図を読み取れるものにし、このペアをこの階層全体で最も価格が近い組み合わせにしている。

似ているのはそこまでだ。{{1}}Claude Haiku 5.5{{/1}}は2026-10-07にリリースされたクローズドなAPIモデルで、100万トークンのウィンドウと最大128,000トークンの出力を持つ。Qwen3.8-Flash-Nextは1800億パラメータのオープンウェイトモデルで、アクティブパラメータは60億。重みはHugging Face上でQwen Community License 1.0の下に公開されており、公表されているコンテキストウィンドウについては、自身のチェックポイント設定と独立系ボードの見解が完全には一致していない。2026-08-26のリリースで、このクラスで構築する者にとって新しくも珍しくもない。

この2つが並べて価格設定されているのは意図的だ。料金表からは分からないことだが、両者は異なる用途向けに作られており、表計算ソフト上では安く見えるほうが、運用コストは高いのだ。

価格設定を明かす算術

2つの料金を、一般的な入力対出力3:1の比率——ほとんどのチャットおよびコード支援トラフィックが落ち着く比率——でブレンドすると、Claude Haiku 5.5は100万トークンあたり0.20ドル、Qwen3.8-Flash-Nextは100万トークンあたり0.23ドルになります。そのブレンドではAnthropicのモデルのほうが約13%安く、この差は入力列が示唆する差より小さく、出力列が示す差より大きいものです。

比率を入れ替えると、順位が変わる。1:1では、両者は100万あたり$0.30と$0.31で、丸め誤差の範囲内の同点だ。出力重視の1:3では、Claude Haiku 5.5が$0.40、Qwen3.8-Flash-Nextが$0.39となり、Qwenが1セント差で勝ち、Anthropicのモデルが両者のうち安い方ではない唯一の比率となる。

「どちらが安いか」に単一の正直な答えは存在せず、どちらか一方を出す比較は読者の代わりに比率を選んでいるにすぎない。擁護できるのはこれだけだ。Claude Haiku 5.5の料金カードは入力中心のトラフィック向けに重み付けられ、Qwen3.8-Flash-Nextのそれは出力中心のトラフィック向けに重み付けられている。そして3:1の比率で両者を分ける100万トークンあたり3セントは、このティアでAnthropicの数値に並ぶものとして誰かが最も近づいた例である。ローンチ資料が何と言おうと、それは意図的なポジショニングだ。

当社のカタログでは、Qwen3.8-Flash-Next を入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドル、キャッシュ済み入力レート0.0184ドルで記載しています。0.15ドルと0.47ドルは、Artificial Analysis がプロバイダーの定価として記録している数値と同じであり、パススルー取り決めが本来生み出すはずのものです。

本物の出来高の1日に実際いくらかかるのか

1日あたり1,000万入力トークンと200万出力トークンを処理するパイプラインを考えてみましょう。これは小規模な本番ワークロードであり、典型的なプロンプト長では第1の料金階層に余裕で収まります。

• 入力コスト — Claude Haiku 5.5 では 1 日あたり $1.00、Qwen3.8-Flash-Next では 1 日あたり $1.50。

• 出力コスト — Claude Haiku 5.5 では 1 日 $1.00、Qwen3.8-Flash-Next では 1 日 $0.94。

• 1日あたりの合計 — $2.00 対 $2.44。この規模では年間で約$160の差、つまり100万トークンあたり約3.7セント。

ここで、料金表が省いている2つの調整を適用すると、方向は逆転する。

まず、Claude Haiku 5.5 は Claude 4.7 以降と共有されている新しいトークナイザーを使用しており、Anthropic 自身のドキュメントによれば、同じテキストを、それが置き換えるモデルよりも約30%多いトークンとして数えます。入力が、それらのトークン数が測定された種類の英語散文である場合、実効入力レートは $0.10 ではなく、100万語相当のテキストあたり $0.13 に近く、それによって Qwen3.8-Flash-Next より3分の1低いどころか、2セント以内の差に収まります。

第二に、そしてより重要なのは、Claude Haiku 5.5 が冗長だという点です。Artificial Analysis は Intelligence Index を実行した際、これについて 162,164 出力トークンを記録しましたが、Qwen3.8-Flash-Next は 107,884 でした。もしその比率が、抽象的な 3:1 ではなく、あなたのワークロードでも当てはまるなら、上記の出力行は $1.00 対 $0.94 ではなくなり、$1.50 対 $0.94 に近いものになります — そして日次合計は Qwen 有利に逆転します。

どちらの調整も単独では決定的ではない。両者が合わさって初めて、2つのモデルが丸め誤差程度しか違わないのか、それともQwen3.8-Flash-Nextのほうが実質的に安く運用できるのか、その差が生まれる。そして、どちらに当てはまるかを知る唯一の方法は、料金表から推測するのではなく、自分のトラフィックでトークンを数えることだ。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

フラットレートがフラットに見えなくなる場所

Claude Haiku 5.5の価格には段差があり、Qwen3.8-Flash-Nextの価格には段差がない。

• 価格 — Claude Haiku 5.5 はプロンプトが100,000トークンまでの場合、100万トークンあたり入力$0.10/出力$0.50、それを超えると$0.50/$2.50。Qwen3.8-Flash-Next は$0.15/$0.47の一律。

• キャッシュ入力 — Claude Haiku 5.5 は読み取り $0.01、書き込み $0.125、Qwen3.8-Flash-Next は読み取り $0.016、書き込み $0.23。

• コンテキスト — Claude Haiku 5.5 は100万トークン。Qwen3.8-Flash-Next の場合、その数は誰に聞くかによって変わります。Qwen は100万トークンのウィンドウを公表しており、チェックポイント自体の設定では位置埋め込みが262,144に制限され、Artificial Analysis は評価済み構成を256,000と記録しています。

• 最大出力 — Claude Haiku 5.5では128,000トークン、当社のカタログ記載ではQwen3.8-Flash-Nextで131,072トークン。

• 入力モダリティ — Claude Haiku 5.5 はテキストと画像、Qwen3.8-Flash-Next はテキスト。

• リリース — Claude Haiku 5.5 は 2026-10-07、Qwen3.8-Flash-Next は 2026-08-26。

• 重み — Claude Haiku 5.5 はプロプライエタリでAPI専用、Qwen3.8-Flash-Next は Qwen Community License 1.0 に基づくオープンウェイト。

それらの行のうち3つは、価格の見出しとは逆方向に働き、プロンプト長による段差が最も急激だ。プロンプトが100,000トークン未満では、Claude Haiku 5.5 は両方の料金ラインでより安価なモデルだ。それを超えると、Anthropic の入力料金は5倍になり、Qwen3.8-Flash-Next は入力で3.3倍、出力で5.3倍の優位を保つ。このしきい値は、そもそもコンテキストウィンドウが分かれる地点とほぼ一致する — 一方のモデルは100万トークン、もう一方は262,144 — したがって、長いウィンドウを必要とするパイプラインは、それを得るために第2段階の料金を払うパイプラインでもある。

それは価格設定への批判ではない。プロンプト長に応じた段階制料金は、長コンテキストモデルの課金方法としては普通だ。これは比較に関する警告である。8,000トークンのプロンプトで行う直接比較は、一組の価格を述べているにすぎない。同じ2つのモデルでも、400,000トークンのプロンプトではまったく別の一組になり、2つ目のケースで安いほうは、1つ目のケースでは高いほうだった。

ベンダーテーブルの下に書かれていること

どちらのベンダーも相手の評価スイートを実行していないため、共通して見える範囲は、Artificial Analysis が双方について測定した行に限られる。

• インテリジェンス指数 v4.3.2 — Claude Haiku 5.5(Max)は43.40、Qwen3.8-Flash-Nextは39.82。Anthropicに3.57ポイントのリードで、このシリーズ最大の総合差です。

• 完了したIndexタスク1件あたりのコスト — 同じボードで$0.37に対し$0.21。

• タスク所要時間 — 1,524.3秒に対して424.6秒。

• Terminal Bench 4.0 — 0.3283 対 0.2525。Claude Haiku 5.5 が 7.6 ポイント差。

• SciCode — 0.5498 対 0.5058。Claude Haiku 5.5 が 4.4 ポイント差。

• Humanity's Last Exam — 0.4439 対 0.3804。Claude Haiku 5.5 を 6.4 ポイント上回る。

• AutomationBench、部分スコア — 0.3541 対 0.5591。Qwen3.8-Flash-Next に 20.5 ポイント差。

Anthropicに6行、そのうちいくつかは大差、そしてQwenに20ポイント差で1行。この形は、この価格帯全体を貫くものと同じだ。Anthropicの小型モデルは、推論、科学、そして回答を得るまでのコストとレイテンシにおいて強く、多段階タスクを完了まで導くことにおいて弱い。Qwen3.8-Flash-Nextはその逆である。

総合スコアとエージェント行の差はここでは異常に大きく、一方に3.57ポイント、他方に20.5ポイントで、この軸においてこの帯域で最も曖昧さの少ないペアとなっている。あなたの仕事が一度だけ答える単一の難しい問いであるなら、Claude Haiku 5.5 はあなたが気づくあらゆる指標で優れている。あなたの仕事が最後までやり遂げなければならないエージェントであるなら、Qwen3.8-Flash-Next はそれを予測する唯一の行で優れており、その差は総合の差の5倍以上である。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

手にできる1800億パラメータ

多くのチームにとってこの比較の決め手となる項目は、ベンチマーク表にはまったく載っていない。

Qwen3.8-Flash-NextはスパースなMixture-of-Expertsモデルで、総パラメータ数は1800億、アクティブは60億——この比率により、モデルの総容量に対してトークンあたりに費やす計算量を控えめに保てる。これはQwen Community License 1.0の下で公開されており、Artificial Analysisはこれを寛容型ライセンスではなく商用ライセンスとして記録している。この区別は、それをもとに計画を立てる前に読んでおく価値がある。なぜなら、コミュニティライセンスはMITではなく、再配布や規模に関して独自の条件を伴うからだ。これらの条件に従うことを前提に、ダウンロードし、セルフホストし、チェックポイントに固定し、量子化し、ファインチューニングすることができる。

Claude Haiku 5.5 は、それらのいずれにも当てはまりません。プロプライエタリで API 専用であり、公開されたパラメータ数も、ライセンスも、リポジトリもありません。Anthropic は、2027-10-07 より早くは呼び出せなくならないよう維持することを約束しています。これは現実的で具体的な保証ですが、可用性に関する保証は、重みそのものとは別物です。

実務上の帰結は双方に及ぶ。そしてそれは、どちらか一方への売り込みとしてではなく、率直に言っておく価値がある。自社テナンシー内での推論、差分比較できる固定チェックポイント、あるいはドメインデータでファインチューニングする能力を必要とするチームは、ベンチマーク指標でこの2つのモデルを選び比べているのではない。彼らは Qwen3.8-Flash-Next を選んでいる。もう一方の選択肢は、彼らが必要とするものをどんな価格でも提供していないからだ。公開されたシステムカード、文書化された評価セット、廃止に関するコミットメントを備えたマネージドエンドポイントを必要とするチームは、もう一方の方向を選んでおり、重みは彼らが使うつもりの機能ではなかった。

定額制の側面を運営する

名称に関する注記。独立系ボードはこのモデルをQwen3.8-Flash-Nextとして登録しているが、当社のカタログでは同一リリースをより短いベンダー名 Qwen3.8 Flash として掲載しており、価格は同一の $0.15 / $0.47、キャッシュ入力料金は $0.0184 で、リポジトリは 2026-08-26 に公開された Hugging Face の重みを指している。以下の数値が Artificial Analysis に由来する場合、それらは同社が Qwen3.8-Flash-Next と呼ぶ項目のものである。両者は同じモデルであり、ボードが単に長い方の名称を採用しているだけである。

Qwen3.8-Flash-NextはOrcaRouterのカタログにプロバイダーの定価で掲載されており、マークアップは0%、ブレンドではなくそのままパススルーされます — つまり上記の$0.15と$0.47は請求書に記載される料金そのものであり、Qwen側での変更は後日の再価格設定時ではなく当日に当社側へ反映されます。Claude Sonnet 5.5とClaude Opus 5.5もカタログに掲載されているため、小規模モデルからAnthropicの中位ティアへのエスカレーション経路は、2つ目の統合ではなくルーティング設定で実現できます200以上のモデルに1つのAPI、1つのキー、自動フェイルオーバーをその下層に備え、コスト上限をアプリケーションコードではなくルート側に置きたい場合にはルーティングDSLが使えます。

Claude Haiku 5.5 はカタログに載っていません。Anthropic 自身の API を通じて利用することはできますが、この比較における Anthropic 側の部分は、当社が現在提供しているものではありません。曖昧なままにするより、そう明言するほうがよいでしょう。

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

二つのうちどちらか、そしてどのような根拠で

トラフィックが入力中心で、プロンプトが100,000トークン未満に収まり、実際のボリュームに対して支払っているなら、Claude Haiku 5.5 は両方の料金ラインでより安いモデルであり、7つの共通測定項目のうち6つでより高得点のモデルです — ただし、30%のトークナイザー差と Anthropic の冗長性が、カード上では請求書上よりも大きく見える割引を食いつぶすという注意点があります。

トラフィックが出力重視だったり、プロンプトが長くてAnthropicのしきい値を超えたり、予測のために定額料金が必要だったりするなら、Qwen3.8-Flash-Nextのほうが安価です — その段階を超える出力では5倍になることもあり — しかもエージェント型補完の行では20ポイント差で勝つモデルです。

重みが必要なら、その比較は接戦ではなく、価格は一切関係ない。

2つのカードは、3:1のブレンドで100万トークンあたり3セント以内の差しかなく、その差は十分小さいので、料金がそれを決める要因になるべきではない。それを決めるのは、あなたがその3つの段落のうちどれにいるのかであり、それはどちらのモデルについてというよりも、あなたのパイプラインについての問いだ。