「Claude Haiku 5.5 vs Qwen3.8-Flash-Next」と表示される生成されたタイトルカード、そのサブタイトルは「オープンウェイトモデルは安価なモデルではない」。「完了したIntelligence Indexタスクあたりのコスト」とラベル付けされた棒グラフでは、Claude Haiku 5.5が$0.21、Qwen3.8-Flash-Nextが$0.37と示されている。そしてフッター行には「数値はArtificial Analysisによる独立したもので、価格はAnthropicおよびAlibabaによるものです。」と書かれている。本物のOrcaRouterロゴが右下に合成されている。
Guides & Insights

Claude Haiku 5.5 対 Qwen3.8-Flash-Next:オープンウェイトモデルは安い方ではない

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

直感では、Alibabaのフラッシュティアのオープンウェイトモデルは、クローズドなAnthropicの小型モデルを価格で下回るはずであり、実際、2つの表示価格ではそうなっている。Qwen3.8-Flash-Nextは、Alibaba自身のAPIで100万入力トークンあたり0.15ドル、100万出力トークンあたり0.47ドルで提供されている。一方、0.10ドルと0.50ドルのClaude Haiku 5.5がある。しかし、両方を同じベンチマークスイートで走らせると、順序は逆転する。Artificial Analysisは、Max effortでのClaude Haiku 5.5を、完了したIntelligence Indexタスク1件あたり0.21ドルと測定している。Qwen3.8-Flash-Nextは同じ測定で0.37ドルかかり、スコアは3ポイント低い。安い表示価格なのは、請求額が大きいほうのモデルであり、その理由は、こうした比較のほとんどを決めるのと同じものだ。料金表は価格ではなく、オープンウェイトモデルはマネージドAPIの請求書以外のどこかで元を取る。その「どこか別の場所」こそが、この対決の実際のテーマである。

それぞれが何か

その2つは6週間の間隔を置いて着陸したものであり、同じ種類の遺物ではない。

• Claude Haiku 5.5 — 2026年10月7日にClaude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、およびAWS上のClaude Platformでリリースされたクローズドウェイトモデル。100万トークンのコンテキスト、同期Messages APIで最大128,000の出力トークン、LowからMaxまでのエフォートダイヤルを備えデフォルトがmediumのアダプティブシンキング、2026年6月の知識カットオフ、そして100,000トークンで段階が変わる料金表。

• Qwen3.8-Flash-Next — 2026年8月26日にqwen-community-1.0ライセンスの下で公開されたオープンウェイトのMixture-of-Expertsモデルで、Alibabaはこれを、Qwen4の基盤となるアーキテクチャの実験的プレビューと説明している。125Bのメインモデルパラメータに加えて、別個の51Bのn-gram埋め込みテーブルを保持しており——4Bのマルチトークン予測モジュールを加える前でおよそ176B——トークンあたり6Bを活性化し、512のエキスパート、トップ10ルーティング、48層を備える。ネイティブで262,144トークンのコンテキストを持ち、YaRNで1Mまで拡張可能で、テキスト、画像、動画を入力として受け付ける。

• Qwen3.8-Flash — 提供されている商用版の対応モデルで、こちらも2026年8月26日からAlibabaのQwenCloud上で稼働しており、入力100万トークンあたり$0.16、出力100万トークンあたり$0.47、デフォルトで1Mトークンのコンテキストを備えています。Flash-Nextとは別物として捉えておく価値があります。一方はダウンロードして中身を確認できるチェックポイントであり、もう一方は価格が設定されたマネージドエンドポイントです。

最後の2つの違いこそが、この比較が興味深い理由のすべてだ。Claude Haiku 5.5 と Qwen3.8-Flash-Next が競合する点はごくわずかだ。なぜなら、両者のうち自分のハードウェアで実行できるのは一方だけだからだ。

逆の方向を指し示している、その実測請求書

以下の独立系の数値はすべて、Artificial AnalysisのIntelligence Index v4.3.2によるものです。AnthropicとAlibabaの料金表は、各ベンダーが自ら公表している価格です。

• Intelligence Index — Claude Haiku 5.5 は Max エフォートで 43、182 モデル中 2 位。Qwen3.8-Flash-Next は 40 で、同クラス 117 モデル中 6 位。3 ポイント差で Anthropic が優勢。

• タスクあたりのコスト — $0.21 対 $0.37。トークンあたりの単価が高いほうのモデルが、完了したタスクあたりで見ると43%安い。

• Index実行時の出力トークン数 — Claude Haiku 5.5で4億4,000万、Qwen3.8-Flash-Nextで2億4,000万で、いずれも中央値の1億を大きく上回っています。Qwenモデルのほうが生成効率は高いのに、タスクのコストは依然として高く、これは両者の差がトークン量だけにあるのではなく、入力の構成と評価者が適用する評価付けの組み合わせによることを示しています。

• 出力速度 — 241.9トークン/秒 対 56.0。Claude Haiku 5.5 は同じ測定で4倍以上高速であり、その実行における295秒という初回トークン時間は、ネットワークの数値ではなく Max effort で思考したことによる産物です。Qwen3.8-Flash-Next の初回トークン時間は2.53秒です。

• 料金表の形 — Claude Haiku 5.5は、10万トークンで$0.10と$0.50から$0.50と$2.50へ段階的に上がります。Qwen3.8-Flashは長さに関係なく$0.16と$0.47で一定であり、これは長いプロンプトにおいて真の利点であり、長い文書を前にしても「ステッカー価格」の主張が生き残る唯一の場面です。

• トークナイザー — Claude Haiku 5.5はClaude 4.7以降と共通の新しいトークナイザーを使用しているため、同じテキストが以前のHaikuよりも約30%多くのトークンとしてカウントされます。これによりプロンプトは100,000トークンの段階へと押し上げられます。これはAnthropic自身のドキュメントに基づくものであり、Qwenの定額料金が最も有利に見えるまさに長文プロンプトの場合に、このモデルに不利に働きます。

つまり、このトレードオフの形はこうだ。トークンあたりの単価を高く払う代わりに、より速く、わずかに賢い回答が得られ、完了したタスクあたりのコストは低くなる。ただし長い入力では料金の崖に注意が必要だ。あるいは、トークンあたりの単価を安く払い、より遅いモデルを得る代わりに、完了したタスクあたりのコストは高くなる。料金はフラットで、ネイティブの262,144トークンウィンドウを備えている。

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

オープンウェイトが実際に計算の前提を変えるのはどこか

上記のすべては2つのマネージドAPIを比較しており、それはQwen3.8-Flash-Nextが勝つようには設計されていない比較だ。その主張は、レンタルする必要がないという点にある。

• リリース初日からのサービング対応。 SGLangはクックブックページと専用イメージを提供済み。vLLMにはそのためのビルドが用意されているが、アーキテクチャ対応のプルリクエストはまだオープンな状態だ。NVIDIAはGB300 NVL72ラック上で両方に加えてTensorRT LLMを検証済みで、ファインチューニングはNeMoがカバーしている。

• 176Bチェックポイントにしては、必要なハードウェアの敷居は低い。 51Bのn-gram埋め込みテーブルは、VRAMではなくホストメモリに置ける。その参照アドレスは事前に判明しており、先読みできるからだ。これにより、このモデルはDGX Sparkクラスターや4×RTX PRO 6000ワークステーションで動作し、同日公開のコミュニティ量子化——75GBのRAMに収まり、フル精度のおよそ80%を維持する1-bitビルド——によって、小規模チームが所有するハードウェアでも動かせる。

• ファインチューニングが利用可能です。ただし、ホスト型のチューニングAPIという意味ではありません。重みはあなたのものであり、通常の条件が付いたコミュニティライセンスの下に置かれ、アーキテクチャは、アブレーション実験とネガティブな結果を公開した技術報告書に文書化されています。

• コンテキストウィンドウは見た目よりも小さい。ネイティブで262,144トークン、YaRNを使えば100万トークンまで拡張可能——それに対しClaude Haiku 5.5はネイティブで100万トークン、しかもRoPEスケーリングの但し書きはない。Qwenの定額料金が最も魅力的に見える長文ドキュメントのワークロードでは、実際にそのドキュメントを保持できるのはもう一方のモデルだ。

• ベンチマークはベンダーによる報告値です。 アリババ自身の表では、Flash-Next は DeepSWE 1.1(58.7 対 54.4)、SWE-bench Pro(62.5 対 56.0)、GPQA Diamond(91.7 対 90.8)で DeepSeek-V4-Flash-0731 を上回り、NL2Repo-Bench(48.1 対 54.2)では下回っています——リポジトリレベルのコード生成、より小型のモデルが追随できていない唯一のエージェント的側面です。いずれも第三者による再現はされておらず、このモデルは登場から 6 週間しか経っていません。

それが両者の間にある正直な境界線だ。Claude Haiku 5.5 は、品質の上限が固定され、運用面を持たない従量課金サービスだ。Qwen3.8-Flash-Next は、コスト曲線が電気料金の水準に向かって下がっていく成果物であり、品質の上限は自分が提供できるもの次第だ。さらに、再現されていないベンチマーク表というリスクと、ランタイムにまだ吸収されつつあるアーキテクチャというリスクがある。

現実的な決め方

それを決めるのは3つの問いであり、ベンチマークに関するのは最初の1つだけだ。

GPUをお持ちですか、それとも欲しいですか?持っていない場合、セルフホストの話は理論上のものになり、上記のマネージド比較がすべてです——そしてコスト・タスクあたり、速度、スコアの点でClaude Haiku 5.5に軍配が上がりますが、その100,000トークンのステップが長いプロンプトに不利に働くという但し書きが付きます。利用率目標を下回って遊んでいるアクセラレータをお持ちなら、Qwen3.8-Flash-Nextは、6Bのアクティブパラメータによるデコードを大量に実行するのが本当に安価な数少ないオープンモデルの一つであり、タスクあたり0.37ドルという数字はもはや意味を持つ数値ではなくなります。

平均的なプロンプトの長さはどれくらいですか?提示価格の議論が成り立つのは、ここだけです。100,000トークン未満では——トークン数をおよそ30%も水増しするトークナイザーを通した後でも——Claude Haiku 5.5 の方があらゆる指標で安上がりです。それを超えると、一律 $0.16 と $0.47 の方が有利なカードとなり、その優位性は262,144トークンのネイティブウィンドウに至るまで、長さが増すほど広がります。それを超えると、YaRN拡張はまた別のエンジニアリング上の問題です。

ワークロードはレイテンシのばらつきをどの程度許容できるのか。 毎秒241.9出力トークン対56.0というのは大きな差であり、セルフホスト型のデプロイではさらにキューイングが加わる。ライブサポートやブラウザ操作を行うエージェント——Anthropicがこのティアの用途として挙げているワークロード——であれば、その違いを実感するはずだ。

第2と第3の問いについてあれこれ推論するのではなく、実際に答えを出したいと考える人にとって、最も安価な手段は共有エンドポイントだ。Qwen3.8-Flash-Next はまだ OrcaRouter のカタログにはなく、Claude Haiku 5.5 も同様だ。当社がルーティングしている Qwen の兄弟モデルはQwen3.8-Flashであり、プロバイダーの定価で、0%のマークアップがそのままパススルーされる。これは本比較におけるモデルに最も近い提供済みの同等品であり、長いプロンプトのコスト検証における適切なベースラインとなる。Anthropic 側では、Claude Haiku 4.5、Claude Sonnet 5.5、Claude Opus 5.5 がいずれも同じキーから今日呼び出せるため、2世代にわたる価格実験は第二の契約ではなく設定の問題で済む。しかも価格はブレンドではなくパススルーであるため、どちらの側でのベンダー値下げも、発表されたその日に当社側へ反映される。この実験を実トラフィック上で安全に実行できるのは自動フェイルオーバーのおかげだ。プレビューモデルや再現されていないベンチマーク表こそ、信頼できるモデルを背後に置いたまま新しいものへルートを向けるべき典型的なケースなのだ。

何が答えを変えるだろうか

2点あり、どちらも検証可能だ。1点目は、Claude Haiku 5.5も動かすハーネス上でのQwen3.8-Flash-Nextの独立評価である。ベンダー表はDeepSeekとの比較であり、独立系ボードの40は単一の配置にすぎない。注視すべき行はリポジトリレベルのコーディングスコアだ。というのも、NL2Repoはこのモデルがすでに後れを取っていることが示されている領域だからである。2点目は、ランタイム関連の作業が実を結ぶかどうかだ。vLLMサポートはいまだオープンなプルリクエストを通じてマージ作業中であり、それが完了するまでは、このアーキテクチャのセルフホスティングは、そういうことを楽しむチーム向けの試みであって、サポートされた経路ではない。

それまでは、要約は短い。Qwen3.8-Flash-Next は、所有するならより魅力的なモデルであり、借りるならより高価なモデルだ。Claude Haiku 5.5 は、より安価で高速、スコアも高いマネージドエンドポイントだが、その料金表は長いものには厳しい。トークンを買うのか、チェックポイントを買うのかで選べばいい——そしてトークンを買うのであれば、オープンウェイトモデルは想定していたほどの割安ではないことに留意してほしい。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.