Qwen 3.8 vs Claude Fable 5:アリババの2.4Tフラッグシップに、ついに価格が付いた
Guides & Insights

Qwen 3.8 vs Claude Fable 5:アリババの2.4Tフラッグシップに、ついに価格が付いた

著者

jinhao song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

アリババがQwen3.8-Maxを2026年7月19日に上海でプレビューした際、同社は何よりも強調された一つの主張を行った。すなわち、この2.4兆パラメータのモデルはフロンティアレベルに近く、Claude Fable 5にのみ劣る。当時、それを評価することは不可能だった。レートカードもベンチマーク表もライセンスもなく、単なるポジショニングステートメントに過ぎなかった。

この日2026年8月3日にQwen3.8-Maxが一般提供開始となりました、比較はついに双方に実質を持つものとなった。Alibabaは100万トークンあたり2ドル/6ドルの価格設定と、実数値が記載されたベンチマーク表を発表した。Fable 5は依然として、独立したArtificial Analysis Intelligence Indexのトップに位置しており、SWE-bench Verifiedで監査済みの95.0%を達成している。したがって、疑問はより明確になる:Qwenが数字を示した今、「Fable 5に次ぐ」という評価は成立するのか?

ビルダーへの注意 — このような主張を検証する最速の方法は、両方のモデルを自分のプロンプトで実行することです。OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントの背後に集約しているため、2つのSDKを接続することなく、同じタスクでQwen 3.8 MaxとFable 5を対決させることができます。

TL;DRの結論。GA版のQwen3.8-Maxは、プレビュー版が示唆していたよりもはるかに強い挑戦者であり、しかも劇的に安価です。以下の価格では、1Mトークンあたり$2 / $6の一律価格、Fable 5の$10 / $50を入力で約5倍、出力で約8倍下回り、自己報告の数値は最先端級です(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、FrontierSWE 73.5。前世代は40.7)。しかし、Fable 5が王座を守る理由は7月から変わらず一つだけです。それは、この2つのうちreferee(審判)を持つのはFable 5だけだということです。Fableの約60のIntelligence Indexと95.0%のSWE-benchは第三者監査済みですが、Qwenの数字はすべてAlibabaの自己報告であり、Artificial AnalysisもLMArenaもQwen3.8-Maxのスコアを公開していません。証明力ではFable 5が勝り、価格ではQwen 3.8が決定的に勝ち、さらにweightsが公開されれば、オープン性でも勝ります。

重要なポイント

Qwen3.8-Max は2026年8月3日時点でGAです — プレビュー版ではなくなりました。料金表、OpenAI および DashScope 互換API、ベンダーベンチマーク表が公開されています。

価格差は非常に大きい: Qwenは1Mトークンあたり$2/$6、Fable 5は$10/$50です。つまり入力で約5倍、出力で約8倍の差があり、Qwenの料金は100万トークンのコンテキスト全体で一定で、長いプロンプトの追加料金はありません。

Fable 5は唯一の監査済みの比較対象であり続けています。 Artificial Analysis Intelligence Index(#1)で約60、SWE-bench Verifiedで95.0%を達成。一方、Qwen3.8-Maxは、依然としてどの独立した評価者からもスコアを付けられていません。

Qwenが自己報告する数値は確かに強い: GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1 — だがこれらはベンダーによる自己申告であり、各ラボは自分たちが勝てるベンチマークしか公表しないものだ。

Alibabaはアクティブパラメータ数を公開したことがないため、2.4Tという見出しだけでは実際のサービス提供コストはほとんどわからない。Fable 5のアーキテクチャも非公開であり、透明性の点ではどちらもクリーンではない。

今週中にオープンウェイトの公開が約束されており、さらにQwen3.8-27Bは約17GBのVRAMで動作すると報告されています。Fable 5はクローズドで、恒久的にAPIのみです。

正確性に関する注記:Qwen3.8-Maxの品質数値はすべてAlibabaが報告したものであり、独立した再現検証は行われていません。Fable 5の数値はArtificial AnalysisおよびAnthropicに由来しており、トラッカーによって異なる可能性があります。Qwenの価格はAlibaba Model StudioのGA料金表に基づくものであり、7月に適用されていた一時的なプレビュー割引ではなくなりました。

スペックと価格、並べて比較

これが確かなデータです。各数値はその出典が明記されています。

• メーカー / ステータス — Qwen3.8-Max: Alibaba; GA(2026年8月3日); Claude Fable 5: Anthropic; GAフラッグシップ

• アーキテクチャ — Qwen3.8-Max: 合計約2.4T、スパースMoE(アクティブパラメータは未公開のまま);Fable 5: クローズド;アーキテクチャ非公開

• コンテキストウィンドウ — Qwen3.8-Max: 1Mトークン (思考時は983,616、最大出力は131,072); Fable 5: 長文コンテキストのフラッグシップ

• AA Intelligence Index — Qwen3.8-Max: 未評価; Fable 5: ~60 — #1 (Artificial Analysis)

• SWE-bench Verified — Qwen3.8-Max: 報告なし(Alibabaは代わりにFrontierSWE 73.5を報告); Fable 5: 95.0%(Anthropic / buildfastwithai)

• ベンダー報告の強み — Qwen3.8-Max: GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、PaperBench 93.0、OSWorld-Verified 86.1(すべてAlibaba報告値);Fable 5:監査済み総合第1位

• 料金(入力/出力)— Qwen3.8-Max: $2.00 / $6.00 1Mあたり、1Mコンテキスト全体で一律;キャッシュ入力 $0.25;Fable 5: $10 / $50 1Mあたり

• オープンウェイト — Qwen3.8-Max: 今週中に提供予定(ライセンス未定); Fable 5: なし — クローズド / APIのみ

• マルチモダリティ — Qwen3.8-Max:テキスト、画像、動画の入力からテキスト出力;Fable 5:マルチモーダルのフラッグシップ

この比較全体を形作るものは2つあり、その両方が8月3日に変わった。

まず、価格欄がページ上で最も目立つ存在になっています。7月時点では、Qwenのコスト優位性は割引クーポンのようなものでした。クレジット90%オフ、期間限定、計画の基準となるトークン単価もありませんでした。今やそれは料金表であり、その差はプロモーションによるものではなく構造的なものです。Fableの50ドルに対して出力6ドルなら、Fable1回分の料金でQwenを約8回呼び出せます。単一の最も難しい回答よりも量に対して支払うワークロードでは、この比率が構築するアーキテクチャを変えます。

第二に、ベンチマークの欄はもはや空ではないが、比較可能でもない。ここが最も重要な微妙な点だ。Alibaba は FrontierSWE 73.5 を報告し、Anthropic は SWE-bench Verified 95.0% を報告している。これらは難易度のカーブが異なる別のベンチマークであり、73.5 と 95.0 を同じものを測定しているかのように並べるのは、率直に言って誤解を招く。私たちが言えることは、より限定的で、より正直なことだ。Fable 5 の数値は、誰もが検証できる条件下で第三者によって生成されたものであり、Qwen の数値は、他の誰も実行したことのないハーネス上で Alibaba が生成したものだ。Artificial Analysis か LMArena が Qwen3.8-Max のスコアを掲載するまで、正しい読み方は7月から変わらない——妥当そうで近いが、まだ証明されていない。

価格差が実際にあなたに買ってくれるもの

抽象的な倍数は実例ほど有用ではないので、ここで一つ例を示します。コードレビューエージェントが、リポジトリのコンテキストとして150,000トークンを送信し、1回の呼び出しで6,000トークンのレビューを生成する場合を考えます。

Qwen3.8-Max: 0.15M × $2 = $0.30、プラス0.006M × $6 = $0.036。≈ 1回あたり$0.34。

Claude Fable 5: 0.15M × $10 = $1.50、プラス 0.006M × $50 = $0.30。1回あたり約$1.80。

• 2,000コール/日の場合: Qwen ≈ $672/日; Fable ≈ $3,600/日。1か月にすると、おおよそ$20,000対$108,000です。

• 安定したリポジトリコンテキストでプロンプトキャッシングを使うと、Qwenのキャッシュ入力は$0.25/1Mで、入力側が$0.30から$0.04未満に下がり、呼び出しは≈ $0.08 — Fableの1回あたりのコストより約22倍安くなります。

それはわずかな節約ではありません。すべてのプルリクエストにレビュアーを実行することと、リスクのあるものだけに実行することの間の違いなのです。そして、Qwenの定額コンテキストは、プロンプトが大きくなるにつれてその効果をさらに強めます。なぜなら、Alibabaは長いプロンプトへの追加料金を設定していないため、900,000トークンのコンテキストを処理しても、5,000トークンのコンテキストと同じトークン単価が適用されるからです。

率直に言えば、トークンあたりの価格は解決済みタスクあたりの価格と同じではない。Fable 5が一発で問題を解決できるのに対し、より安価なモデルが3回の試行に加えて人間の修正を必要とするなら、安価なモデルの方が総合的にはコストがかかる可能性がある。そして最も難しい推論作業において、Fableの監査済み第1位ランキングは、一発でより多くを解決することの最良の根拠である。Qwenのコスト論は、高ボリュームでエラーに寛容なワークロードでは最も強く、低ボリュームでハイステークスなワークロードでは最も弱い。

証明、そしてなぜそれが依然としてこの対面を決定づけるのか

Qwen3.8-Maxに関する最も引用されるハンズオン評価は、プレビュー期のレビュー(thomas-wiegold.com)に基づくものです。このレビューでは、モデルを4つの実ビルドでテストしました。結果は本当に印象的で、QwenはGoポーカーシミュレーションを一発でクリアしました。これは、そのプロンプトを一度のパスでクリアした史上3番目のモデルであり、先例はFable 5Grok 4.5です。さらに、コーヒーロースターのウェブサイトというプロンプトでは、レビュアーがこのテストでこれまでに見た中で最高の出力を生成し、依頼されていないショッピングカート、卸売りセクション、Instagram統合まで、徹底ぶりのあまり追加しました。

問題は速度だった。ウェブサイトでは30分以上、ポーカーシミュレーションでは1時間20分かかり、そのレビュアーが使った中で最も遅いモデルだった。この指摘には、7月の時点では不要だった注釈が今は必要だ。これはプレビュー基盤上で測定された、一人のレビュアーによる、異常に長いエージェント実行での測定である。GA提供は別のシステムだ。参考までに、OrcaRouter自身の7日間テレメトリは現在、p50の初回トークンまでの時間が1.64秒をQwen3.8-Maxについて示している。これはファーストパーティの測定値だが、TTFTと1時間規模のビルドでのエンドツーエンドのスループットは異なる量である。正直な立場としては、プレビューの遅延に関する指摘は、現在の事実として繰り返すのではなく、再テストされるべきだ。

変わっていないのは、証拠の非対称性だ。AlibabaのGAベンチマーク表は、何も公開しないよりは確かに改善だが、それでもベンダーの産物に過ぎない。ラボはどのベンチマークを報告するかを選ぶものであり、Alibaba自身が報告した数字の中で最も弱いもの——IFBench 82.8、指示追従——は、このモデルが過剰に応答してスコープを無視するというプレビュー時の苦情と、たまたま正確に一致している。一方、Fable 5は、結果に利害関係を持たない評価者によって採点されている。「間違えられない仕事を処理できるモデルはどれか」という問いにおいて、その違いは瑣末な問題ではない。それは選択の根拠そのものなのである。

オープン性:Qwenが永続的に勝利するかもしれない軸

Fable 5 は決してセルフホスト可能にはならないだろう。Qwen3.8-Max はそうなるかもしれず、Alibaba は今週中にウェイトが届くと述べている。しかし、2つの注意点には同じだけの重みがある。

最初の点は法的なものです。まだライセンス条文もモデルカードもありません。「オープンウェイト公開予定」という表示は、読むべき文書が存在するまで商業利用権を付与するものではなく、そのリリースが製品に使用できるかどうかはライセンス次第なのです。

2つ目は物理的な問題です。2.4Tモデルは4ビット量子化で約1.2TBとなり、H200あたり約141GBであるのに対し、1トークンを処理する前に8つ以上の最上位アクセラレータが必要です。また、Alibabaはまだアクティブパラメータ数を開示していないため、その支出で得られるスループットを推定することもできません。ほとんどすべてのチームにとって、フラッグシップを自社でホストすることは現実的な選択肢ではありません。

これにより、Qwen3.8-27Bは、同時に発表され、オープンウェイトでもあり、約17GBのVRAMで動作すると報告されており、より実用的に重要なリリースである。QwenをFable 5より好む理由が、生の性能ではなくデータの保存場所やオンプレミス制御にあるなら、27Bは実際にそれを実現するモデルである。2.4TのフラッグシップとFable 5をオープン性で比較するのはほとんど理論的な話だが、27Bをオープン性で比較するのは具体的である。

よくある質問

Qwen 3.8 は Claude Fable 5 より優れていますか?

存在する証拠に基づくものではない。Alibaba の GA ベンチマーク表は強力だ(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6)が、その数字はすべて自己申告であり、独立した評価者がこのモデルを採点した実績はない。Fable 5 は監査済みの約 60 の Intelligence Index(#1)と 95.0% の SWE-bench Verified を保持している。証明力でリードするのは Fable 5 であり、価格で圧倒的にリードするのは Qwen 3.8 である。

「Fable 5に次ぐ」という主張は本当ですか?

それは依然としてAlibaba自身の位置づけにすぎない。GAはベンチマーク表を示したが、第三者による検証はない——Artificial AnalysisとLMArenaはどちらも未評価のままだ。参考までに、前モデルのQwen3.7-MaxはAA Intelligence Indexで46を記録し、Fable 5の約60に対し、この主張が文字通り真実であるためには非常に大きな世代間ジャンプが必要となる。

Qwen 3.8はFable 5よりもどれくらい安いですか?

大幅に異なります。しかもそれは割引ではなく、正式な料金です。Qwen3.8-Maxは1Mトークンあたり$2/$6で、Fable 5の$10/$50に対し — 入力は約5倍、出力は約8倍安価です。Qwenの料金は1Mコンテキスト全体でフラットであり、キャッシュ済み入力は$0.25/1Mなので、繰り返しコンテキストのワークロードはさらに低コストになります。

I don't have specific information about a model called "Qwen 3.8 Max" or its preview status. I'd recommend checking the official Qwen blog or documentation for the latest updates on model releases and availability.

はい。2026年8月3日に一般提供(GA)へ到達し、公開された料金表とOpenAI・DashScope互換のエンドポイントが用意されました。7月に流通していたQoderクレジットキャンペーンや90%オフのプレビューという位置づけは、もはやこのモデルの販売方法を説明するものではありません。

Qwen 3.8は、初期のレビューが言っていたように、まだ最も遅いモデルですか?

その調査結果は、1時間に及ぶエージェンティックビルドを実行するプレビュー基盤上の1人のレビュアーによるものであり、現在の事実として扱うのではなく、GAサービングに対して再テストすべきである。OrcaRouterの7日間テレメトリでは、p50のtime-to-first-tokenが1.64秒と示されているが、これは非常に長いビルドにおけるスループットではなく、最初のトークンのレイテンシを測定したものである。

Qwen 3.8を自分でホスティングして、Fable 5にお金を払う代わりにすることはできますか?

まだです。おそらくフラッグシップではないでしょう。ウェイトは今週中に公開される予定ですが、ライセンスはまだありません。また、4ビットで約1.2TBになるため、H200クラスのGPUが8基以上必要になります。同時に発表されたQwen3.8-27Bは、VRAM約17GBと報告されており、現実的なセルフホスティングの道です。Fable 5は永久に閉鎖されています。

今日はどちらを使うべきですか?

間違った回答が高くつき、監査可能な信頼性が必要な作業にはFable 5 — 難しい推論、影響の大きい本番パスなど。高ボリュームの作業で、8×の出力単価アドバンテージが効いてくる場合にはQwen3.8-Max — 大量のコードレビュー、長文書分析、検証を許容できるあらゆる作業。多くのチームは両方を実行し、タスクの価値でルーティングすべきです。

結論

Qwen 3.8 vs Claude Fable 5は、2週間前とは実質的に異なる比較です。Qwen3.8-Maxは、もはやクーポン付きプレビュー版ではなく、一般提供されているモデルです。Fable 5を入力で5倍、出力で8倍下回る料金体系を100万トークンまで一律で備え、自己報告の数値はフロンティア級であり、前モデルからのコーディング性能の跳躍は再現されれば驚異的です。

しかし、Fable 5 は王座を守っている。その理由は7月に王座を守った理由とまったく同じで、審判がいる側だからだ。監査済みの#1 Intelligence Indexと95.0%のSWE-bench Verifiedは、誰か他の人が検証した主張である。Alibabaの成績表は、どれほど強力でもAlibaba自身のものにすぎない。2つの出来事に注目しよう。Qwen3.8-Maxに対する初の独立したIntelligence Indexスコアと、ライセンスが付属した状態での重みの公開だ。その両方がQwenに有利に進めば、「Fable 5に次ぐ」という言葉はもはやマーケティングではなくなる。それまでは、勝者を選ぶのではなく、ステークに応じて使い分けるのが賢明な答えだ。間違えることが許されない場面ではFableを、高コストを許容できない場面ではQwenを——そして両方を自分のプロンプトでテストすることだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube