Qwen 3.8 vs Claude Fable 5:0902ビルドがコーディングでリードを奪う
Guides & Insights

Qwen 3.8 vs Claude Fable 5:0902ビルドがコーディングでリードを奪う

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

アリババがQwen3.8-Maxを2026年7月19日に上海でプレビューした際、同社は何よりも強調された一つの主張を行った。すなわち、この2.4兆パラメータのモデルはフロンティアレベルに近く、Claude Fable 5にのみ劣る。当時、それを評価することは不可能だった。レートカードもベンチマーク表もライセンスもなく、単なるポジショニングステートメントに過ぎなかった。

2026年8月3日、Qwen3.8-Maxが一般提供開始となった。100万トークンあたり2ドル/6ドルという正式な料金表、数値入りのベンチマーク表、OpenAIおよびDashScope互換のエンドポイントを備えて。9月2日には、アリババはバージョン番号を変えずに次のステップをリリースした。Qwen3.8-Max-0902である。これはコーディングとエージェント業務に焦点を当てたポストトレーニング刷新版で、Code Arena: WebDevリーダーボードで1,691 Eloを記録し、初登場で1位となった。アリババが7月に自社を「その直後」に位置づけることに費やしていたモデル、Claude Fable 5は、同じボードで1,628にとどまっている。7月の問いはさらに先鋭化している。Qwen 3.8は依然として「Fable 5に次ぐ第2位」なのか、それともコーディングの軸はすでに逆転したのか。

ビルダーへの注意 — このような主張を検証する最速の方法は、両方のモデルを自分のプロンプトで実行することです。OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントの背後に集約しているため、2つのSDKを接続することなく、同じタスクでQwen 3.8 MaxとFable 5を対決させることができます。

要約:結論。Qwen3.8-Max-0902 は、Alibaba の 2.4T フラッグシップの中でもこれまでで最強のビルドであり、今回の主張の新しい点はもはや自己申告ではありません。独立系の Code Arena: WebDev ボードで、1,691 Elo を獲得して初登場で1位となり、同ボードで Claude Fable 5(1,628、8位)を上回りました。価格は変わらず、依然として決定的です。1Mトークンあたり一律 $2 / $6 という価格設定は、Fable 5 の $10 / $50 に対し、入力ではおよそ5分の1、出力ではおよそ8分の1の価格です。埋まっていないのは、汎用性能の差です。Artificial Analysis の Intelligence Index では、Qwen3.8-Max は56点と評価され、Claude Fable 5 は62点です。また、一般的な Arena ボードの直近公表週(8月24日〜30日)では、Fable 5 が1位(1,508 Elo)を維持し、Qwen3.8-Max は20位(1,479)にとどまっています。つまり、結論は2つあります。コーディングにおいて、Qwen の0902リフレッシュは第三者による審判を得て勝利を手にしました。一方、広範かつ監査済みの推論では、Claude Fable 5 — そして AA インデックスを66でリードする Anthropic の新しい Claude Fable 5.1 — が依然として地歩を守っています。

重要なポイント

Qwen3.8-Maxは2026年8月3日にGAに到達し、その0902リフレッシュが9月2日にリリースされました — バージョン番号の変更はなく、$2 / $6のレートカードも1Mトークンのコンテキストも同じです。

価格差は非常に大きい: Qwenは1Mトークンあたり$2/$6、Fable 5は$10/$50です。つまり入力で約5倍、出力で約8倍の差があり、Qwenの料金は100万トークンのコンテキスト全体で一定で、長いプロンプトの追加料金はありません。

両者には現在、独立したスコアがあり、それらは異なる方向を示しています。Qwen3.8-Max は Artificial Analysis Intelligence Index で 56 を記録(Claude Fable 5 は 62)し、その 0902 ビルドは Code Arena: WebDev で Fable 5 の 1,628 を上回る 1,691 Elo を達成して首位に立っています。

Qwen自身のベンチマーク表は依然として強力で、依然としてベンダー製です。GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1 — しかし、9月2日の更新版は、独立系アリーナで1位にランク付けされた最初のQwenの結果です。

スペックシートにあったアーキテクチャの空白は埋められた。 Qwen3.8-2.4T-A95Bは、総計2.4Tのうち約95Bをアクティブパラメータとし、512のエキスパートに分散されている。これは8月12日のオープンウェイト公開に際して開示された。Fable 5のアーキテクチャは依然として非公開のままである。

オープンウェイトは約束ではなく、公開済みです。 Qwen3.8-2.4T-A95B(BF16およびFP8)は、カスタムのQwen3.8-Maxライセンスのもと、8月12日にHugging FaceとModelScopeで公開されました。続いてQwen3.8-27Bが8月14日にApache 2.0のもとで公開されました。Fable 5はクローズドで、恒久的にAPIのみの提供です。

精度に関する注記:Alibaba自身のベンチマーク表の数値はベンダー報告によるもので、第三者による再現は行われていません。ここに示す独立系の数値はタイムスタンプ付きの第三者データです:Artificial Analysis Intelligence Index(Qwen3.8-Max 56、Claude Fable 5 62、Claude Fable 5.1 66)、Code Arena: WebDev Eloランキング、および一般Arenaの週間ボード。Arenaのスコアは投票が蓄積されるにつれて変動し、0902ビルドの#1はAlibabaによる特定時点のリストの発表に基づいています。Fable 5のSWE-bench Verifiedスコア95.0%はAnthropicの報告値であり、Qwenの価格はAlibaba Model StudioのGAレートカードに基づいています。

スペックと価格、並べて比較

これが確かなデータです。各数値はその出典が明記されています。

• メーカー / ステータス — Qwen3.8-Max: Alibaba; GA 2026年8月3日; 0902リフレッシュ 2026年9月2日。Claude Fable 5: Anthropic; GAフラッグシップ。

— アーキテクチャ — Qwen3.8-Max: 総計2.4T / アクティブ約95B、スパースMoE、512エキスパート(8月12日開示); Fable 5: 非開示

• コンテキストウィンドウ — Qwen3.8-Max: 1Mトークン (思考時は983,616、最大出力は131,072); Fable 5: 長文コンテキストのフラッグシップ

• AA Intelligence Index — Qwen3.8-Max: 56; Claude Fable 5: 62; Claude Fable 5.1(9月1日): 66、首位

• SWE-bench Verified — Qwen3.8-Max: 報告なし(Alibabaは代わりにFrontierSWE 73.5を報告); Fable 5: 95.0%(Anthropic / buildfastwithai)

• 独立系およびベンダー報告による強み — Qwen3.8-Max: Code Arena WebDev で1,691を記録し第1位(0902時点、独立系);ベンダー公表値:GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6。Claude Fable 5: AA 62、SWE-bench Verified 95.0%

• 料金(入力/出力)— Qwen3.8-Max: $2.00 / $6.00 1Mあたり、1Mコンテキスト全体で一律;キャッシュ入力 $0.25;Fable 5: $10 / $50 1Mあたり

• オープンウェイト — Qwen3.8-Max: 2026年8月12日リリース(カスタムライセンス、Apache 2.0ではない)。Qwen3.8-27Bは2026年8月14日にApache 2.0で公開。Fable 5: なし — クローズド/APIのみ

• マルチモダリティ — Qwen3.8-Max:テキスト、画像、動画の入力からテキスト出力;Fable 5:マルチモーダルのフラッグシップ

この比較全体を枠づけるのは2つの事柄である。1つ目は8月3日に変わり、今もなお当てはまる。2つ目は9月2日に再び変わった。

まず、価格欄がページ上で最も目立つ存在になっています。7月時点では、Qwenのコスト優位性は割引クーポンのようなものでした。クレジット90%オフ、期間限定、計画の基準となるトークン単価もありませんでした。今やそれは料金表であり、その差はプロモーションによるものではなく構造的なものです。Fableの50ドルに対して出力6ドルなら、Fable1回分の料金でQwenを約8回呼び出せます。単一の最も難しい回答よりも量に対して支払うワークロードでは、この比率が構築するアーキテクチャを変えます。

第二に、ベンチマークの列はもはや一方的ではなくなった。8月の大半において、正直な読み取りは限定的だった。AlibabaはFrontierSWE 73.5と自社実行による数値の表を報告し、Anthropicは第三者検証済みの95.0% SWE-bench Verifiedを報告したが、Qwenを採点した独立した評価者は誰もいなかった。その状況を終わらせたのが0902ビルドだ。Code Arena: WebDevは、盲検式のペアワイズ人間投票アリーナである——旧称WebDev Arenaとして知られ、Alibabaの誰によっても運営されていないプロジェクト——そしてQwen3.8-Max-0902は、Claude Opus 5(1,688)、Kimi K3(1,674)、Claude Fable 5(1,628、第8位)を上回る1,691 Eloで第1位としてランクインした。この正直さを支えているのは2つの注意点だ。ひとつは、これが単一のボードであり、一般的な能力ではなくエージェント型フロントエンド開発を測定していること、もうひとつは、「第1位でデビュー」というのが、ある時点のランキング掲載に関するAlibabaの発表にすぎないことだ。しかし、Qwenには評価者がまったくいないという主張はもはや真実ではなく、そのことは、このボード上のどの単一の数値よりも比較のあり方を変えるのである。

価格差が実際にあなたに買ってくれるもの

抽象的な倍数は実例ほど有用ではないので、ここで一つ例を示します。コードレビューエージェントが、リポジトリのコンテキストとして150,000トークンを送信し、1回の呼び出しで6,000トークンのレビューを生成する場合を考えます。

Qwen3.8-Max: 0.15M × $2 = $0.30、プラス0.006M × $6 = $0.036。≈ 1回あたり$0.34。

Claude Fable 5: 0.15M × $10 = $1.50、プラス 0.006M × $50 = $0.30。1回あたり約$1.80。

• 2,000コール/日の場合: Qwen ≈ $672/日; Fable ≈ $3,600/日。1か月にすると、おおよそ$20,000対$108,000です。

• 安定したリポジトリコンテキストでプロンプトキャッシングを使うと、Qwenのキャッシュ入力は$0.25/1Mで、入力側が$0.30から$0.04未満に下がり、呼び出しは≈ $0.08 — Fableの1回あたりのコストより約22倍安くなります。

それはわずかな節約ではありません。すべてのプルリクエストにレビュアーを実行することと、リスクのあるものだけに実行することの間の違いなのです。そして、Qwenの定額コンテキストは、プロンプトが大きくなるにつれてその効果をさらに強めます。なぜなら、Alibabaは長いプロンプトへの追加料金を設定していないため、900,000トークンのコンテキストを処理しても、5,000トークンのコンテキストと同じトークン単価が適用されるからです。

率直に言えば、トークンあたりの価格は解決済みタスクあたりの価格と同じではない。Fable 5が一発で問題を解決できるのに対し、より安価なモデルが3回の試行に加えて人間の修正を必要とするなら、安価なモデルの方が総合的にはコストがかかる可能性がある。そして最も難しい推論作業において、Fableの監査済み第1位ランキングは、一発でより多くを解決することの最良の根拠である。Qwenのコスト論は、高ボリュームでエラーに寛容なワークロードでは最も強く、低ボリュームでハイステークスなワークロードでは最も弱い。

0902という命名:性能は飛躍したが、バージョン番号は飛躍しなかった

9月2日について特筆すべきは、アリババがやらなかったことだ。すなわち、Qwen 3.9をリリースしなかったのだ。改良は同じモデル名のまま日付付きチェックポイントとして出荷され——Qwen3.8-Max-0902——APIも同じ名称・同じ価格でそれを提供した。これは業界が流れつつある方向性を示している。能力の飛躍がもはや新しいバージョン番号を保証しなくなったとき、「どのモデルを使うべきか」という問いは、ファミリー名だけでなく、ビルドと日付の問題になる。

「Qwen3.8-Max」に付けられたベンチマークスコアには賞味期限があります。7月版または8月版に対して測定されたスコアは、今日APIが返すモデルを表していない可能性があります。実際に呼び出しているエンドポイントのビルド識別子を確認してください。0902という番号は、Code Arena: WebDevでClaude Fable 5に後れを取っていたモデルと、そのモデルをリードするモデルとの違いを生むものです。

証明、そしてなぜそれが依然としてこの対面を決定づけるのか

Qwen3.8-Maxに関する最も引用されるハンズオン評価は、プレビュー期のレビュー(thomas-wiegold.com)に基づくものです。このレビューでは、モデルを4つの実ビルドでテストしました。結果は本当に印象的で、QwenはGoポーカーシミュレーションを一発でクリアしました。これは、そのプロンプトを一度のパスでクリアした史上3番目のモデルであり、先例はFable 5とGrok 4.5です。さらに、コーヒーロースターのウェブサイトというプロンプトでは、レビュアーがこのテストでこれまでに見た中で最高の出力を生成し、依頼されていないショッピングカート、卸売りセクション、Instagram統合まで、徹底ぶりのあまり追加しました。

問題は速度だった。ウェブサイトでは30分以上、ポーカーシミュレーションでは1時間20分かかり、そのレビュアーが使った中で最も遅いモデルだった。この指摘には、7月の時点では不要だった注釈が今は必要だ。これはプレビュー基盤上で測定された、一人のレビュアーによる、異常に長いエージェント実行での測定である。GA提供は別のシステムだ。参考までに、OrcaRouter自身の7日間テレメトリは現在、p50の初回トークンまでの時間が1.64秒をQwen3.8-Maxについて示している。これはファーストパーティの測定値だが、TTFTと1時間規模のビルドでのエンドツーエンドのスループットは異なる量である。正直な立場としては、プレビューの遅延に関する指摘は、現在の事実として繰り返すのではなく、再テストされるべきだ。

0902アップデートを経ても変わらないのは、双方の最も有力な根拠が依然として別々の場所から来ていることだ。Qwen3.8-Max-0902のCode Arena: WebDevでの1位は、独立したブラインド投票の結果ではあるが、単一のボードを評価するものにすぎない。そしてAlibaba自身のベンチマーク表はベンダーによる成果物のままだ——各ラボは報告するベンチマークを選べるからだ。同社が報告した中で最も低い数字(IFBench 82.8、指示追従)は、このモデルが過剰に応答しスコープを無視するというプレビュー時の苦情と依然として一致している。Claude Fable 5の根拠はより広範で、ほとんどが第三者によるものだ:AA Intelligence Indexで62、Arenaの総合リーダーボードで1位、SWE-bench Verifiedで95.0%——そしてAnthropic自身の新しいClaude Fable 5.1は、9月1日以来AA指数を66でリードしている。「間違えられない仕事を処理してくれるのはどのモデルか」という問いへの一般的な答えは変わらない。「10分の1の価格で最高のフロントエンドを出荷するのはどのモデルか」という問いへの答えは、9月2日に覆った。

オープン性:Qwenがすでに制した軸

Fable 5は決してセルフホスト可能にはならないだろう。Qwen3.8-Maxはすでにそうだ。8月12日、Qwen3.8-2.4T-A95Bの重み — BF16と公式FP8版 — がHugging FaceとModelScopeに公開され、誰でもダウンロードできる初のMaxクラスQwenとなった。2つの注意点も同様に重みを持つ価値がある。

1つ目は合法です。このリリースはApache 2.0ではなく、独自の「Qwen3.8-Max」ライセンスの下で提供されます:モデル・アズ・ア・サービスまたはAI業務支援ビジネスを運営し、直近の売上高が5,000万ドルを超えるプロバイダーは、Qwenとの別途ライセンス交渉が必要となり、月間アクティブユーザー数が1億人または月間売上高が2,000万ドルを超える商用製品は、モデル名を表示しなければなりません。社内利用やスタートアップにとっては、これらの閾値が適用されることは稀です——しかし、これは完全に自由に使えるという意味ではありません。

2つ目は物理的な問題です。2.4T総パラメータのMoEは、BF16でおよそ4.9TB(公式FP8チェックポイントではその約半分)になり、H200あたりのメモリはおよそ141GBです。つまり、フラッグシップモデルを自前でホストするには、1トークンを処理する前にアクセラレータのラック一式が必要になります。公開されている約95Bのアクティブパラメータによって、そのラックで何が得られるかを少なくとも見積もることは可能です。ほぼすべてのチームにとっては、$2/$6のホスト型APIが現実的な道です。

そのため、8月14日にApache-2.0ライセンスのウェイトが公開され、約17GBのVRAMで動作すると報告されているQwen3.8-27Bは、実用上重要なセルフホスト向けリリースであり続けています。QwenをFable 5より選ぶ理由が、生の性能ではなくデータレジデンシーやオンプレミス管理にあるなら、27Bこそが実際にそれを実現するモデルです——そしてその両面において、オープン性の比較はもはや理論上の話ではありません。

よくある質問

Qwen 3.8 は Claude Fable 5 より優れていますか?

結果は現在、評価軸によって左右される。これは8月時点と比べれば、確かな変化である。コーディングでは、Qwen3.8-Max-0902がリードしている。Code Arena: WebDevで第1位、Elo 1,691を記録し、Claude Fable 5の1,628を上回る。価格は$2 / $6で、Fable 5の$10 / $50よりも安い。広範かつ監査済みの品質では、Fable 5が依然として先頭に立つ。AA Intelligence IndexではQwenの56に対して62、SWE-bench Verifiedでは95.0%、一般的なArenaボードでも第1位である。誤った回答が高くつく現場では、ドキュメントがより充実したFable 5が適した選択肢となる。一方、大量のコーディングやエージェント型Web業務では、最新のQwenの方が安価であり、Arenaランキングでも上位に位置している。

「Fable 5に次ぐ」という主張は本当ですか?

Alibabaの位置づけは独立した数値なしで行われ、その後の0902ビルドで形は変わっている。Qwen3.8-Max-0902はCode Arena: WebDevではClaude Fable 5を上回る(1,691対1,628)が、AA Intelligence Index(56対62)と総合Arenaボード(Qwen #20 Elo 1,479、Fable 5 #1 1,508)では後れを取る。つまり「Fable 5に次ぐ」は「今回のリフレッシュが対象としたコーディングボードではFable 5を上回り、広範な汎用ボードでは後れを取る」という形になった。

Qwen 3.8はFable 5よりもどれくらい安いですか?

大幅に異なります。しかもそれは割引ではなく、正式な料金です。Qwen3.8-Maxは1Mトークンあたり$2/$6で、Fable 5の$10/$50に対し — 入力は約5倍、出力は約8倍安価です。Qwenの料金は1Mコンテキスト全体でフラットであり、キャッシュ済み入力は$0.25/1Mなので、繰り返しコンテキストのワークロードはさらに低コストになります。

I don't have specific information about a model called "Qwen 3.8 Max" or its preview status. I'd recommend checking the official Qwen blog or documentation for the latest updates on model releases and availability.

はい。2026年8月3日に一般提供(GA)へ到達し、公開された料金表とOpenAI・DashScope互換のエンドポイントが用意されました。7月に流通していたQoderクレジットキャンペーンや90%オフのプレビューという位置づけは、もはやこのモデルの販売方法を説明するものではありません。

Qwen 3.8は、初期のレビューが言っていたように、まだ最も遅いモデルですか?

その調査結果は、1時間に及ぶエージェンティックビルドを実行するプレビュー基盤上の1人のレビュアーによるものであり、現在の事実として扱うのではなく、GAサービングに対して再テストすべきである。OrcaRouterの7日間テレメトリでは、p50のtime-to-first-tokenが1.64秒と示されているが、これは非常に長いビルドにおけるスループットではなく、最初のトークンのレイテンシを測定したものである。

Qwen 3.8を自分でホスティングして、Fable 5にお金を払う代わりにすることはできますか?

Qwenについては、条件付きで「はい」です。{{1}}Qwen3.8-2.4T-A95Bは8月12日から独自ライセンス(Apache 2.0ではない)のもとでダウンロード可能になり、Qwen3.8-27Bは8月14日からApache 2.0のもとでダウンロード可能になりました。{{/1}} 実質的な障壁はハードウェアです。{{2}}総量2.4TのMoEにはBF16で約4.9TBが必要であり、これはアクセラレータのラック一式に相当するため、ほとんどのチームはフラッグシップを自前で運用するより、$2/$6のホスト型APIを呼び出すことになるでしょう。{{/2}} Fable 5は恒久的にクローズされています。

今日はどちらを使うべきですか?

間違った答えが高くつく一般的な作業(高度な推論や、影響の大きい本番環境パスなど)では、Claude Fable 5 は依然としてドキュメントがより充実した選択肢であり、Anthropic の Claude Fable 5.1 はその優位性をさらに広げています。大量のコーディングやエージェント型 Web 開発では、Qwen3.8-Max-0902 が現在、独立系アリーナでの優位性を持ち、出力価格も約 8 分の 1 です。具体的には、大量のコードレビュー、フロントエンド生成、長文ドキュメント分析などです。多くのチームは両方を運用し、タスクに応じて使い分けるべきです。

結論

Qwen 3.8 と Claude Fable 5 の比較は、1か月前とは異なるものになり、1週間前ともまた違っています。Qwen3.8-Max は一般提供中のモデルで、その料金表は Fable 5 を入力で5分の1、出力で8分の1の価格で下回り、100万トークンにわたって一律です。そして9月2日以降、同じ名前で 0902 ビルドが提供されており、独立したアリーナでは現在、エージェント型Web開発で第1位にランク付けされ、そのボードでは Fable 5 を上回っています。

どちらのモデルも、もはや比較全体を独占しているわけではない。Claude Fable 5 — そして9月1日以降、AA Intelligence Indexを66でリードしてきたAnthropicのClaude Fable 5.1 — は、広範かつ監査済みの汎用領域を保持しており、Alibaba自身のベンチマーク表は依然としてベンダーによる作為の産物にすぎない。しかし、7月にこの対戦が一方的だった理由 — Qwenには独立した審判がまったくいなかったこと — は9月2日に失効した。Qwen3.8-Max-0902はCode Arena: WebDevで第1位のモデルである。賢明な答えは依然として、重要度とタスクに応じて使い分けることだ。つまり、誤りが高くつく一般的な推論にはFable 5、価格差とアリーナでの優位性の両方が有利に働く大量のコーディングにはQwen3.8-Max、そして両方を自分のプロンプトでテストすることだ。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新