「Qwen 4 Max vs Claude Opus 5」のヒーロータイトルカード。サブタイトルは「両者の足元で動いたベンチマーク」、3つのピル型バッジは「インデックス改訂 v4.3.2」「51 vs 53」「$5.00と$25.00」、右下隅にOrcaRouterのロゴ。
Engineering & Research

Qwen 4 Max vs Claude Opus 5:両者の足元で動いたベンチマーク

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Qwen 4 Max は、2026年9月22日に杭州で開催された雲栖大会でプレビュー公開された。発表済みで未リリースの4モデル構成の Qwen 4 ラインのうちのフラッグシップ層であり、価格もコンテキストウィンドウも公表されたスコアもない。Claude Opus 5 は2026年7月24日から一般提供されており、入力100万トークンあたり5.00ドル、出力100万トークンあたり25.00ドルで、Qwen3.8-Max のリリース以降にあらゆるフラッグシップが照準を合わせてきたターゲットだ。この比較を書く明白な方法は、1列が空欄のスペック表である。有益な方法は、2026年9月19日、つまり発表の3日前に Artificial Analysis が Intelligence Index を再採点し、Claude Opus 5 がその首位のモデルではなくなったことに気づくことだ。この単一の変化が、Qwen 4 Max が打ち負かさなければならないものの捉え方を根底から変える。

9月19日に何が変わりましたか

Artificial Analysisは2026年9月19日にインデックス改訂v4.3.2を公開した。現在の改訂では、Claude Opus 5は最大推論努力でIntelligence Indexのスコアが51 — xhighで50、highで48、mediumで45、lowで39 — であり、Claude Fable 5.1GPT-6 Astra(ともに53)に後れを取っている。そのインデックスでのタスクあたりのコストは5.86ドルだ。

それがダウングレードのように読めても、そうではない。モデルは変わっていない。変わったのはインデックスだ。当社自身の7月から8月にかけての報道では、Claude Opus 5を61~63、そして表の最上位として挙げていたが、それらの数値は当時有効だった改訂の下では正しかった。改訂日を付けずにそれらをまだ引用している人は、すでに引退した数値を引用しているのであり、これは今月書かれた比較記事で最もよくある単一の誤りだ。実際の結果として、「Claude Opus 5は利用可能な中で最高スコアのモデルだ」といった主張はもはや真ではなく、それに基づいて組み立てられた比較は崩壊する。

Qwen側にとっては、その帰結はさらに厳しい。2026年9月に発表されたフラッグシップ層は、2026年9月に再定義されたターゲットを狙っている。Alibabaが最終的にQwen 4 Max向けに何を公表するにせよ、それは53が上回るべき数字であり、63ではないリーダーボードに照らして読まれることになる。

A two-column scoreboard titled "Qwen 4 Max vs Claude Opus 5 - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Independent score none exists; Open weights not published. Right column Claude Opus 5: Status generally available; Input price $5.00 per 1M tokens; Output price $25.00 per 1M tokens; Context window 1M tokens; Independent score 51 on index v4.3.2; Open weights none. Footer reads "Claude Opus 5 from Anthropic published pricing and Artificial Analysis index v4.3.2, September 19 2026.", with the OrcaRouter logo bottom-right.

率直に言えば、その比較

この表の片側は完成しており、もう片側は空白だ。そうでないかのように装うことこそが、この記事の失敗の本質だろう。実際に分かっていることは次のとおりだ。

• ステータス — Claude Opus 5 は2026年7月24日から一般提供中、一方 Qwen 4 Max は2026年9月22日に発表されたが、リリース日は未定

• 入力価格 — Claude Opus 5 は100万トークンあたり$5.00、一方 Qwen 4 Max は非公開

• 出力価格 — Claude Opus 5 は100万トークンあたり$25.00、一方 Qwen 4 Max は未公開

• キャッシュ済み入力 — キャッシュ読み取り時の Claude Opus 5 は100万トークンあたり $0.50、一方 Qwen 4 Max は非公開

• コンテキスト — Claude Opus 5 はデフォルトおよび最大で100万トークン、一方 Qwen 4 Max は未公開

• 出力上限 — Claude Opus 5 は同期で 128K トークン、ベータヘッダー付きの Batches API では 300K であるのに対し、Qwen 4 Max は公開されていません

• モダリティ — Claude Opus 5 はテキスト、画像、ファイルの入力とテキスト出力、一方 Qwen 4 Max は未公開

• 長文コンテキストの価格設定 — Claude Opus 5 には割増料金がないため、900,000トークンのリクエストは9,000トークンのものと同じトークンあたりの料金で課金される。一方、Qwen 4 Max は公表されていない。

• 独立スコア — 最大エフォート時の Artificial Analysis Intelligence Index v4.3.2 で Claude Opus 5 は51、一方 Qwen 4 Max には独立した評価が存在しない

• ベンダー報告のスコア — Claude Opus 5 は SWE-bench Verified 96.0%、SWE-bench Pro 79.2%、OSWorld 2.0 70.6%、Terminal-Bench 2.1 はハーネス次第で80%台半ば、一方 Qwen 4 Max は何も報告なし

• 推論の制御 — Claude Opus 5 は適応的思考がデフォルトで有効になり、5段階のエフォートラダーを備える。一方、Qwen 4 Max は非公開

「未公開」が10行並んでいるのは、修辞技法ではない。それはエビデンスの現状であり、そこから導かれる正直な結論は、これら2つのモデル間の能力比較は、まだ誰にもできないということだ。

埋まらない溝の部分

価格と背景情報は最終的に公開される。ただ一つの違いはリリース後も残るだろう。そしてそれは、Qwen 4 Maxが出荷される週になってからではなく、今のうちに決めておく価値がある。その2つのモデルは、それぞれ異なる方法で購入されるように作られているのだ。

Claude Opus 5は、単一のベンダーから単一の価格で提供される単一のクローズドモデルであり、2027年7月24日より早くに提供終了しないという公式のコミットメントが公表されています。これはキャパシティプランニングにとって安定したターゲットです。Qwen 4 Maxは、Alibabaがはるかに広い価格帯にわたって繰り返しリリースしてきたファミリーのフラッグシップです——Qwen 3.8世代は、入力$2.00のフロンティア・フラッグシップから、それよりはるかに下のFlashティアまで及びます——そしてQwenラインのフラッグシップティアは、歴史的に、より安価なティアがその差を埋めるまでの実用的な寿命が最も短いティアでした。

もう一つの違いはオープンウェイトであり、それは逆の方向を指している。Qwen 3.8世代は、最大モデルのウェイトを独自のQwenライセンスの下で公開しており、これこそがファインチューニング、量子化、セルフホスティングをそもそも可能にしている。Claude Opus 5にはウェイトの公開がなく、今後もされることはない。自分の境界内で実行できるモデル、あるいは改変できるモデルをワークロードが求めるのであれば、それはベンチマークの改訂によってアリババから奪い去ることのできない構造的優位性であり、これを単に一つのフラッグシップと別のフラッグシップの対決と捉えるのではなく、この特定の比較を気にかけるべき最強の理由なのである。

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, English UI), showing the 1M token context badge, the model ID anthropic/claude-opus-5, a 128K maximum output, text plus image plus file input with text output, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24 credited to Anthropic, a p50 time-to-first-token of 5.75s, the OpenAI-compatible code sample, the Public benchmarks block, and the opening of the model description calling Claude Opus 5 Anthropic flagship for demanding reasoning, coding and long-horizon agentic work.

今日この比較を実行する方法

Claude Opus 5 が利用可能になり、OrcaRouter がこれを anthropic/claude-opus-5 としてルーティングし、Anthropic の定価のまま 0% のマークアップで提供します — プロバイダーの料金がそのまま渡されるため、上記の $5.00 と $25.00 という数字は、マークアップされた相当額ではなく、実際に請求される金額です。このことは、この価格帯のモデルではいつも以上に重要です。$25.00 の出力料金に対する 10 パーセントのプラットフォームマージンは 100 万トークンあたり $2.50 で、これはほとんどのオープンウェイトの代替モデルの入力コスト全体を上回ります。さらに、カタログには 1 つの OpenAI 互換エンドポイント上で 200 近いモデルが揃っており、プロバイダーの経路が劣化した際の自動フェイルオーバーや、アプリケーションにモデル名をハードコーディングする代わりにポリシーを明示的に表現するためのルーティング DSL も備えています。

OrcaRouterが取り扱っていないのは、Qwen 4 Max、あるいはQwen 4のどのティアも同様です。カタログにはこのファミリーの項目が一切なく、これは発表されただけで未リリースのモデルに当然期待されることです。ティアが実際に登場すれば同じ場所に現れるはずで、それまではClaude Opus 5と比較する価値のあるQwenモデルは、実際に呼び出せるもの、すなわちQwen3.8-Maxです。2026年8月3日から一般提供されており、100万トークンあたり入力$2.00、出力$6.00、重みも公開され、記録された独立系知能スコアはタスクあたり$1.14で56 — この数値は以前のインデックス改訂時に記録されたものなので、Claude Opus 5の51と比較する際はその注意点を付した上で行ってください。

モデルカードが存在する前に、これをどうするか

ここで下すべき判定はない。2つのモデルのうち一方は製品として存在しないからだ。言えるのは、2026年9月19日に、どちらのベンダーも何もしていないのに比較の構図が変わったということだ。Claude Opus 5は、ほとんどの比較が依拠する独立系インデックスで最高スコアのモデルではなくなり、今では他の2つのモデルに2ポイント差をつけられている。Qwen 4 Maxの登場は、7月時点の表ではなく、その表に加わることになる。

つまり、今後数か月の判断は Qwen 4 Max 対 Claude Opus 5 ではない。そうではなく、Claude Opus 5 対、すでに出荷済みの Qwen モデル — 入力価格が5分の1で、重みが公開されているフラッグシップ — だ。そしてその比較は今すぐ可能で、双方に実際の数値がある。Alibaba がモデルカードを公開したらその判断を見直し、それまでに見かける Qwen 4 Max のベンチマーク表は未検証として扱うこと。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the OpenAI-compatible Python code sample, and the model description naming Qwen3.8-Max Alibaba newest flagship and highest-capability tier to date.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新