
Qwen 4 Max vs Claude Opus 5:両者の足元で動いたベンチマーク
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max は、2026年9月22日に杭州で開催された雲栖大会でプレビュー公開された。発表済みで未リリースの4モデル構成の Qwen 4 ラインのうちのフラッグシップ層であり、価格もコンテキストウィンドウも公表されたスコアもない。Claude Opus 5 は2026年7月24日から一般提供されており、入力100万トークンあたり5.00ドル、出力100万トークンあたり25.00ドルで、Qwen3.8-Max のリリース以降にあらゆるフラッグシップが照準を合わせてきたターゲットだ。この比較を書く明白な方法は、1列が空欄のスペック表である。有益な方法は、2026年9月19日、つまり発表の3日前に Artificial Analysis が Intelligence Index を再採点し、Claude Opus 5 がその首位のモデルではなくなったことに気づくことだ。この単一の変化が、Qwen 4 Max が打ち負かさなければならないものの捉え方を根底から変える。
9月19日に何が変わりましたか
Artificial Analysisは2026年9月19日にインデックス改訂v4.3.2を公開した。現在の改訂では、Claude Opus 5は最大推論努力でIntelligence Indexのスコアが51 — xhighで50、highで48、mediumで45、lowで39 — であり、Claude Fable 5.1とGPT-6 Astra(ともに53)に後れを取っている。そのインデックスでのタスクあたりのコストは5.86ドルだ。
それがダウングレードのように読めても、そうではない。モデルは変わっていない。変わったのはインデックスだ。当社自身の7月から8月にかけての報道では、Claude Opus 5を61~63、そして表の最上位として挙げていたが、それらの数値は当時有効だった改訂の下では正しかった。改訂日を付けずにそれらをまだ引用している人は、すでに引退した数値を引用しているのであり、これは今月書かれた比較記事で最もよくある単一の誤りだ。実際の結果として、「Claude Opus 5は利用可能な中で最高スコアのモデルだ」といった主張はもはや真ではなく、それに基づいて組み立てられた比較は崩壊する。
Qwen側にとっては、その帰結はさらに厳しい。2026年9月に発表されたフラッグシップ層は、2026年9月に再定義されたターゲットを狙っている。Alibabaが最終的にQwen 4 Max向けに何を公表するにせよ、それは53が上回るべき数字であり、63ではないリーダーボードに照らして読まれることになる。

率直に言えば、その比較
この表の片側は完成しており、もう片側は空白だ。そうでないかのように装うことこそが、この記事の失敗の本質だろう。実際に分かっていることは次のとおりだ。
• ステータス — Claude Opus 5 は2026年7月24日から一般提供中、一方 Qwen 4 Max は2026年9月22日に発表されたが、リリース日は未定
• 入力価格 — Claude Opus 5 は100万トークンあたり$5.00、一方 Qwen 4 Max は非公開
• 出力価格 — Claude Opus 5 は100万トークンあたり$25.00、一方 Qwen 4 Max は未公開
• キャッシュ済み入力 — キャッシュ読み取り時の Claude Opus 5 は100万トークンあたり $0.50、一方 Qwen 4 Max は非公開
• コンテキスト — Claude Opus 5 はデフォルトおよび最大で100万トークン、一方 Qwen 4 Max は未公開
• 出力上限 — Claude Opus 5 は同期で 128K トークン、ベータヘッダー付きの Batches API では 300K であるのに対し、Qwen 4 Max は公開されていません
• モダリティ — Claude Opus 5 はテキスト、画像、ファイルの入力とテキスト出力、一方 Qwen 4 Max は未公開
• 長文コンテキストの価格設定 — Claude Opus 5 には割増料金がないため、900,000トークンのリクエストは9,000トークンのものと同じトークンあたりの料金で課金される。一方、Qwen 4 Max は公表されていない。
• 独立スコア — 最大エフォート時の Artificial Analysis Intelligence Index v4.3.2 で Claude Opus 5 は51、一方 Qwen 4 Max には独立した評価が存在しない
• ベンダー報告のスコア — Claude Opus 5 は SWE-bench Verified 96.0%、SWE-bench Pro 79.2%、OSWorld 2.0 70.6%、Terminal-Bench 2.1 はハーネス次第で80%台半ば、一方 Qwen 4 Max は何も報告なし
• 推論の制御 — Claude Opus 5 は適応的思考がデフォルトで有効になり、5段階のエフォートラダーを備える。一方、Qwen 4 Max は非公開
「未公開」が10行並んでいるのは、修辞技法ではない。それはエビデンスの現状であり、そこから導かれる正直な結論は、これら2つのモデル間の能力比較は、まだ誰にもできないということだ。
埋まらない溝の部分
価格と背景情報は最終的に公開される。ただ一つの違いはリリース後も残るだろう。そしてそれは、Qwen 4 Maxが出荷される週になってからではなく、今のうちに決めておく価値がある。その2つのモデルは、それぞれ異なる方法で購入されるように作られているのだ。
Claude Opus 5は、単一のベンダーから単一の価格で提供される単一のクローズドモデルであり、2027年7月24日より早くに提供終了しないという公式のコミットメントが公表されています。これはキャパシティプランニングにとって安定したターゲットです。Qwen 4 Maxは、Alibabaがはるかに広い価格帯にわたって繰り返しリリースしてきたファミリーのフラッグシップです——Qwen 3.8世代は、入力$2.00のフロンティア・フラッグシップから、それよりはるかに下のFlashティアまで及びます——そしてQwenラインのフラッグシップティアは、歴史的に、より安価なティアがその差を埋めるまでの実用的な寿命が最も短いティアでした。
もう一つの違いはオープンウェイトであり、それは逆の方向を指している。Qwen 3.8世代は、最大モデルのウェイトを独自のQwenライセンスの下で公開しており、これこそがファインチューニング、量子化、セルフホスティングをそもそも可能にしている。Claude Opus 5にはウェイトの公開がなく、今後もされることはない。自分の境界内で実行できるモデル、あるいは改変できるモデルをワークロードが求めるのであれば、それはベンチマークの改訂によってアリババから奪い去ることのできない構造的優位性であり、これを単に一つのフラッグシップと別のフラッグシップの対決と捉えるのではなく、この特定の比較を気にかけるべき最強の理由なのである。

今日この比較を実行する方法
Claude Opus 5 が利用可能になり、OrcaRouter がこれを anthropic/claude-opus-5 としてルーティングし、Anthropic の定価のまま 0% のマークアップで提供します — プロバイダーの料金がそのまま渡されるため、上記の $5.00 と $25.00 という数字は、マークアップされた相当額ではなく、実際に請求される金額です。このことは、この価格帯のモデルではいつも以上に重要です。$25.00 の出力料金に対する 10 パーセントのプラットフォームマージンは 100 万トークンあたり $2.50 で、これはほとんどのオープンウェイトの代替モデルの入力コスト全体を上回ります。さらに、カタログには 1 つの OpenAI 互換エンドポイント上で 200 近いモデルが揃っており、プロバイダーの経路が劣化した際の自動フェイルオーバーや、アプリケーションにモデル名をハードコーディングする代わりにポリシーを明示的に表現するためのルーティング DSL も備えています。
OrcaRouterが取り扱っていないのは、Qwen 4 Max、あるいはQwen 4のどのティアも同様です。カタログにはこのファミリーの項目が一切なく、これは発表されただけで未リリースのモデルに当然期待されることです。ティアが実際に登場すれば同じ場所に現れるはずで、それまではClaude Opus 5と比較する価値のあるQwenモデルは、実際に呼び出せるもの、すなわちQwen3.8-Maxです。2026年8月3日から一般提供されており、100万トークンあたり入力$2.00、出力$6.00、重みも公開され、記録された独立系知能スコアはタスクあたり$1.14で56 — この数値は以前のインデックス改訂時に記録されたものなので、Claude Opus 5の51と比較する際はその注意点を付した上で行ってください。
モデルカードが存在する前に、これをどうするか
ここで下すべき判定はない。2つのモデルのうち一方は製品として存在しないからだ。言えるのは、2026年9月19日に、どちらのベンダーも何もしていないのに比較の構図が変わったということだ。Claude Opus 5は、ほとんどの比較が依拠する独立系インデックスで最高スコアのモデルではなくなり、今では他の2つのモデルに2ポイント差をつけられている。Qwen 4 Maxの登場は、7月時点の表ではなく、その表に加わることになる。
つまり、今後数か月の判断は Qwen 4 Max 対 Claude Opus 5 ではない。そうではなく、Claude Opus 5 対、すでに出荷済みの Qwen モデル — 入力価格が5分の1で、重みが公開されているフラッグシップ — だ。そしてその比較は今すぐ可能で、双方に実際の数値がある。Alibaba がモデルカードを公開したらその判断を見直し、それまでに見かける Qwen 4 Max のベンチマーク表は未検証として扱うこと。

この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
