「Qwen 4 Max vs Gemini 3.1 Pro」のヒーロータイトルカード。サブタイトルは「未発表のフラッグシップ対終わることのなかったプレビュー」、3つのピル型バッジは「2026年2月19日からプレビュー」「1,048,576トークンのコンテキスト」「1Mでの検索精度26.3%」、フッター行は「Alibabaは2026年9月22日に発表、Googleは2026年2月19日にプレビュー」、右下隅にはOrcaRouterのロゴ。
Engineering & Research

Qwen 4 Max 対 Gemini 3.1 Pro:発表されないフラッグシップと、終わらなかったプレビューの対決

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ほとんどの比較は、出荷済みの製品と出荷済みの製品をぶつけ合うものだ。今回のこれは異例である。Qwen 4 Max は2026年9月22日、杭州の雲栖大会でプレビュー公開されたが、リリース日も価格もモデルの重みも示されなかった。一方 Gemini 3.1 Pro は2026年2月19日からプレビュー状態にあり、7か月が経った今もなおプレビューのままで、一般提供開始日は発表されておらず、その廃止予定表にも提供終了日は記載されていない。この対決に登場するどちらのモデルも、確定した製品ではない。それはこの比較を省く理由にはならない。それがこの比較そのものであり、そしてこの比較について本当に有益な唯一の点なのだ。

プレビューの7ヶ月

プレビューというラベルは本来、短命な状態を指すはずだ。Gemini 3.1 Proは今や、同じラボからの3つのFlashリリースを通じてそのラベルを保持し続けている。それには2026年9月2日のGemini 3.8 Flashも含まれ、Googleはこれを自社で最も知能の高いFlashモデルと説明している。独立系の総合指標では、そのモデルは現在3.1 Proを上回るスコアを記録している。GoogleのProラインにはこれより新しいモデルがない。Gemini 3.8 Proは存在せず、3.5 Pro世代は遅延し、伝えられるところでは棚上げされた。実際的な影響は、Proの名を冠するモデルが、もはや自社の最高スコアモデルではなくなったことだ。

Google自身がカタログ項目に記載した制限事項のテキストは、プレビューの非推奨化に備えて計画するよう勧めており、これがこのステータスを解釈する誠実な方法です。GA日もシャットダウン日もないプレビューは、その上に構築できるものの、それに合わせてスケジュールを組むことはできないモデルです。

Qwen側は符号を反転させた鏡像だ。Qwen 4 Max は長期プレビュー中ではなく、プレプレビュー段階にあり、まったく何も公開されていない。二つの失敗モードは正反対だ。Gemini 3.1 Pro は実在するエンドポイントだが、その長期的な存在は明示されておらず、Qwen 4 Max はエンドポイントを持たない、明示されたロードマップ項目である。

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

比較、そしてそれを決める長文脈の数値

Gemini 3.1 Pro の仕様は公開されており、具体的だ。Qwen 4 Max の仕様は空だ。じっくり考える価値があるのは、Gemini 列の 1 行である。なぜなら、それは引用されがちな種類の数値であり、引用されるべきではないものだからだ:

• ステータス — Gemini 3.1 Pro は2026年2月19日からプレビュー中、一方 Qwen 4 Max は2026年9月22日に発表されたが、日付は未定

• 入力価格 — Gemini 3.1 Pro は100万トークンあたり2.00ドル、200Kプロンプトまで、それを超えると4.00ドル。一方、Qwen 4 Maxは未公開

• 出力価格 — Gemini 3.1 Proは100万トークンあたり12.00ドル(200Kまで)、それを超えると18.00ドル。一方、Qwen 4 Maxは未公開

• キャッシュ入力 — Gemini 3.1 Pro はキャッシュ読み取りで100万トークンあたり$0.20、一方Qwen 4 Maxは非公開

• コンテキスト — Gemini 3.1 Pro 1,048,576トークン、対して Qwen 4 Max は非公開

• 出力上限 — Gemini 3.1 Pro 65,536トークン、Qwen 4 Max は非公開

• モダリティ — Gemini 3.1 Pro はテキスト、画像、動画、音声、PDF の入力に対応しテキストを出力、一方 Qwen 4 Max は未公開

• 推論制御 — Gemini 3.1 Pro は低・中・高の思考レベル、一方 Qwen 4 Max は未公開

• 長文コンテキスト検索 — Gemini 3.1 Pro はベンダー報告で MRCR v2 が 128K の 8 つのニードルでの平均 84.9 パーセントだが、100 万トークンのポイントワイズ設定では 26.3 パーセント、一方 Qwen 4 Max は報告なし

• ベンダー報告のスコア — Gemini 3.1 Pro は SWE-bench Verified 80.6パーセント、GPQA Diamond 94.3パーセント、ARC-AGI-2 77.1パーセント、Humanity's Last Exam はツールなしで44.4パーセント、一方 Qwen 4 Max は何も報告なし

• 独立スコア — Artificial Analysis Intelligence Index v4.3.2 における Gemini 3.1 Pro は30、一方 Qwen 4 Max には独立した評価が存在しない

持ち帰るべきなのは、あの長コンテキストの行だ。1,048,576トークンのコンテキストウィンドウはマーケティング上の数字にすぎない。100万トークン設定での26.3パーセントという検索率こそ、同じベンダーがそのウィンドウの遠端を測定したときに報告するものだ。どちらの数値もGoogleによるものなので、この差は評価者ではなくモデルについてのものだということになる。ワークロードが、100万トークンのプロンプトの終わり近くに埋もれた事実を見つけることに依存しているなら、見出しのコンテキスト数値は役に立つことを何も教えてくれず、この行がほとんどすべてを教えてくれる。

インデックスは動いたが、モデルは動かなかった。

Gemini 3.1 Proは2026年2月19日に登場し、Artificial Analysis Intelligence Indexで57、分野首位だった。2026年9月19日に公開されたインデックス改訂v4.3.2では、30を示す。この2つの日付の間で、モデルに関して変わったものは何もない。物差しが作り直され、それはAlibabaのQwen 4発表の4日前だった。

その偶然の一致は、数字そのものよりも価値がある。この比較バッチにおける4つのモデルのうち3つ——Gemini 3.1 Pro、Claude Opus 5、Qwen 3.8フラッグシップ——は、同じ改訂のもとで独立したスコアが動いており、いずれの場合もその変動は順位を逆転させるのに十分な大きさだった。今月書かれた比較で、改訂を明示せずに単一の指数値を引用しているものは、異なる物差しで取られたスコアを比較していることになり、その誤りは読者には見えない。

Qwen 4 Max にとっての結果は、ターゲットが動き続けるということだ。Alibaba が最終的に公開するとき、このインデックスで打ち破るべきスコアはその日の最新リビジョンが示すものになり、そのリビジョンは過去1週間で少なくとも一度は変わっている。

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

業務数値が語るもの、耳の痛い数字も含めて

Gemini 3.1 ProはOrcaRouter上でgoogle/gemini-3.1-pro-previewとしてルーティング可能で、FlagshipとFeaturedのバッジを備え、プレリリースのバナーはなく、Googleの定価である100万トークンあたり$2.00および$12.00、マークアップ0%で提供されている。ルーティング自体は誠実だ——ページに記載されたレートはGoogleが公表しているレートである。9月22日までの7日間における運用上の数値も、飛ばさずに記載する価値がある。p50の初回トークン到達時間は10.00秒、出力速度は毎秒約632トークン、そしてこの期間全体のエラー率は77.5パーセントである。このエラー率は脚注ではない。GA日が存在しないプレビュー段階のモデルにとって、これはページ上で最も意思決定に関わる単一の数値であり、それを省いて価格だけを引用する比較は、情報提供ではなく売り込みである。

同じカタログはOpenAI互換の単一エンドポイント上に約200のモデルを擁し、自動フェイルオーバーとルーティングDSLを備えている。これが、これほどのエラー率を致命的ではなく耐え得るものにしている仕組みである。劣化したプロバイダ経路は停止させるのではなくフェイルオーバーさせることができる。Qwen 3.8ファミリー——Qwen3.8-Max、Qwen3.8-Flash、Qwen3.8-27B——はGemini 3.1 Pro Previewと同じエンドポイント上にあるため、本記事が本当に扱っている置き換え、つまり今日実際に実行できる置き換えとは、移行プロジェクトではなくルーティングポリシーの変更である。Qwen 4 Maxはカタログに含まれておらず、Qwen 4のどのティアも含まれていない。それが登場するとき、現れるのはそこである。

決定、と言っても、その程度のものだが

ここにあるどちらのモデルも、本番採用を決められる製品ではない。正直な助言は、両方ともその前提で扱うことだ。Gemini 3.1 Pro は今日呼び出せ、価格もコンテキストウィンドウも公開されており、公開された評価の記録もある。ただし、そのウィンドウの上限付近での検索の弱さも含めてだ。またこれはプレビュー版であり、ベンダー自身が廃止を見越した計画を立てるよう求めている。そのエラー率は、本番依存コンポーネントとしては受け入れられない水準だ。Qwen 4 Max にはそうした問題が一切ない。なぜなら、そうした特性を一切備えていないからだ。

今すぐモデルが必要なら、選択はこの2つの間ではない。Gemini 3.1 Pro と、提供中の Qwen フラッグシップの間だ。そして入手できる証拠からすれば、それは長いコンテキストの検索品質を取るか、公開された重み付きの入力料金 $2.00 を取るかという判断になる。待てるなら、1つではなく2つを注視すべきだ。Qwen 4 Max のモデルカードと、Gemini 3.1 Pro の一般提供開始日だ。どちらが先に現れるかで、Alibaba と Google がこの2つのロードマップのうち実際にどちらを優先しているのかが分かる。

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新