
Qwen 4 Max 対 Gemini 3.1 Pro:発表されないフラッグシップと、終わらなかったプレビューの対決
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ほとんどの比較は、出荷済みの製品と出荷済みの製品をぶつけ合うものだ。今回のこれは異例である。Qwen 4 Max は2026年9月22日、杭州の雲栖大会でプレビュー公開されたが、リリース日も価格もモデルの重みも示されなかった。一方 Gemini 3.1 Pro は2026年2月19日からプレビュー状態にあり、7か月が経った今もなおプレビューのままで、一般提供開始日は発表されておらず、その廃止予定表にも提供終了日は記載されていない。この対決に登場するどちらのモデルも、確定した製品ではない。それはこの比較を省く理由にはならない。それがこの比較そのものであり、そしてこの比較について本当に有益な唯一の点なのだ。
プレビューの7ヶ月
プレビューというラベルは本来、短命な状態を指すはずだ。Gemini 3.1 Proは今や、同じラボからの3つのFlashリリースを通じてそのラベルを保持し続けている。それには2026年9月2日のGemini 3.8 Flashも含まれ、Googleはこれを自社で最も知能の高いFlashモデルと説明している。独立系の総合指標では、そのモデルは現在3.1 Proを上回るスコアを記録している。GoogleのProラインにはこれより新しいモデルがない。Gemini 3.8 Proは存在せず、3.5 Pro世代は遅延し、伝えられるところでは棚上げされた。実際的な影響は、Proの名を冠するモデルが、もはや自社の最高スコアモデルではなくなったことだ。
Google自身がカタログ項目に記載した制限事項のテキストは、プレビューの非推奨化に備えて計画するよう勧めており、これがこのステータスを解釈する誠実な方法です。GA日もシャットダウン日もないプレビューは、その上に構築できるものの、それに合わせてスケジュールを組むことはできないモデルです。
Qwen側は符号を反転させた鏡像だ。Qwen 4 Max は長期プレビュー中ではなく、プレプレビュー段階にあり、まったく何も公開されていない。二つの失敗モードは正反対だ。Gemini 3.1 Pro は実在するエンドポイントだが、その長期的な存在は明示されておらず、Qwen 4 Max はエンドポイントを持たない、明示されたロードマップ項目である。

比較、そしてそれを決める長文脈の数値
Gemini 3.1 Pro の仕様は公開されており、具体的だ。Qwen 4 Max の仕様は空だ。じっくり考える価値があるのは、Gemini 列の 1 行である。なぜなら、それは引用されがちな種類の数値であり、引用されるべきではないものだからだ:
• ステータス — Gemini 3.1 Pro は2026年2月19日からプレビュー中、一方 Qwen 4 Max は2026年9月22日に発表されたが、日付は未定
• 入力価格 — Gemini 3.1 Pro は100万トークンあたり2.00ドル、200Kプロンプトまで、それを超えると4.00ドル。一方、Qwen 4 Maxは未公開
• 出力価格 — Gemini 3.1 Proは100万トークンあたり12.00ドル(200Kまで)、それを超えると18.00ドル。一方、Qwen 4 Maxは未公開
• キャッシュ入力 — Gemini 3.1 Pro はキャッシュ読み取りで100万トークンあたり$0.20、一方Qwen 4 Maxは非公開
• コンテキスト — Gemini 3.1 Pro 1,048,576トークン、対して Qwen 4 Max は非公開
• 出力上限 — Gemini 3.1 Pro 65,536トークン、Qwen 4 Max は非公開
• モダリティ — Gemini 3.1 Pro はテキスト、画像、動画、音声、PDF の入力に対応しテキストを出力、一方 Qwen 4 Max は未公開
• 推論制御 — Gemini 3.1 Pro は低・中・高の思考レベル、一方 Qwen 4 Max は未公開
• 長文コンテキスト検索 — Gemini 3.1 Pro はベンダー報告で MRCR v2 が 128K の 8 つのニードルでの平均 84.9 パーセントだが、100 万トークンのポイントワイズ設定では 26.3 パーセント、一方 Qwen 4 Max は報告なし
• ベンダー報告のスコア — Gemini 3.1 Pro は SWE-bench Verified 80.6パーセント、GPQA Diamond 94.3パーセント、ARC-AGI-2 77.1パーセント、Humanity's Last Exam はツールなしで44.4パーセント、一方 Qwen 4 Max は何も報告なし
• 独立スコア — Artificial Analysis Intelligence Index v4.3.2 における Gemini 3.1 Pro は30、一方 Qwen 4 Max には独立した評価が存在しない
持ち帰るべきなのは、あの長コンテキストの行だ。1,048,576トークンのコンテキストウィンドウはマーケティング上の数字にすぎない。100万トークン設定での26.3パーセントという検索率こそ、同じベンダーがそのウィンドウの遠端を測定したときに報告するものだ。どちらの数値もGoogleによるものなので、この差は評価者ではなくモデルについてのものだということになる。ワークロードが、100万トークンのプロンプトの終わり近くに埋もれた事実を見つけることに依存しているなら、見出しのコンテキスト数値は役に立つことを何も教えてくれず、この行がほとんどすべてを教えてくれる。
インデックスは動いたが、モデルは動かなかった。
Gemini 3.1 Proは2026年2月19日に登場し、Artificial Analysis Intelligence Indexで57、分野首位だった。2026年9月19日に公開されたインデックス改訂v4.3.2では、30を示す。この2つの日付の間で、モデルに関して変わったものは何もない。物差しが作り直され、それはAlibabaのQwen 4発表の4日前だった。
その偶然の一致は、数字そのものよりも価値がある。この比較バッチにおける4つのモデルのうち3つ——Gemini 3.1 Pro、Claude Opus 5、Qwen 3.8フラッグシップ——は、同じ改訂のもとで独立したスコアが動いており、いずれの場合もその変動は順位を逆転させるのに十分な大きさだった。今月書かれた比較で、改訂を明示せずに単一の指数値を引用しているものは、異なる物差しで取られたスコアを比較していることになり、その誤りは読者には見えない。
Qwen 4 Max にとっての結果は、ターゲットが動き続けるということだ。Alibaba が最終的に公開するとき、このインデックスで打ち破るべきスコアはその日の最新リビジョンが示すものになり、そのリビジョンは過去1週間で少なくとも一度は変わっている。

業務数値が語るもの、耳の痛い数字も含めて
Gemini 3.1 ProはOrcaRouter上でgoogle/gemini-3.1-pro-previewとしてルーティング可能で、FlagshipとFeaturedのバッジを備え、プレリリースのバナーはなく、Googleの定価である100万トークンあたり$2.00および$12.00、マークアップ0%で提供されている。ルーティング自体は誠実だ——ページに記載されたレートはGoogleが公表しているレートである。9月22日までの7日間における運用上の数値も、飛ばさずに記載する価値がある。p50の初回トークン到達時間は10.00秒、出力速度は毎秒約632トークン、そしてこの期間全体のエラー率は77.5パーセントである。このエラー率は脚注ではない。GA日が存在しないプレビュー段階のモデルにとって、これはページ上で最も意思決定に関わる単一の数値であり、それを省いて価格だけを引用する比較は、情報提供ではなく売り込みである。
同じカタログはOpenAI互換の単一エンドポイント上に約200のモデルを擁し、自動フェイルオーバーとルーティングDSLを備えている。これが、これほどのエラー率を致命的ではなく耐え得るものにしている仕組みである。劣化したプロバイダ経路は停止させるのではなくフェイルオーバーさせることができる。Qwen 3.8ファミリー——Qwen3.8-Max、Qwen3.8-Flash、Qwen3.8-27B——はGemini 3.1 Pro Previewと同じエンドポイント上にあるため、本記事が本当に扱っている置き換え、つまり今日実際に実行できる置き換えとは、移行プロジェクトではなくルーティングポリシーの変更である。Qwen 4 Maxはカタログに含まれておらず、Qwen 4のどのティアも含まれていない。それが登場するとき、現れるのはそこである。
決定、と言っても、その程度のものだが
ここにあるどちらのモデルも、本番採用を決められる製品ではない。正直な助言は、両方ともその前提で扱うことだ。Gemini 3.1 Pro は今日呼び出せ、価格もコンテキストウィンドウも公開されており、公開された評価の記録もある。ただし、そのウィンドウの上限付近での検索の弱さも含めてだ。またこれはプレビュー版であり、ベンダー自身が廃止を見越した計画を立てるよう求めている。そのエラー率は、本番依存コンポーネントとしては受け入れられない水準だ。Qwen 4 Max にはそうした問題が一切ない。なぜなら、そうした特性を一切備えていないからだ。
今すぐモデルが必要なら、選択はこの2つの間ではない。Gemini 3.1 Pro と、提供中の Qwen フラッグシップの間だ。そして入手できる証拠からすれば、それは長いコンテキストの検索品質を取るか、公開された重み付きの入力料金 $2.00 を取るかという判断になる。待てるなら、1つではなく2つを注視すべきだ。Qwen 4 Max のモデルカードと、Gemini 3.1 Pro の一般提供開始日だ。どちらが先に現れるかで、Alibaba と Google がこの2つのロードマップのうち実際にどちらを優先しているのかが分かる。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
