
Mercury 2.5 プレビュー vs Gemini 3.1 Pro:6か月離れた2つのプレビュー
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0259知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0258知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0166知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
この対戦カードの両モデルは、その名前に「プレビュー」という言葉を冠しているが、似ているのはそこまでだ。Mercury 2.5 PreviewとGemini 3.1 Proはどちらも今日APIから呼び出せる推論モデルだが、プレビューとしての寿命は正反対の端にある。旗艦推論モデルであるGemini 3.1 Proは、2026年2月19日からプレビューが続いており——6ヶ月分の独立評価、公開リーダーボードへの掲載、本番トラフィックの実績を背後に持ち、ローンチ時のArtificial Analysis Intelligence Indexは57、テキスト・画像・音声・動画にわたるマルチモーダル入力、100万トークンのコンテキスト、そして100万トークンあたり2.00ドル/12.00ドルの価格を備えている。Inceptionの拡散LLMであるMercury 2.5 Previewは2026年8月31日にリリースされたばかりで、まだ2日目だ。テキストのみのモデルで、256Kのコンテキスト、毎秒1,107トークンという主張、定価0.20ドル/0.75ドル(9月8日までの割引で約0.04ドル/0.15ドル)、そして独立したベンチマークはひとつもない。両者を「プレビュー」と呼ぶことは、実際の問いを隠してしまう。その問いとは、根本的により高速なテキスト生成方式に対して、6ヶ月分のエビデンスによる先行優位がどれほどの価値を持つかということだ。
各モデルの正体
Gemini 3.1 Pro は、クローズドなマルチモーダル汎用推論のフラッグシップです。テキスト、画像、音声、動画を読み取り、64Kトークンの出力上限を備えた100万トークンのコンテキストウィンドウを処理し、推論の深さを動的に調整します——ベンダーは、タスクの複雑さに応じてスケールする4段階の推論強度を説明しています。発表時の数値(ARC-AGI-2 77.1%、GPQA Diamond 94.3%、SWE-bench Verified 80.6%、Terminal-Bench 2.0 68.5%)はベンダー報告によるものですが、それらは6か月にわたる独立した精査の上に成り立っています。その中には、より厳格な指標スケールでモデルが約46.5を記録したArtificial Analysisによる再測定も含まれます。その再測定こそ、成熟したモデルが当然受けるべきものです。このモデルは、指標の方が厳しくなるほどに徹底的にテストされてきたのです。Mercury 2.5 Preview は拡散モデルです。トークンを1つずつではなく並行して生成・洗練し、調整可能な推論、並列ツール呼び出し、スキーマ準拠のJSONを備えています。これは、Inception が挙げるレイテンシーが複合的に積み重なるワークロード(検索エージェント、音声パイプライン、コーディングサブエージェント)向けに構築されています。それに付随する品質に関する主張はすべて、Mercury 2 から10ポイント以上のジャンプを含め、ベンダー自身によるものであり、第三者はまだ測定していません。

スペックの対比
• 価格 — Mercury 2.5 Preview: 入力/出力 1Mあたり $0.20 / $0.75、~$0.04 / $0.15 の導入価格は9月8日まで。Gemini 3.1 Pro: 1Mあたり $2.00 / $12.00、入力が200Kを超えると $4.00 / $18.00 にステップアップします。
• コンテキスト / 出力 — Mercury 2.5 Preview: 256Kコンテキスト。Gemini 3.1 Pro: 1Mコンテキスト、最大出力64K。
• 入力 — Mercury 2.5 Preview: テキストのみ。Gemini 3.1 Pro: テキスト、画像、音声、動画、ファイル。
• アーキテクチャ — Mercury 2.5 Preview:拡散LLM、並列トークン生成。Gemini 3.1 Pro:自己回帰、動的推論深度。
• 速度 — Mercury 2.5 Preview: 1,107トークン/秒と主張。Gemini 3.1 Pro: 匹敵する見出しとなる主張はなし。
• エビデンス — Mercury 2.5 Preview: ベンダー報告のみ。Gemini 3.1 Pro: ローンチ時のAA Index 57(新しいスケールでは46.5)に加え、長期にわたる独立した評価実績。

マルチモダリティギャップが決定的な違いである。
ほとんどのアプリケーションでは、価格やベンチマークが考慮される前に、この比較は解決されます。Mercury 2.5 Preview には視覚がないからです。Gemini 3.1 Pro はスクリーンショット、図、音声、動画を読み取れます。つまり、テキスト化されていない何かについて答えが欲しいとき、PDF、チャート、会議の録画、UI に向けるべきモデルがこれです。Mercury 2.5 Preview は設計上テキストのみで、テキストを並列生成する拡散言語モデルには画像や音声の入力経路が一切ありません。ドキュメント中心のアプリケーション、ビジョンエージェント、またはあらゆるマルチモーダル製品にとって、ここでの唯一の候補は Gemini 3.1 Pro であり、それ以外はありません。Mercury 2.5 Preview のテキスト限定の制約は、小さな免責事項ではありません。それは、そのモデルがそもそもどのワークロードに適格であるかを決める境界線です。
6ヶ月間のテスト vs 2日間
証拠を見れば、これは競争ではない。そして、なぜそうなのかを率直に述べることが重要だ。{{1}}Gemini 3.1 Proは6ヶ月間にわたり独立した研究所によって徹底的に分析されてきた。そのスコアは確定され、再測定され、議論されてきた。それがモデルにとっての「信頼できる」の姿である。{{/1}}{{2}}Mercury 2.5 Previewには情報源がひとつしかない——その製作者だ——そしてその情報源は、Mercury 2より10ポイント以上の知能の飛躍と、フロンティアのコスト最適化層との同等性を主張している。{{/2}}{{3}}どちらの主張も真実である可能性はある。しかしどちらもInception以外の誰にも確認されておらず、モデルが新しすぎる以上、それは当然のこととしか言いようがない。{{/3}}{{4}}非対称性の本質は、一方が優れているということではない。一方は知ることができ、もう一方はまだ知ることができないということだ。{{/4}}
水星の速度が実際に勝つ場面
Mercury 2.5 Previewの正直な評価は、狭く、テキストのみに限定され、そして現実的なものだ。並列トークン生成は、自己回帰モデル(Gemini 3.1 Proを含む)が追随できない方法でレイテンシの計算を変える。自己回帰モデルは構造上、逐次的だからだ。音声パイプラインに関していえば、皮肉なことに、入力と出力は音声だが、その間の思考はテキストである。高速なテキスト推論層こそが、音声エージェントを応答性の高いものに感じさせるのだ。繰り返しツールを呼び出す検索エージェントや、タスクごとに多数の小さな補完を発行するコーディングサブエージェントにとって、呼び出しごとのレイテンシは知覚上の速度に累積する。導入価格(入力$0.04、出力$0.15)では、Mercury 2.5 PreviewはGemini 3.1 Proの標準出力レートより約80倍安く、それにより高速であるだけでなく、大量のテキスト推論において異なるコスト区分に位置づけられる。これらの文すべてに付随しなければならない注意点:速度は主張であり、品質の同等性も主張であり、独立した測定結果は存在しない。
価格:Geminiのロングコンテキストプレミアム対Mercuryのティーザー
Gemini 3.1 Proのレートカードには、ヘッドラインの数字を比較する前に知っておく価値のある詳細があります。20万入力トークンを超えるリクエストは、100万トークンあたり$2.00/$12.00から$4.00/$18.00へとステップアップします。100万コンテキストのモデルでは、その長文コンテキストのプレミアムはコーナーケースではありません。このモデルが有名なウィンドウを実際に利用するためのコストなのです。Mercury 2.5 Previewにはそのようなステップはなく、その256Kコンテキストが長文コンテキスト領域に達することはあまりないでしょう。しかし、Mercuryの低価格は9月8日に期限が切れるティーザーであり、Geminiの価格は安定した公表レートです。比較する際は、Mercuryのリスト価格$0.20/$0.75を、割引後の数字ではなくGeminiの標準ティアと比較してください。割引はテストを促すインセンティブであり、計画を立てる際に基準とすべき価格ではありません。
ルーティングの決定
両方のモデルは現在ルーティング可能であり、それによって各モデルの扱い方が変わります。Gemini 3.1 Pro は OrcaRouter 上でgoogle/gemini-3.1-pro-previewとして、プロバイダーのリスト価格はそのまま0% markupで透過されるため、標準および長文脈ティアはプロバイダーが公表する価格とまったく同じコストになります。さらに、1つのAPIキーで200以上の他のモデルも利用できます。プレビューバッジは、賭けるよりもむしろ迂回すべきものの典型です — モデルページのエラー率パネルには理由があり、自動フェイルオーバーにより、劣化したプレビューレスポンスはコード変更なしでセカンドプロバイダーにルーティングされます。Mercury 2.5 Preview はまだ OrcaRouter にはありません。Inception は独自のAPIといくつかのサードパーティ製プラットフォームを通じてそれを提供しています。まだフェイルオーバーの背後に置けない、登場から2日しか経っていないモデルは、本番依存ではなくテスト候補です。プロバイダーがそれをリストに載せた日には、同じパススルーが適用され、イントロ割引も同じ日にここに反映されます — そのとき、このマッチアップは意思決定ではなくルーティングルールになります。
正直な評価を述べると、この2つのプレビューは異なる問いに答えている。Gemini 3.1 Proが答えるのは「今日、自分の製品をどのモデルの上に構築すべきか」という問いだ。それはマルチモーダル対応で、長文コンテキストを扱え、独立してテスト済みで、安定しており、価格もそのすべてを反映している。Mercury 2.5 Previewが答えるのは「テキスト推論は物理的にどこまで高速化できるのか」という問いであり、その速度アーキテクチャこそがこのモデルで最も興味深い点だ。それに伴う品質が本物かどうかは、独立した研究所による確認を待つことになる。ワークロードがマルチモーダルまたは長文コンテキスト中心なら、選択はすでに決まっている。テキストのみで、レイテンシが累積し、価格に敏感なワークロードなら、Mercury 2.5 Previewは注目すべき選択肢だ——そして9月8日が、それを比較して見極める日となる。

