ヒーロータイトルカードには「GPT-6 vs Gemini 3.1 Pro」と表示され、チップには「Gemini 3.1 Pro: 2026-02-19よりプレビュー中」、2行の価格表示には「GPT-6 Sol $2 / $10」と「Gemini 3.1 Pro $2 / $12」、フッターには「指数値はArtificial Analysis v4.3.2に基づく。GPT-6のベンダー報告項目は本文中に明記。」と表示される。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

GPT-6 対 Gemini 3.1 Pro:Google の Pro ティアは 2 月以来、新しいモデルをリリースしていない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.1 Pro は 7 か月半にわたり Google の価格表に載っているが、プレビューから一度も抜けていない。2026年2月19日に発表され、今なお Gemini 3.1 Pro Preview という名前のエンドポイントで提供されており、本日時点で一般提供の約束も提供終了日もない——その 2 つの日付こそ、このモデルが自社ベンダーの計画の中でどこに位置づけられているかを示すはずのものだ。対照的に、GPT-6 Sol は 2026年9月22日にリリースされ、2026年10月7日には、週間12億人超のユーザーへの ChatGPT の世界展開における有料プランを支えるモデルになった。

つまり、大見出しの比較は2つのフラッグシップ階層の間にあるのではない。出荷済み製品と、終わりの定まらないプレビューの間の比較であり、その違いはベンチマークの差よりも価値があることが分かる。Artificial AnalysisのIntelligence Index v4.3.2で両者を並べてみると、Goo​gleの7か月前のプレビューは29.7で、GPT-6 Solの47.6に対して、完了したインデックスタスクあたり1.25倍多く請求する——$1.30対$1.04。これらの数字はどちらも本物であり、どちらもそれらにお金を使う前に注意書きを付ける必要がある。

これを無視せずに読む価値があるのは、このプレビューが実際にいくつかの点で勝っているからだ。GPQA Diamond、τ²-Benchのエージェント的ツール使用、そしてある長文脈測定においてGPT-6 Solを上回り、さらに音声と動画を入力として受け付けるが、GPT-6 Solにはそれができない。7か月前のプレビューが4つの対戦のうち2つを依然として取るなら、切り捨てるべきモデルではない。問題なのは能力ではなく、そのライフサイクルにあるモデルなのだ。

数値、そしてそれらとともに必ず伝えなければならない改訂に関する注意事項

Artificial Analysisはスイートを再実行し、現在のインデックス改訂版に基づいてスコアを再公開します。つまり、同じモデルでも、いつ読むかによって2つの異なる数値を帯びうるのです。Gemini 3.1 Proの場合、そのばらつきは異例なほど大きく、このモデルに関する以前の報道では古い改訂版で57と報告されていた一方、現在のページではv4.3.2で29.7と報告されています。どちらの数値も本物であり、どちらも同じウェブサイト上に存在しています。

それは重要だ。同じリビジョンの数値だけが差し引き可能だからだ。ここで使うべきペアは29.7と47.6だ。どちらもv4.3.2由来で、Claude Opus 5.5に57.6、GPT-6 Astraに52.7を記録する同じ実行だからだ。同一実行での読み取り値、次元ごとに1行:

• インテリジェンス指数 v4.3.2 — GPT-6 Sol 47.6 対 Gemini 3.1 Pro 29.7
• 完了した指数タスクあたりのコスト — Gemini 3.1 Pro 1.30ドル 対 GPT-6 Sol 1.04ドル。旧モデルは回答1件あたり25%高コスト
• 入力価格 — 両モデルとも100万トークンあたり2.00ドルで、表面上は同水準
• 出力価格 — GPT-6 Sol 10.00ドル 対 Gemini 3.1 Pro 12.00ドル。Sol は17%安価
• 長文コンテキスト条項 — GPT-6 Sol は入力272,000トークン超でリクエスト全体が4.00ドル/15.00ドルに再価格設定され、Gemini 3.1 Pro は200,000トークン超で4.00ドル/18.00ドルに段階的に引き上げ
• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Gemini 3.1 Pro 1,048,576トークンで、実質同水準
• 最大出力 — GPT-6 Sol 128,000トークン 対 Gemini 3.1 Pro 65,536トークン。Sol はほぼ2倍
• 入力モダリティ — GPT-6 Sol はテキスト、画像、ファイル 対 Gemini 3.1 Pro はテキスト、画像、音声、動画、PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

そこにある2行は、一見明白な読み方を覆すものなので、掘り下げる価値がある。タスクあたりコストの行は、より安く見える料金表が、完成したジョブあたりではより高くつくモデルのものだと示している——Gemini 3.1 Proの出力レート$12にその推論量が加わると、見出しの入力$2が示唆するよりも多くの処理を行う。そしてロングコンテキストの段階は、両側で読み直す価値がある。Gemini 3.1 Proのティアは200,000トークンから始まり、GPT-6 Solの272,000より低いが、出力を$18.00に再価格設定するのに対し、Solは$15.00に再価格設定する。どちらも定額の料金表ではなく、クロスオーバーポイントも一致しない。

プレビューが依然として優位な点

Goo​ogleのモデルは遺物ではない。両方のカードが保持する評価を引き出せ:

• GPQA Diamond — Gemini 3.1 Pro 94.1% 対 GPT-6 Sol、このリビジョンでは比較可能な数値は公開されていない
• τ²-Bench エージェント型ツール使用 — Gemini 3.1 Pro 95.6% 対 GPT-6 Sol、同じボードでは公開されていない
• 長コンテキスト想起 — Gemini 3.1 Pro 82.0% 対 GPT-6 Sol 83.7%、1.7ポイント差
• SciCode — Gemini 3.1 Pro 58.7% 対 GPT-6 Sol 57.6%、実質同等
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% 対 GPT-6 Sol 43.9%、プレビューが競争力を持たない唯一のカテゴリ

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

94.1%のGPQA Diamondと95.6%のエージェント的ツール使用スコアは、レガシーな数値ではなく最先端の数値であり、17.9ポイントというインデックス差が実際の隔たりを過大評価しているのは、まさにそのためだ。このインデックスは10個の評価を合成したもので、Gemini 3.1 Proの失点は、スイートがソフトウェアエンジニアリングに大きく重みを置いている領域に集中している——Terminal-Bench 4.0の4.0%は、58.7%のSciCodeや73.8%のTerminal-Bench 2.1と並べると、壊滅的な外れ値だ。あるエージェントベンチマークでほぼ最高クラスを取り、その後継でほぼ最低クラスになるモデルは、その能力の上限ではなく、トレーニング日について語っている。

音声と動画の入力はもう一つの具体的な強みであり、それはグラデーションではなくゲートだ。パイプラインが会議の録音やスクリーンキャプチャを入力として受け取るなら、Gemini 3.1 Pro はそこに入れるが、GPT-6 Sol は入れない。どれだけ指標でリードしていても、その代わりにはならない。

「まだプレビュー」が具体的にあなたへ何のコストを強いるのか

プレビューステータスは見た目だけのラベルではない。そしてそのコストは、何かの上に築いた後になって初めて表面化する類のものだ。

プレビューエンドポイントには一般提供(GA)の確約は伴わない。つまりベンダーは、あなたが計画を立てられるスケジュールでそのモデルが依然として存在すると約束したわけではない。また、提供終了日も伴わない。それは前者の良い方の読みのように聞こえる――何も廃止されない――が、逆の読み方もできる。Goo​gleは、2月以来この状態にあるモデルのライフサイクルを公表しておらず、その一方で同じ期間を通じてFlash ティアのモデルを出荷してきた。Gemini 3.8 Flash、Gemini 3.5 Flash-Lite、3.6と3.8のFlashライン:Pro ティアはその場にとどまり、後継は代わりにGemini 4 Argonとして登場した。Goo​gleはこれを2026年9月30日に、セキュリティパートナーの指定されたコホートへの段階的ロールアウトとして発表し、そこにも一般提供日は付いていない。

この比較が本当に扱っているのは、まさにこのパターンだ。Gemini 3.1 Pro Preview 上に長期的に維持できるパイプラインを構築するということは、そのモデル自体のベンダーが、いつ正式版へ昇格し、置き換えられ、あるいは廃止されるのかを明言していないモデルの上に構築しているということになる。GPT-6 Sol の立場は逆だ。一般提供されている API 製品で、料金表も公開されており、2026年10月7日以降は、同僚の大半が使っているアプリでも既定になっている。ベンダーによる報告であり、まだ再現されていないが、OpenAI によれば、ChatGPT 内で GPT-6 は Intelligent UI と呼ぶ機能を通じてテキスト、グラフィックス、チャート、インタラクティブなコントロールを使って回答を構成し、ウェブ検索を必要とする回答は GPT-5.6 Instant より44%早く開始し、Extra High エフォートレベルは GPT-5.6 の Medium と同じ速さで応答を開始するという。そのどれも API 統合を変えるものではない。それらすべてが、GPT-6 が今や周囲に溶け込んだ既定であり、プレビューはそうではない理由だ。

また、この議論には平易な版もある。あなたは、ライフサイクルが宣言されていないモデルのために、より低い能力スコアで、完了したタスク1件あたり25%多く支払っている。反論はもっともだ——GPQA Diamondで94.1%と音声入力が得られる——しかしそれは特定のワークロードに向けた具体的な主張であって、旧モデルを好む一般的な理由ではない。

プレビューに賭けずにテストする

Gemini 3.1 Proの立場にあるモデルで避けるべき誤りは、「使うべきか」を単一の二者択一の決定として扱うことだ。そうではない。Gemini 3.1 Pro Preview と GPT-6 Sol はどちらも OrcaRouter のカタログに並んでおり、1つのOpe​nAI互換エンドポイントと1つのキーの背後に、プロバイダー定価に対して0%のマークアップで存在する——つまりプレビュー版は、実際のリクエスト経路に投入し、自分のワークロードで測定し、2つ目のベンダー契約やコード変更なしに継続採用するか破棄するかを選べるものだ。

自動フェイルオーバーこそが、プレビューのライフサイクル上にあるモデルにとってそれを安全にするものです。音声と動画のトラフィックは、2つのうち入力を受け取れる唯一のものである Gemini 3.1 Pro にルーティングし、ソフトウェアエンジニアリングと長出力のトラフィックは GPT-6 Sol にルーティングし、さらにフォールバックを設定して、プレビューのエンドポイントが非推奨になったり、レート制限されたり、ひっそりと価格変更されたりした場合に、リクエストが失敗するのではなく一般提供されているモデルに着地するようにします。それが、生まれて7か月のプレビューが得る構造です — 回避ではなく、それに依存しない道です。

さらに踏み込みたいなら、ルーティングDSLは複数のモデルを1つの論理的な呼び出しにまとめるので、リクエストをGemini 3.1 ProとGPT-6 Solに対して試し、あるベンダーの基準ではなく独自の基準で回答を選べます。モデル融合は逆方向から同じことを行います — 複数のモデルからなるパネルが1つの質問に答える — これは、本番パスをそれにコミットする前に、プレビューの特定の強みがどこでコストをかける価値があるかを見極める合理的な方法です。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

判断、そして注目すべき数字

新しい作業には、GPT-6 Sol がデプロイを左右する6つの次元のうち4つでより安全な選択であり、同じリビジョンでインデックススコアが17.9ポイント高いながら、完了タスクあたりのコストも安い。音声または映像入力を必要とするワークロード、あるいは94.1%の GPQA Diamond こそが購入目的である場合には、Gemini 3.1 Pro Preview が依然として優位であり、プレビューというラベルは、手を引く理由ではなく管理すべきリスクである。

注目すべき数字はインデックスではない。それは Gemini 3.1 Pro のエンドポイント名に付いた日付だ。プレビューの接尾辞が外れたとき——あるいは Argon が実際の API 識別子を伴って一般提供に到達したとき——この比較はまったく別の形になり、Pro ティアの前回リリースから今日までの 7 か月の隔たりが、この記事の主題になる。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新