GPT-6.1 Sol 対 Gemini 3.1 Pro の生成されたヒーローカード。見出しは「7か月のプレビュー、8日間の出荷」。2枚の情報カードには「Gemini 3.1 Pro:2026年2月19日発表、依然としてプレビューエンドポイント、Intelligence Index 29.7」と「GPT-6.1 Sol:2026年9月29日リリース、出荷中の製品、Intelligence Index 51.8」と表示され、フッターには「インデックス数値は Artificial Analysis、Intelligence Index v4.3.2 による。価格は Google と OpenAI による。」と表示され、右下隅に OrcaRouter のロゴがある。
Guides & Insights

GPT-6.1 Sol 対 Gemini 3.1 Pro:7か月のプレビュー 対 8日間の出荷

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.1 Proベンダーの価格表に7か月半にわたって掲載され続けているが、一度もプレビューを脱していない。2026年2月19日に発表され、本日時点で-previewで終わるエンドポイントに文書化されており、一般提供の約束もなく、さらに示唆的なのは、終了日も存在しないことだ。GPT-6.1 Sol出荷から8日で、2026年9月29日に100万入力トークンあたり2.00ドル、100万出力トークンあたり10.00ドルで登場した。Artificial Analysis Intelligence Indexで両者を並べてみると、7か月前のプレビュー版は単に競争力があるというだけでなく、最新のインデックス改訂において新しいモデルから22ポイント以内に収まっている — v4.3.2で29.7対51.8 — しかもインデックスタスクあたりのコストは1.8倍、1.30ドル対0.72ドルだ。この組み合わせこそが、この比較を形式上のものではなく興味深いものにしている理由である。このボードでは、古いモデルのほうが能力で劣りコストで勝っており、卒業するはずだったプレビュー版としては順序が逆になっている。しかしインデックス改訂という注意点は、このセットのどこよりもここで重要だ。なぜなら29.7と53はどちらも同じサイトに引用され、両者は同じ測定ではないからだ。

どちらも1Mクラスのコンテキストウィンドウを備えた大規模マルチモーダルモデルだ。Gemini 3.1 Proはテキスト、画像、動画、音声、PDFを扱い、出力上限は65,536トークン、200,000トークンの価格ティアを超えると料金が2倍になる。GPT-6.1 Solはテキスト、画像、ファイルを扱い、ウィンドウは1,050,000トークン、出力上限は128,000トークン、推論努力レベルは5段階で、272,000プロンプトトークンを超えると長コンテキストティアが適用される。一方はサポートコミットメント付きの出荷済み製品だ。もう一方はライフサイクルが終了時期未定のプレビューであり、その違いはインデックスの差よりも価値があることが分かる。

インデックス番号には、そのリビジョンを付ける必要があります

Artificial Analysisは自社のスイートを再実行し、現在のインデックス改訂の下でスコアを再公開している。つまり、同じモデルでも、いつ読むかによって2つの異なる数値を帯びることがある。Gemini 3.1 Proの場合、その乖離は異例なほど大きい。このモデルに関する以前の自社報道では、古い改訂で57と報じられていたが、今日の時点のページでは、v4.3.2で29.7と報告されている。v4.3.2は、GPT-6.1 Solの51.8も載せている10評価版である。どちらの数値も実在し、どちらも同じウェブサイト上にある。

これが比較にとって意味するのは、限定的だが重要なことだ。同じリビジョンの数値だけが引き算できる。v4.3.2 の 29.7 と 51.8 は 22 ポイントの差を生む。57 と 51.8 は逆方向に 5 ポイントの差を生む。ここで使うべきなのは 22 ポイントの数値である。なぜなら、それは両モデルが同じスイートによって同じ尺度で測定された数値であり、タスクあたりコストの数値 $1.30 対 $0.72 も同じ実行から来ているからだ。

• インテリジェンス指数 v4.3.2 — GPT-6.1 Sol 51.8 対 Gemini 3.1 Pro 29.7

• インデックスタスクあたりのコスト — GPT-6.1 Sol $0.72 対 Gemini 3.1 Pro $1.30

・フルスイート実行にかかるコスト — GPT-6.1 Sol $1,082 対 Gemini 3.1 Pro $1,935

• コンテキストウィンドウ — GPT-6.1 Sol 1,050,000トークン 対 Gemini 3.1 Pro 1,000,000トークン

• 最大出力 — GPT-6.1 Sol 128,000トークン 対 Gemini 3.1 Pro 65,536トークン

• 入力モダリティ — 両方でテキスト、画像、ファイルに対応、さらに Gemini 3.1 Pro では動画、音声、PDF

これらのうち2つはプレビュー版に有利であり、率直に述べておく価値がある。Gemini 3.1 Proは動画と音声を受け付けるが、GPT-6.1 Solは受け付けない。パイプラインが画面録画や通話を取り込むなら、それはどのスコアでも埋められない能力差だ。また、その65,536トークンの出力上限はGPT-6.1 Solの半分であり、これは長文生成では重要だが、出力が短くターン数が多いエージェント作業ではめったに制約にならない。

なぜより新しい数値のほうがあなたの意思決定を左右すべきなのか

価格の問題は指数の問題よりも重要だ。

Gemini 3.1 Pro の料金表は、100万トークンあたり入力 $2.00、出力 $12.00 で、キャッシュ入力が $0.20、キャッシュ書き込みが $0.375、プロンプトトークン 200,000 を超えると料金が $4.00 と $18.00 になる段階境界があります。GPT-6.1 Sol は入力 $2.00、出力 $10.00 で、キャッシュ入力が $0.10、キャッシュ書き込みが $2.50、272,000 トークンを超えると料金が $4.00 と $15.00 になる境界があります。主要な入力価格は同一です。出力価格は GPT-6.1 Sol のほうが 20% 低く、長コンテキスト時の段階も両軸で低くなっています。両料金表が分かれるのはキャッシュです。100万キャッシュ入力トークンあたり $0.10 対 $0.20 で、プレビューモデルのほうがキャッシュ書き込みが安く、$0.375 対 $2.50 です。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, credited to Google and dated 2026-02-19, showing the -preview model identifier, text, image, video, audio and file input with text output, a 1M-token context window with a 65K maximum output, and a rate row reading $2.00 input and $12.00 output per million tokens alongside a 10.60-second median time to first token and an 11.3M seven-day traffic figure.

その最後のペアは、何気ない読み方を逆転させる。ワークロードがキャッシュ重視なら——毎ターン再送される長い固定システムプロンプトや、セッションを通じて読み直される文書など——Gemini 3.1 Pro のキャッシュ書き込みの料金項目は劇的に安く、キャッシュ読み取りの料金項目は2倍だ。どちらのモデルが勝つかは、書いた内容を何回読み直すかで決まり、それは自分のログが持っていて、どのベンチマークも公表していない数値だ。曖昧でないのはインデックスコストだ。同一の評価作業では、8日前のモデルは33%安く完了し、7か月前のプレビューは、新しいモデルより全体で79%高くついた。

プレビューバッジは運用上の事実です

これはスコア表では伝えきれない比較の一部であり、本番デプロイにおいては、上記のすべてよりも優先されます。

Gemini 3.1 Proは2月以来プレビュー状態にあり、一般提供(GA)の発表も、サービス終了日もない。このどちらの欠如も重要であり、それぞれ逆方向に作用する。GAでないということは、ライフサイクルへのコミットメントがないことを意味する。プレビューのエンドポイントは、一般提供のものと同じ非推奨通知の条件ではカバーされておらず、バージョンを上げることなく呼び出し側の下で改訂され得る。これこそが、本番環境ではエイリアスではなく正確なモデル識別子を固定すべき標準的な理由である。サービス終了日がないということは、移行期間を計画することもできないということだ。このモデルは、誰もがGAに昇格すると思っていた四半期をすでに超えて存続しており、このファミリーは以前にもProモデルを終了させたことがある。

GPT-6.1 Solの置かれた状況は、まさにその鏡像だ。登場からまだ8日しか経っておらず、つまり独立した評価記録は構成1つ分の深さしかなく、その障害モードは文書化されていない。誤作動を起こしたときに参照できる実務者のコーパスも存在しない。そのリリース自体がニュースであり、プレビューにはないサポート体制のもとで提供されている。

それらはリスクの量が違うのではなく、リスクの種類が違う。プレビューを選ぶなら、契約上の義務もないのにベンダーがエンドポイントを提供し続けることに賭けていることになる。8日前に登場したモデルを選ぶなら、1回のベンチマーク実行と8日間の可用性があなたのワークロードにとって十分な証拠だと賭けていることになる。インデックスはどちらの判断にも役立たない。

これを簡単にしてくれるただ一つのこと

Gemini 3.1 Pro の一般提供(GA)発表で、モデル識別子が-preview 名前空間から外れ、ライフサイクルへのコミットメントが公表されれば、この問題のほとんどは解決するだろう。22ポイントのインデックス差やタスクあたり1.8倍のコスト差は埋まらないが、現在この比較を偏らせている非推奨化リスクは取り除かれ、チームはプレビュー識別子に固定して望みをかけることなくモデルを採用できるようになる。

あの発表がないこと自体が、7か月半が経った今では情報である。ベンダーが2月に述べた文言では「まもなく」GAに移行する前にアップデートを検証するはずだったプレビューには、そうするためのまる2四半期があった。検証が進行中なのか、それともプレビューが製品そのものなのか——外部からはどちらか分からない。呼び出し元にできるのは、不確実性を織り込み、それに応じてルーティングすることだ。

両方とも 1 つのキー上にあるので、答えはワークロードごとにできます。

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Gemini 3.1 Pro は OrcaRouter 上で、同モデルの表示料金のまま利用できます — $2.00 / $12.00、プロンプトトークンが 200,000 を超えると $4.00 / $18.00 に段階的に上がり、キャッシュ読み取りは $0.20 です。GPT-6.1 Sol は OrcaRouter 上で $2.00 / $10.00、プロンプトトークンが 272,000 を超えると $4.00 / $15.00 に段階的に上がり、キャッシュ読み取りは $0.10 です。どちらもプロバイダー定価で、上乗せは一切なく、キーは1つ、請求も1つです。

これにより、この比較の厄介な部分を安価に解決できる。動画と音声の取り込みはプレビュー側に残る。ペアのもう一方はそれを受け付けないからだ。大量のテキストとコーディング作業は新しいモデルに回る。新しいモデルはタスクあたりのコストが安く、同一の評価作業では33%安い。プレビューのエンドポイントが改訂または撤回された場合、自動フェイルオーバーがそれらの呼び出しを失敗させるのではなく別のルートに移動させる——これはプレビューのライフサイクルリスクが要求する具体的なヘッジである。そして両方が1つのOpenAI互換エンドポイントの背後にあるため、実際に重要な価格比較は、料金表から議論するのではなく、自分のトラフィックで午後のうちに実行できる。

A generated scoreboard titled 'GPT-6.1 Sol vs Gemini 3.1 Pro — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 29.7 on v4.3.2; cost per index task $0.72 against $1.30; input price $2.00 against $2.00; output price $10.00 against $12.00; maximum output 128,000 against 65,536 tokens; lifecycle released September 29, 2026 against a preview running since February 19, 2026. A footer reads 'Index and cost figures per Artificial Analysis v4.3.2; prices per OpenAI and Google as listed on OrcaRouter.'

したがって、擁護できる解釈は、どちらのモデルがより優れているか、ではない。そうではなく、この2つがほぼ同等の価格を付けられながら、ライフサイクルの成熟度では7か月、現在の独立系ボードでは22ポイントの隔たりがあるということだ。そして、プレビューモデルの本当の利点——動画と音声の入力、安価なキャッシュ書き込み——は狭く限定的だということである。ワークロードがこれらのモダリティを必要とするなら、Gemini 3.1 Pro が2つのうち唯一の選択肢であり、そのインデックス差は参入価格である。必要としないなら、先週出荷されたモデルよりタスクあたりコストが80%高い、将来が確定していないプレビューエンドポイントを提示されているのであり、立証責任は逆方向に働く。