
GPT-6 Astra vs Gemini 3.1 Pro:新生フラッグシップと、6か月落ちの格安モデルの対決
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1849知能75コーディング
- obsidianQwen3.8 27B2026-08-1541知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1251知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0547知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0347知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2140知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128知能49コーディング
ニュアンスを語る前に、この対決の全体像を2つの数字で示そう。GoogleのGemini 3.1 Proは、最大200Kトークンのプロンプトに対し、入力100万トークンあたり2.00ドル、出力100万トークンあたり12.00ドルを課金する。一方、OpenAIのGPT-6 Astraは入力10.00ドル、出力50.00ドルの一律料金だ。カレンダー上では、安い方のモデルがはるかに古いモデルでもある。Gemini 3.1 Proは2026年2月19日、GPT-6 Astraは2026年9月3日にリリースされた。このため、この比較は逆方向でも異例だ。通常は、既存製品の方が高く、新規参入者が低価格で攻めるものだからだ。今回は新規参入者の入力価格が5倍であり、問題は、GoogleがProレベルの更新を6か月半も行っていない中でも依然として一線級のGemini 3.1 Proに対して、GPT-6 Astraが本当に5倍のモデルなのかどうかという点だ。
両者はそれぞれのメーカーの製品ラインの頂点に位置するが、その運用方針は対照的だ。{{1}}Gemini 3.1 Pro は、Google の現行 Pro フラッグシップである。2月にプレビュー版としてリリースされ、今日でもなお「プレビュー」のままだ。Google が Flash ラインを3つのリリースで更新し、「Gemini 4」について口にし始める間も、このモデルは一度も刷新されなかった。{{/1}} {{2}}GPT-6 Astra は、OpenAI の最新フラッグシップであり、社内の Preparedness Framework のもとで初めて「Critical」評価を得たモデルだ。段階的なロールアウト、エンタープライズ向けオプトイン、そして開発元が世代を超える飛躍と表現する自己申告のベンチマーク成績を伴って登場した。{{/2}} この2つのモデルのうち一方は、半年間、更新がなく低価格のままだ。もう一方は登場から2日しか経っておらず、あたかもフロンティアが前進したかのような価格設定だ。この2つから選ぼうとする開発者にとって、本当の問いは、そうした2つの状態のどちらがワークロードに適しているかだ。なぜなら、スペック上では両者の差は、価格差が示唆するよりも小さいからだ。
2つの価格表、2つの長さの理論
GoogleはGemini 3.1 Proの価格をプロンプト長に応じて設定している。200K入力トークンまでは入力$2/出力$12、それを超えると入力$4/出力$18へと段階的に上がり、キャッシュ読み出しは$0.20〜$0.40、バッチは半額となる。この価格設定が示すのは、短いプロンプトは安く、長いものは高いということだ——Googleがトラフィックの大半を占めると見込む検索・グラウンディング系ワークロードに合わせて調整された価格モデルである。一方OpenAIはGPT-6 Astraを一律$10/$50(キャッシュ入力は$1.00)とし、非常に長いプロンプトには別種のペナルティを科す。約272K入力トークンを超えると、入力は2倍、出力は1.5倍で再価格化され、実質的に入力$20/出力$75となる。この2つのモデルは、長いコンテキストへの課金が異なる位置で跳ね上がる。Geminiは200Kまでは安く、それを超えると中程度の割高感になる。Astraは272Kまではフラットで、それを超えると急激に高くなる。したがって、300KトークンのタスクはGemini 3.1 ProよりもGPT-6 Astraの方がはるかに高額になり、50KトークンのタスクはGeminiの方が4〜5倍安い。コンテキスト範囲の下限に張り付くようなワークロードでは、Astraの価格は正当化しにくい。逆に、本当に上限付近を必要とするワークロードでは、両ベンダーとも割増料金を課しており、OpenAIの割増の方がより急である。
Gemini 3.1 Pro が本当に先行している点
Googleのフラッグシップには、OpenAIのどのモデルにもない3つの強みがある。そしてAstraをめぐる発表のノイズがあまりに大きいため、見逃しやすい。第一に、入力モダリティ:Gemini 3.1 Proはテキスト、画像、音声、動画、PDFを単一のプロンプトで受け付ける。一方、GPT-6 Astraはテキスト+画像のみで、出力はテキストのみ——前任モデルと同じモダリティの範囲だ。第二に、ネイティブなグラウンディング:GeminiにはGoogle検索、マップ、コード実行がAPIに組み込まれた状態で提供される。これは、エージェント型リサーチや、パラメトリックな想起ではなく新鮮で検証済みの情報を必要とするあらゆるタスクにとって、真の機能差となる。第三に、200Kトークン未満に収まるすべての処理における価格だ。バッチ処理の$1/$6を含め、大規模なオフラインジョブをどちらのモデルで実行する場合でも、圧倒的に最も安い方法となる。これらのどれも推論ベンチマークには現れない。まさにそのため、スコアだけを引用するフラッグシップ対フラッグシップの比較では埋もれてしまうのだ。
スペックシートを並べて表示
• リリース済み — GPT-6 Astra:2026年9月3日。Gemini 3.1 Pro:2026年2月19日(まだ「プレビュー」)。
• 料金(プロンプト≤200K) — GPT-6 Astra: 1Mトークンあたり一律 $10.00 / $50.00。Gemini 3.1 Pro: 1Mトークンあたり一律 $2.00 / $12.00。
• 価格(長いプロンプト) — GPT-6 Astra: 入力272K超の場合、1Mあたり約$20.00/$75.00。Gemini 3.1 Pro: 入力200K超の場合、1Mあたり$4.00/$18.00。
• コンテキスト/出力上限 — GPT-6 Astra: 入力約1.05M、出力128K。Gemini 3.1 Pro: 入力1M、出力約65K。
• 入力 — GPT-6 Astra: テキスト + 画像。 Gemini 3.1 Pro: テキスト、画像、音声、動画、PDF。
• グラウンディング / ツール — GPT-6 Astra:ウェブ検索、ファイル検索、コード実行。Gemini 3.1 Pro:ネイティブのGoogle検索、Maps、コード実行、関数呼び出し。
• 推論コントロール — GPT-6 Astra:推論努力は低〜最大。Gemini 3.1 Pro:推論努力は調整可能。
六か月が見えるところ
Gemini 3.1 Proは、リリース時にはArtificial Analysis Intelligence Indexの首位に立っていたが、今はそうではない。夏後半のフラッグシップであるClaude Opus 5、GPT-5.6 Sol、そして今回のGPT-6 Astraはすべて、現在のインデックススケールでGemini 3.1 Proより上位に測定される。GoogleはProレベルの答えをまだ出していない。最も劇的な差はARC-AGI-3で生じている。これは、通常のチェーン・オブ・ソートでは解けないように設計されたベンチマークだ。OpenAIはAstraについて自社ハーネスで99.9%と報告し、ARC Prizeによる標準ハーネスの独立実行では62.7%と測定された。一方、独立した実行ではGemini 3.1 Proは1%未満で、Astra以前のフロンティアの残りと同じほぼゼロの帯域にある。元のARC-AGI-2では、Google自身の数値によるGemini 3.1 Proはリリース時に77.1%という好成績だった。後継ベンチマークは別の領域であり、OpenAIの新しいパラダイムが6か月前のモデルを真に置き去りにするのは、その領域だけだ。
より微妙なリグレッションは、長文コンテキストの信頼性です。独立したマルチニードルテスト(MRCR v2)によると、Gemini 3.1 Proは128Kでは正確に情報を取得できる一方、1Mウィンドウの上限に近づくにつれて性能が急激に低下します。これは、Googleがリリースから6か月経っても完全には修正できていない崩落パターンです。Astraの1.05Mコンテキストは新しく、大規模環境では未検証ですが、この領域こそOpenAIが最も積極的に自社で実装したと主張しているところであり、そこには1回の応答でGeminiの約65Kよりもはるかに大きな生成成果物を出力できる128Kの出力上限も含まれます。扱うワークロードが、最初から最後まで忠実に読み取らなければならない巨大なコンテキスト1件であるなら、選択肢は、性能低下が実測されているモデルか、ウィンドウ上限付近の挙動がまだ誰にもストレステストされていないモデルか、のどちらかです。どちらにせよ、気楽に選べる選択肢ではありません。

実際的な決定
本番ワークロードの大部分 — 文書に対するRAG、グラウンディング中心のリサーチ、マルチモーダル入力、20万トークンに収まるあらゆるもの — において、Gemini 3.1 Pro は現時点で経済的に合理的な選択肢であり、その差は僅かではない。入力コストが5分の1で、モダリティとグラウンディングの面でも優位にある中、GPT-6 Astra は、そうしたワークロードが決して使うことのない推論の余力に巨額のプレミアムを支払っていることになる。エージェンティックコーディング、長期的なコンピューター操作、そして本当に128Kの生成成果物や信頼性の高い100万トークン近いコンテキストを必要とする問題については、GPT-6 Astra が評価すべきモデルだ — ただし、率直に言って、その話題の数字はOpenAIのものであり、独立した初日の評価は、トークン効率に優れる一方で、マーケティングが示すよりも能力ギャップが小さいことを示している。Gemini の6ヶ月間の開発停止こそが決定的な背景である。あなたが選ぼうとしているのは、Google が改良を止めた、安価で高性能で成熟したモデルか、OpenAI が積極的に前進させている、高価でリリースされたばかりのモデルかのどちらかなのだ。
ため両方ともホストされており、どちらも手元に置いておく価値がある、実際的な答えは置き換えではなくルーティングすることです。Gemini 3.1 Pro は Google の定価で OrcaRouter に載っており、マークアップなしでパススルーされるので、$2/$12 という経済性はルーターを挟んでも維持されます。そして、ルーティング DSL によって、200K 未満か長いプロンプトかの使い分けは手動判断ではなくルールになり、短い根拠付きクエリは Gemini に送られ、GPT-6 Astra はそのレートに見合うタスクに温存されます。GPT-6 Astra は本稿執筆時点ではまだ OrcaRouter にありません。プロバイダーが gpt-6-astra の提供を開始すると、モデルページにはその日中に OpenAI の定価が表示されます。そして、既にプロバイダー間でワークロードを稼働させ続けているフェイルオーバールールは、リリースから2日しか経っていないモデルにパイプライン全体を賭けずに、限られたトラフィック量で Astra を採用できるようにする仕組みと同じです。


評決
GPT-6 Astra 対 Gemini 3.1 Pro は、Google が6か月間放置してきたモデルと、OpenAI が2日前にリリースしたばかりのモデルとの対決です。価格差は主にこの非対称性を反映しており、同じ規模の性能差を反映しているわけではありません。安価でマルチモーダルな根拠に基づく推論を大規模に必要とするなら、Gemini 3.1 Pro がこの比較では文句なしの勝者であり、その状況は数か月間変わっていません。新しいパラダイムの推論、大きな出力上限、あるいは信頼性の高いコンテキストウィンドウ先頭コンテキストを本格的に求めるなら、GPT-6 Astra は、それらの機能を活用するワークロードにおいて、そのプレミアム価格に見合う価値があります。ただし、それは OpenAI の発表時のベンチマーク表ではなく、あなた自身のタスクで測定した場合の話です。過ちとなるのは、6か月前の割安モデルと2日前のフラッグシップを、どちらの方向であれ、その新旧の差が重要でないかのように扱うことです。その年齢差こそが、すべてを物語っています。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
