
Grok 4.7 対 Gemini 3.1 Pro:リーダーボードは動いたが、モデルは動かなかった
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年2月19日、Artificial Analysisは「Gemini 3.1 Pro Preview:AIの新たなリーダー」という見出しの記事を公開した。10の評価のうち6つで首位に立ち、Claude Opus 4.6に4ポイント差をつけていた。今日、同じモデルのページを見ると、その数字は30で、200モデル中69位だ。ベンダーは何も変えていない。変わったのは物差しだ:Artificial Analysisは2026年9月19日にIntelligence Indexをv4.3.2に改訂し、カタログ内の全モデルを異なる評価セットで再採点した。その結果、2月の首位は9月には中位となり、当のモデル自体はプレビューのまま手つかずでいた。これが、Grok 4.7(ベンダーが2026年9月21日にリリース)との比較の背景であり、この対決が、どちらのモデルがより賢いかというよりも、この2つのうちどちらなら来月も同じものであり続けるとまだ信頼できるかという話になっている理由である。
これらがそれぞれ実際には何なのか
Gemini 3.1 ProはGoogleの最新Proティアモデルであり、これまで一度も一般提供(GA)に到達していません。2026年2月19日にgemini-3.1-pro-previewとして出荷され、Googleの非推奨化テーブルには今も「終了日は未発表」と記載されています。つまり、プレビューの状態が7か月続く一方で、その下位ではGoogleがFlashのラインアップを順次投入してきました。5月に3.5 Flash、7月に3.6、8月に3.7、9月に3.8です。Gemini 3 Proより新しいGA版Proモデルは存在しません。1,048,576トークンの入力ウィンドウと65,536トークンの出力上限を持ち、テキスト、画像、動画、音声、PDFを入力として受け取り、テキストを出力します。また、thinking-levelコントロールをlow、medium、highで公開していますが、budgetパラメータもminimal設定もありません。重みは非公開です。
Grok 4.7は登場から1日しか経っておらず、同様にクローズドウェイトです。500kトークンのコンテキストを保持し、これはGeminiの半分で、テキストと画像を入力できるため、動画や音声はまったく取り込めません。これがこの比較で最も際立つ能力差です。200kプロンプトトークン未満では、入力100万トークンあたり$2.00、出力100万トークンあたり$6.00で、そのラインを超えると$4.00と$12.00に上がり、キャッシュ読み取りは$0.50と$1.00です。xAIはまた、出力速度が約2倍で価格も2倍の、より高速なバリアントも掲載しています。ここで確認したドキュメントには、その最大出力の数値は公表されていません。
支配者が動いた。それが物語だ。
両モデルは現在、Artificial Analysis Intelligence Index v4.3.2でスコア評価されている。このインデックスはTerminal-Bench 2.1をTerminal-Bench 4.0に、tau3-BankingをAutomationBench-AAに置き換え、GDPval-AA Eloスケールを再アンカーした。インデックスが導入されたとき、すべてのモデルの数値は変動した。Gemini 3.1 Proの数値はほとんどのモデルよりも大きく動いた。なぜなら、その2月時点の強みは、新しいインデックスが廃止または重み付けを変更した評価に集中していたからだ。今日、2つの列を並べて見ると:
• 総合 — Grok 4.7(xhigh):Artificial Analysis Intelligence Index v4.3.2 で 46。Gemini 3.1 Pro Preview:同じリビジョンで 30、200 件中 69 位。
• 長いコンテキスト — Grok 4.7:500kウィンドウ、AA-LCR v1.1で77%。Gemini 3.1 Pro:1Mウィンドウ——その2倍の大きさ——そして65Kの出力上限は、長いコンテキストのエージェントセッションが通常必要とする量のおよそ半分にすぎない。
• 入力モダリティ — Grok 4.7:テキストと画像。Gemini 3.1 Pro:テキスト、画像、動画、音声、PDF。互角どころか、ベンチマークの差ですらない——能力の差だ。
• 速度 — Grok 4.7:まだ公表された測定値はありません。Gemini 3.1 Pro:毎秒124.4出力トークン、200件中39位、Google AI Studio経由での初回トークンまでの時間は63.62秒。
• 価格、標準ティア — Grok 4.7: 100万トークンあたり入力 $2.00 / 出力 $6.00。Gemini 3.1 Pro: 入力 $2.00 / 出力 $12.00。同じ入力で、出力は2倍。
• 価格、長文コンテキスト枠 — Grok 4.7:プロンプトトークン200kで$4.00 / $12.00へ倍増。Gemini 3.1 Pro:同じ200kの境界で$4.00 / $18.00へ段階的に上昇。同じ入力で、出力は50%増。
• 成熟度 — Grok 4.7:登場からまだ1日しか経っておらず、ベンダー公表のベンチマークはほとんど第三者による再現がなされていません。Gemini 3.1 Pro:市場投入から7か月が経過していますが、依然としてプレビュー版のままで、GA(一般提供)の確約も提供終了日もありません。

プレビューの問題は今や現実のものとなっている
もし何も問題が起きていなければ、7か月に及ぶプレビューはリスクというより珍事だっただろう。だが、問題は起きた。2026年9月18日以降、ユーザーはGemini 3.1 ProがAI Studioのモデルセレクターから消えたと報告し始め、本稿執筆時点に至るまで、Google社員からの応答も、非推奨の告知も、原因の説明もない——確定した提供終了ではなく、未解決の可用性インシデントである。これを発表の経緯と並べて見てみよう。Googleは2026年5月のI/Oで、Gemini 3.5 Proが「来月ロールアウトする」と述べ、8月下旬の報道では、社内候補が「Flashシリーズより十分に優れているとは言えなかった」ため、同モデルは廃案になったと伝えられた。Google自身のProページには今も「3.5 Pro 近日登場」と掲載されており、これが一画面に収まった矛盾である。決着がどうであれ、実務的な読み方はこうだ。Gemini 3.1 ProはGA日もなく、後継モデルの名前も示されておらず、現在の可用性にも疑問符が付いたプレビューエンドポイントである。
Grok 4.7のリスクは裏返しの関係にあり、種類としてはより小さい。登場からまだ1日しか経っていないため、その数値は乏しい——Artificial Analysisは速度やレイテンシーの測定値を公開しておらず、xAI自身のベンチマークスイートも独立に再現されていない。疑問の余地がないのは、このモデルが一般提供されており、価格が設定され、文書化され、アイデンティティが安定していることだ。アイデンティティが安定していて数値が未証明のモデルのほうが、数値が公開されていて可用性がそうでないモデルよりも、その上に構築するのははるかに容易だ。
分裂が実際に要する対価
文書パイプライン向けに選んでいると仮定します。入力10万トークン、出力8千トークンの場合、Grok 4.7は入力$0.20、出力$0.048 — 約25セントです。Gemini 3.1 Proは入力$0.20、出力$0.096 — 約30セントです。両者は互いに20パーセント以内に収まっており、また、あなたの文書がスキャン、PDF、音声、動画であれば、2つのうちそれらをそもそも読めるのはGeminiだけです。これはベンチマークの議論ではありません。そのワークロードでは、それで比較は終わりです。
ここで、長コンテキストのエージェント向けに選定していると仮定しよう。入力300k、出力8kの場合、Grok 4.7は入力$1.20、出力$0.096で、約$1.30かかる。Gemini 3.1 Proは入力$1.20、出力$0.144で、約$1.35かかる。実質的に同じであり、ここではGeminiの1Mウィンドウと65K出力上限がそれを決める制約になる。なぜなら65Kの上限は、長時間のエージェント実行が破綻する地点だからだ。この対決において、どちらのモデルも安価な選択肢ではなく、フロンティア基準で見てもどちらも高価ではない。

動く標的を迂回する
OrcaRouterはGemini 3.1 Proを取り扱っており、プロバイダーの料率のまま専用のモデルページに掲載しています——入力$2.00、出力$12.00、1Mのコンテキストウィンドウと最大65kの出力——当社はプロバイダーの定価を0%のマークアップでそのまま通しているからです。このようなケースでは、それは宣伝文句ではありません。Googleのこのプレビュービルドは価格未定の期間があり、9月には可用性が揺らいでいました。こうしたときにルーターが果たす有用な役割は、背後にあるものが変わっても統合を安定した状態に保つことです。自動フェイルオーバーとは、応答をやめたプレビューエンドポイントが障害ではなくルーティング上のイベントになる、ということですさらにルーティングDSLを使えば、マルチモーダルモデルとテキスト専用モデルを1回の呼び出しで組み合わせられます——まさにこのペアが示唆する形であり、Geminiが動画を読み取り、Grokがその文字起こしに対して推論を行うというものです。本稿執筆時点で、Grok 4.7はOrcaRouterのカタログにはありません。今日それを使うには、xAI自身のAPIと、それを取り扱うサードパーティのプラットフォームを経由することになります。
構築する価値のあるパターンは次のとおりだ。動画、音声、PDFを取り込む必要があるものにはGemini 3.1 Proを使い続け、そのプレビュー版ステータスは、避ける理由ではなく、回避策を講じるべき運用上のリスクとして扱う。テキストと画像の作業にはGrok 4.7を据える。そこでは、より低い出力価格とより高い総合スコアが当てはまり、今日統合するモデルが6か月後もなお呼び出しているモデルである。唯一やってはいけないのは、69位というランキングをそのモデルへの評価判定として読むことだ。それはベンチマーク改訂への判定であり、Gemini 3.1 Proを降格させたその同じ改訂は、Googleが一切手を加えていない数十のモデルも降格させた。
電話
現在のインデックスでは、Grok 4.7 が Gemini 3.1 Pro を16ポイントリードしており、出力価格では標準ティアで半額、長コンテキストティアでは3分の1安い。ワークロードがテキストと画像なら、それだけで決めてよい。動画、音声、スキャン文書がワークロードなら、2者のうち唯一の候補は Gemini 3.1 Pro であり、比較はそこで終わる——買っているのはスコアではなく能力だ。両者に付すべき注意点は、性能ではなく素性に関するものだ。一方は7か月前のプレビューで、GA日はなく、背後に9月の可用性インシデントがある。もう一方は出たばかりの1日前で、見出しになる数字はあるものの、それ以外は独立に再現されていない。どちらも確定した選択ではない。どちらも、決め打ちするよりルーティングして使い分ける価値がある。

この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
