GPT-6 と Grok 4.7 の比較用ヒーロータイトルカード。見出しは「GPT-6 vs Grok 4.7」。チップには「GPT-6 Sol: 1.05Mコンテキスト、128K出力、$2.00 / $10.00」と表示。チップには「Grok 4.7: 500Kコンテキスト、450K出力、$2.00 / $6.00」と表示。フッターには「入力価格は同額だが、出力価格と出力上限はそうではない」と表示。
Guides & Insights

GPT-6 対 Grok 4.7:出力列が決め手となる

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GPT-6 SolとGrok 4.7は入力トークンに対して同じ料金を請求する — 100万トークンあたり$2.00で、どちらも同じ — そのため入力の列は両者を選ぶ際には役に立たない。判断の分かれ目は1つ右の列にある。GPT-6 Solは出力トークン100万トークンあたり$10.00を請求し、Grok 4.7は$6.00だ。さらに両モデルは、1回の呼び出しで生成できる出力量について3.5倍も食い違っている。GPT-6 Solは128,000トークンが上限だが、Grok 4.7 — SpaceXAIのフラッグシップであり、Grok 4.6の後継として2026年9月21日にリリースされた — は450,000トークンに達する。

この対決における他のすべては、それら二つの事実から導き出される。さらに、もう一つ加わる。GPT-6 Solのほうがより大きなコンテキストウィンドウを備えており、1,050,000トークン対Grok 4.7の500,000トークンである。つまり、これは一方のモデルが優れているという話ではない。異なる形を持つ二つのモデル、そしてあなたのワークロードがどちらの形なのか、という話なのだ。

まず、リクエストの形を正しく整えましょう

GPT-6 と Grok 4.7 のどちらを選ぶかの判断を整理するのに役立つ方法は、自分のジョブが実際に消費するリソースで見ることです。ほとんどの本番トラフィックは 3 つのケースでカバーされます。

長い入力、短い出力。 大きなドキュメント、コードベース、あるいは長いエージェントのトランスクリプトを投入し、要約や差分、あるいは判断結果を受け取るケース。ここではコンテキストウィンドウが制約要因となり、GPT-6 Solの1,050,000トークンはGrok 4.7の500,000トークンのおよそ2倍です。ただし両方のカードにある料金ティアの線に注目してください。Grok 4.7の$2.00のレートは入力200,000トークンまで適用され、それを超えると$4.00に上がります。一方、GPT-6 Solの$2.00のレートは272,000まで続き、その後$4.00に上がります。200,001トークンの時点で、Grokはすでに値上げ後の料金となり、GPT-6 Solはまだ値上げ前です。つまり250,000トークンのドキュメントは、Grok 4.7では100万トークンあたり$4.00、GPT-6 Solでは100万トークンあたり$2.00かかり、出力を数える前にして2倍です。

短い入力、長い出力。 あなたが生成しているのは、長文ドキュメント、大きなコードファイル、構造化された成果物、またはモデルが結果を書き出す必要があるツール呼び出しの連鎖です。これは Grok 4.7 がまさに作られたケースです。450,000トークンの出力上限は、ほとんどのモデルが許容する量を桁違いに超えており、出力100万トークンあたり $6.00 対 $10.00 では、それらの各トークンに 40% 少なく支払うことになります。あなたの生成が日常的に 128,000 出力トークンを超えるなら、GPT-6 Sol はそのリクエストを 1 回の呼び出しではまったく処理できませんが、Grok 4.7 ならできます。

バランス型で、どちらもヘビーです。 長い入力と長い出力が組み合わさる場合が、この2つのカードが互いに影響し合うケースです。40万トークンの入力と20万トークンの出力は、Grok 4.7 では入力 $4.00、出力 $12.00 の価格になります(いずれも同モデルのしきい値を上回っています)。一方、GPT-6 Sol では入力 $4.00、出力 $15.00 です。トークン単価で GPT-6 Sol の方が高くなるのはこの構成だけであり、ChatGPT時代の定番の方が安いと決めつける前に、自分の平均値と照らし合わせて確認する価値があります。

OpenAIが変えたもの、そしてそれがここで重要な理由

GPT-6は3モデルからなるファミリーであり、2026年10月7日、OpenAIはその中間に位置するモデルを一般に公開しました。ChatGPTにおけるGPT-6 — Intelligent UIのロールアウト — は、Plus、Pro、Business、Enterprise向けにはGPT-6 Sol、FreeおよびGo向けにはGPT-6 Lunaによって動作し、毎週ChatGPTを利用する12億人以上の人々に届いています。これは能力に関する事実ではなく提供範囲に関する事実であり、比較において「GPT-6」が何を意味するかを変えます。誰かがGPT-6がベンチマークで別のモデルに勝った、あるいは負けたと言うとき、通常は特にGPT-6 Sol、あるいは$10.00 / $50.00のフラッグシップGPT-6 Astraを指しています。

この対決では、ChatGPTのロールアウトが一つの具体的な点で重要になる。Grok 4.7は2026年9月21日、GPT-6 Solの4日前にリリースされ、純粋なAPIおよびアプリのモデルであり、同等の10億ユーザー規模の消費者向けデフォルトは存在しない。SpaceXAI自身による説明は限定的かつ具体的だ。長時間実行されるソフトウェアエンジニアリング、ツール使用と自己検証を伴うエージェント型ワークフロー、そしてナレッジワークのためのフラッグシップである。それはアウトプットの多い仕事に関する表明であり、まさにGrokのカードがより強い形だ。

正直に表示されたスコアボード

これら2つの独立した評価はArtificial Analysisによるもので、要約すると、総合指数では両者は接近しており、個別テストでは製品の違いに合致する形で結果が分かれている。

• AA Intelligence Index:Grok 4.7 46.4(評価対象モデル中16位)、GPT-6 Sol 47.6 — GPT-6 Solが約1ポイント先行
• Humanity's Last Exam:Grok 4.7 43.1%、GPT-6 Sol 47.9%
• SciCode:Grok 4.7 57.4%、GPT-6 Sol 57.6% — 実質互角
• Long-Context Recall:Grok 4.7 76.7%、GPT-6 Sol 83.7% — GPT-6 Solが先行、より大きなコンテキストウィンドウと整合的
• Terminal-Bench(Grokのカードではv4.0):同一のハーネスファミリーでGrok 4.7 25.8%、GPT-6 Sol 43.9%
• コーディング:Grok 4.7はコーディング指数の上位10%に入り、リーダーボード上の最強モデルたちと並ぶ

2つの注意点があり、それらは飾りではない。2モデルの指標値は異なる日付で評価されているため、これは同日の直接対決ではなく、1ポイントの差はリビジョンが生み出す変動の範囲内にある。そして、上記の Grok 4.7 の数値はすべて、カタログに掲載されているプロバイダー自身の公表値であり、私たちが再実行したスコアではない——正直に読めば、Grok 4.7 はコーディングモデルとして上位10%に入るが、汎用推論の複合指標では GPT-6 Sol に1ポイントほど後れをとっており、terminal-bench の差がこのセットで最大の単一シグナルだ、ということになる。

Screenshot of the OrcaRouter model page for Grok 4.7, showing the SpaceXAI Grok 4.7 card with a 500,000-token context window, up to 450,000-token output, text/image/file input and text output, and a tiered rate of $2.00 per million input and $6.00 per million output up to 200,000 tokens, stepping to $4.00 and $12.00 above.

レイテンシと信頼性、それはスペック表が隠しているもの

公開されている料金表もベンチマーク表も、本番環境でのサービス品質を左右する要素をそろって欠いている。だからこそ、宣伝用の数字ではなく、実測された数値に目を向ける価値がある。

2026年10月の最初の1週間におけるOrcaRouter自身のプレイグラウンド測定では、Grok 4.7は初回トークン遅延の中央値3,825 msを記録し、毎秒約147トークンで出力を生成し、エラー率は約8%でした。同じ期間に測定されたGPT-6 Solの中央値遅延はそれより高く、6,363 msで、エラー率ははるかに高くなっていました。これらは共有ルート上でのプレイグラウンド観測であり、ベンダーのSLAではありません。また、あるモデルのルートにおける39%のエラー率は、モデルの問題ではなくルーティングの問題です。これはまさに、フェイルオーバーが埋めるために存在する種類のギャップです。比較の要点は、その特定の期間においてGrok 4.7のルートがGPT-6 Solのルートよりも実質的に応答性が高く、信頼性も高いように見えたということであり、どちらのベンダーの公開カードもそのことを示してはいなかったということです。

どちらにもコミットせずに両方を実行する

これほど僅差の比較では、事前に価格でどちらかを選び、3か月後に自分のトラフィックの形が変わっていたことに気づく——という誘惑に駆られる。それを解決するのがルーティングだ。OrcaRouterではgrok/grok-4.7もGPT-6 Solも同じカタログ内のライブルートとして単一のAPIの背後に並び、プロバイダーの定価でマークアップ0%——つまりSpaceXAIやOpenAIが料金を変更すれば、次回の請求突合時ではなくその当日に反映される。プロバイダーをまたぐ自動フェイルオーバーは、一方のルートが劣化したケースをカバーする。これは上記のエラー率のばらつきを踏まえると直接的に関係する。そしてルーティングDSLを使えば、モデルの好みではなくリクエストの形によってトラフィックを振り分けられる。長い入力・短い出力の処理はウィンドウが大きいモデルへ、長い出力の生成は450Kの上限とより安い出力料金を持つモデルへ送り、人間ではなくリクエストサイズの述語に選ばせればよい。

選択

あなたの仕事が長文書分析、大規模コンテキスト推論、あるいは200,000入力トークンを超えるようなものであるなら、GPT-6 Solのほうが適したカードです。コンテキストは2倍、独立系指数もより高く、しきい値もさらに72,000トークン先にあります。あなたの仕事が生成——長いコード成果物、長文ライティング、モデルが見つけた内容を書き出す必要がある長いツール呼び出しチェーン——であるなら、Grok 4.7のほうが適したカードです。GPT-6 Solには到達できない450,000トークンの出力上限、40%安い出力トークン、そしてそれに見合うトップ十分位のコーディング特性を備えています。本当にその両方を行うなら、答えはモデルではありません。それはルートです。

A comparison card titled 'The shape of the request decides'. Left column 'Grok 4.7': rows 'Context: 500K', 'Output: up to 450K', 'Input: $2.00 to 200K, then $4.00', 'Output: $6.00, then $12.00', 'AA Index: 46.4'. Right column 'GPT-6 Sol': rows 'Context: 1,050,000', 'Output: 128K', 'Input: $2.00 to 272K, then $4.00', 'Output: $10.00, then $15.00', 'AA Index: 47.6'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; evaluation dates differ between models.'Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate card of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新