GPT-6 Sol ProとGrok 4.7を比較する記事のヒーロータイトルカードで、「GPT-6 Sol Pro vs Grok 4.7」と表示され、サブタイトルは「冗長さは2倍、価格は3分の1」。
Guides & Insights

GPT-6 Sol Pro 対 Grok 4.7:冗長性は2倍、価格は3分の1

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月の最も安価なフロンティア隣接モデル2つは、1日違いで登場した。そして興味深いのは、どちらがより賢いかという点ではない。GPT-6 Sol——人々がGPT-6 Sol Proを検索するときに行き着くモデル、つまり別個の製品ではなく、そのモデルのreasoning.modeをproに設定したもの——は、2026年9月22日に、入力100万トークンあたり2.00ドル、出力100万トークンあたり10.00ドルで出荷された。Grok 4.7はベンダーから9月21日に、同じ入力2.00ドル、出力6.00ドルで出荷された。Artificial Analysisの中立なハーネス上では、両者はインデックス2ポイント差、完了タスクあたりおよそ2ドル差につけているが、その差の理由は能力ではない。そこへ到達するまでにそれぞれが消費するトークン数なのだ。

SolはIntelligence Indexを実行して7700万の出力トークンを生成した。Grok 4.7は2億4000万を生成した。その比率——3対1を少し上回る程度——が比較のすべてであり、トークンあたりの価格表から得られる結論を覆す。

2つのレートカード、そして「安いほう」が安くないとき

両ベンダーともこれらの数値は自ら公表しているもので、いずれも独立した形で価格を再設定されたものではない。

• 入力 — GPT-6 Sol は100万トークンあたり$2.00 対 Grok 4.7 は100万トークンあたり$2.00

• 出力 — {{KEEP}}GPT-6 Sol{{/KEEP}} {{1}}100万トークンあたり10.00ドル{{/1}} 対 {{KEEP}}Grok 4.7{{/KEEP}} {{2}}100万トークンあたり6.00ドル{{/2}}

• キャッシュ済み入力 — GPT-6 Sol は100万トークンあたり$0.20、Grok 4.7 は100万トークンあたり$0.50。Sol のキャッシュ読み取りは2.5分の1の安さで、これは見出しの出力レートが示唆する内容とは逆です。

• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Grok 4.7 500,000トークン

• 長文コンテキスト割増 — GPT-6 Sol は、272,000 入力トークンを超えるリクエストについて、リクエスト全体で入力料金とキャッシュ料金を 2 倍、出力を 1.5 倍に再価格設定するのに対し、Grok 4.7 は 200,000 入力トークンで全料金を 2 倍にし、これもリクエスト全体に適用される

• 知識カットオフ — GPT-6 Sol は2026年4月20日、Grok 4.7 は事前学習のカットオフが2026年6月と報告されており、8月まで補足トレーニングを実施

• 推論エフォート — GPT-6 Sol: なし、低、中(デフォルト)、高、xhigh、最大 対 Grok 4.7: 低、中(デフォルト)、高、xhigh

• モダリティ — どちらもテキストと画像の入力を受け付け、テキストを返します

キャッシュ読み取りの行こそ、購入者が腰を据えて検討すべき項目だ。Grok 4.7 の出力料金は 40% 低いが、キャッシュされた入力は 150% 高い。そして、長いエージェント履歴や繰り返し使われるシステムプロンプトが宿るのは、このキャッシュ入力の領域だ。大規模で安定したコンテキストを主に再読み取りするワークロードでは、両モデルの料金は $6 対 $10 という数字が示すよりもずっと近くなる。

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

独立した記録、そしてそれを決めるただ一つの数字

Artificial Analysisは両モデルを測定した唯一のハーネスであり、その数値は並べて示す価値がある。なぜなら、その乖離は示唆に富むからだ。

• インテリジェンス指数 — 最大エフォート時の GPT-6 Sol 48 対 xhigh 時の Grok 4.7 46。どちらも同等モデルの中央値 25 を大きく上回る

• インデックスタスクあたりのコスト — GPT-6 Sol $1.06 対 Grok 4.7 $3.74

• インデックス実行の出力トークン — GPT-6 Sol 77M 対 Grok 4.7 240M、中央値 88M に対して

• 出力速度 — Grok 4.7は毎秒39トークンと計測されており、ハーネス自体がこれを顕著に遅いと評している。同じボード上のSolの数値は、同じ要約行には公表されていない

• Coding Agent Index — GPT-6 Sol はタスクあたり2.99ドルで57、対する Grok 4.7 は自社製 Grok Build ハーネスで56、Grok 4.6 から9ポイント上昇

インデックス差は2ポイント、タスクあたりのコストは3.5倍。これは価格設定の異常ではない——冗長さが生む算術だ。Grok 4.7は長々と考えを声に出すモデルであり、ハーネスは88Mトークンの中央値に対して「非常に冗長」とフラグを立てる。そしてコストは料金表ではなく、トークン数に従う。

コーディングエージェントの比較には、スコアボードが隠している注意点がある。Grok 4.7の56は、xAI自身のGrok Buildハーネス内で測定されたもので、これはxAIが出荷し、ベンチマークの基準として用いている構成だ。Solの57は中立的なハーネスで測定されている。ファーストパーティのハーネスによる1~2点の優位は、ハーネスの選択で説明できる範囲に十分収まる。つまり、正直に読めば、この2つはエージェント型コーディングにおいて互角なのであって、Solが1点リードしているのではない。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

各ベンダーが主張していること、そしてどちらも示していないこと

xAIの発表資料は具体的であり、それは長期的なストーリーである:Grok 4.7はGrok 4.6よりも大きなベースモデル上に構築され、より長い強化学習の実行が与えられた。それは「完了するまでに数時間かかる可能性がある」タスクを対象とし、自己検証、長文脈処理、およびGrok Bot環境内での振る舞いを研ぎ澄ます。ベンダーが報告した数値には、Terminal-Bench 4.0が38.0%(Grok 4.6の20.3%に対して)、CursorBench 4.0が46.3%、DeepSWE v1.1が71.0%が含まれる。これらのすべてはxAI自身の測定値であり、いずれも独立に再現されていない;出回っている独立したTerminal-Bench 4.0の数値はベンダーのものより実質的に低く、これはそのギャップの典型的な形である。

GPT-6 Solに関するOpenAIの主張は、すでに上記で取り上げたものであり、同じ注記が付されている。ベンダー報告による数値は、xhigh effortでのAutomationBenchで33.2%対Claude Opus 5のmaxで26.9%、タスクあたりコストは約9%であり、またmax effortでのDeepSWE v1.1で68.8%——xhighでのClaude Fable 5とは1.1ポイント以内で、タスクあたりコストは約80%低い。比較対象に注目してほしい。OpenAI自身のチャートはSolをAnthropicのモデルと対決させており、Grok 4.7とは比較していない。どちらのベンダーも、互いの直接対決の結果を公開していない。

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

ルーティング層が真価を発揮する場面

OrcaRouter はこの組み合わせのどちらのモデルも取り扱っていません — Grok 4.7 と GPT-6 Sol はいずれも当社のカタログに存在しないため、ここに書かれていることは当社を通じた両モデルの価格に関する主張ではありません。この特定の組み合わせにおいてルーティングレイヤーに価値があるのは、料金表ではなくフェイルモードのほうです。Grok 4.7 に手を伸ばす理由はその長期的なエージェント動作にあり、手を伸ばさない理由は、毎秒39トークンという出力速度が長時間のエージェント実行を無視できないほど遅くし、遅い実行とはタイムアウトしうる実行だからです。プロバイダーをまたぐ自動フェイルオーバー があれば、長時間のジョブを実際に利用可能なモデルにルーティングでき、その速度が単一障害点になることを防げます。そして、ルーティング DSL はモデルの選択を呼び出し内部のルールとして表現します — 移行としてではなく。これはここで重要です。この組み合わせに対する正しい答えは、タスクがトークン消費型かレイテンシ重視型かによって変わり、それは四半期の性質ではなくリクエストの性質だからです。

決定規則

• 固定予算でのエージェント型コーディング — GPT-6 Sol。中立コーディング指数で同水準の能力を、タスクあたりおよそ3分の1のコストで。なぜなら、3分の1のトークンでそこに到達するからです。

• 実行の長さこそが本質となるロングホライズンタスク — Grok 4.7。このリリースは数時間におよぶ作業に特化してトレーニングされており、SWE-Marathon と CursorBench におけるベンダーの数値はまさにその方向へ動いている。

• レイテンシに敏感なボリューム — 現在の記録では、どちらでもない。タスクあたりのコストは Sol の方が良い数値だが、Grok 4.7 の実測 39 トークン毎秒は、インタラクティブな用途にとっては現実的な制約となる。

• 大半がキャッシュされる長文コンテキストのワークロード — GPT-6 Sol は、出力の行ではなくキャッシュ読み取りの行で効いてきます。100万キャッシュトークンあたり $0.50 に対して $0.20、しかもウィンドウは2倍のサイズとなれば、プロンプトの安定している部分が多いほど、その優位性は強まります。

• 比較をトークン単位の料金表から作成したなら、タスクあたりのコストから作り直してください。出力 $6.00 対 $10.00 は、この記事で最も情報量の少ない数字の組み合わせであり、既存のすべてのページが冒頭に掲げている組み合わせでもあります。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新