GPT-6 Sol と Grok 4.7 を比較する記事のヒーロータイトルカードで、タイトルは「GPT-6 Sol vs Grok 4.7」、サブタイトルは「より安いトークンなのに3倍の費用がかかる」。統計「出力トークン 240M vs 77M」を示し、Grok 4.7 は出力 $6.00、タスクあたり $3.74、GPT-6 Sol は出力 $10.00、タスクあたり $1.06。
Guides & Insights

GPT-6 Sol vs Grok 4.7:より安いのに3倍のコストがかかるトークン

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月に1日違いで登場した2つのモデルは、価格表の上では大きく異なっている。Grok 4.7は9月21日に登場し、100万入力トークンあたり$2.00、100万出力トークンあたり$6.00だった。GPT-6 Solは9月22日に登場し、入力は同じ$2.00、出力は$10.00だった。Grokの出力は40%安い。ほとんどの比較がGrokを選ぶ根拠はこれだけであり、そしてそれは見るべき数字ではない。

この組み合わせを決める数字は、どちらの料金表にも載っていない。2億4000万対7700万——Artificial AnalysisがIntelligence Indexを実行した間に各モデルが生成した出力トークン数だ。Grok 4.7は、同じ質問セットに答えるために3倍を少し超えるトークンを消費した。それをトークン単価に掛けると、出力が安いモデルは完了したタスク1件あたり$3.74、対するもう一方は$1.06になる。トークンあたりでは安いのに、請求額は3倍以上。

各モデルの正体

Grok 4.7はxAIによるGrok 4.6の後継モデルで、同社最強のコーディングおよびナレッジワーク向けモデルとして位置づけられており、500,000トークンのコンテキストウィンドウ、テキストと画像の入力、テキスト出力、そしてlow、medium、high、xhighで設定可能な推論エフォートを備えている。xAIはパラメータ数を公表していない。2026年6月と報告されている事前学習カットオフを採用しており、8月まで追加学習を行っている。

GPT-6 Sol は OpenAI のミッドティア GPT-6 モデルである — フラッグシップの GPT-6 Astra より下、低価格帯の GPT-6 Luna より上に位置し — 1,050,000 トークンのコンテキストウィンドウ、922,000 トークンの最大入力、128,000 トークンの出力上限、2026年4月20日の知識カットオフを持つ。入力はテキストと画像、出力はテキストで、推論エフォートは none から max まで設定でき、OpenAI はその価格設定をプロモーション用ではなく恒久的なものだと説明している。

コンテキストウィンドウは接近していない。Sol のものはおよそ 2 倍だ。それが重要になるのはちょうど 1 つのクラスのワークロードだけで、しかもそれはほとんどの人が実行するクラスではない。

料金表、そしてそれを反転させる行

• 入力 — GPT-6 Sol 100万トークンあたり$2.00 対 Grok 4.7 100万トークンあたり$2.00、同一

• 出力 — GPT-6 Sol は100万トークンあたり$10.00、Grok 4.7 は100万トークンあたり$6.00;Grok の方が40%安い

• キャッシュ入力 — GPT-6 Sol $0.20/100万トークン vs Grok 4.7 $0.50/100万トークン。Solのキャッシュ読み取りは2.5分の1の安さで、これは出力レートが示唆するものとは逆である

• キャッシュ書き込み — GPT-6 Sol は100万トークンあたり$2.50、Grok 4.7 は同じシートに公表されていない料金

• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Grok 4.7 500,000トークン

• 長文コンテキスト割増 — GPT-6 Sol は、272,000 入力トークンを超えるリクエストについて、リクエスト全体で入力料金とキャッシュ料金を 2 倍、出力を 1.5 倍に再価格設定するのに対し、Grok 4.7 は 200,000 入力トークンで全料金を 2 倍にし、これもリクエスト全体に適用される

• 知識カットオフ — GPT-6 Sol は2026年4月20日、Grok 4.7 は事前学習のカットオフが2026年6月と報告されており、8月まで補足トレーニングを実施

• 推論エフォート — GPT-6 Sol: なし、低、中(デフォルト)、高、xhigh、最大 対 Grok 4.7: 低、中(デフォルト)、高、xhigh

• モダリティ — テキストと画像を入力、テキストを出力、両方に対応

キャッシュ行こそ、購入者がじっくり向き合うべきものだ。Grokの出力レートは低いが、そのキャッシュ入力はSolの2.5倍であり、キャッシュ入力こそ長いエージェント履歴や繰り返されるシステムプロンプトが存在する場所だ。大半が大きな安定したコンテキストの再読み込みであるワークロードでは、$6対$10が示唆するよりも両者ははるかに近くなる——そしてそこにトークン量比が加わると、順序は逆転する。

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

なぜ2億4000万トークンがすべてを物語るのか

Artificial Analysisは、xhighのGrok 4.7がインデックス実行全体で約2億4,000万の出力トークンを生成したと計測した。同じボード上のモデルの中央値は約8,800万だった。同社自身のサマリーは、このモデルを「著しく遅く、非常に冗長」と評している。同じハーネスで計測されたGPT-6 Solは7,700万を生成し、ボード上では「かなり簡潔」と説明されている。

ボードはその帰結も直接報告している。Grok 4.7はIntelligence Indexで46を記録し、タスクあたり3.74ドル。高設定でもスコアは46のまま、コストはタスクあたり2.73ドル。GPT-6 Solは48を記録し、タスクあたり1.06ドル。同じインデックス、同じハーネスで、どの料金表にも示されない2~3.5倍のコスト差。

これらの数値をきれいな一対一比較として扱う前に、注意点が2つあります。2つのページは同じ日に取得されましたが、掲載されている母数が異なります — Grokのページには212モデルのクラスが表示され、別のGrokのリストでは655中何位という順位が報告されています — そのため、2つのスコアが同じインデックスビルド上のものだとは保証できません。また、どちらの数値もベンダー公表値ではありません。Artificial Analysisは独自のハーネスを実行しており、そこが要点ですが、2つのリストでは推論設定が異なります(Grokはxhigh、Solはmax)。したがって、500パーセントのコスト差を発見事項とし、2ポイントのインデックス差はおおよそのものとして扱ってください。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

xAIが公表したこと、そして誰も検証していないこと

xAI自身の発表数値は強力であり、すべてのベンダーの発表数値と同様、再現されていない。CursorBench 4.0はxhighで46.3%、Grok 4.6の40.4%に対して。Terminal-Bench 4.0は38.0%で、20.3%に対して——今回のリリースで最大の単一の向上だ。DeepSWE v1.1はhighで71.0%、65.2%に対して。EEBenchは64.0%で、53.0%に対して。これらはxAIのハーネス、xAIの設定、xAIの報告によるものだ。

OpenAIのGPT-6 Solに関する数値は同じパターンに従っており、同じ割引を受けるに値する。違いは、SolがGrokよりも独立した証拠を1つ多く持っている点だ。それはArtificial Analysisのタスクあたりコストの数値で、ベンダーのスコア表からではなく、測定されたトークン消費量から算出される。この比較に耐えるのはその数値だ。

どちらのモデルについても、同じタスク・同じハーネス・同じエフォート設定で直接比較した結果は、これまで誰も公開していない。もしそうしたものを見かけたら、その3つの変数のうちどれが動いたのかを確認してほしい。

キャッシュされたエージェントトラフィック1か月分の価格設定

大半が安定したコンテキストで構成されるワークロードを想定します。たとえば、60,000トークンのシステムプロンプトとリポジトリ要約を備えたコーディングエージェントが、月5,000回の呼び出しで再読み込みされ、各呼び出しが4,000の出力トークンを返すとします。キャッシュが機能し、安定したプレフィックスがキャッシュ料金で課金されると仮定します。

GPT-6 Sol の場合、キャッシュ済み入力トークン3億個は100万個あたり$0.20で$60.00。出力トークン2,000万個は100万個あたり$10.00で$200.00。合計$260.00。

Grok 4.7の場合:同じ3億のキャッシュ済み入力トークンが100万トークンあたり$0.50で$150.00。2,000万の出力トークンが100万トークンあたり$6.00で$120.00。合計$270.00。

ほぼ同一 — しかもそれは、トークン量を一定に保った場合の話であり、かなり寛大な仮定だ。インデックス実行で測定されたGrok 4.7の冗長さは、Solの3倍だった。出力量にたとえ1.5倍の係数を適用するだけでも、Grokの請求額はSolの$320.00に対して$330.00になり、そこから差はさらに広がる。より安い出力単価は、キャッシュと冗長性が重なると通用しない。キャッシュだけでもかろうじて通用するにすぎない。

ここで述べていることは、OrcaRouter経由でのどちらかのモデルの価格についての主張ではありません——どちらも当社のカタログには載っていません。GPT-6 SolはOpenAI自身のAPI経由で、Grok 4.7はxAI経由で利用できます。Grok 4.6を含むGrokシリーズの残りは、当社経由でルーティングできます パススルーモデルの下、xAIの定価にて。この計算の要点は、あなたが書くエスカレーションルールは、料金表ではなく、あなた自身のトラフィックにおける完了タスクあたりのコストに基づくべきだということです——そして、2つ目の契約を交わすことなくそのルールを検証できるようにするのが、ルーティングレイヤーなのです。

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

それぞれの居場所

• 大量・キャッシュ済みコンテキストのエージェント作業 — GPT-6 Sol。キャッシュ入力の項目はSolが2.5倍有利で、出力量の項目はGrokのそれを上回る不利さであり、しかも両者は相乗的に効いてくる。

• リリースで公表されているTerminal-Benchの改善が最も強いコーディング作業 — Grok 4.7はその数値を持つモデルで、しかもその数値は大きい。トークン分の予算だけを考え、レートは気にしないでください。

• 500,000トークンを超える長文書 — GPT-6 Sol、そして{{1}}これは{{/1}}僅差{{1}}ではない{{/1}}。Grokのウィンドウは、Solの半分で終わる。

• レイテンシーに敏感なパス — どちらでもない。Artificial AnalysisはGrok 4.7を毎秒39.2出力トークンと記載しており、これを著しく遅いと評している。より優れていると決めつける前に、現在のボードでSol自身の速度の数値を確認せよ。

• 「だからGrokのほうが安い」で終わるトークン単位の比較を見せられたなら——それは一歩早すぎる終わり方だ。次のステップはトークン数だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新