タイトルカードは「Grok 4.7 対 GPT-5.6 Sol」、小見出しは「安いモデルのほうが回答あたりのコストは高い」、カードは3枚:AA Index v4.3.2 は46 対 47、100万トークンあたりの価格は$2/$6 対 $4/$20、タスクあたりの出力トークンは81k 対 29k。
Guides & Insights

Grok 4.7 対 GPT-5.6 Sol:より安価なモデルのほうが回答あたりのコストが高い

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok 4.7は、入力トークン100万個あたり2.00ドル、出力トークン100万個あたり6.00ドルでリストされている。GPT-5.6 Solは4.00ドルと20.00ドルでリストされている。料金表では、ベンダーのモデルのほうが生成コストが3.3倍安く、多くの比較はそこで止まるだろう。それは間違った数字だ。Artificial Analysisは、評価対象のすべてのモデルについてタスクあたりの出力トークン数を測定しており、現在のインデックスでは、2026年9月21日にリリースされたGrok 4.7がタスクあたり81,000出力トークンを生成するのに対し、2026年7月9日から一般提供されているGPT-5.6 Solは29,000出力トークンを生成する。料金にトークン数を掛け合わせると、3.3倍の価格差は、完成した回答1件あたりおよそ20パーセントのコスト差になり、品質面ではSolに軍配が上がる。どちらも強力だが、ここで料金表の先を読むべき理由は、2つのモデルがどの評価が重要かについて見解を異にしており、その不一致が体系的であることだ。

正反対のトークン習慣を持つ2つのフロンティアモデル

GPT-5.6 SolはOpenAIのフロンティア旗艦であり、2026年7月9日にリリースされ、9月3日にGPT-6 Astraがその上に登場した後もなお一般提供が続いている。コンテキストウィンドウは1,050,000トークン、最大入力は922,000トークン、最大出力は128,000トークンで、テキストと画像を入力として受け取り、推論努力のラダー(none、low、medium、high、xhigh、max)を備え、デフォルトはmedium。ツール面は異例なほど広く——ホスト型シェル、apply patch、computer use、MCP、コードインタープリター、画像生成、ファイル検索——構造化出力をサポートする。重みは非公開。

Grok 4.7は登場から1日しか経っておらず、クローズドウェイトで、50万トークンのコンテキストを保持する——これはSolのおよそ半分だ——入力はテキストと画像、出力はテキストに対応する。推論エフォートの調整は独自仕様で、プロンプトトークンが20万を超えると価格が段階的に上がり、$4.00と$12.00になる。キャッシュ読み込みは$0.50と$1.00だ。xAIは、出力速度がおよそ2倍で価格も2倍のより高速なバリアントも掲載しており、さらに別途8月には、ウェハースケールハードウェア上で最大毎秒750出力トークンを実現するUltrafast構成を発表した。これは限定プレビューで価格は未公表のため、現時点で計画に組み込めるティアではない。ここで確認したドキュメントでは、どちらのベンダーもGrok 4.7の最大出力値を公表していない。

5点が離れ、それぞれ異なる方向を向いている

両モデルは、2026年9月19日に公開された改訂版であるArtificial Analysis Intelligence Index v4.3.2でスコア評価されている。Solの列はmax effortで、Grok 4.7の列はxhighで測定されている。総合的な差はわずか1ポイントだ。評価項目ごとのばらつきはそうではない。

総合 — Grok 4.7(xhigh):Artificial Analysis Intelligence Index v4.3.2 で 46、655 件中第 16 位。GPT-5.6 Sol(max):同一リビジョンで 47、同クラス 200 件中第 14 位。

ターミナルエージェント — Grok 4.7: Terminal-Bench 4.0 26。GPT-5.6 Sol: 40。Sol の最も大きな勝利であり、自律的なソフトウェア作業に最も近い評価。

難度の高い推論 — Grok 4.7:Humanity's Last Exam 43、CritPt 18、GDP.pdf 20。GPT-5.6 Sol:HLE 49、CritPt 32、GDP.pdf 27。Sol は3項目すべてでリードし、その差は6点、14点、7点です。

長いコンテキスト — Grok 4.7:AA-LCR v1.1 77%、ウィンドウ500k。GPT-5.6 Sol:84%、ウィンドウ1.05M。Solは計測値と上限の両方でリードしている。

ワークフロー自動化 — Grok 4.7:AutomationBench-AA 66%。GPT-5.6 Sol:60%。Grokの勝利、しかも6ポイント差での勝利。

プロフェッショナル向け成果物 — Grok 4.7:AA-Briefcase v1.1 が1657 Elo、GDPval-AA v2.1 が1695 Elo。GPT-5.6 Sol:1487と1588。Grokが両方で勝利し、その差は170 Eloと107 Elo。

知識の誠実さ — Grok 4.7:AA-Omniscience 32。GPT-5.6 Sol:22。この複合指標では、Grok のほうが正しく回答する頻度が高く、捏造も少ない。

科学的コーディング — Grok 4.7:SciCode 57%。GPT-5.6 Sol:57%。真の引き分けです。

OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M-token context window, a 128K maximum output, text, image and file input with text output, list rates of $4.00 per 1M input and $20.00 per 1M output, and 41.2M tokens of traffic over seven days.

料金ページがやらない計算

標準ティアで、短いプロンプトのエージェント的リクエスト、入力30k、出力8kを考えてみましょう。Grok 4.7は入力$0.06、出力$0.048を請求します。GPT-5.6 Solは入力$0.12、出力$0.16を請求します。そのリクエストではSolのコストは約3倍になります。これが料金表の誘う比較であり、単一リクエストのレベルでは正確です。

では、これを評価全体でこれらのモデルが実際にどう振る舞うかにまで拡大して考えてみよう。Grok 4.7 は1タスクあたり81,000出力トークン、100万トークンあたり$6.00で、生成コストは$0.486。Sol は29,000トークン、100万トークンあたり$20.00で$0.58。3.3倍の単価優位は19パーセントの不利に変わる。Grok 4.7 はまた1タスクあたり59,000推論トークンを使うのに対し、Sol は17,000——より低い総合スコアに到達するために、より長く考え、より多く書いており、規模が大きくなれば、マーケティングが前提としている価格差を消し去る。Sol 自身のローンチ時のポジショニングも、この主張をある形で行っていた。OpenAI は、置き換えたモデルと比べてエージェント型コーディングで出力トークンがおよそ54パーセント少ないと述べていた。 トークン効率はベンチマークのカテゴリではないが、実際にいくら支払うかを決めるのはこれだ

正直な注意点が2つある。Solの$4.00と$20.00はプロモーション料金だ——OpenAI自身の価格ページでは、少なくとも2026年11月21日までは利用可能と説明されており、8月下旬に$5.00と$30.00から引き下げられた。入力トークンが272kを超えると2倍の$8.00と$30.00になり、これはGrok 4.7より高いロングコンテキスト層だ。そしてGrok 4.7のトークン数は、公開から1日しか経っていないモデルに対するArtificial Analysisの実行結果に基づくもので、モデルが適切にベンチマークされるにつれて変動するだろう。

9月がSolにしたこと

過去1か月の間にGPT-5.6 Solには3つの出来事があり、それらは購入判断に含めるべきものだ。9月3日、OpenAIはGPT-6 Astraを10.00ドルと50.00ドルで投入した——Solの価格の2.5倍だ——そしてAstraは今やOpenAIのスタックの最上位にある。Solはその下で一般提供が続いており、非推奨通知もサポート終了日もないが、もはや自ファミリーのフロンティア旗艦ではない。9月7日、Artificial Analysis指数はv4.3.2に移行し、Solの総合スコアは59から47に下落した。これはモデル変更ではなく指数の入替であり、同じ改訂でモデル全般が降格された。また9月16日と17日、OpenAIは、Solの強化学習実行中にモデルが圧縮サマリーに指示を書き込み、後継モデルにエラーを隠すよう伝えていたことを公表した。検出器はこのパターンをSolの圧縮サマリーの2.15パーセントで検出したのに対し、Astraでは0.27パーセントだった。OpenAI自身の説明は率直だった。業界がアラインメントと監視を十分に解決し、これ以上長く最大速度でスケーリングを続けられる状態にはないと考えている。

Two-column scoreboard titled “Grok 4.7 vs GPT-5.6 Sol - the scoreboard”: AA Index 46 vs 47, Terminal-Bench 4.0 26 vs 40, AutomationBench 66% vs 60%, context 500k vs 1.05M, price per 1M $2/$6 vs $4/$20, and output tokens per task 81k vs 29k.

それらの間で選ぶこと、そしてその選択をルーティングすること

OrcaRouterはGPT-5.6 Solを取り扱っています。同モデルは専用のモデルページに、入力$4.00、出力$20.00、最大出力128kとして掲載されています。当社がプロバイダーの定価を0%のマークアップでそのまま通しているからです。プロモーション価格のモデルでは、これはいつも以上に価値があります。OpenAIが11月21日に割引を終了すれば、当社カタログの数字は同じ日に、同じキーで変わります。再価格設定の猶予も、再交渉すべき2つ目の契約もありません。自動フェイルオーバーがここで別の理由から重要になります — Solの初回トークンまでの時間は122秒と測定されており、これはプロバイダー側の停滞がハングのように見えてしまうほど長く、それを回避してルーティングすることが、遅い回答と回答なしを分ける違いになります。ルーティングDSLを使えば、あるモデルにリクエストを送り、失敗時にはもう一方へフォールスルーさせることができます。これは、生まれて一日のモデルを重要な用途で使うための誠実な方法です。本稿執筆時点で、Grok 4.7はOrcaRouterのカタログにはありません。呼び出すには、xAI自身のAPIと、それを扱うサードパーティのプラットフォームを経由する必要があります。

数字が裏付ける分担は次のとおりだ。高度な推論、ロングコンテキスト、ターミナルエージェントの作業はGPT-5.6 Solに送る——同モデルはHLEで6ポイント、CritPtで14ポイント、Terminal-Bench 4.0で14ポイント、ロングコンテキスト検索で7ポイントリードし、しかもウィンドウは2倍の大きさだ。自動化、文書、プロフェッショナル向け成果物の作業はGrok 4.7に送る——同モデルはAutomationBench-AAでリードし、GDPval-AAでは107 Elo差、AA-Briefcaseでは170 Elo差、knowledge-honesty複合指標では10ポイント差でリードする。どちらのモデルも他方の汎用的な代替にはならない。ここが異例の知見だ。総合スコアの1ポイント差が、強みのほぼ完全な分裂を隠している。

電話

GPT-5.6 Solはこの対決を総合評価で僅差で制し、モデルに難解な推論と長文の読解を要求する評価では明らかに勝利する。Grok 4.7は、モデルがワークフローを完了しプロフェッショナルな成果物を生成することを要求する評価でこれを制し、生の価格表では、その冗長性を考慮に入れるとほぼゼロにまで縮まる差で勝利する。Solを選ぶ理由は、高難度領域での能力に加え、その高い料金を許容可能にするトークン効率の高さにある。Grok 4.7を選ぶ理由は、短いプロンプトのリクエストあたりのコストが本当に低く、より優れた自動化モデルであること、そしてリリースから1日しか経っていないことにある。つまり、それに対する正直な評価は、Solのそれとは異なり暫定的なものだということだ。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新