
GPT-5.6 vs Grok 4.6:指標では互角、コンテキストと価格で分かれる
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123知能49コーディング
2026年9月上旬までに両モデルが測定されたArtificial Analysis Intelligence Indexのスケールでは、OpenAIのGPT-5.6 — そのフラッグシップ層であるGPT-5.6 Solは、gpt-5.6というAPI名がルーティングされる先である — とSpaceXAIのGrok 4.6が、同じスコア「61」を記録した。独立した指数が競合する2つのフラッグシップを同点に据えるのは、フロンティアモデルの比較では最もまれな結果であり、この対決が面白くなるのは、そこで終わるのではなく、そこから先である。同点となったモデルは、売られ方が大きく異なる。GPT-5.6 Solは、{{1}}OpenAIが7月9日にリリースし、9月3日のGPT-6 Astraローンチに伴って同社のバリュー層へ再位置づけされたフラッグシップであり、8月24日の値下げ後は、入力トークン100万件あたり4.00ドル、出力トークン100万件あたり20.00ドルで提供され、最大約105万トークンのコンテキストを読み取ることができる{{/1}}。一方、xAIが8月12日にリリースしたGrok 4.6は、2.00ドル / 6.00ドルで提供され、上限は50万トークンだ。独立した指数では同点でありながら、両モデルは1回のリクエストをどこまで拡張できるか — {{2}}そしてその拡張にかかるコスト{{/2}} — という点で分かれる。
このページが今存在するのには具体的な理由がある。2つの料金表と2つの上限が、数週間のうちに相次いで動いたからだ。Grok 4.6は8月12日にリリースされ、当初の2週間はGrok BuildとAPIに限定されていたが、8月28日にはウェブとモバイルの通常のGrokチャットでも利用できるようになった。GPT-5.6 Solのプロモーション割引は8月24日に適用され、その10日後、GPT-6 AstraのローンチによってSolは静かにフラッグシップからバリューフラッグシップへと降格した。下記の2つのモデルは、どちらも今や、Astraクラスの価格を払わずにフロンティアに近い推論を求める時に手に取るものだ——まさにそれが、61対61の同点が雑学クイズではなく生きた判断ポイントになっている理由である。
「tied at 61」が意味すること、そして意味しないこと
スコアには日付と基準(スケール)が必要だ。Artificial Analysisは、9月初旬まで使用されていたインデックススケールで、GPT-5.6 Solを約61、Grok 4.6を61と測定した。このスケールは、このブログの他のGPT-5.6対戦記事が引用しているスケールだ。その測定では、GrokはAAが追跡する202モデル中11位で、Solは同じスコアでありながらGrokから数ランク以内に位置した。その後AAは9月7日にインデックスを再調整し(v4.3)、このバージョンではスコアが圧縮される。新しいスケールではGPT-5.6 Solは47、GPT-6 AstraとClaude Fable 5.1は53と測定され、Grok 4.6の総合スコアは新しいスケールではまだ公表されていない。したがって、以下の同点は再調整前の9月スケールについての表明であり、相対的な位置として読むのが最も適切だ。両者がともにスコアされた直近のインデックスでは、この2つは同等であり、両方ともClaude Opus 5クラスのすぐ後ろに位置していた。
同点についてもう1つ注意点があり、それはこの結果の使い方に関わってきます。2つのスコアは異なる努力設定で生成されました。GPT-5.6 Solは最大推論——OpenAIの最も高いダイヤル設定(難しいリクエストでは4つの並列サブエージェントを実行)——で、Grok 4.6は高——xAIの低〜超高ダイヤルにおけるデフォルト——で生成されました。両方とも「全力を尽くす」構成ですが、同じ構成ではありません。同点は、モデルが提供するすべての設定間ではなく、これら2つの特定の設定間でのものです。同等のスコアが確立するのは、独立した複合指標において、どちらのモデルも相手陣営が指摘できるような一般的知能の優位性を持っていないということです。したがって、どちらかを選ぶ購入者は、指標の先を見て、コンテキスト、価格、そして各陣営が実際に示せる証拠を考慮する必要があります。
2つのレートカード、2つの崖
両ベンダーとも、長いプロンプトをプレミアムイベントとして請求し、閾値を一度超えるとリクエスト全体を上位ティアで請求します。これが、この価格比較をわかりやすくする共通の仕組みです。OpenAIのGPT-5.6 Solの料金は、キャッシュリードが$0.40のとき、100万トークンあたり$4.00 / $20.00ですが、リクエストがおよそ272K入力トークンを超えると、リクエスト全体が$8.00 / $30.00に再設定されます。これは、Epoch AIが9月8日に文書化した長文脈構造です。xAIのGrok 4.6の料金は、キャッシュリードが$0.50のとき、$2.00 / $6.00ですが、プロンプトが200Kトークンを超えると、リクエスト全体が$4.00 / $12.00に移行します。
• リリース — GPT-5.6:2026年7月9日(公開API。gpt-5.6エイリアスはSolティアに到達)。Grok 4.6:2026年8月12日。
• 1Mトークンあたりの定価(入力/出力) — GPT-5.6 Sol: $4.00 / $20.00、キャッシュ読み取り $0.40(プロモーション期間:少なくとも2026年11月21日まで)。Grok 4.6: $2.00 / $6.00、キャッシュ読み取り $0.50。
• 長文プロンプトティア — GPT-5.6 Sol: 約272K入力を超えると、リクエスト全体が$8.00 / $30.00に。Grok 4.6: 入力200Kでは、リクエスト全体が$4.00 / $12.00に。
• コンテキスト / 出力上限 — GPT-5.6 Sol: 入力約1.05M、出力128K。Grok 4.6: 入力500K、公表された出力上限なし。
• インデックス(独立) — GPT-5.6 Sol(最大)〜61 vs Grok 4.6(高)61、再較正前の9月スケール。
• モダリティ — テキストと画像の両方の入力を受け付け、テキストを生成します。
実際に数値を計算してみると、そのパターンは明白だ。Grok 4.6が対応できるあらゆるプロンプト長において、Grok 4.6の方が安価な選択肢となる。なぜなら、その改定後の上限価格が、依然としてGPT-5.6 Solの標準レート以下に収まるからだ。
• 入力100K / 出力8K — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56。Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25。Grokはこのリクエストでは約55%安価です。
• 400K入力 / 30K出力(入力・出力とも再価格設定済み) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10。Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96。独自の崖を考慮しても、Grokはまだおよそ半額である。
• 600K入力 / 30K出力 — GPT-5.6 Sol: 0.60 × $8 + 0.03 × $30 = $5.70。Grok 4.6: 対応不可 — 600Kは500Kのコンテキストウィンドウを超えています。この帯域ではSolが唯一の選択肢であり、その価格が割高に見えなくなります。

このクリフ(崖)形状には、GPT-5.6 Solに有利な点が1つある。Solの閾値(272K)はGrokの閾値(200K)よりも高い位置にあるため、入力がおよそ200K〜272Kの帯域では、Grokにはすでに再価格が適用されているのにSolにはまだ適用されていない。それでもその帯域では、Grokが金額面で勝る傾向がある。再価格後のGrokの出力レートは$12で、Solの標準レート$20より依然として40%低いからだ。経済性がSolに有利に傾くのは500Kトークンを超えた領域だけであり、そこはまさにGrokのコンテキストウィンドウが到達できない領域だ。プロンプトの長さが200K未満に収まるならば——ほとんどのチャット、RAG、コードアシストのトラフィックがこれに該当する——Grok 4.6はスケール時にブレンドコストでほぼ2分の1のコストで済む。さらに、クリフはリクエスト全体に適用される仕組みである以上、200Kは「緩い目安」ではなく「計画上の境界」として扱うべきだ。
Solの追加の50万トークンが実際に何のためにあるのか
Grok 4.6の500Kウィンドウは、スペックシートが示唆する以上に実際のワークロードにフィットする。コードベース全体の読み込み、長大なエージェント・トランスクリプト、大規模な検索コンテキストなどだ。さらに、公開された出力上限がないことも生成側で有利に働く。非常に長いアーティファクトを生成しなければならない単一呼び出しの場合、Grokには文書化された上限がない一方、GPT-5.6 Solは128K出力トークンで止まる。 GPT-5.6 Solの優位性は500K〜1.05Mの帯域にある。ただし、実際にその帯域を必要とするワークロードはマーケティングが示唆するより狭い。具体的には、リポジトリ全体と長いタスク履歴をコンテキスト内に保持するエージェント、非常に長い会議・調査トランスクリプトのワンパス分析、そしてGrokサイズのウィンドウにチャンク化するには大きすぎるコーパスに対する検索ジョブだ。もしどのパイプラインもこの帯域に触れないのであれば、Solの追加コンテキストは、$4.00の入力レートを支払いながらも使わないヘッドルームにすぎない。
2つのモデルは推論の進め方も異なる。GPT-5.6 Solはlow / medium / high / maxの4段階の努力量ダイヤルを備えており、maxでは4つの並列サブエージェントが動作して難しいタスクを調整する——実質的に難しいリクエスト1件につき小さなエージェント群が動く形で、強力だが出力トークンの消費が大きく、約61というインデックススコアの背景にある設定でもある。一方Grok 4.6は単一モデルで動作し、lowからxhighまでのダイヤル(デフォルトはhigh)と、検索やコード実行のためのサーバーサイドツールを備えている。そのため行動の予測がしやすく、予算管理も単純だ。リクエスト1件につきモデル1つで、レートカードからコストを見積もれる。確定的な支出を重視する開発者にとっては、Grokの単一モデル設計のほうが運用上シンプルであり、最難関の長期的タスクにはSolのmax努力量スウォームのほうが高性能な構成だ——そしてその最良スコアと最悪の請求額が同じ設定から生まれるのも、そのためである。
それぞれの側が実際に示すことができる証拠
どちらのモデルにも独立したコーディング・スコアボードでの優位性はなく、引用可能なエビデンスはベンダーごとに分かれている。OpenAIはGPT-5.6 SolがSWE-bench Verifiedで約96%を達成したと報告している。これは両モデルが示せる中で最も強力なコーディングの引用実績だが、いまだ独立した監査が公表されていない報告値だ。また、Solの実世界での強みは、CodexやChatGPTのツール環境に組み込まれている点にある。xAIはGrok 4.6がGPQA Diamondで94.9%を記録し、同ベンチマークでテストされた中で最高スコアだと主張している。さらに、包括的なタスク1件あたりのAPIコストが平均約0.84ドルというエージェント評価も引用しているが、これらはどちらもベンダー側の数値だ。速度に関しては、両者の差は価格差が示唆するほどではない。AAの測定では、Grok 4.6は標準サーバー環境で毎秒64.9出力トークン、GPT-5.6 Solも同じ60代半ばのレンジだった。なお、OpenAIが別途提供するCerebras搭載の「Ultrafast」プレビュー(最大毎秒約750トークン)は、まだ利用が制限されており価格も未設定だ。エビデンス表全体の読み方は次の通り。総合指標は互角、コーディングの実績は両者とも独立した監査なしで並び、決定を覆すような速度差もない。
2026年9月時点で、どのデフォルトが合理的か。
「Grok 4.6」を選ぶのは、トラフィックが入力200Kトークン以内に収まる場合です。対応するどの長さでも価格はほぼ半額になり、独立系の指標でもモデルは互角とされています。さらに、単一モデルに絞ったダイヤルとサーバーサイドのツールにより、請求額を予測しやすく保てます。「GPT-5.6 Sol」を選ぶのは、500K〜1.05Mトークンのコンテキスト帯域が本当に必要な場合、スタックがすでにCodexまたはChatGPTネイティブであり、報告されている約96%のSWE-bench値が調達部門へのコーディング実績の証明になる場合、あるいは最難関の長期的タスク向けに、4つのサブエージェントによる最大努力構成という選択肢が欲しい場合です。そして、2つの日付に注目してください。「GPT-5.6 Sol」の$4/$20プロモーションが保証されているのは、少なくとも2026年11月21日までです。それを過ぎれば、この比較は変わります。しかもxAIはすでに「Grok 4.7」をほのめかしています。どちらの出来事によっても、これから標準化しようとしている比較の価格設定が変わり得ます。
アーキテクチャを再設計せずに両方を実行する
指標が同点である以上、これは品質ではなく上限と価格の判断になります。そのため、多くのチームにとって実用的なパターンは「選ぶ」ことではなく「ルーティングする」ことです。GPT-5.6 Sol と Grok 4.6 はどちらも OrcaRouter 上で、各プロバイダーのリスト価格のままゼロマークアップでパススルーされています。リスト上の価格は OpenAI の $4/$20 と xAI の $2/$6 で、どちらかのベンダーが料金を変更すると、その新しい価格は同じキーで当日中に反映されます。単一の OpenAI 互換エンドポイントを使えば、以下のことができます:200K未満のトラフィックを Grok 4.6 に送信すること、Sol のより長いコンテキストまたはその max-effort 構成を必要とするプロンプトをエスカレーションすること、そして自動フェイルオーバーを使用して、あるプロバイダーパスでのレート制限を障害ではなくルーティングイベントにすること。

この比較の価格面は変動する部分です — OpenAIのSolプロモーションは11月21日までしか保証されておらず、xAIはロードマップに4.7を掲げています — そのため、このブログが更新し続けているリファレンスは、GPT-5.6 Solの価格ページであり、日付スタンプ付きで、レートカードが変更されるたびに再検証されています。

二行の答え
プロンプトが500Kトークン以内に収まるなら——実際、大半はそうだが——Grok 4.6 は、対応できるあらゆる長さで GPT-5.6 Sol と同じ独立系インデックススコアを、ほぼ半額で提供する。公開済みの出力上限はなく、単一モデルで予測可能な運用ができる。GPT-5.6 Sol がプレミアムに見合うのは、Grok が届かない領域、すなわち500Kトークンを超えるコンテキストと OpenAI のツール環境の中だ。そこでは、報告されている SWE-bench Verified 約96%というスコアに加え、その下に位置する Terra 層と Luna 層によって、単一モデルではなくモデルファミリーを手にできる。インデックスが同点である以上、この決定は能力ではなく上限と費用の問題だ。だから、契約する前に実際の最長プロンプトを測定してほしい。そのひとつの数値が勝者を決めるのだから。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
