
GPT-6 vs Grok 4.6:2つの中間ティア、200Kトークンを超えると分岐する1つの請求額
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
GPT-6 SolとGrok 4.6は、2つの列の先頭では100万入力トークンあたり$2.00、100万出力トークンあたり$6.00と同じコストがかかる。それに併記されることがほとんどないのは、両者の列がリクエスト内の異なる地点で一致しなくなるという点だ。Grok 4.6はプロンプトが200,000入力トークンを超えると長コンテキスト料金の請求を開始するが、GPT-6 Solは272,000まで待つ。これらのラインを超えると、あふれた分だけでなくリクエスト全体が再価格設定され、しかも2社はそれを逆方向に再価格設定する。これが長時間のエージェント実行の請求額を決める部分だ。GPT-6 Solとその兄弟であるGPT-6 AstraおよびGPT-6 Lunaは2026年9月22日に出荷された。SpaceXAIのラインナップの中間層であるGrok 4.6は2026年8月12日に出荷され、すでにGrok 4.7が加わっている。したがってこれは、出荷済みの2つのモデルの比較であり、どちらのローンチでもない。
2026年10月7日に変わった2つ目の事柄は、GPT-6の読み方に大きく関わります。OpenAIはGPT-6をChatGPTのメインのChatタブに展開し始めました。無料プランには10月8日に到達し、Plus、Pro、Business、Enterpriseの各プランではGPT-6 Solが、FreeとGoのプランではGPT-6 Lunaが動作します。それは表面的な変更です — 同じモデル、はるかに多くのユーザー、そしてOpenAIがIntelligent UIと呼ぶ新しいインターフェース層です。APIレートは1つも変わりません。つまり、もしあなたが「GPT-6」を何かとベンチマークしているなら、今や非常に多くの人々がブラウザのタブでも話しかけているモデルをベンチマークしていることになります。
2枚のカードが実際に異なる点
• ショートコンテキスト入力 — GPT-6 Sol 100万トークンあたり$2.00 対 Grok 4.6 100万トークンあたり$2.00
• ショートコンテキスト出力 — GPT-6 Sol 100万トークンあたり$10.00 対 Grok 4.6 100万トークンあたり$6.00
• 長いリクエストのしきい値 — GPT-6 Sol は272,000入力トークンを超えると価格が変動 対 Grok 4.6 は200,000超
• 長いリクエストの入力 — GPT-6 Sol 100万トークンあたり$4.00 対 Grok 4.6 100万トークンあたり$4.00
• 長いリクエストの出力 — GPT-6 Sol 100万トークンあたり$15.00 対 Grok 4.6 100万トークンあたり$12.00
• キャッシュされた入力 — GPT-6 Sol 100万トークンあたり$0.20 対 Grok 4.6 100万トークンあたり$0.50
• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Grok 4.6 500,000トークン
• 入力モダリティ — 両方ともテキスト、画像、ファイルを受け付けます
• ナレッジワークスコア — Artificial Analysis Intelligence Index における GPT-6 Sol 47.6 対 Grok 4.6 44.3
• Terminal-Bench 2.1 — GPT-6 Sol は同じリビジョンでは未公開 対 Grok 4.6 88.4
2つの出力行を一緒に読めば、判断の形が見えてくる。Grok 4.6は、200K未満のあらゆるリクエストで出力トークン100万あたり$4.00安く、それを超えるとわずか$3.00しか安くない。これは、見出しの40%が示唆するよりずっと小さな差だ。なぜなら、両モデルとも、境界を超えた部分ではなくリクエスト全体の価格を計算し直すからだ——この点はじっくり考える価値がある。200,001トークンのプロンプトは、高価なレートで1トークン+安価なレートで200,000トークンとして請求されるわけではないのだから。
すると今度は、しきい値自体が逆方向に働きます。Grok 4.6 は GPT-6 Sol より 72,000 トークン早く再価格設定を開始します。200K から 272K の間に一貫して収まるワークロードでは、Grok 4.6 はトークンあたりの見出し価格が安いにもかかわらず、より高価なモデルであり、2つのうち何らかの動きを見せたのはこれだけです。あなたのプロンプトがそのウィンドウのどちら側に落ちるかは、どちらの見出し価格が低いかよりも有用な問いです。

ベンチマークギャップは価格ギャップよりも小さく、狭い
Artificial AnalysisのIntelligence Indexは、ベンダーが用意した表ではなく第三者による測定ですが、そこではGPT-6 Solが47.6、Grok 4.6が44.3に位置しています。0~100のスケールにおける3.3ポイントの差は確かに存在しますが、あるタスクにとって一方のモデルが不適切で、もう一方が適切になるといった種類の隔たりではありません。また、この数値はモデルごとに特定の推論設定で測定されたものです。GPT-6 Solは設定可能なreasoning effortを公開している一方、Grok 4.6は独自のものを公開しているため、一対一の単一の数値を引用している人は、二次元のグリッド上の一点を引用しているにすぎません。
両者が本当に大きく差がつくのは、ターミナル形式のエージェント作業だ。Terminal-Bench 2.1では、Grok 4.6が88.4を記録している。GPT-6 Solには、当カタログが採用しているリビジョンにおいて比較可能な公開数値がない。空欄を正直に解釈すれば、その数値が公開されていないということであり、モデルの成績が悪かったということではない。長時間稼働するシェル駆動型エージェントが作業負荷なら、公開されている証拠はGrok 4.6に軍配を上げ、欠けている証拠はどちらの側の証拠にもならない。
長文コンテキストでの知識検索では、逆の関係が成り立つ。GPT-6 Sol は長コンテキスト想起で 83.7 を記録し、Grok 4.6 の 80.3 に対し優位に立つ。そして両モデルのベンダーはそれぞれ別の場で自社の数値を報告している——SpaceXAI は Grok 4.6 の GPQA Diamond が 94.9 だと強調し、OpenAI の GPT-6 に関する資料は主にベンダー報告によるもので、再現されていない。これを正しく保つ 2 つのルールがある。ベンダーの数値は主張であり、インデックスの数値は特定のリビジョンにおける測定値である。両者は互換ではなく、単一の「より良い」スコアに平均化すべきではない。
後継者問題
これらのどちらも、それぞれのラボの最新モデルではなく、そうでないふりをすることは、この比較がなしうる最も誤解を招くことでしょう。SpaceXAIは2026年9月21日にGrok 4.7を、同じ$2.00 / $6.00の基本料金でリリースし、Intelligence Indexは44.3から46.4へ動きました。OpenAIは2026年9月29日にGPT-6.1 Solを、これも$2.00 / $10.00でリリースし、Intelligence Indexは51.8、そして1つの料金は実際に改善しました。キャッシュ入力は100万あたり$0.20から$0.10に下がりました。Artificial Analysisは現在、GPT-6 Solのページを非推奨としてフラグを立て、読者をGPT-6.1 Solへ誘導しています。
では、公平な捉え方は「この二つのどちらを採用すべきか」ではなく、「この二つのどちらか、しかもどちら側についても、一つ新しい世代ではないと本当に言い切れるか」だ。GPT-6 Sol に留まる理由は通常、能力に関する主張ではなく、特定の8日前の統合にある。Grok 4.6 に留まる理由は、その後継がまだ公には匹敵していない、公開されたターミナルエージェントの数値だ。どちらも正当であり、どちらも期限付きだ。

1つのキーから両方を実行
両モデルはOrcaRouterによってルーティングされるため、2つの候補を生かしておくための機械的な部分にはコストがかかりません。200以上のモデルの手前にある1つのAPI、同じキー、2つ目の契約も、両者間のコード変更も不要です。これは通常時よりもここで重要です。というのも、この特定の組み合わせで2つ目のモデルを採用する根拠は、能力のヘッジではなくルーティングの判断だからです。200K~272KのウィンドウをGPT-6 Solに送り、それより短いものすべてをGrok 4.6に送れば、同じアプリケーションが、どちらのベンダーも選ばせてくれないしきい値の両側で、より安い請求になります。
自動フェイルオーバーは、同じ構成の中でも地味な方の半分です。長いコンテキストのエージェント実行が長くなるのは、まさに何かがセッションを開いたままにしているからであり、40分の時点でのプロバイダーの一時的な不調は、高くつく種類の障害です。事前に設定された2つ目のルートがあれば、それは再実行ではなく再試行に変わります。
当社のカタログでは、どちらも各プロバイダー自身の定価で掲載しており、一切上乗せしていません。そのため、どちらかのカードで料金変更があれば、プロバイダー側に反映されたその日に当社側にも反映されます。これはスローガンとしてではなく、率直に述べておく価値があります。気にするべき理由は、上記の$0.20対$0.50というキャッシュ入力の差が、ベンダーがこっそり動かすまさにその種の料金項目であり、パススルーであればリセラーが追いつくのを待つ必要が一切ないからです。

実際に決めるのは何なのか
プロンプトが短いなら、Grok 4.6 は出力価格で、どのインデックス差でも埋められないほどの差をつけて勝ち、そのターミナルエージェントスコアはどちらの列でも公表されている中で最強の数値です。プロンプトが長いなら、GPT-6 Sol のより遅い再価格設定のしきい値とより長いウィンドウは、その高い出力レートよりも価値があり、キャッシュ入力の行はコストの4分の1です。プロンプトが200Kから272Kの間にあるなら、あなたは、安く見えるモデルの方がより高くつく唯一のワークロードを抱えており、修正策はモデル選択ではなくルート選択です。
注視すべきは、どちらのモデルでもなく、すでに市場に出ている2つの後継モデルのほうだ。Grok 4.7とGPT-6.1 Solはどちらも、ここで判断を先延ばしにする理由を弱める。そして、3週間ごとに再実行しなければならない比較は、アーキテクチャ文書の中ではなく、ルーターの背後に置くべき比較だ。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
