記事「Grok 4.7 vs Grok 4.6 — 同じ価格、異なるモデル」用に生成されたヒーロータイトルカード。サブタイトルは「9月21日のリリースで実際に何が変わったのか」、統計チップは Terminal-Bench 4.0 38.0% vs 20.3%、AA Index 46 vs 44、両方とも $2/$6 と表示。
Guides & Insights

Grok 4.7 vs Grok 4.6:同じ$2/$6の価格、中身は別モデル

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

SpaceXAIはGrok 4.7を2026年9月21日に出荷しましたが、それについてまず注目に値するのは、変わらなかった点、つまり価格です。Grok 4.7の価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、これはGrok 4.6が2026年8月12日のリリース以来ずっと同じ価格です。同じ料金表、同じ50万トークンのコンテキストウィンドウ、同じテキストと画像の入力——それでいながら、エージェント作業で重要な評価において、この2つのモデルは決して互角ではありません。SpaceXAIが自社で公開した数値によれば、Grok 4.7はTerminal-Bench 4.0でGrok 4.6をほぼ2倍にし、38.0%対20.3%を記録しています。これがこの比較の全体像です。価格が同じまま世代が入れ替わり、その向上分のほぼすべてが1か所に集中し、Grok 4.6で本番運用チームを悩ませた部分は依然として残っているのです。

2つのモデルの間で実際に何が変わったのか

SpaceXAI自身による今回のリリースの説明は限定的であり、形容詞ではなくその輪郭を引用する価値がある。Grok 4.7はGrok 4.6よりも大規模なベースモデル上に構築されており、「完了までに数時間かかることもある」タスクを狙った、より長い強化学習ランが与えられた。同社によれば、そのランは3つの点を研ぎ澄ました。自己検証、長いコンテキストの処理、そしてGrok Bot環境内での振る舞いである。新しいアーキテクチャ、新しいモダリティ、異なるサービングスタックについての主張はない。

その捉え方が重要なのは、ベンチマークの改善がどこに現れるかを予測できるからで、実際にそれはまさにそこに現れる。何時間もかかる難しいタスクに対するより長いRLパスは、知識クイズを動かすよりも、ターミナルとリポジトリの作業をはるかに大きく動かす。Grok 4.7がGrok 4.6よりも広範なモデルになることを期待していたなら、リリースノートはそうではないと言っている——同じモデルの形であり、エージェント的作業の高難度側へさらに訓練されたものだ。

パラメータの話は、この件でベンダーによる開示ではない唯一の部分だ。マスク氏は9月上旬、Grok 4.7は約2.1兆個のパラメータを搭載しており、Grok 4.6の1.5兆個に対して40%増だと述べ、それ以来この数字は至る所で繰り返されている。これはSpaceXAIの仕様書には一度も登場していない。これはベースモデルについて広く伝えられた主張として扱い、確認済みの仕様とみなさないこと。また、アーキテクチャがスパースな場合——Grok系はそうだが——パラメータ数は提供コストや能力についてほとんど何も語らない点に留意されたい。

ソーシングラベルが添付されたベンチマークギャップ

この節のあらゆる数値は、SpaceXAIの打ち上げ資料に由来している。執筆時点で、そのいずれも独立に再現されたものはない。正直な読み方をするなら、これはたまたま異例なほど具体的な一連の主張として受け止めるべきものであり、それによって後から検証は可能になるが、今この時点で検証済みになるわけではない。

• Terminal-Bench 4.0 — Grok 4.7 38.0%(ベンダー報告)対 Grok 4.6 20.3%。今回のリリースで最大の差分であり、「より難しいタスクでのより長いRL」という主張と一致する唯一のものです。

• CursorBench 4.0 — Grok 4.7 46.3%(ベンダー報告)対 Grok 4.6 40.4%。確かな向上ではあるが、控えめなものだ — 6ポイント未満で、自律型ターミナルセッションよりも日常的なエディター作業に近いベンチマークでの話である。

• DeepSWE v1.1 — 高い推論エフォート時の Grok 4.7 は 71.0%(ベンダー報告値)、それに対し Grok 4.6 は 65.2%。これまた堅実ながら、目覚ましいものではない改善だ。

• EEBench — Grok 4.7 64.0%(ベンダー報告)。Grok 4.6 の数値はそれと併せて公表されていないため、これはアップグレードについて何も教えてくれない。

• AA-Briefcase v1.1 — プロフェッショナル・ナレッジワーク評価において、Grok 4.7 が 1,657 Elo(ベンダー報告)

リストを集合として読めば、パターンは一貫している。Grok 4.7 は、タスクが長くエージェント的である場面では明確に優れており、タスクが短い場面ではわずかに優れている。Terminal-Bench の跳ね上がりはほぼ2倍で、エディター作業の改善は1桁台のパーセンテージだ。あなたのワークロードがオートコンプリート型なら、小さな改善のために同じ $2/$6 を払っていることになる。あなたのワークロードが「2時間走らせて戻ってくる」ものなら、このリリースはまさにあなたに向けられている。

独立した測定が今のところ示していること

独立した数字が1つあり、それは誤読しやすいため慎重に述べておく価値がある。Artificial AnalysisはGrok 4.7のIntelligence Indexスコアを46と評価しており、バージョンはv4.3.2で、ボード上では655モデル中16位に位置づけている。Grok 4.6は同じ尺度で44だ。合成指数における2ポイントの差は、Terminal-Benchが示すような倍増ではなく、この不一致は矛盾というより示唆に富む。指数は推論、知識、数学、コーディングを混ぜ合わせているため、1つのエージェント的領域における大きな向上は、モデルが変えなかった他のすべてによって薄められる。

同じページにあるさらに2つの詳細は、見出しのスコアより役に立つ。第一に、{{1}}Grok 4.7{{/1}}はこのインデックスを実行する際に{{2}}2億4000万の出力トークン{{/2}}を生成したが、中央値は{{3}}9200万{{/3}}だった——これは冗長な推論モデルであり、出力100万トークンあたり$6の料金では、その冗長さは1つの明細項目になる。第二に、このインデックスの総合スコアは、それを同じ価格帯で最強クラスのモデル群の中に位置づけるが、購入者にとって実際に重要なのはこの比較である。Artificial Analysisはモデルページに{{4}}Grok 4.7{{/4}}の価格を入力済みの状態で公開していないので、そこからタスクあたりコストの数値を取ってはいけない。ベンダーの$2/$6を使うこと。

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

どちらのモデルも修正しなかった価格の崖

Grok 4.6の料金表のうち、本番運用チームが嫌悪するようになった部分がここにあり、Grok 4.7でもそれは変わらなかった。入力トークンが200,000未満では、料金は入力$2、出力$6です。それを超えると、リクエスト全体が入力$4、出力$12に再計算されます。超過分のトークンではなく、リクエスト全体が対象です。210,000トークンの呼び出しは、わずか11,000トークン多いだけで、199,000トークンの呼び出しの2倍のコストがかかります。

両モデルが500,000トークンのコンテキストウィンドウを備えていると、その崖からは簡単に足を踏み外してしまう。長コンテキストのエージェント実行とリポジトリ全体のプロンプトは、まさにGrok 4.7がチューニングの対象としたワークロードだ。つまり、このモデルの最良のユースケースは、料金の倍増を引き起こす可能性が最も高いユースケースでもある。長いエージェントセッションをよりうまく処理するからといって作業をGrok 4.7に移すなら、移した後ではなく、移す前に価格改定分を予算に組み込んでおこう。

考慮すべき速度ティアも存在します。SpaceXAIはGrok 4.7の高速版を提供しており、出力速度を2倍にし、表示価格も2倍にします。これは対話型コーディングには正当なトレードオフですが、バッチ作業には悪い取引です — 同じタスクを同じ品質でこなすのに、誰も見ていない実時間の短縮のために2倍の費用がかかるのです。

リライトなしでGrok 4.6から移行

実用的な良い知らせは、これがプラットフォーム移行ではなくモデルの差し替えだという点です。両方のモデルはテキストと画像を入力として受け取りテキストを返し、どちらも low から xhigh までの同じ推論エフォートレベルを使用し、リクエストの形式は SpaceXAI が Grok 4.5 以降提供してきたものと同じです。effort パラメータを付けて Grok 4.6 を呼び出すコードは、Grok 4.7 を呼び出すために再構成する必要はありません。

この入れ替えがタダで済まないのは、評価の場面だ。Grok 4.7 の向上は長時間のエージェント実行に集中しているので、短い単一ターンのプロンプトで組んだテストスイートではほとんど何も見えてこない——CursorBench 規模の改善だけが目に入り、アップグレードは労力に見合わなかったと結論してしまう。なのに、その正当性はあなたのスイートが決して試さないタスクの中にこそある。本当に決着をつけられる測定とは、複数ステップにわたる作業でのタスク完了だ。受け入れられたパッチ、持ち込まれたリグレッション、完了タスクあたりのツール呼び出し、そして実行が人間の救出を必要とする頻度。これこそベンダー自身の数値が指し示す軸であり、あなたのコードベースについて公表されたベンチマークがどれもカバーしていない軸なのだ。

冗長性は2番目に測定すべきものです。標準的なインデックスで2億4千万トークンを出力するモデルは、あなたのワークロードでも前世代より多くのトークンを出力することになり、出力100万トークンあたり6ドルでは、同価格でのアップグレードの価値が静かに帳消しになりかねません。コミットする前に、完了したタスクあたりの出力トークンを1週間追跡してください。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

どちらに電話しますか

この判断は本当に単純だ。モデル比較としては異例だが。Grok 4.6 は、短いターンでコストに敏感なトラフィック、つまりチャット、分類、要約、エディタ規模のコード支援では依然として正しい選択だ。そこでは Grok 4.7 の利得は小さく、その冗長さは負担になる。Grok 4.7 は、それが作られた用途、すなわち長時間にわたるエージェント型コーディングとターミナル作業において正しい選択だ。そこではタスクが何時間も走り、自己検証が仕事を終えられるか行き詰まるかの分かれ目になる。

ここで両方を動かすことは妥協ではなく、正解であり、しかも低コストで実現できます。Grok 4.6 は OrcaRouter のカタログにSpaceXAI の定価で、0% のマークアップをそのまま通した価格で掲載されているため、上記の $2/$6 の料金表がそのままお支払い額になります — そして、当社はプロバイダーの定価をマークアップせずにそのまま通しているので、ベンダーの価格変更は届いたその日に当社側でも反映されます。1 つの API キーで Grok 4.6 と200 以上の他のモデルをカバーするため、タスクに応じてトラフィックを移すのは 2 つ目の契約ではなく設定変更で済みます。Grok 4.7 を信頼する前に本番経路で試したい場合、より安全なパターンはフォールバックを Grok 4.6 に保つことです — 今日からルーティングできるモデルであり、新しいモデルが不調のときはプロバイダー間の自動フェイルオーバーでリクエストを戻せます。

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

次に見るもの

この比較に決着をつけるものは2つあり、そのどちらもまだ起きていない。1つ目はTerminal-Bench 4.0の数値の独立した再現だ。38%というのは誰かが再実行したくなるほど大きな跳躍であり、もしそれが維持されれば、エージェント型パイプラインにおけるGrok 4.7の正当性は、マーケティングではなく実力に基づいて強固なものになる。2つ目はGrokロードマップの残りの部分だ。SpaceXAIはGrok 4.8、Grok 4.9、Grok 5をこのリリースの後に公に並べており、Grok 4.6自体の寿命は約5週間だった。Grok 4.7を長期的なプラットフォームの前提として採用するのは、チームがGrok 4.5で犯した過ちを繰り返すことになる。

今のところ、同価格でのアップグレードは現実のものであり、進むべき方向性も明確だ。覚えておくべき数字は、$2/$6で、長時間にわたるターミナル作業ではおよそ2倍になる一方、それ以外ではほとんど変わらないモデルが手に入るということ——そしてそれは、世代を画する飛躍というより、具体的で有用かつ検証可能な主張なのだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新