Grok 4.7のリリース日記事用タイトルカード。見出しは「Grok 4.7 — リリース日問題」、サブタイトルは「未リリース。xAIが実際に語ったこと」。チップは3つ:「初期トレーニング完了」「SpaceXデータ投入」「マスク: 3〜4週間」。下部の注記は「約2.1Tパラメータ — 主張であり、仕様ではない」。
Guides & Insights

Grok 4.7、Artificial Analysis Intelligence Indexで46点を獲得し、SpaceXAIをトップ4に押し上げる

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok 4.7、Artificial Analysis Intelligence Indexで46点を獲得し、SpaceXAIをトップ4に押し上げる

Grok 4.7が登場した。SpaceXAIは2026年9月21日(月)にこれをリリースした——入力トークン100万あたり2ドル、出力トークン100万あたり6ドルというGrok 4.6と同じ価格で、同じ50万トークンのコンテキストウィンドウ、より新しい知識カットオフ、そして新たな最高推論レベルを備えている。CursorとGrok Buildで、ベンダー自身のAPI経由で、そしてサードパーティのコーディングハーネス、モデルルーター、クラウドプラットフォームを通じて利用できる。7月8日登場のGrok 4.5は、より安価な選択肢としてその下にとどまり、依然として打ち負かさねばならないモデルに変わりはない。Claude Fable 5.1、Claude Opus 5、GPT-5.6 SolはいずれもArtificial Analysisのv4.3.2 Intelligence IndexでGrok 4.7の上に位置しており、そこでのGrok 4.7の最初の独立スコア46は、Grok 4.6より2ポイント高く、Claude Fable 5.1より7ポイント低い。同じ評価者の長期ホライズン知識作業向けAA-Briefcaseボードでは4位につけ、3つのClaudeエントリの後ろ、xhigh effortのClaude Opus 5の前に位置し、タスクあたりのコストはClaude Opus 5のおよそ半分だ——これは今回のリリースで初めて、性能差ではなくコストパフォーマンスの勝利と読める独立した結果である。11日が経ち、状況は中心ではなく周辺で広がっている。10月1日以降、Grok自身のウェブアプリとモバイルアプリ内で順次展開されており、そこではモードピッカーが最も難しい2つの項目でこれを名指ししており、またOrcaRouterではSpaceXAI自身の2ドル/6ドルで掲載されている。

それが今回のローンチだ。より有用な数字は同じ日に、この話の中でベンダーではない唯一の評価者から届いた。Artificial AnalysisがGrok 4.7に対する最初の独立評価を公開したのであり、それは3つの部分からなる結果だ — Intelligence Indexで46、Grok 4.6をわずか2ポイント上回るだけであり、Coding Agent Indexで56、それを9ポイント上回り、AA-Briefcaseで1,657 Elo、111ポイント上回る。これら3つの数字は異なる方向を指しており、それらの間の開きこそが、このリリースで最も興味深い点だ。以下では、出荷済み仕様、各行に必要なラベルを付したベンダー自身のベンチマーク表、そして適切に読み解いた独立系スコアを示す — SpaceXAIが決して触れなかった準備態勢に関する注意点について、それらが何を語っているかも含めて。

SpaceXAIが9月21日にリリースしたもの

まず仕様から見ていきましょう。というのも、それは前モデルの仕様と異例なほど近いからです。Grok 4.7 の価格設定は Grok 4.6 とまったく同じです — 入力トークンが200,000未満の場合は、入力トークン100万あたり2ドル、出力トークン100万あたり6ドルで、リクエストがこのしきい値を超えると入力4ドル、出力12ドルに上がります。これは Grok 4.6 が導入したのと同じ構造です。コンテキストウィンドウは500,000トークンです。ナレッジカットオフは2026年5月で、Grok 4.6 の2026年2月1日より3か月後です。推論エフォートは4つのレベル — low、medium、high、xhigh — に分かれており、公表されている数値は xhigh での値です。高速版は出力速度が2倍で、価格も2倍です。

その内実として、xAIは新しいアーキテクチャではなく3つの変更を説明している。ベースモデルはGrok 4.6のものより大きい。強化学習の実行はより長く、完了に何時間もかかるタスクに重み付けされていた。そしてモデルは、自身の作業を検証し、長いコンテキストをよりよく保持するよう訓練された。これにはGrok Botハーネスに対するネイティブな理解も含まれる。同社自身の一行要約は「同等のモデルの2倍の速さで、半分の価格」だ——これは測定値ではなく競合に関するポジショニングの主張であり、そのように読む価値がある。

提供範囲は初日から広く、その後二度にわたって拡大してきた。ローンチ時点では、CursorとGrok Build、ベンダー自身のAPI、サードパーティ製コーディングハーネス、モデルルーター、クラウドプラットフォームだった。SpaceXAI自身のGrok Buildページには今や「Grok 4.7で構築を始めよう」とはっきり記されている。9月28日、Amazon Web ServicesはこれをAmazon Bedrockに追加した。同じ50万トークンのコンテキストウィンドウと同じ4段階の推論エフォートレベルを備え、クロスリージョン推論プロファイルを通じて提供されるため、このモデルはベンダーのAPIだけでなく、ハイパースケーラー自身のカタログからも利用できるようになった。続いて10月1日には、Grokのコンシューマー向けウェブアプリとモバイルアプリ内で展開が始まり、2日経った今もそこにとどまっている。この最後の一件は異例なほど静かだ。SpaceXAIはGrok 4.5で同等の段階を「Bringing Grok 4.5 to iOS, Android, Web, and X」と題したブログ記事で発表したが、Grok 4.7については何も公開していない。そのためこの変更は、宣言されたものではなく製品内で見て取れるものになっている。これは出荷されたものではなくサーバーサイドの変更であり、アプリのストア掲載情報がそれを裏付けている。GrokのiOS版とAndroid版の掲載情報はいずれも10月1日に動いた。App Storeのビルドは同日リリースされた1.4.47で、そのリリースノートは「Improvements to Chat, Voice and Imagine」にしか触れておらず、Playの掲載情報も同じ日に更新された。この変更はバイナリに組み込まれたのではなく、バックエンドからプッシュされている。この展開は文書化されているのではなく報道されているだけなので、正確な範囲は、日付入りのAWS投稿に裏付けられたBedrockへの掲載時よりも特定しにくい。しかも報道はすでにずれ始めている。これを追跡しているアカウントは今や、Grok 4.7をFast、Expert、Build、Heavyのすべてのモードにわたるベースモデルだと説明しているが、このリストはgrok.comが実際に提供している内容とは一致しない。これはベンダーの説明ではなく、追跡者たち自身の報道として読むべきだ。選ばれたサイバーセキュリティパートナーは、このモデルのレッドチーム能力への招待制アクセスを得ている。

この記事が記録として残してきた内容に、訂正が一つあります。2か月にわたって流布していたパラメータ数——およそ2.1兆、Grok 4.6の1.5兆を約40%上回る——は、依然としてどの仕様表にも載っていません。xAIはGrok 4.7のパラメータ数を公開しておらず、Artificial Analysisはモデルサイズを非公開として掲載しています。その数字はもともと創業者の主張にすぎず、今回のローンチでそれが仕様になったわけでもありません。

ベンチマーク表はxAI自身のものだ——ここにあるのはそうではないものだ

以下のリストにある数値はすべてベンダーの発表に由来するもので、独立に再現されたものは一つもない。その但し書きを付けたまま読んでほしい。これらはxAIが選んだ評価におけるxAIの数値であり、リリース当日に公開されたもので、どの製品のローンチでも最初の1週間はベンダーのベンチマークが最も信頼できない時期にあたる。比較の列も同様にベンダー自身のもので、Grok 4.6(high)、GPT-5.6 Sol(max)、Claude Fable 5.1(max)を、それぞれベンダーが選んだエフォートレベルで実行したものだ。

• CursorBench 4.0 — Grok 4.7 46.3%、Grok 4.6 40.4%、GPT-5.6 Sol 41.7%、Claude Fable 5.1 51.8%。ベンダー報告。

• DeepSWE v1.1 — 高エフォート時の Grok 4.7 が 71.0%、Grok 4.6 が 65.2%、GPT-5.6 Sol が 72.7%、Claude Fable 5.1 が 70.0%。ベンダー報告値。

• Terminal-Bench 4.0 — Grok 4.7 37.6%、Grok 4.6 20.3%、GPT-5.6 Sol 37.3%、Claude Fable 5.1 57.9%。ベンダー報告であり、改訂済み:Grok 4.7 の行はローンチ日の表では 38.0% だったが、今日ベンダーのページでは 37.6% と表示されている。

• EEBench — Grok 4.7 64.0%、Grok 4.6 53.0%、GPT-5.6 Sol 39.4%、Claude Fable 5.1 56.4%。ベンダー報告値。

• Harvey Legal Agent — Grok 4.7 19.6%、Grok 4.6 15.8%、GPT-5.6 Sol 2.5%、Claude Fable 5.1 6.7%。ベンダー報告値。

• HealthBench Professional — Grok 4.7 56.7%、Grok 4.6 48.5%、GPT-5.6 Sol 60.5%、Claude Fable 5.1 62.1%。ベンダーによる報告。

• AA Briefcase v1.1 — Grok 4.7 1,657、Grok 4.6 1,546、GPT-5.6 Sol 1,487、Claude Fable 5.1 1,678。これは表の中で唯一、もはやベンダー限定ではない行です。Artificial Analysis 自身の AA-Briefcase ボードが、xhighエフォートの Grok 4.7 について同じ 1,657 を、high の Grok 4.6 について 1,546 を公表しています。比較列は依然として、ベンダーが選ぶモデルとエフォートレベルの組み合わせです。

• GDPval Elo — Grok 4.7 1,695、Grok 4.6 1,605、GPT-6 Astra 1,542、Claude Fable 5.1 1,735。ベンダー報告値。

その結果群を正直に読めば、「Grok 4.7の勝ち」ではない。Grok 4.7は8項目すべてでGrok 4.6を上回っているが、それは後継モデルとして最低限果たすべきことだ。競合全体と比べると、評価は良し悪しが混在している。CursorBench、Terminal-Bench、EEBenchではGPT-5.6 Solを上回り、DeepSWEでは下回る。CursorBench、Terminal-Bench、HealthBench、および2つのElo形式指標ではClaude Fable 5.1に後れを取り、EEBenchとHarvey法務エージェント評価では上回る。また、ベンチマーク結果のどこまでがエフォートレベル次第なのかも示している——DeepSWEの71.0%は、ほかはxhighで示されている表の中で、highエフォートの数値だ。

安全性は、ベンダーの主張が異例なほど具体的になっている唯一の領域だ。xAIは、Grok 4.7がまったく新しいセーフガードスタック上に構築されたと述べており、拒否とジェイルブレイク耐性について同社がこれまでテストした中で最も強いモデルだと称している。LatchBioのバイオセーフティベンチマークでは62.4%を報告し、HackerBench v0.3では、リスクのあるデュアルユースプロンプトの3.3%を通過させてしまう一方で、正当なセキュリティ業務をブロックすることはほとんどないと報告している。これらはベンダー自身のリリースについてベンダーが報告した評価であり、第三者による再現はなされていない。

この記事で最初に出てくるベンダー自身によるものではない数値は、Artificial Analysisが9月21日に発表した3つであり、それらは示唆に富む形で互いに食い違っている。Intelligence Indexでは、Grok 4.7がv4.3.2スケールのxhigh effortで46を記録し、そのリーダーボードでは16位となっている。Grok 4.6の44に対してだ。この2ポイントの上昇は、Artificial Analysisによれば、SpaceXAIを同インデックスの上位4ラボに入れるのに十分なものだという。この順位は正確に読む必要がある。それはラボの最良モデルについての記述であり、このモデルについてのものではない。そしてこのモデル自体は、Claude Fable 5の50を4ポイント下回り、Claude Fable 5.1とGPT-6 Astraが同点で並ぶ53を7ポイント下回る位置にとどまっている。2ポイントの上昇は、同じモデルのエフォートレベル間に見られる範囲にも収まっている。これは、後継モデルが前世代を上回るスコアを出すことは、後継モデルが可能なことを変えることと同じではない、という注意喚起になる。この数値を読むうえでもう一点注記すると、スケールのバージョンが重要だ。なぜならArtificial Analysisは指数を改定しており、7月と8月のほとんどの報道に現れる61/62/63という値は、廃止された2026年9月以前のスケールに属するもので、これらと比較することはできない。

コーディングエージェント指数は2番目の数字であり、動いたのはこちらだ。SpaceXAI自身のGrok Buildハーネスでxhigh努力で実行すると、Grok 4.7は56を記録し、Grok 4.6の47に対して9ポイント差(2ポイントではない)で、ネイティブハーネスで評価されたモデルの中では4位となり、Claude Fable 5.1、GPT-6 Astra、Claude Opus 5に次ぎ、GPT-5.6 Solを上回る。この指数はDeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnAを303タスクで均等に重み付けした合成指標であり、3つのコンポーネントすべてが改善した:DeepSWEは65%から73%、Terminal-Benchは18%から33%、SWE-Atlas-QnAは58%から63%へ。これはxAIが説明した修正——数時間規模のタスクに重みを置いたより長い強化学習——が何かをしたという最初の独立した証拠であり、コーディングエージェントを選ぶチームが最も重視すべき数字である。なぜなら、それはベンダー自身の表ではなく、モデルが実際に出荷されるハーネスで測定されているからだ。

注意点は、その9ポイントが何を犠牲にするかだ。Artificial Analysis自身の実行では、Intelligence Index上で2億4,000万の出力トークンが生成された。これは同社が追跡するモデル群の中央値9,400万に対して2倍以上であり、Indexの1タスクを評価するコストは3.74ドルとされた。出力トークン100万あたり6ドルでは、冗長さはエージェントループが費用に見合うかどうかを決める費目であり、中央値の2倍を超える出力で買った9ポイントの向上は、無料のアップグレードではなく現実のトレードオフだ。同じ測定は、ヘッドラインのスコアを単一の評決として読むべきではないことも意味する。トークンあたりで見れば、Grok 4.7のGrok 4.6に対する優位は指数の差分が示唆するよりも小さく、Intelligence Indexを構成する一般知識評価では、実質的に同じモデルでありながら請求額が大幅に高いだけに近い。次節のAA-Briefcaseの結果はその例外であり、しかも大きな例外だ。

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

2つ目の独立したボード:AA-Briefcase、そしてタスクあたり半分のコストで何が手に入るか

Artificial Analysisは同じ日にGrok 4.7に関する3つ目の数値を公表したが、それはコードではなくナレッジワークに関するものだ。AA-Briefcase——長期的なエージェント型ナレッジワーク向けの独自ボードで、4つの数週間規模のプロジェクトシナリオと91の採点済み成果物から構成される——では、xhigh effortのGrok 4.7は1,657 Eloを記録し、ボード上で4位、Anthropicのエントリのみに後れを取る。Claude Fable 5.1のmax effort(1,678)、Claude Opus 5のmax effort(1,673)、Claude Fable 5.1のxhigh(1,669)だ。それはClaude Opus 5のmax effortに16 Elo差で及ばず、xhighではClaude Opus 5のxhigh(1,649)を8 Elo上回っている。この順位を正確に読むと、「Anthropicのモデルのみに後れを取る」というのはArtificial Analysis自身が使った表現であり、正確ではある——しかし4位は2位ではなく、その上の3行はすべて同じベンダーなのだ。

前世代からの向上幅は、今回のリリースにおける最大の単一変化です。high effort(1,546)のGrok 4.6に対して、xhighのGrok 4.7はAA-Briefcaseで111 Eloを獲得しています。これはIntelligence Indexでの2ポイントの向上の50倍以上です。Artificial Analysisは、その要因をほぼすべて分析品質に帰しています。そこではGrok 4.6の1,690に対して1,994 Eloである一方、プレゼンテーション品質はわずかに低下し、1,519に対して1,499です。これは明快な特徴です。モデルは分析についてよりよく推論し、成果物のフォーマットはわずかに悪化しています。同じ方向性は、Artificial AnalysisがAA-Briefcase-Liteについて引用した数値にも現れています。これはHugging Faceで公開した公開デューデリジェンスシナリオです。分析品質は1,698から1,994に上昇し、プレゼンテーションは1,531から1,499に低下しています。この比較には2つの注意点があります。AA-Briefcase-Liteは明示的に例示目的です。Artificial Analysis自身の方法論ページには、公開された第5シナリオは「公式のAA-Briefcase結果には算入されない」と記されています。また、それについて引用された品質数値はメインボードで公開されているxhighの行と一致するため、Liteの段落は独立したスコアボードではなく、進む方向の例示として扱ってください。

この結果が意思決定を変えるのは、コストの部分だ。AA-Briefcaseのタスクあたりコスト指標は、提出全体を実行する総コストをその91タスクで割ったものだ。Artificial Analysisが公表した総額を割ってみると、xhighのGrok 4.7ではタスクあたりおよそ9.30ドル、max effortのClaude Opus 5ではおよそ17.79ドルになる。16 Elo差で約半分だ。Artificial Analysis自身によるこの結果の要約は、Grok 4.7が「Opus 5のすぐ後ろに位置し、タスクあたりコストは約50%」というものだ。これは本稿の残りが述べているのと同じトレードオフであり、別の方向から同じ答えに到達している。Grok 4.7はフロンティアを打ち負かすのではなく、それを価格で下回る。ただし、正直な但し書きが2つある。トークン代は実際にかかる。AA-Briefcase-Liteで、Artificial Analysisはサンプルデッキを作成するAPIコストを、xhighのGrok 4.7で約8ドル、xhighのGrok 4.6で約4.40ドルとしている。したがって、後継モデルは同じ作業で、置き換えるモデルより約80%高くつく。そしてタスクあたりの数値は、代表的なキャッシュヒット率を用いて、定価でのトークン使用量から計算されている。そのため、あなたのキャッシュ状況によって変動する。これは請求額のモデルであり、あなたの請求額そのものではない。

Grok 4.7はGrok 4.6と競合の中でどこに位置するのか

• 100万トークンあたりの価格 — Grok 4.7 は入力200K未満で $2(入力)/ $6(出力)、それを超える場合は $4 / $12。Grok 4.6 も同一。

• コンテキストウィンドウ — 両方とも500,000トークン。

• 知識のカットオフ — Grok 4.7 は2026年5月、Grok 4.6 は2026年2月1日。

• 推論エフォート — Grok 4.7 の low / medium / high / xhigh と、Grok 4.6 で公表されているレベルとの比較。

• 独立スコア — Artificial Analysisのv4.3.2 Intelligence Indexにおいて、xhigh effortで46、対して44。Artificial Analysisによれば、これでSpaceXAIは同インデックスのトップ4ラボに入るに十分だという。

独立系のコーディングスコア — Artificial Analysis Coding Agent Index で 56 対 47(各モデルをネイティブハーネスで評価)。ネイティブハーネス使用モデルの中では4位で、GPT-5.6 Sol を上回ります。

• 独立したナレッジワークスコア — Artificial AnalysisのAA-Briefcaseボード上で、xhighエフォート時は1,657 Elo、これに対してhighのGrok 4.6は1,546。総合4位で、Anthropicの3エントリーに次ぎ、xhighのClaude Opus 5を上回る。

• AA-Briefcase タスクあたりのコスト — 同じボード上で、最大エフォートの Claude Opus 5 が約 17.79 ドルであるのに対し、約 9.30 ドル。16 Elo の差に対して、タスクあたりの請求額はおよそ半分。

• Index実行あたりの出力トークン数 — 2億4,000万。一方、Artificial Analysisが追跡しているモデル全体の中央値は9,400万です。この改善は無償ではありません。

• ベンダーのコーディング評価 — CursorBench 4.0 は 46.3% 対 40.4%。

• サービング速度 — Grok 4.6の標準サービングと比較して、出力速度2倍・価格2倍の高速バリアント。

• 安全性 — 新しいセーフガードスタックで、LatchBioのバイオセーフティベンチマークにおいて報告値62.4%;Grok 4.6はその主張なしで出荷された。

そして同じスコアボード上、競合陣のスコアはこうだ。Claude Fable 5.1が53、Claude Opus 5が51、GPT-5.6 Solが47、Kimi K3が44。マスク自身の予測——Grok 4.7は「Opus 5.0とほぼ同等であるべきで、5.1ではない」——に、今や数字が付いた。そしてその数字は、彼が言った通りの場所に着地した。すなわちフロンティアの下であり、上ではない。Claude Fable 5.1との測定上の差は7ポイント。一方で価格差は逆方向に開き、Claude Fable 5.1は100万トークンあたり$10/$50、Grok 4.7は$2/$6とされている——入力価格は5倍、出力価格は8倍以上だ。これがチームに迫られている実際のトレードオフであり、能力の勝利というより価格性能のトレードオフだ。AA-Briefcaseは本稿で唯一、順位が入れ替わるボードだ。そこでは、xhighにおけるGrok 4.7が同じくxhighのClaude Opus 5を1,657対1,649で上回る。とはいえ、max effort時のOpus 5の1,673には及ばず、Claude Fable 5.1の1,678にも及ばない。また、結論を出す前に3つの独立したスコアを並べて見る価値がある。なぜならそれらは同じ方向を指していないからだ。一般知能では7ポイント後れを取る一方、コーディングエージェント指数ではGPT-5.6 Solを上回り、知識作業では前身より111 Elo先行し、その向上分を出力トークンで払っている。それらの事実のうちどれがあなたの選択を決めるかは、ワークロードがコーディングエージェントなのか、知識成果物なのか、それともチャットプロンプトなのかによって変わる。そしてその切り分けのほうが、単一の順位より有用だ。

リークが正しかったこと、そして決着しなかった1つのこと

この記事が9月まで追いかけてきた成果物は本物であり、そのローンチは、それらをその種の証拠がどれほどの価値を持つかの試金石に変える。以下がその台帳だ。

• そのカタログのプルリクエストは料金を正しく当てていた。9月21日の提出は、Grok 4.7をオープンソースのエージェントクライアントのZenとGoのカタログに追加するもので、05:36 UTCに作成され、プルリクエストのテンプレートセクションが欠けていたために07:46 UTCにコンプライアンスボットによって自動クローズされ、マージされることはなかったが、そのモデルをGrok 4.6の公表料金で掲載していた。実際、それは完全に正しかった。$2/$6で、変更はなかった。しかし、結果よりも仕組みのほうが重要だ。投稿者はそのすぐ上にあるモデルから料金をコピーしており、コピーがたまたま正しい推測だった。それは運であって、権威ではない。そして同じプルリクエストの能力に関する主張も、何の情報ももたらさなかった。提案は正しくても、それだけで証拠になるわけではない。

• プロビジョニングの痕跡は本物だったが、リリースではなかった。9月16日~17日にコミュニティのトラッカーが報告した、Google Cloud Consoleのモデルクォータページ上のgrok-4.7の行と、Grok Botの設定エラーで浮上した日付付きのgrok-4-7-0907ビルドスラグは、どちらも準備中のモデルを指し示していた。どちらにも誰も日付を付けていなかったし、どちらも発表ではなかった。それらが示しているのは、サードパーティのインフラが整えられつつあったということだ。後から振り返れば、それは正確だったが、依然としてスケジュールではなかった。

• パラメータ数は一度も確認されなかった。約2.1兆、Grok 4.6をおよそ40%上回る——9月2日にマスクが繰り返し述べたが、ローンチ時のどの仕様書にも依然として記載はなかった。これはこの一連の騒動全体の中で、ベンダー側の情報源が一切ないまま事実として扱われるほど広く流布した数字の、最も明白な事例である。

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

上のカードは、この記事が最後に確認した時点のローンチ前の状態を記録している。モデルIDも、リリース日も、公開されたベンチマークもない。そこにある各行はその後、9月21日の発表によって取って代わられており、このカードがここに残されているのは、あのカードと出荷済みモデルとの間の隔たりこそがこの6週間の本当の物語だからだ——出荷当日まで確定仕様が一切生まれなかったフロンティア・ローンチである。

• 準備性に関する留保が未解決の疑問であり、今や部分的証拠が存在する。マスクは9月中旬、Grok 4.7が高難度タスクで「早すぎる終了」をし、その回答チェックが「十分に厳密ではない」と述べ、これは長い応答に対する強化学習ペナルティが高く設定されすぎているためだとし、「おそらく」と留保を付けた。ローンチ発表はこれに触れていない。xAIが示す修正は間接的だ。数時間規模のタスクに重みを置いたより長い強化学習と、より良い自己検証は、まさに早期終了に対処するために行う変更である。Coding Agent Indexの結果は、それが効果を上げたことを示す初の外部の兆候だ——56対Grok 4.6の47で、Terminal-Bench 4.0は18%から33%へほぼ倍増しており、これはまさに長い時間軸・多ステップ側の端に当たる。ただし、同じハーネスのスコアは、はるかに多くの出力トークンでその向上を買っている側面でもあるため、明快な答えではない。モデルが依然として長く難しいタスクを放棄するかどうかは、APIアクセスを持つ誰でも検証可能であり、依然として最初に検証する価値がある事柄だ。

• SpaceXのコーパスは依然として未確認だ。報じられている学習補足データ——Starlinkテレメトリ、Raptor燃焼室圧力ログ、Starship再突入テレメトリ、社内Slackスレッド、Jiraチケット、GitHubリポジトリ、ERP記録——は、Muskが述べた内容をコミュニティが報じたものであり、企業による開示ではない。ローンチ発表では、より大規模なベースモデルと、より長い強化学習の実行について述べられているが、コーパスについては何も触れていない。もしそれがそこに含まれているとしても、それを裏付ける仕様書はない。唯一の証拠となるのは、そのモデルが実際のエンジニアリング業務で、同種のモデルにはできない何かをするかどうかだ。

4度外したタイムライン、そして市場が正しく捉えたもの

Grok 4.7は、公の場で、五つの別々のタイムラインで約束され、最初の四つは期限切れになった。7月24~25日、マスクは約4週間と述べ、8月22日をほのめかした。8月12日、彼は「3~4週間」に修正し、9月2~9日をほのめかした。9月2日、彼はおよそ10日間に絞り、9月12日を指し示した。9月11日、その期限が切れた日に、彼は「あと数日」と言った。五つ目はそもそも期間ではなかった——Google Cloudのクォータページにあるgrok-4.7の行——そして、それこそが最も正確に近かった。モデルは9月21日にリリースされ、誰かが確約した最後の日付のすぐ後であり、その前に示されていた成果物には日付が添えられていなかった。

予測市場はカレンダーを正しく当て、モデルを間違えた。Kalshiの「SpaceXAIは9月18日より前にGrok 4.7をリリースする?」は9月18日03:59 UTCに取引を停止し、最後は65¢で取引され、取引高は1,785契約、オープンは1,211契約だった。両主要市場で決済された契約はすべてNoで確定した——Kalshiの8月14日、21日、28日、31日および9月4日、8日、11日のウィンドウと、Polymarketの9月12日、9月14日の契約である。Polymarketの「次のGrokモデル(4.7以上)は9月18日までにリリースされる?」は、11日間で42%から88.5%の間を推移した後、9月15日時点で64%だった。市場がツイート主導の急騰に逆張りしたのは正しく、9月18日のウィンドウが空のまま終わると見たのも正しかった。モデルについては3日早すぎたが、それは日付付き契約が価格に織り込めない唯一の事柄だ。

閲覧数は、較正用のメモとして残しておく価値がある。マスク氏の9月2日のカウントダウン、「10日後に出る」は1,029万回の閲覧を集めたが、間違っていた。同氏の9月11日の撤回投稿は205万回を集め、これも間違っていた。同氏の9月13~14日のロードマップ投稿は約199万回を集め、最も正解に近かった——同氏は、ゼロから構築したC++スタックで学習させた約2.5兆パラメータのモデルであるGrok 4.8を、Grok 4.7に対する「目に見える改善」と表現した。そのすべてを通じて、リーチが追っていたのは正確さではなく自信だった。

ロードマップの項目のうち2つは、今や予測ではなく、未解決の疑問となっている。Grok 4.8にはモデルIDも価格もコンテキストウィンドウもなく、どこにもベンチマークの登録がない。そして、Grok 4.7が静かにGrok 4.8へ「ブランド変更」されたという見方——4.7が遅れている間にマスクが4.8の名を挙げたことについてのあるメディアの解釈——は、逆の形で決着した。4.7は4.7として出荷され、IndexではGrok 4.6の44に対して46であり、これは後継者の増分であって、再出発ではない。

これは、今日Grokを利用しているチームにとって何を意味するか

実用的な状況は9月21日に変わり、それは可能な限り劇的でない形で変わった。同じ価格、同じコンテキストウィンドウ、Indexの2ポイント向上、コーディングエージェントの9ポイント向上、ナレッジワークの111ポイント向上を伴う新しいモデルIDだ。それ以降の2つの変更は見た目以上に重要だ。Grokアプリは今や、モデルを開発者だけでなく一般ユーザーに提供しており、こちら側のカタログにもそれが掲載されている。これらが合わさることで、本稿の最後で説明するルーティング層は計画からデフォルトへと変わる。コストモデルをGrok 4.6の$2/$6で構築していたなら、トークンあたりの価格はGrok 4.7でも依然として正しい。しかしトークン数は正しくない。Artificial Analysis自身の実行では、Intelligence Indexで2億4000万出力トークンを消費した。これは同社が追跡するモデル全体の中央値9400万トークンに対してのことだ。したがって、料金表が同一でも、同じリクエストのコストが2倍を優に超えることがある。これは価格表には決して現れない種類の変化だ。このリリースが無料だと結論づける前に、100万トークンあたりの料金ではなく、出力トークンで実際のエージェントループを価格計算せよ。乗り換える理由がベンダーが主張する価格性能フロンティアなら、その最強の証拠は今やベンダーの表ではなくAA-Briefcaseだ。そのボードで4位、タスクあたりコストはClaude Opus 5のほぼ半分。一方で、Claude Fable 5.1とのIntelligence Index差は7ポイント、価格差は入力で逆方向に5倍、出力で8倍以上に広がっている。そしてあなたのワークロードが特にコーディングエージェントなら、事態はIndexが示唆するより強い。Grok BuildハーネスでのCoding Agent Indexの56は、GPT-5.6 Solを上回っており、一般知能の46とは別リーグだ。それらのどちらがより重要かは、完全にあなたのワークロード次第であり、SpaceXAIの外部でGrok 4.7をあなたのワークロードで実行した者はいない。

ではOrcaRouterのカタログこれが、料金表を一切手を加えずにそのまま通すことで得られるものです。コストモデル上のトークン単価が、そのまま請求書上のトークン単価になり、このファミリーのすべてのモデルが1つのキーで扱えるため、ワークロードをGrok 4.6からGrok 4.7へ移すのは2つ目の契約ではなく文字列の変更で済みます。そのページには、50万トークンのコンテキストウィンドウと、Grok 4.6の統合がすでに対象としているのと同じOpenAI互換のサーフェス — Chat CompletionsとResponses — が掲載されています。

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

そのルーティング層は、ベンダー自身の数値と同じ日に独立系の数値が公表されたモデルを評価するうえでも、低リスクな方法でもある。上記のベンチマーク一覧は依然としてベンダー自身のものであり——ベンダーが選んだ評価、ベンダーが選んだエフォート水準、ベンダーが選んだ比較列——そのいずれも再現されていない。変わったのは、Artificial Analysisの3つのスコアがベンダーのものではないということだ。そのため問いは「これのどこかは本物なのか」から「これらの結果のどれに自分のワークロードは似ているのか」へと移った。中位の汎用知能を示す46、ネイティブハーネスのコーディングエージェントの中で4位を示す56、あるいはフロンティアのタスクあたりコストの半分でナレッジワーク4位を示す1,657である。そして経済性を決める数値は、ベンチマークではなく、1回の実行が消費する出力トークンだ。これを価格付けできるのは自分のトラフィックだけである——Artificial Analysisの測定ではIndex実行あたり2億4000万トークンで、中央値9400万トークンに対して、またその公開AA-Briefcase-Liteシナリオではサンプルデッキ1セットあたり約8ドル対4.40ドルである。自動フェイルオーバーを使えば、実際のトラフィックを新しいモデルに向け、トークン請求額や早期放棄の挙動が宣伝より悪かった場合に、それでも応答するプロバイダーへフォールバックできる——これが、実証されていないモデルを試すことと、それにパイプラインを賭けることの違いである。

まず最初に知る方法(うまくいった確認)

このセクションは以前、待っている間に注目すべきシグナルの一覧でした。待つ時間は終わったので、ここでは同じ一覧を、実際に起きたことと照らし合わせて採点します。

モデルリストこそが確認材料であり、そしてそれは動いた。この記事では6週間にわたり、ツイートではなくベンダーのモデルリストを注視するよう助言してきた。Grok 4.7が実在するその瞬間、リストには価格とコンテキストウィンドウが付与されたモデルIDが加わるはずだったからだ。実際にそうなった。grok-4.7が、500Kのコンテキストウィンドウ、入力200K未満で$2/$6、それを超えると$4/$12という価格、2026年5月の知識カットオフ、そして4段階のエフォートレベルとともに登場している。マスクが示したあらゆるウィンドウも、リリース間隔をめぐるあらゆる議論も、あらゆる市場予想日も、そのリストを動かせなかった。リリースがそれを動かしたのだ。

• サードパーティのカタログは発表に先行するが、それらはデプロイではなく提案である。9月21日のカタログのプルリクエストは、これまでで最も明確な例であり、そのクローズの経緯は示唆に富む。あるコントリビューターがモデルに向けた準備をし、2時間後にボットがテンプレートセクションの欠落を理由にその変更をクローズし、その2日後にモデルが出荷された。この種の成果物は、タイムスタンプ付きの意図として読むべきだ。それは確かに発表より上流にあるが、利用可能であることを意味するものではない。

• OrcaRouterのモデルカタログをチェック。それは今や移転しました。9月いっぱい、この記事のアドバイスは、orcarouter.ai上のgrok-4.7モデルページが「今日から当社を通して呼び出せる」というシグナルになるというものでした。モデルは、プロバイダーがオンボーディングを完了した時点で初めて掲載されるからです。カタログには現在、Grok 4.7がベンダーの料金でマークアップなしに掲載されているため、読者が実行するように言われていた確認には答えが出ました。それは今日、1つのAPIを通してルーティング可能です。

• コンシューマー側での可視性という観点では、Grokアプリは今や、APIコンソールを開くことなど決してないユーザーの目の前にGrok 4.7を押し出している。10月2日に改めて確認すると、grok.comがログアウト状態の訪問者に配信するピッカーのデータでは、4つの項目のうち2つに依然としてこのモデル名が記されている。Expertは「じっくり考える · Grok 4.7」、Heavyは「エキスパートチーム · Grok 4.7」と表示される一方、アプリがデフォルトで起動するモードであるFastは「すばやい応答」としか説明されておらず、AutoはFastとExpertのどちらかを選ぶものとされている。4つの項目はAuto、Fast、Expert、Heavyだ。Buildはそのどれでもない。Grok Buildは独立したページにある別個のターミナル製品であり、このモデルにBuildという帰属が付くのは実際にはそのページにおいてだ。そこでは訪問者に対して「今すぐインストールして、Grok 4.7でのビルドを始めよう」と呼びかけている。したがって、10月1日に出回り10月2日にも繰り返された「Grok 4.7が『Fast、Expert、Build、Heavy』全体のベースモデルになった」という主張は、アプリが提供していないモードを列挙し、アプリが起動時に開くモードを省いており、しかもそれはベンダーの見解ではなくトラッカーたちの読み方だ。SpaceXAIはこの展開について何も発信していないからである。同等のGrok 4.5の段階には専用のブログ記事があったが、今回の場合は、変わらなかったニュースページの下で静かに変わった製品があるだけだ。

現状

Grok 4.7は2026年9月21日にリリースされ、入力トークン100万あたり2ドル、出力トークン100万あたり6ドル、50万トークンのコンテキストウィンドウ、2026年5月の知識カットオフを備えていた。それ以降の11日間で変わったのは、モデルそのものではなく提供状況マップだ。Amazon Bedrockは9月28日に追加し、Grok自身のWebアプリとモバイルアプリ内では10月1日にロールアウトが始まり、10月2日時点でもそこでまだ展開中だった。そして現在はOrcaRouterにもSpaceXAI自身の料金で、上乗せなしで掲載されている。独立系スコアはローンチと同じ日に出て、今も一致していない。Artificial Analysisのv4.3.2 Intelligence Indexではxhigh effortで46、Grok 4.6を2ポイント上回り、SpaceXAIを同インデックスのトップ4ラボに入れるのに十分。Grok BuildハーネスのCoding Agent Indexでは56、Grok 4.6を9ポイント上回り、ネイティブハーネスモデルの中で4位、GPT-5.6 Solの前。AA-BriefcaseではElo 1,657、Grok 4.6を111ポイント上回り、ボード上4位で、Anthropicの3エントリに次ぎ、タスクあたりコストはClaude Opus 5のおよそ半分。ベンダーのローンチ表にあるすべてのベンチマークはベンダー自身のもので再現されておらず、例外は1つだけ。Artificial Analysis自身のAA-Briefcaseボードは同じ1,657を公表しており、ベンダーはその後、自社のTerminal-Bench行を38.0%から37.6%に下方修正した。コーディングとナレッジワークの改善は本物だが、出力トークンを食う。Index実行あたり2億4,000万トークンで中央値は9,400万、AAの公開デューデリジェンスシナリオではサンプルデッキ1セットあたり約8ドルで、比較対象は4.40ドル。これがこのリリースが安いかどうかを決める数字だ。2か月にわたって流布した約2.1兆パラメータという数字には、依然としてベンダーの出典がない。早期放棄に関する注意点も直接扱われることはなかった。ただしGrok BuildハーネスでTerminal-Benchが18%から33%へ跳ね上がったことは、修正が効いたことを示す最初の外部証拠だ。本稿が読者に注視するよう伝えた2つのシグナルはどちらも発火した。ベンダーのモデル一覧にgrok-4.7が価格とコンテキストウィンドウ付きで加わり、こちらのカタログも同じ料金で掲載している。つまり、勝ち筋は9月よりもシンプルだ。$2/$6のGrok 4.6が答えだったが、$2/$6のGrok 4.7も同じ答えであり、より新しいモデルID、より良いコーディングとナレッジワークのスコア、はるかに大きなトークン請求、そして最も難しい2つのモードでその名を挙げるコンシューマーアプリが付いてくる。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新