
Grok 4.5とは?トップスコアではなくトークン経済性を売りにしたV9フラッグシップ
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok 4.5は、ベンダー(現在はSpaceXAIブランドで出荷・マーケティングを行っている企業)による1.5兆パラメータのMixture-of-Experts推論モデルで、2026年7月8日にリリースされた。テキストと画像を入力として受け取り、テキストを返し、500,000トークンのコンテキストウィンドウを備え、価格は入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル。これは「完了したタスクあたりのトークン数」をローンチスライドの前面に押し出したモデルであり、同ラボがその後2つの新しいフラッグシップをその上に築いたモデルでもある。
その最後の一文こそ、このページを書く必要がある理由そのものだ。「Grok 4.5」で検索すると、7月のローンチ記事が出てくる。Cursorとの提携、「Opus-class」という言葉、毎秒80トークンという主張などだ。しかし、9月下旬に開発者が実際に抱く疑問、つまりGrok 4.6とGrok 4.7が同じ定価で存在するなか、Grok 4.5をまだ何かに組み込む価値があるのか、という問いに対する明確な答えは得られない。したがって、このページはニュース記事ではなくリファレンス項目である。モデルの概要、位置づけ、測定可能な長所、測定可能な短所、そして別のものを選ぶべき人々について述べる。ここでは何もローンチとして扱われていない。実際にローンチではないからだ。
出典についてですが、このようなページでは通常以上に重要なので、以下の各数値には出所が明示されています。xAIが自社モデルについて公表した数値は、ベンダー報告として表示しています。Artificial Analysisによる数値は独立した測定値で、2026年9月23日にモデルページから直接読み取ったものです。一次情報源で確認できなかった数値については、推計するのではなく、その旨をページに記載しています。
Grok 4.5は自身のファミリー内でどこに位置するのか — そしてそれは最上位ではない
Grok 4.5 に関する報道で最もよくある間違いは、それをフラッグシップとして扱うことだ。実際、約5週間はそうだった。それ以降、xAI は 2026年8月12日に Grok 4.6 を、9月上旬に Grok 4.7 をリリースしており、どちらも依然として100万トークンあたり $2.00 と $6.00 の価格設定だ。Grok 4.5 は今やスタックの中間に位置する。低価格帯より高性能で、最前線からは2世代遅れており、そして — ここが重要な点だが — 現在の Grok ラインで唯一、キャッシュ入力料金が後継モデルより安いモデルである。xAI 自身の価格表によれば、Grok 4.5 のキャッシュ料金は100万トークンあたり $0.30、Grok 4.6 と Grok 4.7 はいずれも $0.50 でキャッシュされる。
こちらが、ベンダーの価格設定ドキュメントが現在記載しているラインナップです。数値はすべて100万トークンあたりで、すべてベンダー公表のものです:
• Grok 4.20(3つのバリアント:マルチエージェント、推論、非推論)— 100万トークンのコンテキスト、入力$1.25 / 出力$2.50、キャッシュ$0.20、2026年3月31日出荷
• Grok 4.3 — 1Mコンテキスト、入力$1.25 / 出力$2.50、キャッシュ$0.20、さらにバッチ割引。Grokのコンテキスト100万トークンを得る最安の方法
• Grok 4.5 — 500Kコンテキスト、入力$2.00/出力$6.00、キャッシュ$0.30、2026年7月8日リリース
• Grok 4.6 — 500Kコンテキスト、入力 $2.00 / 出力 $6.00、キャッシュ済み $0.50、2026年8月12日リリース
• Grok 4.7 — コンテキスト500K、入力$2.00 / 出力$6.00、キャッシュ$0.50、2026年9月上旬リリース
• Grok Build 0.1 — 256Kコンテキスト、入力 $1.00 / 出力 $2.00、汎用モデルではなくコーディング特化型
そのリストから2つのことが導き出される。第一に、Grok 4.5はフラッグシップでなくなったときにも値下げされなかった——フラッグシップ価格のままであり、つまり、安いキャッシュ料金を特に求めているのでなければ、あるいは4.5スナップショットに固定されているのでなければ、同じ金額でGrok 4.6のほうが厳密により優れた価値を持つということだ。第二に、Grok 4.5はGrok 4.3と4.20ファミリーの半分のコンテキストしか持たず、しかも入力価格は2倍だ。その理由はV9基盤にある。1.5兆パラメータで、Grok 4.3のおよそ3倍の規模であり、より大きなベースモデルこそが、ウィンドウを犠牲にしてその能力を買い取ったものなのだ。
もし本当に必要なのが予算を抑えた長いコンテキストなら、このファミリー内で正直な答えは Grok 4.3 であり、Grok 4.5 ではない。能力とウィンドウのトレードオフこそが Grok シリーズを決定づける判断であり、より新しい数字のほうがすべてにおいて優れているふりをするよりも、それを率直に述べておく価値がある。
スペックシート

これらはxAIが自社のモデルページで公開している仕様であり、第三者による推計ではありません:
• モデル識別子 — grok-4.5、別名 grok-4.5-latest および grok-build-latest
• モダリティ — テキストと画像を入力、テキストを出力。画像は入力として受け付けられますが、モデルは画像を生成しません
• コンテキストウィンドウ — 500,000トークン。入力500Kに加えて別途出力用の枠が設けられるのではなく、プロンプトと応答の間で共有される
• ライセンス — プロプライエタリ。オープンウェイトはなく、ダウンロード可能なチェックポイントもありません。Grok 4.5 には API 経由、またはベンダー自身の製品を通じてアクセスします。
• 定価 — 入力トークン100万個あたり$2.00、出力トークン100万個あたり$6.00、キャッシュ済み入力$0.30
• 長いコンテキストの料金 — プロンプトトークンが200,000以上になると、料率は入力 $4.00 / 出力 $12.00 / キャッシュ $0.60 に上がり、この高い料率はしきい値を超えた分のトークンだけでなく、リクエスト内のすべてのトークンに適用される。これはこのページで見落とすと最も高くつく唯一の詳細である
• 推論制御 — 4つのレベル、low、medium、high、xhigh。デフォルトは high。推論を完全にオフにすることはできず、推論トークンは出力トークンとして課金されます
• ツールとフォーマットのサポート — 関数呼び出しと構造化出力はネイティブでサポートされています。サーバー側の検索ツールは、トークン使用量に上乗せして課金されます。ベンダーのモデルページでは現在の呼び出しごとの料金を確認できず、存在するということだけは確認できました。
• レート制限 — 1秒あたり150リクエスト、1分あたり5000万トークン
• Batch API — Grok 4.3 とは異なり、Grok 4.5 ではサポートされていません
• 提供リージョン — ローンチ時点では us-east-1 と us-west-2。欧州での提供は初日には明示的に利用不可であり、ベンダーは2026年7月中旬に提供開始が見込まれると説明していた。実際に提供が開始された正確な日付を裏付ける後日の一次情報源は確認できなかったため、ここではEUのタイムラインは未確認として扱う。
埋め合わせるのではなく、記録しておく価値のある不一致が1つある。OrcaRouter自身のカタログにおけるgrok/grok-4.5の項目には、キャッシュ読み取り料金が100万トークンあたり$0.50と表示されている。これはxAIがGrok 4.6およびGrok 4.7に課す料金と一致しており、ベンダーの料金表がGrok 4.5について示す$0.30とは異なる。価格に関する権威はベンダーのドキュメントにある。当社のページは後継モデルのキャッシュ料金を掲載してしまっているようであり、ここで密かに繰り返すのではなく、フラグを立てて知らせている。
Grok 4.5が測定可能なほど得意とすること
ローンチ時の目玉の主張はトークン経済性であり、ローンチページ上の主張のうち、単なるスコアではなく背後にメカニズムを伴う唯一のものだ。SWE-bench Pro において、xAI は Grok 4.5 が解決済みタスクあたり平均 15,954 出力トークンであるのに対し、最大エフォートで実行する Claude Opus 4.8 では 67,020 トークンだと報告している——同じ作業を終えるのに約 4.2 倍少ないトークン数だ。解決済みタスクあたりの出力トークンが少ないことは、より安価なモデルと、より安価でかつウォールクロック時間でより高速なモデルとの違いである。なぜなら、出力トークンこそが待たされるものだからだ。ベンダー報告であり、ベンダー自身のハーネス上で計測され、独立した誰によっても再現されていない——しかしそれはチェリーピッキングされたパーセンテージではなく、構造的な主張だ。
ベンダーのベンチマーク表は、モデルとともに公開されたもので、したがって全体を通じてベンダー報告ですが、同じモデルと比較すると次のようになっています:
• DeepSWE 1.0 — Grok 4.5 は 62.0% で、66.1% の Claude Fable 5 と 64.31% の GPT-5.5 に後れを取る一方、55.75% の Claude Opus 4.8 を上回っている
• SWE Marathon、解決率 — Grok 4.5が29.0%で、26.0%のClaude Opus 4.8と24.0%のClaude Fable 5を上回っています。Grok 4.5が首位に立った唯一のコーディングベンチマークです
• Terminal-Bench 2.1 — Grok 4.5 は83.3%、Claude Fable 5 の84.3%およびGPT-5.5 の83.4%と実質同等で、Claude Opus 4.8 の78.9%を上回っています
• DeepSWE 1.1 — Grok 4.5 は 53%、Claude Fable 5 の 70% と GPT-5.5 の 67% に後れを取っている
• SWE-bench Pro — Grok 4.5 は 64.7%、Claude Fable 5 の 80.4% と Claude Opus 4.8 の 69.2% に後れを取る
率直に読めば、Grok 4.5 は長期的なタスク解決と、タスクを完了するためのコスト効率で勝り、より難しい単発のコーディングベンチマークでは負ける。エージェントループ向きの優れたモデルであり、一発で解く難しい問題には平凡なモデルだ——そしてその区別こそ、トークン効率の数値が予測する通りのものである。

独立した全体像はより薄く、このページで注意を要するのはこの点です。Artificial Analysis は現在、Grok 4.5 (high) を Intelligence Index スコア 39、212 モデル中第52位、インデックス バージョン v4.3.2 として掲載しています。これは同等モデルの中央値 25 を上回っていますが、先頭集団には近くありません。このモデルについて 7 月の報道で 54 や 56 のスコアが引用されているのを見た場合、それを 39 と比較しないでください。Artificial Analysis はローンチ以降インデックスを改訂しており、この 2 つの数値は異なる改訂版に由来します。これはまさに、ベンチマーク表を信用できなくする種類の古い数値の比較であり、だからこそこのページではスコアと併記してインデックス バージョンを記載しています。
Grok 4.5が測定可能なほど苦手とすること
Artificial Analysisは出力速度を毎秒55.1トークンと報告しており、212モデル中126位、中央値の74を下回る — ローンチ時にxAIが公表した毎秒80トークンには遠く、現在最速のモデルが記録する毎秒約340トークンにはさらに遠い。また、最初のトークンまでの時間は10.94秒で、中央値は3.86秒だ。この2つの数字は、デフォルトで高に設定され、オフにできない推論モデルの本当のコストを物語っている。待たされ、そのうえゆっくり話すのだ。推論レベルをデフォルトのままにしておけば、Grok 4.5は手元で最も遅いモデルのように感じられるだろう。
さらに3つの、控えめながら確かなネガティブ要素を、意思決定に与えるべき影響の大きさ順に挙げます。
• Artificial AnalysisはGrok 4.5を非推奨としてフラグを立てており、それについてはデフォルトの10,000トークン入力ワークロードのみをベンチマークし続けていると述べている。それは、あなたが検討しているモデルを第三者が完全には測定しなくなったと告げていることであり、代わりにGrok 4.6を推奨している。リーダーボード上で非推奨であることは、API上で利用できないことを意味しない — それは独立したエビデンス基盤が凍結していることを意味する
• 難度の高いワンショットコーディングに最も近い2つのベンチマーク、DeepSWE 1.1とSWE-bench Proのいずれにおいても、xAI自身の表によれば、Claude Fable 5とGPT-5.5の両方に敗れている
• コンテキスト長は Grok 4.3 の半分しかないのに、入力価格は 2 倍で、バッチ API もまったくありません。ワークロードが長文書処理やオフラインのバッチ推論であるなら、Grok 4.5 は同じファミリーの中でさえ間違った選択です
ハルシネーションとキャリブレーションについては、本ページでは現在の独立した数値を確認できませんでした。7月の報道ではハルシネーション率が約54%と流布されていましたが、私たちが閲覧したArtificial Analysisのモデルページではその数値を検証できず、ベンダーのページにも記載されていません。出典を確認できない数値を繰り返すのではなく、ここでは未測定として記録しています。
誰がGrok 4.5を選ぶべきで、誰が別のものを選ぶべきか
Grok 4.5を選びましょうトークンあたりのコストよりも完了したタスクあたりのコストが重要となるエージェントループを実行しており、V9のトークン経済性の挙動が自分のワークロードで成立することをすでに計測済みである場合です。また、大規模で安定し、繰り返しヒットするプレフィックスに対して、キャッシュ入力レート$0.30のGrokファミリーのスナップショットが必要な場合にも適した選択です。このキャッシュレートはGrok 4.6やGrok 4.7が課す料金よりも確かに安く、キャッシュを多用するワークロードでは、その差が2世代分の能力を上回る可能性があります。
ほとんどすべての用途では、代わりにGrok 4.6またはGrok 4.7を選んでください。定価は同じ、500Kのコンテキストウィンドウも同じ、より新しいトレーニング、より優れた独立系スコア、そしてArtificial Analysis自身の推奨。今日「最高のGrokが欲しい」という問いに対して、答えが4.5になるバージョンは存在しません。
コンテキストが制約条件なら Grok 4.3 を選びましょう:100万トークンで $1.25 と $2.50、しかも Grok 4.5 にはないバッチ割引が付きます。長文ドキュメントの RAG やリポジトリ全体の分析は、依然としてその独壇場です。
ファミリーの外から選ぶ タスクあたりの価格ではなくピークスコアを最適化するなら。Claude Fable 5 は xAI 自身の比較表にあるあらゆるコーディングベンチマークで首位に立ち、GPT-5.5 は DeepSWE 1.0 と 1.1 で Grok 4.5 を上回っています。オープンウェイトを求め、より小さいモデルでも構わないなら、それはまったく別の買い物であり、Grok モデルはどれもそれでは太刀打ちできません。
2つ目の契約なしでGrok 4.5を呼び出す
Grok 4.5がOrcaRouter上でxAIの定価で提供開始。プロバイダーの料金はマークアップゼロでそのまま反映されるため、上記の$2.00と$6.00が実際にお支払いいただく金額となり、ベンダーの価格改定は先方に反映されたその日にこちら側にも反映されます。このモデルについては、これがいつも以上に重要です。多くの読者の目の前にある判断は「Grok 4.5か、それとも何も使わないか」ではなく、「Grok 4.5か、Grok 4.6か、Grok 4.3か」だからです。そして、同じファミリーの3つのモデルを比較することこそ、単一のエンドポイントで200以上のモデルを扱えるからこそ安く済む、まさにそのことなのです。鍵は1つ、2つ目の契約は不要、そしてA/Bテストも統合作業ではなく文字列を変えるだけで済みます。
フェイルオーバーの論拠はここでは異例なほど具体的だ。Grok 4.5 は依然としてルーティング可能だが、独立系トラッカーによる完全なベンチマーク評価の対象ではなくなり、ベンダーのフラッグシップでもなくなった――唯一の経路としてではなく、フォールバックチェーンに入れておきたいモデルだ。プロバイダーをまたぐ自動フェイルオーバーは、エコシステムがすでに乗り越え始めたスナップショットに本番ルートを賭けることなく、得意な用途で使い続けられる仕組みである。
このページは、選択が明白であるふりをすることはしない。Grok 4.5は特定の強みを持つ良いモデルだが、同じ金額で今ならより新しいモデルが手に入る系列の中にある。今日まったく新しく始めるなら、正直な推奨はGrok 4.6だ。すでにGrok 4.5をエージェントループで動かしていて、予算として見込んだトークン数でタスクを完了できているなら、正直な推奨は何も変えず、四半期後に再測定することだ。

Grok 4.5は本日OrcaRouterでルーティング可能で、Grok 4.6、Grok 4.7、Grok 4.3も同様です。OrcaRouterはプロバイダーの定価をマークアップゼロでそのまま通すため、ベンダーの価格変更は先方に反映されたのと同じ日に当社側にも反映され、2つのGrokモデル間でワークロードを移すのは2つ目の契約ではなく文字列の変更で済みます。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
