Grok 4.5 対 GPT-6 Astra のヒーロータイトルカード。サブタイトルは「定価は6倍、請求額は3倍」、スタットカードの表示は「定価:$2.00 / $6.00 対 $10.00 / $50.00(100万トークンあたり)」、「タスクあたりコスト:$1.04 対 $3.26」、「初回トークン:10.94秒 対 342.30秒」、フッターは「ベンダー料金表および独立系データ、2026年9月23日時点」、右下隅に OrcaRouter のロゴ。
Guides & Insights

Grok 4.5 対 GPT-6 Astra:定価は6倍、請求額は3倍

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok 4.5GPT-6 Astraをそれぞれの料金表で並べると、その差はばかげているように見える。100万入力トークンあたり$2.00対$10.00、100万出力トークンあたり$6.00対$50.00だ。同じ2つをArtificial AnalysisのIntelligence Indexにかけると、差はチームが実際に議論できる程度のものまで縮まる——完了タスクあたり$1.04対$3.26。表示価格の倍率は入力で5倍、出力で8.3倍。実際のトークン数で測った請求額の倍率は3倍強。そして、この2つのモデルが最も大きく異なる次元は、そのどちらでもない。それは最初のトークンを受け取るまでの待ち時間であり、独立した測定値では10.94秒対342.30秒だ。

それがこの対決の全体を一段落でまとめたものであり、このページがどちらかへの戴冠式ではない理由でもある。GPT-6 Astra は、明確かつ再現可能な差で、より知能の高いモデルだ。Grok 4.5 は、現実ではあるものの価格表が示唆するよりもかなり小さい差で、安価なほうだ。そのほかすべて——速度、トークン効率、コンテキスト、コーディングベンチマーク——は、分かれるか、引き分けか、あるいは二つの異なる物差しで測られていることが判明する。

これらはいずれも新しいモデルではありません

はっきり言っておく価値がある。多くの比較ページは、どちらも先週登場したばかりであるかのように読めるからだ。

xAIは2026年7月8日にGrok 4.5をリリースした。これは1.5兆パラメータのV9基盤上に構築され、静的なコードだけではなく開発者セッションデータを用いてCursorと共同トレーニングされた。これが、そのエージェント型コーディングの評判の源だ。50万トークンのコンテキストウィンドウを備えている。ベンダー自身のモデル一覧には、後継2モデルと並んで今日もなお掲載されている——xAIはその後Grok 4.6とGrok 4.7をリリースした——したがってGrok 4.5は、Grok系の最上位ではなく、$2/$6の階層として扱うべきだ。

OpenAIは2026年9月3日にGPT-6 Astraを発表し、その後数日間かけて段階的に展開した。そして現在もOpenAIの旗艦モデルであり続けている。100万トークンのコンテキストウィンドウ(OrcaRouterのカタログには入力1,050,000、最大出力128,000と記載)、2026年4月30日時点の知識カットオフ、そして長期的なエージェント作業——コンピュータ操作、研究、科学・サイバーセキュリティ業務——に明確に位置づけられている。OpenAI自身の説明によれば、同社の「Critical」サイバーセキュリティ基準をクリアした初のモデルであり、そのため管理者が有効化するまでエンタープライズアクセスはデフォルトでオフになっている。

どちらも各ベンダーのAPIで一般提供されている。どちらも新規ローンチではない。今週動きがあったのは、そのうちの一方をめぐるファミリーだけで、それについては比較ではなく推奨を変えるものなので、本稿の最後で触れる。

料金表、誰も口にしないティアも含めて

• 入力、ショートコンテキスト — Grok 4.5 100万あたり$2.00 対 GPT-6 Astra 100万あたり$10.00

• 出力、短いコンテキスト — Grok 4.5 は100万あたり $6.00 に対し、GPT-6 Astra は100万あたり $50.00

• キャッシュ済み入力 — Grok 4.5 は100万トークンあたり$0.30、GPT-6 Astra は100万トークンあたり$1.00

• ロングコンテキスト入力 — Grok 4.5 は100万あたり$4.00 対 GPT-6 Astra は100万あたり$20.00

• ロングコンテキスト出力 — Grok 4.5 は100万あたり$12.00、GPT-6 Astra は100万あたり$75.00

• コンテキストウィンドウ — Grok 4.5 500,000トークン 対 GPT-6 Astra 1,000,000トークン

重要なのは、ほとんどどの比較ページにも記載されていない条項だ。Grok 4.5では、リクエストのプロンプトが200,000トークンに達すると、リクエスト全体が上位の料金区分で再計算される——xAIのドキュメントは、境界を超えたトークンだけでなく「リクエスト内のすべてのトークンについて、より高い料金で請求される」と明記している。したがって、500,000トークンのウィンドウは実在するが、そのうちおよそ上位60%は2倍の請求になる。OpenAIのAstra向け料金ページも、同じ短コンテキスト/長コンテキストの2列構造を示しているが、切り替え点がどこにあるかは明記していない。そのため、規模を拡大して使う場合に適用されるのは長コンテキスト列だと考え、境界は自分の請求書で確認するとよい。

Screenshot of xAI's own documentation page for Grok 4.5 (docs.x.ai, model id grok-4.5) captured 23 September 2026, showing 'At a glance' with Modalities Text, Image to Text, a Context window of 500,000 and Pricing of $2.00 and $6.00, supported Capabilities of function calling, structured outputs and reasoning, and a Pricing block giving Input Tokens $2.00 / 1M tokens, Cached tokens $0.30 / 1M tokens and Output Tokens $6.00 / 1M tokens, above a 'Higher context pricing' control reading 'We charge different rates for requests which exceed the 200K context window'.

Astraの数値の上には、2つのサービスレベルの倍率が乗っています。BatchとFlexは標準料金の半額で動作し、Fastモードは倍額——短いコンテキストで入力$20.00、出力$100.00です。Grok 4.5にはxAIの料金表にバッチ枠がありません。そのレバーはキャッシュ割引と、2倍の優先処理です。

これらすべてに対する当社自身の立場は、あえて地味です。OrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通しているため、上記の両方の料金表は、どちらかのベンダーが変更したその日に当社側でも有効になり、キャッシュされたトークンは満額ではなくプロバイダーのキャッシュ料金で請求されます。突き合わせるべき2つ目の数字はありません。

ワークロードの実際のコストとは

ここでは表示価格は良い目安にならない。なぜなら、2つのモデルは同じ仕事を完了するのに同じ数のトークンを使うわけではないからだ。120,000トークンのリポジトリコンテキストと25,000トークンの回答を伴うコーディングエージェントのタスクを考えてみよう。Grok 4.5では入力が$0.24、出力が$0.15で、合計$0.39。GPT-6 Astraでは$1.20と$1.25で、$2.45。6.3倍の差だ。

では、プロンプトを長コンテキストの境界線の先へ押し進めよう。入力300,000トークン、出力20,000トークンだ。Grok 4.5は$1.20に$0.24を加えた、つまり$1.44を請求する。GPT-6 Astraは$6.00に$1.50を加えた、つまり$7.50を請求する。両ベンダーが入力料金を2倍にし、Astraの出力倍率が最上位ティアで縮小するため、差は5.2倍に圧縮される。

そのどちらもArtificial Analysisが測定しているものではなく、同社の数値のほうがより有用だ。Intelligence Index全体を実行すると、完了したタスク1件あたりの平均コストは、高エフォートのGrok 4.5で$1.04、最大エフォートのGPT-6 Astraで$3.26になる。入力価格が5倍離れているのに倍率が3.1倍まで下がる理由はトークン効率にある。インデックス全体で、Grok 4.5は77Mの出力トークンを生成し、Astraは60Mだった。Astraのほうがより簡潔なモデルなので、価格で開いた差の一部を埋めている。予算書類で「5倍安い」と書き続けてきたなら、請求書に載る数字は3倍だ。

スピードは互角。レイテンシは違う。

これは私たちを驚かせた発見であり、安価なモデルこそが速いという直感に反している。

Artificial AnalysisはGrok 4.5を毎秒55出力トークン、GPT-6 Astraを58と測定している。同じインデックス改訂における5%の差であり、AA自身の要約も両方を平均より遅いと述べている——比較の中央値は毎秒74トークンだ。スループットが選択基準なら、この2つのモデルに差はつかない。勝者をでっち上げるのではなく、率直に言おう。両方について同じ方法で測定された唯一の速度数値では、両者は同等だ。

レイテンシは両者を劇的に隔てている。AAによれば、Grok 4.5の最初の回答トークンまでの時間は10.94秒、エンドツーエンドでは20.01秒。GPT-6 Astraは342.30秒、エンドツーエンドでは350.91秒だ。これはおよそ31倍であり、同期リクエストにおいては、スピナーが回り続けるのとコーヒーブレイクに出かけるのとの違いに等しい。

誰かがそれをもとに予算を組む前に、正直な注意点が2つある。第一に、これらは推論を含む数値だ——AAの「最初の回答トークンまでの時間」はモデルの思考時間を意図的に算入している——したがってこれらが示すのは難しいタスクであり、チャットの1ターンではない。第二に、これらはエフォートを揃えたものではない。Astraの公開エントリは最大エフォートで、Grok 4.5は高エフォートであり、エフォート設定はまさにこの数値を動かすつまみだ。OrcaRouter自身のGPT-6 Astraの掲載情報では、ライブトラフィック全体で最初のトークンまでの時間のp50が8.31秒、p95が10.00秒となっている。これはまったく別の測定ポイントであり、実際の本番呼び出しでの最初のトークンであって、ベンチマークタスクでの最初の回答トークンではない。この2つは比較できるものではなく、比較として同じ文に置くべきではない。

Two-column comparison scoreboard for Grok 4.5 vs GPT-6 Astra. Grok 4.5 column: AA Index 39 (high), price per 1M $2.00 / $6.00, cached input $0.30, cost per task $1.04, speed 55 tok/s, first answer token 10.94s. GPT-6 Astra column: AA Index 53 (max), price per 1M $10.00 / $50.00, cached input $1.00, cost per task $3.26, speed 58 tok/s, first answer token 342.30s. Footer: 'Index, cost, speed and latency per Artificial Analysis, index v4.3.2, read 23 September 2026. Prices per the vendors' own rate cards.'

コーディングベンチマーク:引用する前にバージョンを確認しよう

この対決を検索すれば、Terminal-Bench 2.1でのGrok 4.5の83.3%が、Terminal-Bench 4.0でのGPT-6 Astraの57.9%と対比して示されているのを見つけるでしょう。これらは同じ名前をまとった別個のベンチマークです。両者は比較できませんし、両者を並べている比較ページは何も伝えていません。

両ベンダーが公表しているコーディング関連の数値の大半は、この問題を抱えている。xAIのGrok 4.5向けシートでは、SWE-bench Pro 64.7%、Terminal-Bench 2.1 83.3%、DeepSWE 1.0 62.0%、DeepSWE 1.1 53%が報告されている。OpenAIのAstra向けシートでは、Terminal-Bench 4.0 57.9%、OSWorld 2.0 72.6%、FrontierMath Tier 4 97.6%、ARC-AGI-3 99.9%が報告されている。すべてベンダー報告であり、それらのほとんどは重複していない。

両者が真に同じハーネス上で交わる場所が一つある。Datacurve の DeepSWE v1.1 で、これはすべてのモデルを同一の mini-swe-agent スキャフォールド上で、113 個の独自かつ汚染のないタスクを通して実行する。そこでは GPT-6 Astra が 1 タスクあたりおよそ $6.52 で 74.1% を記録し、Grok 4.5 は 53% にとどまる。これがこのページ上で最もクリーンな単一の結果であり、Astra を決定的に有利にする。Grok 4.5 に固有のさらなる注意点が一つある。xAI の CursorBench の数値は、以前のコードベースがトレーニングに漏えいしていたことが判明したため、公開比較から除外された。したがって、このモデルの CursorBench の数値はいずれも使用不能として扱うべきである。

エージェント的行動とツール呼び出し

両者は同じ目的地へ異なる道筋をたどるが、その違いはスコアではなくアーキテクチャにある。

GPT-6 Astra の開発者向け機能は、あなたがオーケストレーターを構築することを前提としています。非同期ツール呼び出しをサポートしているため、ツールの完了を待つ間もモデルが他の作業を続けることは妨げられません。WebSockets を介したタスク途中のステアリングにより、実行中の処理を再起動せずに方向転換できます。また、推論エフォートは会話の途中で調整可能です。Codex ではコンテキスト保持メカニズムが追加され、以前のコンテキストを検索可能なままにしつつ、コンテキストウィンドウをまたいでノートを保持します。OpenAI 自身のシステムカードには、このモデルが前世代よりも監視しにくいと記されていると報じられており、これは監査証拠として、モデルの語りではなくツール呼び出しログとシステム状態を扱うべき理由です。

Grok 4.5のエージェント機能に関する話は、新しいプリミティブにあるというよりも、どこで訓練されたかにある。実際の複数ファイル編集とデバッグのセッションでCursorと共同訓練したことが、xAIがソフトウェアタスクにおけるトークン効率の根拠として挙げている点であり、だからこそこのモデルは汎用フラッグシップとしてではなく、コーディング環境のデフォルトとして現れる。関数呼び出し、構造化出力、ストリーミング、プロンプトキャッシュはすべてサポートされている。ツール呼び出しはOpenAI互換の形式に従っており、そのため既存のクライアントに導入するのはベースURLの変更だけで済む。

両者が同等の努力量で登場する共有された独立のエージェント型ベンチマークは存在しないため、ここで勝者をでっち上げるつもりはない。言えるのは、Astraのツール呼び出しインターフェースは長期にわたる作業において二者のうちより表現力が豊かであり、Grok 4.5のタスクあたりのトークン経済性は大量処理の作業においてより魅力的であるということだ。

Grok 4.5を選択する場合

• タスクごとのコストが判断を左右する大量または高頻度の処理を実行しており、AA Intelligence Indexで39が品質基準をクリアしている場合。

• プロンプトが200,000トークン未満に収まっています。ここがGrok 4.5の価格優位性が最も大きくなる領域であり、長文コンテキストの再価格設定は発動しません。

• キャッシュ割引を本当に活用したいなら。キャッシュされた入力トークン100万個あたり$0.30は、Astraの$1.00に対して、繰り返しプレフィックスのワークロード——長いシステムプロンプト、共有リポジトリのコンテキスト——を素早く安くします。

• 難しいタスクで1分未満の初回トークン遅延が必要で、数分にわたる待ち時間を許容できない場合。

GPT-6 Astraを選ぶなら

• タスクこそが製品であり、誤った答えの前では請求額など端数誤差にすぎない。曲線のこの端における14インデックスポイントは、マーケティング上の差異ではなく、実質的な能力差である。

• あなたは実際に50万トークンを超えて作業しています。AstraのウィンドウはGrok 4.5のおよそ2倍で、値上げ条項なしでそこに到達するのは両者のうちAstraだけです。

コンピュータ操作、ディープリサーチ、あるいはサイバーセキュリティ態勢——OpenAIのクリティカル閾値に伴う、エンタープライズではデフォルトで無効となるコントロールを含む——が必要です。

• 単純なリクエスト・レスポンス型の呼び出しではなく、非同期のツール呼び出しや実行途中でのステアリング(介入)を求めるオーケストレーターコードを書いている場合。

今週何が動いたのか、そしてそれがなぜ推奨を変えるのか

OpenAIは2026年9月22日、GPT-6 Solを100万トークンあたり2.00ドル/10.00ドル、GPT-6 Lunaを0.10ドル/0.50ドルで提供開始し、これらの料金はプロモーションではなく恒久的なものだと説明した。Solはコーディングと分析向けの中位モデルで、入力価格はAstraのおよそ5分の1だ。

それはまさにこの判断にとって重要だ。もしあなたがGrok 4.5とGPT-6 Astraを比較検討していた理由が価格だったなら、OpenAI側で公平に比較すべき相手はもはやAstraではない — Astraはフラッグシップであり、Grok 4.5が実際に競合する階層には今やSolが位置している。Grok 4.5は出力で依然Solを下回り($6.00対$10.00)、入力ではSolと並ぶ(各$2.00)ため、立場を追われてはいない。しかし今週より前に書かれた比較は、バリューモデルとフラッグシップを比べて、その結果を価格の話と呼んでいたのだ。

xAI側も同様だ。xAI自身のモデル一覧には、grok-4.5と並んでgrok-4.6とgrok-4.7が掲載されている。つまりGrok 4.5は、現在の最先端というより、モデルファミリーの中の一つの選択肢にすぎない。

Screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured 23 September 2026, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a p50 time to first token of 8.31s and p95 of 10.00s over seven days, traffic of 300.7M tokens over seven days, a 1M-token context with 128K maximum output, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, the catalogue date 2026-09-04, and the English-language interface with the language switcher on EN.

それこそが、一つを選ぶのではなくルーティングすることを選ぶ本当の論拠です。実務家の記事で繰り返し登場する2モデル構成——大量の処理は安価なモデルへ送り、難しい末尾部分は高価なモデルへエスカレーションする——はルーティングの判断であり、書き直しではなく設定として表現できるものです。OrcaRouterは両方のモデルを一つのAPIと一つのキーの背後にまとめ、プロバイダーの定価を0%のマークアップでそのまま通し、プロバイダー間の自動フェイルオーバーを備え、ルーティングDSLを使えば、しきい値を下回る作業をgrok/grok-4.5に送り、エスカレーション先はopenai/gpt-6-astraで、タスクが失敗したりサイズの閾値を超えたりしたときにエスカレーションできます。本番パイプラインをそれに賭けることなく、トラフィックのごく一部で高価な経路を試せます。

短いバージョン

GPT-6 Astraはより優れたモデルだ。その差は僅差ではなく、そうでないふりをするならこのページは無価値だろう——同じインデックス改訂で53対39、両方が受験した唯一のコーディングベンチマークで74.1%対53%。

Grok 4.5 はより安価なモデルだが、完了したタスクあたりでは、その価格表が示唆する 5~8.3 倍ではなく 3.1 倍安い。なぜなら Astra はタスクを完了するまでに費やすトークンがより少ないからだ。そして、両者について同一条件で測定された唯一の速度数値では、両者は同等だ。

決めるべきは、どちらのモデルが勝つかではない。14ポイントの指標差が、あなたの特定のワークロードにおいて約3倍の請求額に見合うかどうか——そして、その答えが送信するすべてのリクエストで同じかどうかだ。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新