「Grok 4.7 vs Claude Opus 5」と読めるタイトルカード、サブ見出しは「価格差は現実だ。同等性はそうではない」、そして3枚のカード:AA Index v4.3.2 は46 vs 51、100万トークンあたりの価格は$2/$6 vs $5/$25、Terminal-Bench 4.0 は26 vs 49。
Guides & Insights

Grok 4.7 vs Claude Opus 5:価格差は本当だが、同等性はそうではない

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok 4.7 は、入力トークン100万あたり2.00ドル、出力トークン100万あたり6.00ドルで呼び出せる。Claude Opus 5 は5.00ドルと25.00ドルで呼び出せる。これは出力で4.2倍の差だ——ベンチマークを開く前に、通常なら比較に決着をつけてしまう類の隔たりである。しかし、この比較は決着しない。両モデルが現在スコアを付けられている Artificial Analysis Intelligence Index のバージョン——2026年9月19日に公開された改訂版 v4.3.2——では、Claude Opus 5 が51、2026年9月21日にベンダーからリリースされた Grok 4.7 が46に位置する。5点差は一方的な圧勝ではないが、その5点の中身はこうだ。Opus 5 はそのインデックスの10項目の評価のうち8項目で勝っている。より安価なモデルの売りは価格であり、コンテキストは互角で、Grok 4.7 の価格優位が最も重要になるはずだった唯一の場面こそ、それが消える場面なのだ。

2つのフラッグシップ、大きく異なる価格体系

Claude Opus 5 は2026年7月24日から市場に投入されており、AnthropicのOpusティアのフラッグシップで、同社のラインナップではClaude Fable 5.1の下に位置します。コンテキストウィンドウは1Mトークンで料金は一律——Anthropicは、90万トークンのリクエストも9千トークンのリクエストと同じトークン単価で課金され、長文コンテキストの割増は一切ないと明言しています——最大出力は128Kで、Message Batches APIでは300Kまで拡張できます。思考は適応型でデフォルトで有効、エフォートの段階はlow、medium、high、xhigh、maxで、デフォルトはhighです。重みは非公開です。

Grok 4.7は登場から1日しか経っていない。500kトークンのコンテキストを保持し、テキストと画像を入力として受け取ってテキストを返し、独自の推論エフォート調整機能を備えている。その定価は、プロンプトトークンが200k未満では100万トークンあたり入力$2.00、出力$6.00で、その閾値以上では$4.00と$12.00に上がる。キャッシュ読み取りは同じ2つの価格帯で$0.50と$1.00だ。xAIはまた、約2倍の出力速度を約2倍の価格で実現する高速バリアントも掲載しているが、その構成は公開された速度測定値が添付されないまま出荷された。ここでもウェイトは非公開で、この比較の双方から「自分で動かす」という逃げ道をなくしている。

独立取締役会は近しくもなく、お世辞にも褒められたものではない

これらのモデルはどちらも、エージェント、コーディング、一般知識、科学的推論を網羅する10の評価を組み込んだArtificial Analysisのv4.3.2インデックスでスコア化されている。2つの列を並べて見ると、その5ポイントという見出しの数字は、より安価なモデルにとって寛大に映る——複合スコアにおけるたった5ポイントの差は多くを覆い隠し得るが、ここではそれがほぼ全勝を覆い隠している。

複合知能 — Grok 4.7(xhigh):Artificial Analysis Intelligence Index v4.3.2 で 46。Claude Opus 5(適応的推論、最大エフォート):同一リビジョンで 51。

高度な推論 — Grok 4.7:Humanity's Last Exam 43、CritPt 18。Claude Opus 5:HLE 55、CritPt 29。それぞれ12ポイント差と11ポイント差で、いずれもOpus 5が優位。

エージェント型ターミナル — Grok 4.7:Terminal-Bench 4.0 で 26。Claude Opus 5:49。これはこのボード上で最大の単一ギャップであり、しかもそれは実際の自律作業に最も近いベンチマークにおけるものだ。

職場の自動化 — Grok 4.7:AutomationBench-AA 66%。Claude Opus 5:57%。Grok 4.7の明確な勝利の1つ、そして本物の勝利だ — エージェントがガードレールに抵触せずにワークフローを完了できるかを評価するベンチマークでの9ポイント差。

知識と誠実さ — Grok 4.7:AA-Omniscience 32。Claude Opus 5:37。どちらのモデルもハルシネーションを起こすが、この指標では Opus 5 のほうが少ない。

ロングコンテキスト — Grok 4.7:AA-LCR v1.1 77%、ウィンドウ500kトークン。Claude Opus 5:79%、ウィンドウ1Mトークン。

インデックスの実行コスト — Grok 4.7:評価全体で2億4,000万出力トークン。Artificial Analysisにより異常に冗長であると指摘。Claude Opus 5:1億4,000万。Grok 4.7は、より低いスコアに到達するために1.7倍のトークンを消費している。

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Grok 4.7の価格優位性が死に絶える場所

これが、料金表が隠している計算だ。現実的なエージェント型リクエストを考えよう。入力30kトークン、出力8k。Grok 4.7は入力$0.06、出力$0.048 — 約11セント。Claude Opus 5は入力$0.15、出力$0.20 — 約35セント。これは紛れもない3倍であり、この規模ではGrok 4.7がコストだけを見れば明らかな選択だ。

次に、Grok 4.7 自身のマーケティングの中心に据えられているリクエスト、つまり長コンテキストのエージェントセッションを取り上げよう。プロンプトを 200k トークン超まで押し上げると、Grok 4.7 の料金は倍になり、入力 $4.00、出力 $12.00 になる。Claude Opus 5 は動かない — その 1M ウィンドウは入力 $5.00、出力 $25.00 の定額で課金される。入力 250k、出力 8k では、Grok 4.7 は入力 $1.00、出力 $0.096 で、およそ $1.10。Opus 5 は入力 $1.25、出力 $0.20 で、およそ $1.45。その差は 3 倍からおよそ 1.3 倍へと縮まった。さらに押し進めよう — 400k、500k、Grok 4.7 のウィンドウの上限まで — そうすれば Opus 5 の定額はさらに差を詰め続け、一方でそのウィンドウは 100 万トークンまで伸び続ける。Grok 4.7 は短いプロンプトでは安価なモデルであり、長いプロンプトでは価格面でほぼ互角だ。これは、料金ページが作り出そうとしている直感を逆転させる。

この話を誠実に保つには、2つの注意点がある。第一に、ロングコンテキスト階層はxAI自身のモデルドキュメントに記載された定価体系であり、測定値ではない — 実際の請求額はキャッシュに左右され、そしてGrok 4.7の$0.50というキャッシュ読み取り料金は本当に安い。第二に、Artificial AnalysisはGrok 4.7の速度測定値をまだ公表していない。そのため、「安くて速い」という主張のうち「より速い」という半分は、現時点では未検証である。測定されているのはOpus 5で、毎秒59トークン、最初のトークンまでの時間は49秒である — 遅く、高価で、ほぼすべての品質軸で先行している。

実際にルーティングすることになるもの

これは、正直な答えがワークロードによって変わる比較であり、それに基づいて行動するための最も安価な方法はルーターですClaude Opus 5 は OrcaRouter で利用できます。プロバイダーの価格を0%のマークアップでそのまま反映した専用のモデルページに掲載されているため、当社のカタログにある Opus 5 の $5.00 と $25.00 は Anthropic の定価であり、マークアップされた価格ではありません。Anthropic が価格を変更すれば、同じキーで当日中に数字が変わります。Grok 4.7 は本稿執筆時点で OrcaRouter のカタログには含まれていません。今日それを呼び出すには、xAI 自身の API と、それを扱うサードパーティのプラットフォームを経由することになります。この非対称性は、それを前提に設計する前に知っておく価値があります。

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

数字から導かれるルーティングパターンは単純明快だ。長いコンテキストを扱う推論重視の作業やターミナルエージェントの作業は Opus 5 に送る——Terminal-Bench 4.0 で23ポイント差をつけて勝利し、同じ価格で2倍のウィンドウを備える。これはまさに困難で長時間のジョブの姿そのものだ。大量の自動化やワークフロー処理は Grok 4.7 に送る。AutomationBench-AA で9ポイント差をつけて勝利し、短いプロンプトならコストは3分の1で済む。両方ともカタログに入っていれば単一のエンドポイント経由で到達できるため、この振り分けは二つ目のベンダー契約ではなくルーティングルールであり、自動フェイルオーバーによって一方の経路のレート制限は障害ではなくルーティングのイベントになる。ワークロードが本当に両方を必要とする場合——安価な一次パスと高価な検証パス——ルーティング DSL はそれらを二つの統合ではなく単一の呼び出しに組み上げる。

評決

証拠に基づいて選ぶなら、この対決はClaude Opus 5の勝ちであり、しかも僅差ではない。10件の評価のうち8件、最も差が開いた2項目、同一価格で2倍のコンテキスト、そしてより高いスコアを、3分の2をはるかに下回るトークン予算で達成している。5点満点の総合スコアは、その圧倒的な優位を言い尽くせていない。Grok 4.7の主張の根拠は、その価格表が示唆するよりも狭いが、空でもない。ほとんどのアプリケーションが実際に使うプロンプトサイズでは本当に安く、自動化向けモデルとしてはこちらが優れており、そして登場からまだ1日しか経っておらず、ベンダーのベンチマークスイートは今も独立した再現の途上にある。コストに敏感な自動化にはこれを選び、Artificial Analysisが数値を公開した際にはその速度に注目し、長文コンテキストの価格帯を、安価なモデルが安価なままでいられるかを決める要因として扱うべきだ。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新