
Grok 4.6 対 Claude Opus 5: 同じ61、異なる二つの経済
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
Artificial Analysisは、すべてのフロンティアモデルを同じ9つの評価にかけ、その請求書を公開している。そのIntelligence Indexでは、Grok 4.6とClaude Opus 5は同じ数値— 61 —に達している。これは、総合スコアではどちらを使うべきか判断できないという珍しい直接対決となっている。それを判断できるのは、同じソースに掲載されているあまり知られていない数値だ。AA-Briefcaseのナレッジワークスイートでは、Grok 4.6は約53ターンと約5億の入力トークンでタスクを完了したのに対し、Claude Opus 5は最大努力でも同じ作業に約103ターンと20億トークンを要した。これは、主要スコアが同一である2つのモデル間のトークン消費における4対1の差であり、モデルカードの比較をやめて実際の請求書を比較し始めたときにのみ明らかになる。
両モデルとも現在のフラッグシップとして発表されたものであり、世代の不一致ではなく、クリーンな比較が可能です。Grok 4.6は、SpaceXAIから2026年8月12日にリリースされました。Grok 4.5の基盤——同じ1.5兆パラメータのMixture-of-Expertsベース——を改良し、長時間稼働するエージェントを目的として、より長い教師あり学習と強化学習の実行で再トレーニングされたものです。Claude Opus 5は、Anthropicから2026年7月24日にリリースされました。固定の日付スタンプを持つフラッグシップで、適応的思考、100万トークンのコンテキストウィンドウ、画像およびファイル入力を備えています。両者は独立したスコアボード上では同じ位置にあり、価格表では正反対の位置にあります。Grok 4.6は100万トークンあたり2ドル/6ドル、Claude Opus 5は5ドル/25ドルです。興味深いのは、この文のどちらの半分が本番環境での選択を決定づけるかを見極めることです。
4対1の効率格差を隠している61
インテリジェンス・インデックスは9つの評価を合成した複合指標であり、それが強みであると同時に盲点でもある。推論、数学、コーディング、ナレッジワークのスコアを平均した単一の数値は、モデルがどうやってその結果に至ったかを隠してしまう。そして、この2つのモデルは正反対の方法でその結果に至っている。Artificial Analysis自身のブリーフケース型プロフェッショナル知識ワークスイートは、その点を最も明確に映し出す窓である。実際の長期間にわたるタスクを測定し、Grok 4.6はタスクあたり約53ターン、0.5B入力トークン、Claude Opus 5 Maxはおよそ103ターン、2B入力トークンと記録されている。タスクごとの経済性で見ると、これは調査・作成作業を4分の1のトークンで完了するモデルと、トークンを燃やし尽くすモデルの違いである。
原因は設計上の選択であり、バグではありません。Grok 4.6は、作業を進めながら自身の成果を検証し、サブタスクが本当に完了した時点で停止するよう特別に訓練されています。xAIは、自己テストを伴う長いタスクの軌跡を訓練目標として説明しています。Claude Opus 5は、推論の深さと知識の広さに向けて訓練されており、そのデフォルトの動作は、厳密に必要な以上に深く考え、より多く参照することです。両者とも「推論モデル」ですが、労力の配分が異なります。そして、その配分こそがエージェントのワークロードにとって重要な仕様なのです。

このギャップは、モデルをループ内で呼び出すエージェント、つまり研究エージェント、数十ターンを実行するコードエージェント、夜間にバッチを処理するドキュメントパイプラインにとって最も重要です。毎ターンが課金され、すべての入力トークンは次の呼び出しで再送信する必要があるコンテキストです。0.5Bトークンで53ターンで完了するモデルは、トークンあたりのコストが安いだけでなく、各タスクについても、2Bトークンで103ターンを要するモデルよりも、定価を掛けるまでもなく、およそ一桁安いのです。
仕様書、両面
紙面上で異なる点を、各項目1行で記載してください。
• Intelligence Index — Grok 4.6 は 61 点で 184 中 6 位、Claude Opus 5 も 61 点でトップに並んでいます。Artificial Analysis によると同点です。
• 1Mトークンあたりの定価 — Grok 4.6は入力$2 / 出力$6(200K入力トークン以上のプロンプトでは$4 / $12に倍増); Claude Opus 5は入力$5 / 出力$25で、50%のバッチ割引により$2.50 / $12.50になります。
• コンテキストウィンドウ — Grok 4.6は500Kトークン、Claude Opus 5は1,000,000トークン。これは両モデルの中でも最も明確なスペック上の優位性だ。
• 最大出力 — Claude Opus 5は最大128K出力トークン(バッチAPI経由では300K)に対応しています。Grok 4.6の出力上限はそれより低く、一般的な長文回答の範囲です。
• 入力 — いずれもテキストと画像を受け付け、Claude Opus 5はファイルも受け付けます。また、Anthropicのマルチモーダル入力はドキュメント内へより直接アクセスします。
• GDPVal-AA v2(知識業務) — Grok 4.6 は Elo 1,753、Claude Opus 5 は Elo 1,852。Opus 5 が知識業務品質の王座を獲得し、ブリーフケース効率では Grok が優位でした。[Artificial Analysis]
• CursorBench v3.2 — Grok 4.6 は 69.9%、Claude Opus 5 は 70.0% で、両者が測定されたコーディングエージェントベンチマークでは実質的に互角。[Artificial Analysis]
• 推論制御 — Claude Opus 5 は、低から最大までの努力量ダイヤルと、デフォルトで有効な適応的思考を公開します。Grok 4.6 は推論努力を公開しますが、長いエージェント軌道を優先するデフォルトに調整されています。
これらを並べて比較する意義は、どちらのモデルも圧倒的ではないということだ。Claude Opus 5はスペック上ではより優れたゼネラリストだ。より長いコンテキスト、より高い出力上限、ファイル入力、より高い知識労働の質を備えている。Grok 4.6はコストパフォーマンスに優れ、より効率的なエージェントだ。残る唯一の疑問は、どちらがあなたが実際に抱えている仕事に当てはまるかということだ。

Claude Opus 5 がプレミアム価格に見合う理由
{{1}}Anthropicの発表数値 — ベンダー報告に基づくものであり、独立に再現されたものではない — では、{{/1}}{{2}}Claude Opus 5はSWE-bench Verifiedで96.0%、SWE-bench Proで79.2%、コンピューター操作のOSWorldでは70.6%を記録している。{{/2}}{{3}}総合複合指標では、その61はGrok 4.6と並び、{{/3}}{{4}}GDPVal-AAでは明確な差で先行している。{{/4}}{{5}}実際にはこれは、100万トークンの余裕を備えた1つのモデルが、ナレッジワーカーの一日の業務全般 — ドラフト作成、分析、長文書の推論、画像+テキストのタスク、コーディング — にわたって互角に渡り合える、ということを意味する。{{/5}}
コンテキストウィンドウこそが、それに手を伸ばす正直な理由である。500Kトークンの上限は大きいが、コードベース全体と研究コーパス、長いエージェントセッションの中間結果を合わせたものを収められるわけではない。非常に大きなコーパス(リポジトリ全体、1年分の財務報告書、長いPDFの束)に対して深いシングルパス分析を行うチームは、Grok 4.6の天井に突き当たり、Claude Opus 5の天井には決して達しないだろう。そうしたワークロードにとって、追加のコンテキストは贅沢品ではない。それは、作業が収まるか、上限を回避して調整するかの違いである。
Grok 4.6 の方がお買い得な場合
同じ事実を裏返せば、Grok 4.6はエージェントパイプラインにとってはるかに優れた買い物であり、その差は僅かではない。Opus 5の定価と比べると、入力は2.5倍、出力は4.2倍安く、さらにタスクごとのトークン効率がそれを増幅する。AA-Briefcaseの数値は、同じナレッジワークの成果に対して、トークンがおよそ4分の1、ターン数がおよそ2分の1で済むことを示唆している。4倍と2.5倍を掛け合わせると、Opus 5の経済性では1ドルかかるタスクが、Grok 4.6ではおよそ0.10ドルで済むことになる——Opus側のバッチ割引がその差をいくらか縮める前の話だが。
特にエージェンティックコーディングに関して言えば、Grok 4.6のDeepSWE 1.1スコアは、4.5から4.6への更新で54%から65.9%に向上し、CursorBenchスコアはOpus 5と0.5ポイント以内の差に収まりつつ、その過程で自身の作業を自己検証しています。1日あたり何千ものエージェンティックコールを実行し、各コールがマルチターンのループであるチームにとって、タスクあたりの経済性とより短いトラジェクトリは、成立する製品と資金消耗の違いを生みます。これがxAIが提示するケースであり、独立した効率性データがその方向性を裏付けています。
ルーティングの決定
これは、ルーターが本領を発揮するマッチアップです。正解は「両方、ただし分割はワークロードの形状で定義される」だからです。Grok 4.6 と Claude Opus 5 は、どちらも OrcaRouter 上で各ベンダーの定価で利用できます — grok/grok-4.6 は $2 / $6、anthropic/claude-opus-5 は $5 / $25 — マークアップは 0% なので、コストモデルに書いた数値がそのまま請求されます。分割を実用的にする仕組みは次の通りです。両モデルに共通の1つのAPIキー、長時間のエージェント実行中に一方のプロバイダーのエンドポイントが劣化した場合の自動フェイルオーバー、そして短く高ボリュームのターンを Grok 4.6 に送り、長いタイムホライズンでコンテキストを大量に消費する作業を Claude Opus 5 にエスカレーションできるルーティングDSLが、1回の呼び出しの中で完結します。2層アーキテクチャを運用するために追加の契約は必要ありません。また、実際のトラフィックデータが入ってくれば、モデルカードで推測する代わりに分割を再調整できます。

正直な読み
複合インデックスにおける同点は現実のものであり、それは罠です。同じスコアのモデルは互換性がありません。それらは、スコアでは見えないまさにその点で差別化されています。Claude Opus 5 は、広範でコンテキストが重く、文書・画像を扱う知識作業で、コストよりも1Mトークンのウィンドウと深い推論が重要となる場合の、より安全なデフォルトです。Grok 4.6 は、タスクごとのトークン効率と2.5倍の価格優位性が積み重なって桁違いの請求額の差となる、大量のエージェントループにおける、より良いデフォルトです。ワークロードが前者であれば、Opus 5 にお金を払い、価格を気にするのをやめましょう。後者であれば、紙面上の61というパリティは、Grok 4.6 を最初に試すための最高の理由です。ベンチマークは両者が同等だと言い、請求書はそうではないと言います。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
