
Claude Opus 5.5 対 Grok 4.6:一方のモデルは読み、もう一方は行動する
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Claude Opus 5.5とGrok 4.6は、50万トークンのコンテキストを保持するフロンティア級モデルを手に入れるための最も安価な2つの手段であり、しかも両者は同じ製品ではない。ある測定では、Grok 4.6は絶対的な天井からわずか3ポイント差にある。GPQA Diamondで94.9——大学院レベルの科学問題セットであり、Anthropicのフラッグシップも同じ帯域に収まっている。しかし次の測定では、38ポイントも後れを取る。モデルにシェル内で実際の作業を完了させることを求めるエージェント型ターミナルベンチマーク、Terminal-Bench 4.0で、Artificial AnalysisによるスコアはGrok 4.6が21.21%、Claude Opus 5.5が59.60%だった。これはどちらの方向の誤植でもなく、この組み合わせの全体像は、なぜ両方の数値が同時に真なのかを説明するところにある。
2つのリリース、同じ価格帯、4か月違い
SpaceXAIは2026年8月12日にGrok 4.6をリリースし、Grokラインの現行フラッグシップとして、入力トークン100万個あたり2.00ドル、出力6.00ドル、50万トークンのコンテキストウィンドウ、テキスト、画像、ファイルの入力サーフェスを備えています。Anthropicは約6週間後の2026年9月22日にClaude Opus 5.5をリリースし、4.00ドル/20.00ドル、100万トークンのコンテキストウィンドウ、128,000出力トークンを備えています。どちらも構成可能な推論エフォート、ツール呼び出し、構造化出力をサポートし、OpenAI互換のチャットサーフェスと各ベンダー独自の形式の両方に対応しています。
つまり、素朴に読めばこれは明快なトレードオフだ。Grok 4.6 は入力の価格が半額で、出力はおよそ3分の1。Claude Opus 5.5 は2倍のコンテキストウィンドウで応答する。このトレードオフは現実であり、長文書を扱う作業では、それだけが唯一重要なことかもしれない。しかし、興味深い分岐点はそこではない。なぜなら、両モデルは同じ独立系ハーネスで測定されており、エージェント型作業で重要な軸において同じ位置には収まらなかったからだ。
両方が測定された軸についてカタログが述べていること
OrcaRouterのカタログでは、行ごとにベンチマークの出所が示されています — 各数値には、それが由来する評価元の名前が付いています — そのため、以下のペアはどちらのモデルについてもすべて単一の情報源、Artificial Analysisによるものであり、片側がベンダーの数値でもう片側が第三者によるものではありません:
• GPQA Diamond — Claude Opus 5.5 は当社のカタログではこの軸に掲載されていません。Grok 4.6 は 94.9% を記録しています
• Humanity's Last Exam — Claude Opus 5.5が61.4%、Grok 4.6が42.9%
• SciCode — 66.9% 対 56.5%
• 長文脈リコール — 84.7% 対 80.3%
• Terminal-Bench 4.0 — 59.60% 対 21.21%
• AAインテリジェンス指数 — 57.6 対 44.3
GPQAの行は、ベンダーの資料から埋めるのではなく、Anthropic側で意図的に空白のままにされている。そこでのGrok 4.6の94.9は、そのカード上で最も強い数値であり、本物である——SpaceXAIの主張ではなく独立した測定——そして、モデルについて実際の何かを語っている。課題が、擁護可能な答えが一つだけの整った問いであるとき、Grok 4.6はフロンティア水準の性能を発揮する。これをTerminal-Bench 4.0の21.21%と並べて読むと、その形が見えてくる。科学について正しい答えを出すことと、実際のファイルシステムに対してシェルで5ステップのタスクを実行することは、異なる能力であり、Grok 4.6は前者のほうが後者よりもはるかに進んでいる。
その組み合わせを判定として使う前に、一つ注意点があります。両モデルのArtificial Analysisの数値は異なる評価日に記録されており、Grok 4.6のものはより古いセットです。この比較は、8月に評価されたモデルと9月に評価されたモデルの間のもので、その期間中に評価ハーネス自体も改訂されています。差の方向は5つの別々の軸で一貫しているため、私たちはこれをシグナルとして扱いますが、正確なポイント値は同日比較ではなく、8月対9月の比較として読むべきです。
どちらも売り込んでいない人が作った指数
第二の独立した指標が存在し、方向性では一致しているものの、細かな区別をつけることにははるかに消極的だ。Epoch AIが50を超えるベンチマークの複合指標として構築し、Claude 3.5 Sonnetが130、GPT-5が150となるように再スケーリングしたEpoch Capabilities Indexでは、私たちが2026年10月2日に読んだファイルにおいてClaude Opus 5.5は167.35に位置づけられている。Grok 4.6は8月12日の評価に基づき156.61だ。これは、指数の開始時に約5ポイントがMETRのタイムホライズン指標の倍増に対応すると観測されたスケール上での10.74ポイントの差であり、大きく、かつ両モデルの公表された区間164.0~172.0と154.66~158.93の余裕をもって外側にある——これらの区間はまったく重なっていない。
この指標では決着がつかない点には留意する価値がある。Claude Sonnet 5.5 を 165.2、Claude Fable 5.1 を 164.82 に位置づけており、どちらも Grok 4.6 を上回っている。しかもそのどちらも、100万出力トークンあたりの価格は Grok 4.6 の第2ティア料金より安い。費用あたりの能力だけで選ぶ人には、同じベンダーファミリー内に第3、第4の選択肢があるということだ。そして本記事の組み合わせが扱うのは別の話、つまりこの2つのモデルがそれぞれ何を得意としているかである。
料金表と、そのうちの1つにだけ表示される行

Grok 4.6の料金表には、Claude Opus 5.5の料金表にはない段階が1つあります。200,000プロンプトトークンを超えるリクエストには基本料金の2倍が請求されるため、入力は$2.00から$4.00に、出力は$6.00から$12.00になり、キャッシュ読み取りは$0.50から$1.00になります。Claude Opus 5.5は、1,000,000トークンのウィンドウ全体を通じてキャッシュ読み取りが$0.20で一定の$4.00/$20.00を請求します。その逆転は、どちらかのモデルから長いコンテキストを購入する場合の実務上の帰結であり、ワークロードが実際に大きくなると、見かけの料金比較を覆します:
• 30,000入力トークン時点の価格 — Claude Opus 5.5 は高価な方で、30,000入力・8,000出力でおよそ28セント、それに対して Grok 4.6 は約11セントです
• 入力トークン250,000時の価格 — ここでは順序が逆転する。Grok 4.6は料金が2倍になるティアに移行しているのに対し、Claude Opus 5.5は移行していないからだ
• キャッシュ読み取り — Claude Opus 5.5は100万あたり$0.20、これに対してGrok 4.6は$0.50、段階を超えると$1.00に上昇
• 最大出力 — Claude Opus 5.5では128,000トークン、Grok 4.6の出力上限はカタログ記録に公開されていない
Grok 4.6には、後になって発見されるままにするのではなく、はっきりと言っておく価値のある欠落が1つあります。その記録には最大出力値がまったく記載されていません — この項目は未測定であり、ゼロではありません — そのため、非常に長い単一応答に依存するワークロードでは、比較のその側で計画の基準にできる公表された数値がありません。
読まれるべきではないパフォーマンス列
当社のカタログにはモデルごとの提供性能パネルも掲載されており、Grok 4.6 ではそれがページ上で最も誤解を招くものになっています。カードには、p50 レイテンシが 10,000 ミリ秒、7 日間のウィンドウにおけるエラー率が 97.58%、その期間に提供されたトークン数が 26,184 と表示されています。これらの項目は、遅いモデルを説明しているのではありません。ほとんど呼び出されなかったモデルを説明しているのです。そのトラフィック水準ではサンプルが薄すぎて、レイテンシ分布は何の意味も持ちませんし、エラー率はサービスの品質ではなく、ごく少数の試行を反映したものです。そのブロックを Grok 4.6 が遅い証拠として扱うのは、測定のアーティファクトを測定結果として読むことにほかなりません。
一方、Claude Opus 5.5のパネルには、その背後に母集団があります。7日間の期間にわたって毎日サンプリングした結果、p50は4.4秒台であり、同じ期間に1億5,600万トークンが処理されました。とはいえ、これもまた、あるがままに読むべきものです。つまり、これは当社自身のプレイグラウンドのトラフィックであり、モデルの性質ではなく、当社ユーザーのサンプルにすぎません。
どちらをルーティングするか、そして自分の作業でそれを見つける方法
数字が示すその差は、それに基づいて行動できるほど安定している。Claude Opus 5.5 は、エージェント型の作業や長期的な作業に適した選択肢だ — Terminal-Bench 4.0 における 59.60% 対 21.21% の差は、両モデルが測定されたどの軸においても最大の隔たりであり、それはモデルに質問ではなくタスクを任せられるかどうかを予測する軸でもある。また、プロンプトが本当に長い場合にも適した選択肢だ。なぜなら、料金表は段階的に変わらず、コンテキストウィンドウは2倍のサイズだからだ。Grok 4.6 は、大量の質問形式の作業に適した選択肢だ。最初の200,000トークン以内で $2.00/$6.00 の 94.9% GPQA Diamond スコアは、倍額のティアにまで拡大しない検索応答ワークロードにとって非常にお得だ。
どちらもOrcaRouter上で、プロバイダーの定価、マークアップ0%で提供されています — Claude Opus 5.5は$4.00/$20.00、キャッシュ読み取りは$0.20、Grok 4.6は$2.00/$6.00で、200K超のティアはSpaceXAIが設定するとおりに正確に適用されています — これらが1つのキーの背後にあるため、上の内訳は議論するのではなく、自分のプロンプトセットでテストできます。両方がルーティングされる場合、自動フェイルオーバーがその下に備わっており、安価なモデルがエージェント経路を担っているときには心強いものです。
この組み合わせが導き出す結論はこうだ。Grok 4.6 はより優れた読み手であり、Claude Opus 5.5 はより優れた働き手だ。GPQA Diamond の 94.9 と Terminal-Bench の 21.21 は、同じモデルを二度測定したものであり、あなたのワークロードがその2つの数字のどちらに近いかを知ることが、判断のすべてだ。


この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
