生成されたヒーローカードは、タイトルが「Claude Sonnet 5.5 vs Grok 4.5」、サブタイトルが「2つの$2入力レートと6分の待ち時間」で、3枚の統計カードを表示しています。初回トークン 370.8秒 vs 6.9秒、タスクあたりのコスト $7.60 vs $1.04、Intelligence Index 56 vs 39。フッターには「インデックス、タスクあたりのコスト、レイテンシは Artificial Analysis v4.3.2 による。価格は各ベンダーによる」と書かれています。
Guides & Insights

Claude Sonnet 5.5 対 Grok 4.5:2つの$2入力レートと6分の待ち時間

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Sonnet 5.5とGrok 4.5は、入力に対して同じ価格を課している。100万トークンあたり2.00ドルだ。だが一致しているのはそこまでで、ある一つの数字がどんなスペック表よりも雄弁にそのことを示している。Artificial AnalysisのIntelligence Index改訂版v4.3.2では、Max Effort設定におけるClaude Sonnet 5.5の最初の回答トークンまでの中央値は370.8秒。Grok 4.5は6.9秒だ。同じ入力単価。何かが返ってくるまでの待ち時間は53倍。2026年9月28日リリースのClaude Sonnet 5.5と、2026年7月8日リリースでその後自らのファミリー内で2度追い越されたGrok 4.5は、紙の上ではフロンティア前半戦へ入るための最も安い2つの手段であり、そしてその紙は、本当に重要な判断——待つことと引き換えに何を買っているのか——を覆い隠している。

その数字にはすぐに但し書きが必要だ。というのも、構成を伴わないレイテンシの数値は無意味だからだ。370.8秒は、A​nthropicのデフォルトの推論モードを最大エフォートで動かした場合のもので、回答トークンを出す前に非常に大きな思考バジェットを費やす。高速な最初のトークンを求める呼び出し元は、別の設定をする。しかし方向性は現実であり、アーティファクトではない——Artificial AnalysisはClaude Sonnet 5.5の出力速度を毎秒138.7トークンと測定しており、これはごく一握りのモデルに次ぐ2番目であり、Grok 4.5は毎秒59.2トークンだ。最も長く待つモデルが、最も速く書く。あなたが選んでいるのは、長い熟考の後に速い回答が来るか、短い熟考の後に遅い回答が来るか、ということだ。

9月28日に何が変わりましたか

Claude Sonnet 5.5は登場からまだ1日。Anthropicは2026年9月28日、API識別子claude-sonnet-5-5でこれをリリースし、Bedrock、Google Cloud、Microsoft Foundryでも同時に提供を開始した。同社の説明によれば、Claude Sonnet 5より30%高速に動作し、ほとんどの作業でタスクあたり最大30%低コストだという。これらはベンダー側の公表値であり、独立した再現は行われていない。ただし比較対象としている価格は実在する。料金表が100万入力トークンあたり$2.00、100万出力トークンあたり$10.00、キャッシュ読み取り$0.20、キャッシュ書き込み$2.50で据え置かれているためだ。コンテキストウィンドウは1,000,000トークン、同期出力の上限は128,000トークン、そしてMessage Batches APIではoutput-300k-2026-03-24ヘッダーを付けることで300,000トークンとなる。ナレッジカットオフは2026年6月。ゼロデータリテンションは提供開始時から利用可能で、Anthropicは2027年9月28日より前にこのモデルを廃止する予定はない。

Artificial Analysis model page for Claude Sonnet 5.5 in its Adaptive Reasoning, Max Effort, Default Fallback configuration, released September 2026, showing an Intelligence Index of 56, an output speed of 138.7 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, $7.60 per Intelligence Index task, 410M output tokens generated during the Index evaluation, and a 1M-token context window.

Anthropic自身のドキュメントページも、アップグレードの代償について異例なほど明確に述べている。Claude Sonnet 5.5と、現在Claudeのトラフィックの大半が稼働しているモデルとを分かつのは5つの破壊的変更であり、それらについては後述する。

Grok 4.5はより古い選択肢であり、より複雑な方でもある。SpaceXAI — モデルカード上では今もx​AIブランドで出荷している企業 — は、2026年7月8日に、1.5兆パラメータの専門家混合モデルとして、Cursorコードエディターとともに訓練され、500,000トークンのウィンドウ、テキスト・画像・ファイル入力、そして最高スコアではなくほぼ完全にトークン経済性に基づくローンチ時の売り文句を備えてリリースした。もはやフラッグシップではない。Grok 4.6とGrok 4.7はいずれも存在し、どちらも同じ$2.00 / $6.00の定価で、私たちのカタログには3つすべてが掲載されている。したがって、2026年9月における興味深い問いは、Grok 4.5が優れているかどうかではなく、この3つの中で最も古いものに手を伸ばすことを依然として正当化する何かがあるかどうかである。

請求書は料金表ではありません。

独立したボードの上でその二つを並べて置けば、トレードの形が現れる。

• インテリジェンス指数、リビジョン v4.3.2 — Max Effort 時の Claude Sonnet 5.5 は 56、Grok 4.5 は 39

• Indexタスクあたりのコスト — Claude Sonnet 5.5 $7.60 対 Grok 4.5 $1.04、いずれも推定値ではなく実測値

• 出力単価 — Claude Sonnet 5.5 は100万トークンあたり$10.00、Grok 4.5 は100万トークンあたり$6.00

• 出力速度 — Claude Sonnet 5.5 138.7トークン/秒 対 Grok 4.5 59.2トークン/秒

• 最初の回答トークンまでの時間、最大エフォート — Claude Sonnet 5.5 370.8 秒 対 Grok 4.5 6.9 秒

• Index評価全体を通じて生成されたトークン — Claude Sonnet 5.5 410M vs Grok 4.5 77M

• コンテキスト — Claude Sonnet 5.5 1,000,000トークン 対 Grok 4.5 500,000トークン

冗長性の行は、タスクあたりコストの差の背後にある仕組みであり、このページで最も有用な単一の数値である。評価全体で競合モデルが7700万トークンを出力するのに対し、4億1000万トークンを出力するモデルは、タスクあたり7倍のコストになるために67%高い出力レートを必要とするわけではない——それでも実際には67%高い出力レートを持っており、両方の効果が同じ方向に働く。Anthropic自身の説明も、この解釈と矛盾するどころか一致している。「タスクあたり最大30%削減」は、レートではなくトークン数についての主張である。なぜなら、Claude Sonnet 5 と Claude Sonnet 5.5 の間でレートは変わらなかったからである。Artificial Analysis も反対側から同じ結論に達しており、このモデルを平易な言葉で、際立って高速だが非常に冗長だと説明している。無駄の少ないモデルと比較すると、その同じ特性が Claude Sonnet 5.5 の最大の運用リスクとなる。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Grok 4.5, the scoreboard, with six matched rows: input price $2.00 vs $2.00, output price $10.00 vs $6.00, Intelligence Index 56 vs 39, cost per task $7.60 vs $1.04, first token 370.8 s vs 6.9 s, and context window 1,000,000 vs 500,000 tokens, with a footer reading Index, cost per task and latency per Artificial Analysis v4.3.2; prices per the vendors.

Grok 4.5の安い料金が安くなくなるのはどこからか

「$2.00 / $6.00」という表示は単価ではなく、料金階層だ。SpaceXAI 自身の開発者向けドキュメントでは、その価格は入力20万トークンまでに適用され、それを超えると入力$4.00、出力$12.00へと倍になる。Grok 4.5 のウィンドウは50万トークンなので、宣伝されているウィンドウの後半は前半の2倍のコストがかかる。リポジトリ規模のプロンプトを Grok 4.5 に読み込むのは、$6出力の操作ではない。$12出力の操作であり、その時点では「高価な」$10出力単価のモデルのほうが、大量のトークンも出力するあらゆるリクエストにおいて安い。

Claude Sonnet 5.5には同等のティアが存在しません。$2.00 / $10.00 の料金は1,000,000トークンのウィンドウ全体にわたって適用され、キャッシュ読み取りは入力料金の10分の1にあたる$0.20で課金されます。これにより、長いコンテキストのユースケースは机上の空論ではなく、実運用に耐えるものとなります。

ウィンドウサイズはその論点のもう半分であり、指し示す方向も同じだ。Grok 4.5のウィンドウは50万トークンで、その一つひとつが告知どおりの料金で課金される。Claude Sonnet 5.5は100万トークンを扱えるが、これが効いてくるのはワークロードの形しだいだ。推論の対象となるリポジトリ、長いエージェントのトランスクリプト、視野に入れ続けなければならない大量のドキュメント。上限は2倍、その半分の時点で料金ティアが切り替わることもなく、キャッシュ読み取りは入力レートの10分の1——これが、これほど大量のコンテキストを何度もの呼び出しにまたがって持ち運ぶことを、予算を組むべき対象ではなく一行の費用項目に変える。

実用的な違いは微妙ではない:

• 短いプロンプトで高密度の出力 — Grok 4.5はレートで勝利し、トークンの習慣でも再び勝利

• 200,000入力トークンを超えるプロンプト — Grok 4.5の料率は2倍になるが、Claude Sonnet 5.5はそうならない

• 低遅延が求められるインタラクティブ作業 — デフォルト設定では、Grok 4.5 が大差をつけて最初に応答します

• 長期間にわたるエージェント実行 — Claude Sonnet 5.5 の総合スコアと 128K 出力上限こそが、追加のタスクコストを支払う価値のある理由であり、300K バッチ上限がそれをさらに拡張します

マイグレーションはモデル文字列ではありません

Claude Sonnet 5からClaude Sonnet 5.5に移行する人は、コードを書く前にA​nthropicの移行ノートを読むべきです。なぜなら、5つの挙動が変わり、そのうち明白な場所で明らかに失敗するのは1つだけだからです。

• デフォルト以外の temperature、top_pまたはtop_k は 400 を返すようになりました — サンプリングを多用するパイプラインは、劣化するのではなく動作を停止します

• thinking: {"type": "disabled"} は 400 を返し、between_tools でなければなりません。effort は low、medium、high のいずれかに制限され、xhigh と max は拒否されます

• 強制的なツール使用 — tool_choice が "any" または名前付きツール — は完全に拒否されるため、スキーマに準拠した呼び出しを強制するループは auto厳格なツール使用または構造化出力

• 古い computer_20251124コンピュータ使用ツールは、Claude API および Goo​gle Cloud では拒否されます

• シンキングブロックは生成元のモデルとアカウントに紐づくため、推論は Claude Sonnet 5 から引き継がれますが、異なるファミリーへ横方向に引き継がれることはありません — また、アドバイザーツールは Sonnet 5.5 エグゼキューターの背後でアドバイザーとして Claude Opus 4.8、Claude Opus 4.7、Claude Sonnet 5 を受け入れなくなりました

6つ目の変更は何も失敗させない。だからこそ危険だ。ツール呼び出しの間のテキストが、今では thinking ブロックの内部で返される。そのテキストをユーザーにストリーミングするアプリケーションは、表示値を設定するか、事前の thinking を完全にオフにするまで、ツール呼び出しの間は沈黙する。何もエラーにならない。出力が単に見えなくなるだけだ。

Grok 4.5 はそのいずれも要求しない。サンプリングまわりがそのまま使える OpenAI 形式のモデルであり、Grok 4.5 自身の前身から Grok 4.5 へ移行するのはモデル文字列の変更で済む。移行コストは完全に Claude 側にのしかかり、しかもそれは午後で済む話ではなく丸一日の作業だ。

両方とも1つの認証情報で、そしてそれの正直な限界

2社の比較を頭の中に抱えておくのは簡単だが、実際に運用するとなるとコストが潜んでいる。OrcaRouterは200以上のモデルを単一のOpenAI互換エンドポイントの背後に置き、プロバイダーの定価をそのまま通し、マークアップを一切加えない。そのためどちらか一方の料金改定は、次回の契約更新時ではなく当日中にここへ反映される。さらにアップストリームプロバイダー間の自動フェイルオーバーと、呼び出しを組み立てるためのルーティングDSLを備えている。Grokシリーズ全体がSpaceXAI自身の料金でカタログに掲載されており、Grok 4.5はgrok/grok-4.5として、100万トークンあたり入力$2.00、出力$6.00で、その50万トークンのウィンドウ全体にわたってルーティングできる。

Claude Sonnet 5.5は当社のカタログにはありませんし、このページでそうであるかのように示唆するつもりもありません。現在それを利用するルートは、A​nthropic自身のAPI、あるいはインフラがすでにそこにあるならBedrockやGoo​gle Cloudです。Claude Sonnet 5は6月30日からここでルーティング可能で、A​nthropicの$2.00と$10.00で提供されており、Claude APIトラフィックの大半が今も利用しているモデルであり、Claude Sonnet 5.5がまだ登場から1日しか経っておらず誰の本番環境での証拠もない中では、自然なフェイルオーバー先となります。

そのすべてに一つの但し書きが当てはまりますが、それは決して小さなものではありません。上の Grok 4.5 の行は、当社のカタログが現時点で再現しているとおりのベンダーの売り込みです。その項目のトラフィックカウンターは過去7日間ゼロを示しており、スループット値は測定されていません。最初のトークンまでの時間は、ほとんど呼び出されないモデルが示しがちな1秒の下限にとどまっています。ここで最近のトラフィックがないモデルは、そのモデルが悪いという証拠にはなりません — このファミリーの呼び出しは 4.6 と 4.7 に移っているのです — しかしそれは、そのページの運用数値が薄いことを意味し、信頼に値するレイテンシ値はライブルートの測定値です。

OrcaRouter model page for grok/grok-4.5, dated 2026-07-08, showing a 500K-token context window, text, image and file input, the pricing row of $2.00 input and $6.00 output per million tokens, a p50 time to first token of 1.00 s, a p95 of 4.0 s, and a traffic counter reading Collecting.

どちらを選ぶべきか

Grok 4.5は、プロンプトが短く、回答の密度が高く、統合がすでにOpenAIに対応している場合に適したモデルです。そして、リクエストが200,000入力トークンを超えない場合にも適しています。その線を越えると、計算を担う側が変わるからです。最初のトークンが数分ではなく数秒で到着する必要がある場合にも適した選択です。そうではないのは、現行のGrokフラッグシップという点です。Grok 4.6とGrok 4.7は同じ定価でその上に位置しており、どちらよりも4.5を選ぶ理由は、具体的なものでなければなりません。

Claude Sonnet 5.5 は、プロンプトが膨大で、作業が十分にエージェント的であり、17 の Index ポイントと 128K の出力上限がタスクあたり 7 倍高いコストを正当化するほどである場合、あるいは総合スコアこそが買っているものにほかならない場合に適したモデルです。その冗長さは欠陥ではなく設計上の決定であり、コミットする前に自分のトラフィックで測定すべき数値です — なぜなら、Index タスクあたり $7.60 対 $1.04 は、あなたのワークロードだけが算出できる数値の代理指標にすぎないからです。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新