ヒーローカード、タイトルは「Claude Sonnet 5.5 vs Grok 4.6」、サブタイトルは「料金表の言い分とトークン請求額は別物」、ピルは「出力 $10 vs $6」「タスクあたりコスト $7.60 vs $1.86」「Index 56 vs 44」、フッターには Artificial Analysis v4.3.2 とベンダー価格を引用。
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6:料金表が語る数字と、トークン請求が語る現実は食い違う

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

見出しの計算は、記事が始まる前から決着しているように見える。Grok 4.6 は入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。Claude Sonnet 5.5 は2ドルと10ドルだ。Space​XAI のモデルは出力で40%安く、入力では同等で、2026年8月12日から一般提供されている——その癖が噂ではなく文書化されているほど長く。Anthro​pic のモデルは2026年9月28日に登場し、これが書かれる前日のことで、このティアでは断トツに最新のものだ。

次に、独立系の効率指標に目を向けると、順位が逆転する。Artificial Analysis は GPT および Claude クラスのモデルを、自社の Intelligence Index と併せてタスクあたりのコスト基準で測定しており、v4.3.2 改訂版では、ここにある2つのモデルはインデックスタスクあたり Grok 4.6 が $1.86、Claude Sonnet 5.5 が $7.60 だ。料金表が安いほうのモデルのほうが、運用コストは4倍高い。その理由、そしてこの逆転が成り立つ場合と成り立たない場合を解き明かすことが、この比較のすべてだ。

2つのモデル、それぞれのファミリーにおける2つのポジション

Grok 4.6 は Grok シリーズの現行フラッグシップです。SpaceXAI 自身の開発者向けドキュメントが最新版として記載しており、Grok 4.5 を後継し、50万トークンのコンテキストウィンドウ、テキスト・画像・ファイル入力サーフェス、基本価格はいずれも同じです。設定可能な推論エフォート、ネイティブのツール呼び出し、構造化出力、完全なサンプリングサーフェスをサポートし、ファーストクラスの OpenAI Responses モデルとして、翻訳レイヤーなしで既存のエージェントフレームワークにそのまま組み込めます。Artificial Analysis では Intelligence Index 44、同社が測定する216モデル中31位、GPQA Diamond の数値は 94.9% です。

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5は、Anthropicの5.5世代における2番目のモデルであり、同社がラインナップの中でスピードと知能の最良の組み合わせと位置づけるモデルです。提供形態は claude-sonnet-5-5/ で、Claude API と3大クラウド上で利用でき、1Mトークンのコンテキストウィンドウ、128Kの同期出力上限を備え、入力・出力・キャッシュについてClaude Sonnet 5の$2 / $10料金を維持し、ゼロデータリテンションで利用可能です。同じインデックス改訂では56点を記録し、216中3位です。

だから、この2つは実際には同じ市場にはない。一方は50万トークンのフロンティアモデルで、7週間にわたって低価格で販売されている。もう一方は100万トークンの汎用ティアで、トークンあたりのコストは前身より高くなく、総合スコアは12ポイント高い。それでも比較する価値はある。どちらも入力$2のモデルであり、調達判断は実際そこから始まるからだ。

誰もスライドに載せない4倍の格差

レートカードはトークンに価格を付ける。請求はタスク建てであり、モデルが答えに到達するまでに費やすトークン数は、定数ではなく設計上の選択である。ここで両者は乖離しており、測定された数値は際立っている:

• 出力単価 — Claude Sonnet 5.5 は100万トークンあたり10ドル、Grok 4.6 は100万トークンあたり6ドル

• Intelligence Indexタスクあたりのコスト — Claude Sonnet 5.5 $7.60 対 Grok 4.6 $1.86

• インデックスにおける冗長性 — Claude Sonnet 5.5 は出力トークン 4億1000万、Grok 4.6 は9400万

• インテリジェンス指数 — Claude Sonnet 5.5 が 56、Grok 4.6 が 44、いずれも v4.3.2 上

• 出力速度 — Grok 4.6 は毎秒 67.7 トークンで、中央値 82.7 に対して測定された。Anthropic によれば、Claude Sonnet 5.5 は Claude Sonnet 5 よりも 30% 以上速く出力を生成しており、Artificial Analysis の計測では Claude Sonnet 5 は毎秒 78.7 トークンだった

冗長性のラインこそがメカニズムだ。4倍のトークンを出力するモデルが、タスクあたり4倍のコストになるのに出力レートが67%高い必要はない——だが、それは役立つ。そしてここでは両方の効果が同じ方向を指している。Anthropic自身の説明は、この解釈に反するどころか、それを支持している。発表資料では、Claude Sonnet 5.5は同一のトークン単価でClaude Sonnet 5よりも「タスクあたり最大30%安い」と主張されているが、これはレートではなくトークン数に関する主張だ。はるかに無駄の少ない外部ベースラインと比較すると、その同じ性質がこのモデルにとって最大のコストリスクになる。

こうしたことは何一つ、指標の差をなくすものではない。総合スコアの12ポイントは実際の能力差であり、失敗する安価なタスクは安価とは言えない。つまり、正直に問うべきは「どちらのレートが低いか」ではなく「より難しいタスクには何トークンかかるか」であり、その数字は自分のワークロードを実行して初めて存在する。

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

コンテキスト、労力、そして統合の形

2つ目の相違点はアーキテクチャに関するもので、何も書き直すことなく2つのうちどちらを採用できるかを決める。

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 では Claude Sonnet 5 と比較して6つの挙動が変わり、そのうち5つは破壊的です。送信すると thinking: {"type": "disabled"}/ は 400 を返すようになったため、between_tools/ に置き換える必要があります。強制的なツール使用 — tool_choice/ が "any"/ または名前付きツールである場合 — は一律に拒否されるため、スキーマに適合する呼び出しを強制するループは auto/ に切り替え、strict なツール使用または構造化出力と組み合わせる必要があります。旧式の computer_20251124/ コンピュータ使用ツールは Claude API と Google Cloud では拒否されます。Thinking ブロックは、それを生成したモデルとアカウントに紐付けられるようになったため、会話はその推論を Claude Sonnet 5 から引き継ぐことはできますが、異なるモデルファミリーへ横断的に持ち込むことはできません。また、アドバイザーツールは、Sonnet 5.5 の実行者を支えるアドバイザーとして Claude Opus 4.8、Claude Opus 4.7、Claude Sonnet 5 を受け付けなくなりました。

Grok 4.6はそんなものは一切求めていない。それはサンプリング面がそのまま残ったOpenAIフォーマットのモデルであり、Grok 4.5からの移行はモデル文字列の変更に過ぎない。ただし、それ自身のコスト構造には落とし穴があり、それはAnthropicのものの鏡像だ。$2 / $6の料金は最大200,000入力トークンまで適用され、それを超える分はすべて$4 / $12で請求される。Claude Sonnet 5.5は1Mウィンドウ全体にわたって標準料金を請求する。

二つの構成を並べてみれば、選択はもはやどちらのベンダーが安いかということではなくなる:

• 短いプロンプト、濃密な出力 — Grok 4.6のより無駄のないトークン消費と低い出力レートが決定的に優位に立つ

• 非常に長い入力 — Claude Sonnet 5.5の1M一律レートは、コンテキスト上限のはるか手前で、倍々に増える段階料金より有利になり始める

の背後で • 大規模な単一出力 — Sonnet 5.5 の 128K 上限は Grok 4.6 と同等で、Message Batches API では 300K に達しますoutput-300k-2026-03-24/ ヘッダー

• 既存のOpenAI形式のコード — Grok 4.6は変更不要、Sonnet 5.5には上記のツール使用とthinkingの対応が必要

両方を1つの資格情報に載せる

2社比較を頭の中で思い描くのは簡単だ。実際に走らせる段になると、コストはそこに潜んでいる。2つのアカウント、2組の制限、2つの請求画面、そして意味を持つ前に2回測定しなければならないトークン数だ。

OrcaRouter はそれを、200 以上のモデルをカバーする単一の OpenAI 互換エンドポイントに集約し、プロバイダーの定価をマークアップなしでそのまま通すため、Grok 側でも Claude 側でもベンダーの料金改定が、次の契約更新時ではなく同じ日にここへ反映されます。Grok 4.x 系のラインナップはすべて、ベンダー自身の料金でカタログに掲載されており、またClaude Sonnet 5 は 6 月 30 日から Anthropic の $2 / $10 でルーティング可能です — Claude API トラフィックの大半が今も稼働させているモデルで、実測 150 出力トークン/秒、p50 の初回トークン時間は約 5 秒です。

特に Claude Sonnet 5.5 は、当社のカタログにはまだ含まれていません。含まれるまでは、そこへ到達する手段はベンダー自身の API であり、1つの複合ベンチマーク以外に誰も独自にベンチマークしたことのないモデルにワークロードを賭けずに試す方法は、自動フェイルオーバーの背後でトラフィックの一部を流すことです、Grok 4.6 または Claude Sonnet 5 が取りこぼした分を拾う形で。まったく新しいティアを試すのはルーティングの判断であり、移行プロジェクトではありません。

数字をどうするか

Grok 4.6は、仕事が短く、出力が密で、統合がすでにOpenAIに対応している場合に選ぶべきより優れたモデルだ。この価格帯の他の何よりもタスクあたり測定可能なほど無駄が少なく、そのサンプリング制御は無傷であり、7週間の提供期間はその故障モードが他の人々によって発見済みであることを意味する。

Claude Sonnet 5.5 は、入力が膨大なとき、複合スコアこそが購入したいものであるとき、あるいは作業が十分にエージェント的で、12ポイントのインデックス差と 128K の出力上限が、タスクあたりのコストの4倍の差よりも重要になる場合に、より優れたモデルだ。移行チェックリストは実際に存在し、それはモデル文字列の編集ではなく丸一日の作業だ。

決着をつけるのは、あなた自身のトラフィックにおけるトークン毎タスクの測定を、両方で実行することだ。この記事の中で結果を左右するあらゆる数字——$1.86 対 $7.60、94M 対 410M——は、その一つの数値の代理指標にすぎず、そしてそれらの中で自分で算出できる唯一のものである。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新