
Claude Sonnet 5.5 対 Gemini 3.1 Pro:トークンあたりは安価、タスクあたりでは11倍割高
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
料金表では、Claude Sonnet 5.5 のほうが安価なモデルであり、能力面では大差をつけている。2026年9月28日に一般提供を開始し、入力トークン100万あたり2.00ドル、出力トークン100万あたり10.00ドルだった。一方、2026年2月19日に発表され、今もプレビューエンドポイントから提供されている Gemini 3.1 Pro は2.00ドルと12.00ドルだ。Sonnet 5.5 はまた、Artificial Analysis の Intelligence Index v4.3 で56を記録し、Gemini 3.1 Pro Preview の30に対して、単一のハーネス上で26ポイント差をつけている。Gemini の1,048,576トークンのコンテキストは、同モデルが唯一完全に勝っている主要数値だ。しかし、同じ評価者によれば、オープンエンドのタスクを1つ完了させるコストは Google モデルで0.67ドル、Anthropic モデルで7.60ドルであり、これは逆方向に11倍になる。どちらの数値も正しく、それらが共存する理由——一方にある65,536トークンの出力上限と、他方にある冗長性の問題——が、この比較のすべてである。
各エンドポイントが実際に何なのか
計算に入る前に身元を正せ。ここでの主題はanthropic/claude-sonnet-5.5、2026年9月28日公開、テキスト・画像・ファイル入力、1,000,000トークンのコンテキスト、最大出力128,000トークン、Claude Platformではデフォルトでhighになるeffortパラメータを伴う適応的思考。相手はgoogle/gemini-3.1-pro-preview、2026年2月19日公開、テキスト・画像・動画・音声・ファイル入力、1,048,576トークンのコンテキスト、最大出力65,536トークン。その2つの名前のうち一方には、もう一方にはない語が含まれており、それは飾りではない。
プレビューの接尾辞は7か月間付いたままです。その間にGoogleは複数のFlashリリースを出荷し、Proティアの後継は出していません。3.1 Proが置き換えたモデルは提供終了として記載されています。そのいずれもモデルの欠陥ではありません — 稼働し続け、安定し、価格設定もずっと適切でした — が、それは統合対象のエンドポイントが一般提供のライフサイクルコミットメントの対象外であることを意味し、このファミリーはすでにProモデルを1つ終了しています。これを脚注ではなく常設の項目として扱ってください。なぜなら、誤れば複数年にわたるアーキテクチャ判断のコストが変わるからです。
反対の方向を指す2つの数値
トークン単位の比較をまず行います。それは誰もが実行する比較であり、より新しいモデルに有利だからです。
• 入力 — 両方とも100万あたり$2.00、ヘッドライン料金では完全に同額
• 出力 — Claude Sonnet 5.5 は $10.00、Gemini 3.1 Pro は $12.00。Anthropic のモデルの方が 17% 安い
• キャッシュ読み取り — ティア境界未満では両方とも100万あたり$0.20
• キャッシュ書き込み — Claude Sonnet 5.5 の5分間ウィンドウでは100万あたり$2.50、Gemini 3.1 Pro は$0.375。キャッシュエントリの書き込みは Google の方が約7倍安い
• コンテキスト — 1,000,000 対 1,048,576。実用上何の影響もない違い
• 最大出力 — 128,000トークン 対 65,536、Anthropicモデルは上限がほぼ2倍
• 入力モダリティ — テキスト、画像、ファイル 対 テキスト、画像、動画、音声、ファイル
次に、同じ評価者による、同じ週の、双方を最大エフォート構成にした場合のタスクごとの比較です。Claude Sonnet 5.5 では $7.60、それに対して Gemini 3.1 Pro では $0.67。11倍です。この仕組みは推測ではなく同じページに記載されています——Sonnet 5.5 はインデックススイート全体で4億1000万トークンを生成したのに対し、この分野の中央値は8800万トークンで、評価者はこれを非常に冗長だと述べています。一方、Gemini 3.1 Pro はかなり簡潔だと評されています。一方のモデルがもう一方の数倍も書く場合、出力レートにおける17%の優位は請求書を前にしては生き残りません。
この教訓はこれら2つのモデルを超えて一般化する。料金表が値付けするのはトークンであり、請求されるのは完成した仕事に対してだ。料金表どまりの比較は、間違った量を測っている。
200,000トークンにおける階層の境界
Gemini 3.1 Proの料金は一律ではなく、その段差は上記の比較の一部を逆転させるほど大きい。200,000トークン未満のプロンプトでは、レートは入力$2.00、出力$12.00、キャッシュ読み取り$0.20です。その境界を超えると、呼び出し全体が入力$4.00、出力$18.00、キャッシュ読み取り$0.40で再価格設定され、入力レートは倍増してちょうどClaude Sonnet 5.5の2倍になり、出力はAnthropic側では17%安い状態から、Google側では80%高い状態になります。
その境界は特別なものではありません。200,000トークンのプロンプトは、小さなコードベース、長い契約書の集合、数時間分の文字起こし、あるいはしばらく稼働しているエージェントに相当します。長いコンテキストの作業こそ、1Mトークンのウィンドウが売りにしている用途であり、つまりそのウィンドウを最も活かせる層は、価格上の優位が消える層でもあります。プロンプトが日常的に200,000トークンを超えるなら、ランディングページに載っている料金ではなく、$4.00と$18.00のGemini 3.1 Proを評価してください。
キャッシュ書き込みには独自の一文を割く価値がある。なぜなら、それは逆方向に反転し、ティアの変更を生き延びるからだ。100万あたり$0.375 対 $2.50 では、Gemini はキャッシュを満たすのがはるかに安く、その料金は境界を越えても動かない。大きなプレフィックスを再利用するのではなく毎ターン再構築するエージェントにとって、その一行は入力レートよりも大きな構造的優位になり得る — そしてそれは、この比較において、どのティア境界も触れない唯一の行だ。
65,536トークンの上限、そしてそれがなぜアーキテクチャを決めるのか
あなたが構築できるものを最も大きく変える数字は最大出力です。Gemini 3.1 Pro では 65,536 トークン、Claude Sonnet 5.5 では 128,000 トークンです。上限は性能指標ではなく、タスクが 1 回の呼び出しに収まるかどうかという制約です。
大きな成果物 — 完全なソースファイル、長いレポート、文書全体、構造化データセット — を出力するものは、Gemini の場合 65,536 トークンを超えるなら、状態を呼び出し間で受け渡しながら一連の呼び出しに分解しなければならない。分解すると、各ステップで入力トークンが増え、オーケストレーションコードも増え、あるチャンクが終わって次のチャンクが始まる継ぎ目に新たな障害モードが生じる。第2の制約がさらにそれを悪化させる。Anthropic 自身の資料では、Sonnet 5.5 の信頼できる長い作業のための実用的なしきい値はかなり高く置かれており、Gemini の上限は両者のうち厳しい方で、その差は2倍ある。最長の成果物が 40,000 トークンなら、このセクションは無関係であり、タスクごとのコストで比較すべきだ。100,000 なら、上限がすでにあなたの代わりに判断を下している。
モダリティ──Geminiが完全に掌握する唯一の軸
Gemini 3.1 Proは動画と音声を受け付けます。Claude Sonnet 5.5はテキスト、画像、ファイルを受け付け、動画と音声のどちらも扱えません。通話録音、画面キャプチャ、製品動画、会議音声など、メディアを中心としたワークロードでは、この組み合わせに代用はなく、2つのエンドポイントのうち入力を受け付けられるのは1つだけなので、価格比較は無意味です。テキストと画像のワークロードでは、機能セットが重複し、上記の価格計算が適用されます。
Gemini のもう一つの運用上の数値は、明言する価値があります。知能を前面に押し出したページでは見落とされやすいからです。当社のカタログでは、初回トークン遅延の中央値が p50 で 10,000 ms、出力レートが毎秒約 1,283 トークン、7日間のエラー率が 56.8% と測定されています。これは極めて高速なモデルでありながら、観測される失敗率が非常に高いものです——その組み合わせは、ユーザーが待っているどんな処理よりも、余裕のある再試行予算を伴うバッチ作業にはるかに適しています。比較すると、Claude Sonnet 5.5 はより低速で、より安定したプロファイルです。エラー率はどちらのベンダーのランディングページにも表示されません。これは、候補モデルがそれらを測定する単一のエンドポイントの背後に置かれている場合にのみ現れる種類の数値であり、2つのダッシュボードではなく1か所から両方を評価すべき理由の一つです。
何をどこにルーティングするか
作業がテキストか画像である場合、26ポイントのインデックス差が問題になるほど品質基準が高い場合、出力成果物が128,000トークンの上限を必要とするほど長い場合、またはワークロードが対話型で56.8%のエラー率が許容できない場合は、Claude Sonnet 5.5 に送信してください。構造化され、範囲が限定されたタスクでは、$7.60 という数値を生み出す冗長性ペナルティは大部分が消え、トークンあたりの優位性が実際のコスト削減になります。
入力に動画または音声が含まれる場合、プロンプトが200,000トークン未満に収まり処理量が多い場合、大きなキャッシュを頻繁に書き込んでいて$0.375のキャッシュ書き込みが積み重なる場合、またはタスクがバッチ形式でタスクあたりのコストだけが重要な列である場合は、Gemini 3.1 Pro に送信してください — 1タスクあたり$0.67対$7.60なら、かなりの回数のリトライを行えます。
どちらも現在、OrcaRouter上でルーティング可能です。 google/gemini-3.1-pro-previewとanthropic/claude-sonnet-5 はどちらも、1つの認証情報でプロバイダーの定価のまま、マークアップ0%で利用できるライブカタログ掲載項目です。つまり、上記の振り分けは2つの個別統合としてではなく、ルーティングルールとして表現できます — メディア形式のリクエストは一方のエンドポイントへ、テキストと画像のリクエストはもう一方へ送り、どちらかがエラーを出し始めた場合はフェイルオーバーします。Claude Sonnet 5.5はまだ当社プラットフォーム上のルートではありません。掲載された際には、新しいキーなしで同じルールが適用されます。
この対決についての正直な結論:Claude Sonnet 5.5 のほうが大差で優れたモデルであり、トークンあたりのコストも安い。そして Gemini 3.1 Pro は、オープンエンドな作業における完成したタスクあたりではおよそ11倍安く、キャッシュを書くとなれば6倍安く、両者のうち唯一動画を見ることができる。あなたに料金表を引用してくる人は、存在しない比較を語っている。存在する比較は、どのリクエストを制限できるかについてのものだ。



この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
