Claude Sonnet 5.5 vs DeepSeek V4 Pro のヒーロータイトルカードを生成。サブタイトルは「20インデックスポイントと0.022ドルのキャッシュ読み取り」で、100万トークンあたり$2.00と$10.00を$0.66と$1.98と対比して表示し、右下隅にOrcaRouterのロゴを合成。
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro:20インデックスポイント、そして$0.022のキャッシュ読み取り

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つの料金表を並べてみると、その比較は始まる前から決着がついているように見える。Claude Sonnet 5.5は2026年9月28日から一般提供されており、入力トークン100万個あたり$2.00、出力トークン100万個あたり$10.00のコストがかかる。2026年4月24日にリリースされたDeepSeek V4 Proは、$0.66と$1.98だ。エージェント作業で重要なのは出力の行であり、$10.00対$1.98は5対1の差——10万トークンあたり1ドル対20セントである。次に能力の面を見ると、Artificial AnalysisはClaude Sonnet 5.5をIntelligence Index v4.3で56、DeepSeek V4 Proを36と評価しており、同じハーネス上で20ポイントの差がある。これが緊張関係のすべてだ。DeepSeekのモデルは出力価格の5分の1、測定された能力のおよそ3分の2に位置しており、その2つの事実は、あなたのワークロードがトークンで実際に何をするのかを知らなければ、単一の推奨には収束しない。

各モデルが正確には何であるか

この比較が最初につまずくのは命名の部分なので、まずそこを直しておこう。私たちが掲載しているDeepSeek V4 Proはdeepseek/deepseek-v4-pro、2026年4月24日リリースで、1,048,576トークンのコンテキスト、最大出力384,000トークン、入力はテキストのみのモデルだ。Artificial Analysisは、これをDeepSeek V4 Pro 0813 — 8月13日ビルド — というラベルでスナップショットとして追跡しており、以下に引用する数値はその行のものだ。Sonnet側はAnthropicのanthropic/claude-sonnet-5.5で、テキスト・画像・ファイル入力、1Mコンテキスト、最大出力128K。ベンダーのページと評価サイトのページを比較していて数値が一致しない場合は、どちらかが間違っていると結論づける前に、ビルドのサフィックスを確認してほしい。

DeepSeek V4 Proはテキスト入力のみに対応しています。Claude Sonnet 5.5は画像やファイルも受け付けます。これが最初の構造的な違いであり、決して些細なものではありません。スクリーンショット、PDF、図表を取り込むあらゆるパイプラインは、単純に一方を他方に置き換えることはできません。なぜなら、一方は見ることができないからです。

料金表を、1行ずつ

入力 — DeepSeek V4 Pro は100万あたり0.66ドル、Claude Sonnet 5.5 は同2.00ドル。DeepSeek は67%安い

• 出力 — 100万あたり$1.98 対 $10.00。DeepSeekは80%安く、この比較で最大の単一の差

• キャッシュ読み取り — 100万トークンあたり$0.022 対 $0.20。長いエージェントループを占めるこの項目で、DeepSeekは89%安い

• キャッシュ書き込み — Claude Sonnet 5.5 の5分間ウィンドウでは100万あたり2.50ドル。DeepSeek V4 Pro のカタログ行には、キャッシュ書き込みの別行はない

• コンテキスト — 1,048,576トークン対1,000,000。DeepSeekはわずかに長く、実用上何ら影響のない違いである

• 最大出力 — 128,000 に対して 384,000 トークン、一括生成を制約する上限において DeepSeek が 3 倍の差で勝利

• 入力モダリティ — テキスト・画像・ファイルとは対照的に、テキストのみ

• 推論 — どちらも固定の思考バジェットではなく設定可能な推論エフォートを使用するため、深さはそれぞれにおいてリクエストパラメータとなります

DeepSeek側には、料金表の比較では見えてこないスケジュール上の細かな事情があります。当社のカタログ行には時間帯別料金のウィンドウが設定されています。UTC 01:00~04:00、およびUTC 06:00~10:00の間、記載料金は2倍になります。その時間帯には、V4 Proは入力$1.32、出力$3.96かかります。それでもClaude Sonnet 5.5より安く、入力は34%、出力は60%それぞれ安いのですが、見出しの数字が示唆するほどの差ではなくなります。スケジュールできるバッチワークロードはスケジュールする価値があり、できないワークロードは平均ではなくピーク料金で見積もる価値があります。これはまた、マーケティングページではなくカタログを読んで初めて見えてくる類のことであり、すべての候補モデルを3つのベンダーアカウントではなく1つのエンドポイントの背後に置くべき理由でもあります。

2つの能力値、そのうち1つは独立していない

サードパーティ側では、順位は明白だ。Artificial Analysisは、Intelligence Index v4.3において、Claude Sonnet 5.5を56、DeepSeek V4 Proを36と採点しており、どちらも最大エフォートの推論構成で測定している。同じ評価者は、Claude Opus 5を51、Gemini 3.1 Pro Previewを30としている。したがって、V4 Proの36は、前のAnthropicのフラッグシップを下回り、GoogleのProティアを上回る位置に置く——価格が5分の1のモデルとしては立派な位置であり、トップからはほど遠い。

タスクあたりコストの逆転はここでも見られ、今回の対決では前回とは反対方向に進む。DeepSeek V4 Pro は index suite で評価するのに $0.67 かかる。Claude Sonnet 5.5 は $7.60 かかる。これは誤植でも、丸め誤差の産物でもない。より新しい Anthropic モデルはスイート全体で 4億1000万トークンを出力するのに対し、中央値は 8800万トークンであり、DeepSeek モデルの冗長さでは、その規模の価格差を埋めるには到底及ばない。制約のないオープンエンドタスクでは、安価なモデルは実際に桁違いに安く、それは単に料金表の上だけの話ではない。

ベンダーが公表した数値は、もっと慎重に扱う必要がある。DeepSeekはV4 Proについてτ²-Benchのスコア96.2を公表しており、これは強い数字ではあるが、ベンダー報告であり、しかもτ²-BenchはArtificial Analysis指数のv4.3改訂で削除された。したがって、この数値をAnthropicが公表するどんな数値とも同じ尺度上に独立的に位置づけることはできない。Anthropic自身のClaude Sonnet 5.5のローンチ表にも独自の留保があり、Max effort設定はFrontierCodeでXhighより低いスコアになるという脚注や、ベンチマークのうち2つは構造化出力のバグがあるリリース前デプロイで実行されたという注記が含まれている。両ベンダーの表を並べても、そこにあるのはランキングではなく2つのマーケティング資料である。この記事の中で同じ一つの軸に載せられる数値は、2つの指数スコアと2つのタスクあたりコストだけである。なぜなら、この4つはすべて同一の評価者によって出されたものだからだ。

なぜ出力上限が価格よりも重要なのか

この比較で最も注目されていない数字こそ、アーキテクチャを変える数字だ。出力トークンで384,000対128,000。

出力上限は快適さのための機能ではない。タスクが1回の呼び出しで済むか、連鎖になるかを決める。大規模なソースファイルの生成、完全な文書の出力、長い構造化レポートの作成、書籍の1章の翻訳——成果物が128,000トークンを超えるものは——Claude Sonnet 5.5への1回の呼び出しでは実行できず、呼び出し間で状態を引き継ぐ一連の処理に分解しなければならない。分解とは、各ステップで再送される入力トークンが増え、キャッシュ読み取りが増え、オーケストレーションコードが増え、チャンク間の継ぎ目にエラーが潜むという新たな種類の障害が生じることを意味する。5倍の価格のモデルがオーケストレーション層を丸ごと排除できるなら、トークンで安くなるより先にエンジニアリング時間で安くなり得るし、逆に1回の呼び出しに収まるタスクでは、そもそも上限が計算に入ってこない。

つまり、上限の問題は価格の問題より先にあります。最も長い成果物が128,000トークン未満に収まるなら、このセクションは無視して、完了したタスクあたりのコストで比較してください。収まらない場合は、トークンだけでなく、構築しなければならないパイプラインのコストも見積もってください。

スイッチングコストとフォールバック問題

どちらの方向への移行であっても、主にコードではなくプロンプトの問題であり、予算を見込んでおくべき例外が1つある。

どちらのモデルも推論をエフォートパラメータで設定するが、両者は異なるベンダーのパラメータであり、レベルもデフォルト値も異なる。高エフォートの Anthropic 設定向けに調整したプロンプトは、DeepSeek のエフォート設定へ同じ条件の置き換えとして移行するのではなく、再測定として移行する。移行の前後どちらであっても、コスト見積もりを信頼する前に、ワークロードごとに 1 日かけて品質を再確立するつもりでいるべきだ。

例外は視覚です。Claude Sonnet 5.5 は画像とファイルを読み取りますが、DeepSeek V4 Pro はテキストのみを読み取ります。モデルにスクリーンショット、スキャンしたページ、レンダリングされたチャートを渡すパイプラインの部分には DeepSeek の相当機能がないため、完全移行はトラフィックのテキスト形式の部分集合にしか利用できません。これは早い段階で引くべき境界線です。通常は、答えが1つのモデルではなく分割になることを意味するからです。

どちらも今日、OrcaRouter 上でルーティング可能です — deepseek/deepseek-v4-proとanthropic/claude-sonnet-5はいずれも公開カタログのエントリであり、プロバイダーの定価でマークアップ 0%、1 つの認証情報で利用できます。これが最も重要になるのは、まさにこの種の比較においてです。そこでの決め手は、抽象的により優れたモデルはどちらかではなく、特定のリクエストをどちらに送るべきかだからです。テキストのみの大量処理を安価なモデルに、ビジョン処理を高価なモデルに振り分ける分割はルーティングルールであり、両方のエンドポイントが同じキーと同じフェイルオーバーポリシーに従う場合、はるかに簡単に表現できます。Claude Sonnet 5.5 自体はまだ当社のプラットフォーム上のルートではないため、現時点でのこの分割はAnthropic モデルと DeepSeek V4 Pro を組み合わせるものであり、置き換えるものではありません。

規則として述べられた決定

タスクが「見る」ことを必要とするとき——画像、PDF、スクリーンショット、レンダリングされた出力——、成果物が散文にして1ページより長く、それをフロンティアモデルに書かせたいとき、あるいは20ポイントのインデックス差が、人間が書き直さなければならない下書きとそのまま出荷できる下書きとの分かれ目になるときは、Claude Sonnet 5.5 に送ってください。

ワークロードがテキスト入力・テキスト出力で、大量処理で、推論品質の上限が低くても許容できるときは、DeepSeek V4 Pro に送りましょう。分類、抽出、要約、一括書き換え、明確な仕様があるコード変換、そしてそうしなければ言葉を動かすために出力100万トークンあたり10ドルを払うことになるようなあらゆる用途です。89%のキャッシュ読み取り割引により、このモデルでの長文コンテキストのエージェントループは、比較対象のほかのどれにもない形で、構造的に安価になります。

率直な結論:これは DeepSeek が負けている能力競争ではなく、ほとんどのチームが、使わない能力を買う方向に誤るリソース配分の判断だ。あなたのトラフィックがテキストで、品質基準が「未読のまま出荷できるほど」ではなく「レビューに回せるほど」なら、出力価格 20% でキャッシュ読み取り $0.022 の V4 Pro が正しいデフォルトであり、その 20 インデックスポイントは、あなたが今進んで払っている税金だ。

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新