
Claude Sonnet 5.5 対 Claude Opus 5.5:ベンチマークは収束するが、請求額はそうならない
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
Claude Sonnet 5.5 は2026年9月28日に一般提供を開始し、100万入力トークンあたり2.00ドル、100万出力トークンあたり10.00ドルだった。Anthropicの旗艦であるClaude Opus 5.5は、その6日前の9月22日に4.00ドルと20.00ドルでリリースされた——どちらの料金もちょうど2倍である。明白な読み方は、Opus 5.5が上限であり、Sonnet 5.5は予算が現実になったときに選ぶ妥協策だというものである。Anthropic自身の発表時の表はその読み方を支持していない。同社が公表した数値では、Claude Sonnet 5.5はGDPval-AA v2.1でOpus 5.5の1846に対して1844、AA-Briefcase v1.1で1822に対して1811、Terminal-Bench 4.0で66.4%に対して70.6%を記録している——ターミナル内で実際に行われた作業を測定する、まさにそのベンチマークで勝っているのだ。それらの数値の2行下で、Anthropic自身のキャプションは、Opus 5.5が「複雑でオープンエンドな作業では依然として明らかに強い」と述べている。どちらの記述も真実であり、それらを同時にどう捉えるかを見極めることが、この比較の主な目的である。
ローンチ表が語ること、そして語ろうとしないこと
Anthropicのベンチマーク群に見られるパターンは、首位に立ったモデルではなく、差の大半を埋めたモデルだというものだ。経済的に重み付けされたタスクセットであるGDPval-AA v2.1は2ポイント差の接戦。文書および成果物の評価であるAA-Briefcase v1.1は11ポイント差の接戦。CursorBench 4.0は逆を行き、Sonnet 5.5が55.5%に対しOpus 5.5が57.8%。OSWorld 2.1は80.1%対81.8%、Humanity's Last Examはツール使用時で64.5%対67.7%。このパターンを覆すのはTerminal-Bench 4.0だけで、しかも大きく覆す——70.6%対66.4%で、エージェント的なコマンドライン作業においてSonnetが4ポイント優位だ。
数字ではなく行ラベルを読むと、別の何かが見えてくる。Opus 5.5 のエントリのいくつかには effort の注記が付いており——Xhigh で 66.4%——、脚注には、Max 構成のスコアは FrontierCode において Xhigh より低く、高くはないと記されている。高い effort は単調ではない。「最大 effort」が無料のアップグレードだと想定する予算重視のチームは、Anthropic 自身のテストの少なくとも一つにおいて、より悪い回答のためにトークンを買っていることになる。そして FrontierCode 1.1 では、同じ脚注が Sonnet 5.5 を Max 構成で 46.2% とし、Opus 5.5 の 54.4% と対比している。これは、フラッグシップが依然として引き離している領域を示す最も明快な単一の数字だ——持続性が報われるタスク定義の下での長期的なコード作業である。
もう一つ、埋もれさせるのではなく率直に述べておく価値のある注意点がある。Anthropic は、自社が公開している GDPval-AA と AA-Briefcase の実行が、構造化出力のバグを抱えたプレリリース版デプロイで行われたと注記している。これは同じ表にある両モデルに影響するため、比較そのものが無効になるわけではないが、絶対値は確定した結果ではなくスナップショットとして扱うべきだということを意味する。ベンダーのベンチマーク表は、方法論の付録が付いたマーケティング資料であり、これにもその付録が添付されている。
独立した測定がどこに落ち着くか
Artificial Analysis は、Intelligence Index v4.3 上で、両モデルを単一のハーネス、すなわち「Adaptive Reasoning, Max Effort, Default Fallback」と名付けた同一構成の下で評価している。Claude Opus 5.5 は 58。Claude Sonnet 5.5 は 56。これは、同じ評価者が Opus 5 を 51、Sonnet 5 を 38、DeepSeek V4 Pro を 36、Gemini 3.1 Pro Preview を 30 としているスケールにおける 2 点差である。新しい Sonnet がフラッグシップの 2 点下、前世代 Opus より 5 点上に登場したことが、今回のリリースの実質的な主張であり、それはベンダーによる主張ではなく第三者による主張である。
次に、同じページがその経済性を逆転させる。Artificial Analysis の報告では、Sonnet 5.5 の評価実行はタスクあたり $7.60 かかるのに対し、Opus 5.5 は $5.98 だ。Sonnet 5.5 のトークンあたり価格は半分であるにもかかわらず。原因は同じページにはっきり書かれている。Sonnet 5.5 はインデックススイート全体で4億1000万トークンを生成したが、追跡対象モデルの中央値は8800万トークンだった——評価者の言葉で言えば「非常に冗長」。Opus 5.5 は同じスイートで2億6000万トークンを生成した。100万出力トークンあたり $10 対 $20 という条件では、約1.6倍の冗長性係数をもっても、Sonnet 5.5 は完了したタスクあたり約27%多く支払うことになる。
これは、トークン単位の価格表では見えてこない比較の側面であり、二つの数字が矛盾なく併存する理由でもある。トークンあたりでは、Sonnet 5.5 のほうが半分のコストで済む。完了したタスクあたりでは、オープンエンドのプロンプトを使い、出力長を管理しない評価スイート上では、むしろ高くつくことがある。そのどちらがあなたのワークロードを言い表しているかが、実際の判断だ。
エフォートレベル、出力上限、そして統合の形
買い手にとって、機械的に重要な特性は、これら2つのモデル間でほぼ同一である。
• コンテキスト — 両方とも同じプロバイダーで 1,000,000 トークンなので、プロンプトエンジニアリングの前提はそのまま通用します
• 最大出力 — どちらも128,000トークン。大量生成はここでは差別化要因にはならない
• モダリティ — 両方ともテキスト、画像、ファイル入力に対応。どちらも音声や動画は受け付けません
• 推論制御 — 両方で適応型思考を有効にし、深さは思考トークン予算ではなくエフォートパラメータで設定します。Claude Platform ではデフォルトは high、Claude アプリ内では medium です
• キャッシュ書き込み — Claude Opus 5.5 は100万あたり$5.00、Claude Sonnet 5.5 は$2.50。安価なモデルが、再構築されたプレフィックスを食わせるのにも安価なモデルである唯一の項目
• キャッシュ読み取り — どちらも100万あたり$0.20、長時間のエージェント実行を支配する項目では完全に互角
サーフェスが一致しているため、それらの間の移行はモデル文字列の変更と工数の再測定であり、統合プロジェクトではありません。これはベンダー間では珍しく、この特定の組み合わせをそもそも比較する価値がある理由でもあります。2つの候補は価格と深度が異なるのであって、記述しなければならないAPIが異なるわけではありません。
運用上の違いが一つあり、それには一行を割く価値がある。Anthropic は、Claude Sonnet 5.5 がサイバーセーフガードとフォールバックを最上位モデルと同等の基盤で備えて登場する最初の Sonnet だと述べている。つまり、よりリスクの高いサイバーセキュリティ関連のリクエストは、指定したモデルが応答するのではなく、以前の Sonnet に目に見える形でルーティングされる。ワークロードがその領域に触れる場合、モデル文字列はどちらのモデルが応答したかを保証するものではない — どちらの階層でも。Anthropic はまた、Sonnet を thinking 無効で実行する場合は between-tools behaviour に切り替える必要があるとも注記している。これは設定フラグではなくコード変更だ。どちらもモデルを避ける理由ではない。どちらも出荷前に知っておくべき理由だ。
OrcaRouterでは、Claude Opus 5.5は、カタログ内の他のすべてのモデルと同じ認証情報で本日からルーティング可能です。プロバイダーの定価のまま、マークアップは0%、その下で自動フェイルオーバーも利用できます。Claude Sonnet 5.5はまだ当プラットフォームのルートにはなっていません — このモデルは登場から1日しか経っておらず、掲載されるまでは、Anthropic自身のAPIを通じてアクセスすることになると正直にお伝えするほかありません。現在当社を通じてOpus 5.5を利用している方は、統合のその他の部分を一切変更することなく、Sonnet 5.5が提供開始された日に切り替えの価格を算出できます。
どれをどこに置くか
数字から導かれる使い分けは次のとおりだ。ターミナルに縛られたエージェント作業には Claude Sonnet 5.5。Anthropic 自身の Terminal-Bench 4.0 の数値では2つのうちより強く、価格は半分だ。スループット型のあらゆる用途には Claude Sonnet 5.5。コスト差が縮まるのは、タスクが長い出力を強制するときに限られるからだ。FrontierCode 級の作業、大規模コードベース全体にわたる長期的リファクタリング、そして 54.4% 対 46.2% の差がリーダーボードの一行ではなく、実際の問題の形を反映しているあらゆるワークロードには Claude Opus 5.5。
タスクが自由形式で、出力長を予測できないなら、トークンあたりの価格は完全に見当違いの数字だと考えてください。どちらに決めるにせよ、まず1週間、自分のトラフィックで完了タスクあたりのトークン数を測定してください。artificial-analysisの$7.60対$5.98という数値は、安価なモデルが、実際に支払う指標では負けうるという警告です。
正直な結論を言えば、これはもはや能力対コストのトレードオフではない。問題は、あなたの作業に境界があるかどうかだ。境界が定まり、大量で、ツール駆動のタスクでは、入手可能な証拠を見る限り、安価なモデルのほうが優れてもおり、フラッグシップは倍の価値などない。終わりが決まっていない長期的な作業については、Anthropic自身の一文——Opus 5.5が依然として明らかに強い——を信じるべきであり、ベンチマークの収束がどれほど進んでも、まだそれを覆すことはない。



