Claude Opus 5.5 vs GPT-5.6 Sol のヒーロータイトルカード。見出しは「ほとんど重ならない2つのローンチ表」で、バッジには $4.00 vs $5.00、66.4% vs 37.3%、カットオフ Jun vs Feb、右下隅に OrcaRouter のロゴ。
Guides & Insights

Claude Opus 5.5 vs GPT-5.6 Sol:ほとんど重ならない2つの立ち上げ表

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今週、Claude Opus 5.5GPT-5.6 Sol両ベンダーが公表したベンチマークの表が、ほとんど同じ行を一つも共有していないということだ。2026年9月22日にリリースされた Claude Opus 5.5 の発表資料では、Terminal-Bench 4.0 において GPT-5.6 Sol を29ポイント上回るとされている。一方、2026年7月9日から一般提供されている Sol の発表資料が前面に押し出しているのは、Sol Ultra が91.9%を記録した Terminal-Bench 2.1 と、80で首位に立った Artificial Analysis Coding Agent Index だ。どちらの表も本物である。そしてどちらも、それを勝ち取ったベンダー自身が実行したものだ。有益な問いは、抽象的にどちらのモデルが優れているかではない。どのベンチマークが、誰のハーネスの下で実行されたときに、あなたのワークロードについて何かを教えてくれるのか、ということだ。それはどちらのローンチ記事もあなたに問い合わせてほしいとは思わない、より難しい問いであり、この比較が軸に据えているのもまさにその問いである。

二つのモデルを並べて

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• ベンダー — AnthropicOpenAI

• リリース — 2026年9月22日のClaude Opus 5.5 対 2026年7月9日のGPT-5.6 Sol

• 100万トークンあたりの価格 — 入力 $4.00 / 出力 $20.00 対 入力 $5.00 / 出力 $30.00

• キャッシュ読み取り — Opus 5.5では100万あたり$0.20。Solのキャッシュ料金はプラットフォームごとに設定されており、単一の比較可能な数値としては公開されていません

• コンテキストウィンドウ — 両方とも100万トークン

• 最大出力 — 両方とも128Kトークン、AnthropicのBatch APIではベータヘッダー付きで300K

• ナレッジカットオフ — Opus 5.5 は2026年6月、Sol は2026年2月16日

• 推論制御 — 適応型思考は常に有効、デフォルトはmediumエフォート。スケールは low から max までで、max reasoning effort 設定に加え、並列サブエージェントを統括する Ultra モードを備えています

• ラインナップ — Opus 5.5は5.5ファミリーの第1弾で、Sonnet 5.5とHaiku 5.5は今後数週間での登場が予定されている。一方、SolはTerraやLunaと並ぶ3階層ファミリーのフラッグシップだ

その行のうち2つは、他の行よりも多くの働きをしている。知識カットオフの差は4か月にわたり、これはあなたのプロンプトが今年の春に起きた何かに触れるなら重要だ。そしてOpus 5.5は、入力価格と出力価格の両方でSolを下回るようになった——3か月前からの逆転で、当時はSolがフロンティア級の出力に到達するためのより安価な手段であり、Claude Opus 5は$5/$25だった。

両方のモデルが実際に現れる唯一の行

両方のモデルを掲載した公開されている表はただ一つだけで、それはAnthropicのものである。そこに載っている数値はすべてベンダーによる自己申告であり、2つのモデルのうち一方を販売している企業が作成したものである:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 対 GPT-5.6 Sol 37.3%

• Terminal-Bench-Science 0.1 — 58.7% 対 22.4%

• FrontierCode v1.1(Main)— 54.4% 対 47.5%

• CursorBench 4.0 — 57.8% vs 41.7%

• AutomationBench — 40.0% 対 28.8%

• GDPval-AA v2.1 — 1846 Elo 対 1588

それは完全勝利であり、Terminal-Benchの2行における差は、そのまま受け入れるのではなく精査に値するほど大きい。Anthropic自身の脚注が、その作業の一部をあなたに代わってやってくれる。Opus 5.5のTerminal-Bench実行では、デフォルトではなくxhighエフォートが使われており、デフォルトのmediumエフォートでは、FrontierCodeの優位は54.6%対47.5%まで縮まる — 見出しの数字ではなく、7ポイント差だ。Anthropicはまた、表全体に一般的な注意書きを添えており、この能力レベルではベンチマークの差は「実世界の違いを知るにはあまり信頼できない手がかり」であり、Claude Fable 5.1に対する自社内部の差は、スコアが示唆するよりも小さいと述べている。ベンダーが自社の表を割り引いているという一文こそ、その表の中で最も信頼できる一文だ。

また、その表から欠けているもの、つまり OpenAI のモデルが勝つベンチマークにも注目してください。都合のよい行しか含まないベンダーの表は、全勝の証拠ではなく、行を選んだ証拠です。

OpenAI自身の数字が示すもの

Solの発表資料は、異なるベンチマークで、異なるハーネスにおいて、別の話を語っている。7月の発表時に報告された内容:

• Terminal-Bench 2.1 — Sol Ultraが91.9%、標準のSolが88.8%であるのに対し、Claude Mythos 5は88.0%、Claude Fable 5は84.3%

• Artificial Analysis Coding Agent Index — 80。当時、Claude Fable 5を2.8ポイント上回る最先端(state of the art)と評されていた

• エージェント最終試験、長時間実行されるプロフェッショナルワークフロー — 53.6。OpenAIはこれをClaude Fable 5より13.1ポイント先行と報告した

• BrowseComp — 92.2%;OSWorld 2.0 — 62.6%;SWE-Bench Pro — 64.6%

それらの行のいずれにも Claude Opus 5.5 は含まれていない。7月には存在しなかったからだ。Sol の表は Fable 5 と Mythos 5 を打ち負かすために作られており、実際にそうしている。Opus 5.5 を打ち負かすかどうかは、どちらのベンダーの資料でも単純に答えられていない——2つの表は2か月隔てて、異なる相手に対して作成されたものだからだ。

SWE-Bench Pro の行は特筆に値する。なぜなら、OpenAI の発表資料が自社モデルの負けを示している唯一の箇所だからだ。Sol が 64.6% であるのに対し、Claude Fable 5 は 80% だ。OpenAI はベンチマークの妥当性を疑問視して反応し、そのタスクのおよそ 30% が壊れていると推定した。それはおそらく本当だろう。また、「このベンチマークには欠陥がある」という主張は両ラボが行うもので、しかも常に自分たちが負けるベンチマークについてのものだ、という有用なリマインダーでもある。

ハーネス問題——それは誰の表も解決しない

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

2つの表が一致しないのは、一方のベンダーが嘘をついているからではない。エージェント型コーディングのベンチマークはモデルとスキャフォールドの組み合わせを測定するものであり、そのスキャフォールドが異なるからだ。Terminal-Bench 4.0 と Terminal-Bench 2.1 は同じ着想の異なるリビジョンであり、別々の人々によって運営され、ツールの予算もリトライのルールも異なる。Anthropic の Opus 5.5 の数値は Anthropic のハーネスで生成され、OpenAI の Sol の数値は Codex 流のツール群で生成された。どちらかのモデルを相手方のハーネスに移せば、スコアは変わる。

独立したデータは、存在する場合には、どちらの表よりも僅差の競争を描いている。2026年8月のサードパーティ製エージェントベンチマークは、実際のアプリケーション作業で複数のモデルにわたって実施され、GPT-5.6 Solを精度・コスト・速度の最良の組み合わせと評価した——1回あたり約0.52ドル、5分——一方、Claude Opus 5(5.5ではない)は実行の92%で最も高精度だった。エンタープライズ向けコードタスクを扱う別のリーダーボードでは、Claude Opus 5が96.4%で1位、GPT-5.6 Solが86.5%で3位となり、ここでもSolは新しいOpusではなく前のOpusと比較されていた。どちらもOpus 5.5との直接対決ではなく、どちらも何かを決着させるものではない。ただ、ベンダー以外の誰かが比較を実施すると、その差が小さくなることは確かに示している。

実践的な結論は、表をランキングとして読むのをやめ、仮説のリストとして読むことだ。あなたの仕事が長期的なターミナル自動化なら、AnthropicのTerminal-Benchのギャップは、自分のタスクで検証する価値のある仮説だ。多段階の専門的リサーチであれば、SolのAgents' Last Examの結果も同じ種類の仮説だ。どちらの数値も、実際に走らせてみなければあなたのワークロードには当てはまらない。

完了したタスクあたりのコスト、これだけが重要なコストです

料金表では、Claude Opus 5.5 は入力・出力の両方向で安くなっています。入力は $5.00 に対して $4.00、出力は $30.00 に対して $20.00、そしてキャッシュ読み取り料金は $0.20 で、これは Claude Opus 5 が課していた料金より 60% 低くなっています。毎ターン長いシステムプロンプトを再送信するエージェントにとって、このキャッシュの行がコストの大部分を占めており、プロンプトを一切変更しなくても長時間のセッションが実質的に安くなる理由がここにあります。

しかし、トークン単価がエージェントの請求額を決めたことはこれまで一度もない。OpenAIがSolの投入時に示した根拠は、表示価格ではなくトークン効率に基づいていた。コーディングにおけるトークン効率が54%改善したと報告し、出力トークンと所要時間はClaude Fable 5の半分未満でありながら、コストは約3分の1低いという。AnthropicもOpus 5.5について、ちょうど裏返しの主張をしている。通常のワークロードでの実行コストはClaude Opus 5より約40%低く、料金表は20%しか下がっていない。さらにBox、Kiro、Factory、GitHubからの顧客の声はいずれも、トークン数またはステップ数の大幅な削減を挙げている。どちらの主張も同じ方向を指している——より少ないターンで完了するモデルが勝つ——そして、どちらも独立した監査を受けていない。

独立したタスクあたりコストの算定が存在する場合、現時点ではSolに軍配が上がる。9月に公開されたある分析では、SWE-bench VerifiedにおいてGPT-5.6 Solを解決済みIssue 1件あたり1.56ドル、成功率96.2%とし、Claude Opus 4.8は88.6%だった。これはSolを、Opus 5.5ではなく、より旧いAnthropicモデルと比較して測ったものであり、結論ではなく出発点にすぎない。だが、一発で問題を解決するモデルは、3回の試行を要するより安価なモデルよりもコストが低いということを思い出させる。これをあなたにとって決着させる唯一の測定は、あなた自身のタスクを両方の方法で実行し、トークン数を目の前に置いて比べることだ。

それは調達の問題というよりルーティングの問題であり、そのどちら側がすでに解決可能なのかを正確に押さえる価値があります。GPT-5.6 Sol は本日 OrcaRouter で利用可能。OpenAI 自身の定価、マークアップ0%で — プロバイダー定価がそのまま適用されるため、ベンダーの料金変更は同期を待たずに当日中に当社側で有効になります。Claude Opus 5.5 はまだ当社のルートの一つではありません。Anthropic 自身の API および主要クラウド経由で利用できます。それが当社のルートに乗れば、同じキーで両方に対応でき、これにより実験は、二つ目の契約と二つ目の SDK ではなく、ルーティングルールになります。ワークロードは、自社の数値が有利と示す方のモデルに送り、自動フェイルオーバーはもう一方に向けたままにし、ルーティング DSL の一行に、四半期ごとではなくリクエストごとに判断させます。どちらか一方の値下げは、移行ではなく設定変更です。

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

両者が本当に異なるところでは

ベンチマークを取り除いても、4つの違いが残る。そのすべてが検証可能だ:

• ナレッジカットオフ。Opus 5.5は2026年6月、Solは2026年2月16日。4か月は、最近のライブラリ、最近の出来事、最近変更されたAPIに触れるものにとって実質的な差であり、それを捉えるベンチマークは存在しない。

• セーフガードのルーティング。Opus 5.5 には Fable 5.1 相当のセーフガードが搭載されています。ほとんどのサイバーセキュリティ関連のリクエストは Claude Opus 4.8 に再ルーティングされ、生物学関連の作業は、アカウントが認証されていない限り Claude Opus 5 にフォールバックします。あなたの製品がどちらかの領域に属している場合、トラフィックの一部はより小型のモデルによって応答されています。Sol には同等の文書化されたルーティングはありませんが、OpenAI は自社のサイバー関連の安全性評価について言及しています。

• オーケストレーション。Solは、複数の並列サブエージェント(デフォルトでは4つ)を統括するUltraモードと、推論エフォートを最大化する設定を提供している。Opus 5.5には、プラットフォーム機能としてそのどちらも備わっていない。そのレバーとなるのはエフォートパラメータであり、マルチモデルの構成は、ベンダーから渡されるものではなく、自分で構築するかルーティングするものだ。

• ファミリーの経済性。Sol は3つの階層の1つで、その下に Terra と Luna がある——そして7月30日のアップデートで、Luna の価格は80%、Terra は20%引き下げられた。Anthropic のより安価な兄弟分である Sonnet 5.5 と Haiku 5.5 は発表済みだが、まだ提供されていない。ワークロードが混在しているなら、現時点では OpenAI がより安価な階層を提供している。

それらの中から選ぶこと

長時間実行されるエージェント型コーディングやナレッジワークが仕事である場合、トークンあたりの価格が重要である場合、プロンプトが過去4か月以内の何かに触れる場合、または100万トークンのコンテキストがキャッシュ100万トークンあたり$0.20で、あなたのアーキテクチャを手頃なものにするのであれば、Claude Opus 5.5を選びましょう。まず中程度のエフォートから始め、継承された高設定ではなく、そして、測定すべきは低設定が持ちこたえるかどうかです。

ベンダー統合型のオーケストレーション・モードを求めるなら、旗艦モデルの下位にあたる、より安価な階層を数週間後ではなく今すぐ必要としているなら、あるいはあなたのワークロードがSol自身のローンチ時のエビデンスが最もよく対象としている種類のもの——長期的なプロフェッショナル・ワークフローとコンピュータ操作で、そこでは最も強い結果が報告されている——であるなら、GPT-5.6 Solを選びましょう。

すでに Claude Opus 5 をご利用の場合は、Opus 5.5 がそのまま置き換えられるものではない点にご注意ください。thinking を無効化できなくなり、強制的なツール使用はエラーを返し、thinking ブロックはモデルと会話に紐づけられ、また旧版の computer_20251124 コンピュータ使用ツールは Claude API や Google Cloud では受け付けられません。最初の3点は Claude Fable 5.1 にも当てはまります。Sol への切り替えは、まったく別の統合となります。

この比較に実際に決着をつけるのは、両モデルを同一のエフォート、同一のハーネス、同一のタスクセットで実行した単一の独立した試行だ。今週時点で、それを公表した者は誰もいない。誰かが公表するまで、誠実な立場は証拠が支持する立場になる。Anthropic の表は Opus 5.5 に有利で、Anthropic によって作られた。OpenAI の表は Sol に有利で、OpenAI によって作られた。現存する独立系の結果は Sol を以前の Opus と比較しており、はるかに接戦だと述べている。そしてあなたの請求額を決める2行——完了タスクあたりのトークン数とキャッシュ読み取り量——は、どちらのベンダーも公表していない2行だ。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新