
Claude Sonnet 5.5 vs GPT-6 Sol:2ドル帯に、今や2つのフラッグシップがひしめいている
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
Claude Sonnet 5.5とGPT-6 Solの価格は同一だ——入力100万トークンあたり2ドル、出力100万トークンあたり10ドル——そして両者は2026年9月下旬に6日違いで登場した。興味深いのはその偶然ではない。興味深いのは、Artificial Analysisがv4.3.2 Intelligence Indexで両者を測定したとき、中位ティアのAnthropicモデルが、OpenAIがフラッグシップとして販売してきたモデルを上回ったことだ。Claude Sonnet 5.5が56、GPT-6 Solが47。同じリビジョンでは、Sonnet 5.5が置き換えるモデルであるClaude Sonnet 5は38だ。
つまり、これはもはや安価な階層と高価な階層の比較ではない。同じ価格の2つのモデルを、2つのラボから比較するものだ。Anthropicのモデルとその前身との間には18ポイントの差があり、OpenAIの最上位リリースに対するAnthropicの優位は9ポイントある。以下はすべて、これらの差のうちどれが実際のワークロードに触れても生き残るのか、どれがベンチマーク上のアーティファクトにすぎないのかを見極めるための試みである。
各モデルの正体
Claude Sonnet 5.5は、Anthropicの5.5世代における2番目のモデルで、2026年9月28日にリリースされた。それは、その登場を予告していたClaude Opus 5.5のローンチから5日後のことだった。claude-sonnet-5-5Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundryを通じてこのidを名乗り、このティアの100万トークンのコンテキストウィンドウと128Kの出力上限を維持し、さらにClaude Sonnet 5の価格をそのまま踏襲している。入力$2、出力$10、キャッシュ読み取りは100万トークンあたり$0.20、5分間のキャッシュ書き込みは$2.50だ。初日からゼロデータ保持で利用可能で、Anthropicの提供終了コミットメントは2027年9月28日まで続く。

GPT-6 Solは、紛らわしい名前のGPT-5.6 Solというモデルの後継です。OrcaRouterが依然として入力$4/出力$20で利用可能として掲載しており、Artificial Analysisはその後、GPT-6 Solへのポインタ付きで非推奨としています。新モデルは2026年9月22日に$2/$10で登場し、1,050,000トークンのコンテキストウィンドウ、128Kの出力上限、段階制料金を備えています。$2/$10という基本価格は最大272,000入力トークンまで適用され、それを超える分はすべて$4/$15で課金されます。
その最後の細部こそ、「同一価格」という枠組みが真っ先に崩れる箇所だ。
料金が同額になるのは、短いプロンプトの場合に限られる。
両方の料金表は$2と$10を提示しており、ほぼすべての発売日比較はそこで止まっていた。請求額を決める条件で両者を並べてみましょう:
• ヘッドライン料金 — Claude Sonnet 5.5 $2 / $10 対 GPT-6 Sol $2 / $10
• 長コンテキスト料金 — Sonnet 5.5 は100万トークンのウィンドウ全体を標準料金で課金します。GPT-6 Sol は入力トークンが272,000を超えると $4 / $15 に倍増します
• コンテキストウィンドウ — 1,000,000トークン 対 1,050,000トークン
• 最大出力 — 同期APIでは両モデルとも128Kトークン。Sonnet 5.5はMessage Batches APIで300Kに達します。それを可能にするのがoutput-300k-2026-03-24ヘッダー
• バッチ割引 — Sonnet 5.5の入力と出力が50%オフ。Solについては同等と決めつけず、OpenAIの現行条件を確認すること
• キャッシュ読み取り — どちらも100万あたり$0.20
80万トークンのリポジトリ走査にかかるトークンあたりのコストは、GPT-6 SolがClaude Sonnet 5.5の2倍だ。そしてそれはまさに、両モデルが売り込まれているワークロードである。プロンプトが短ければ、料金表は実際のところ互角であり、価格が何かを決めるべきではない。長ければ、すでに価格が決めている。
Anthropic自身のスコアボードを注意深く読んでください。
Anthropicは、Claude Sonnet 5、Claude Opus 5.5、GPT-6 Solとの4列比較を公開した。ベンダー報告による数値で、第三者はまだ再現していない:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% 対 Sonnet 5 10.3%
• FrontierCode 1.1、メイン — Sonnet 5.5 は Max effort で 46.2%、Sonnet 5 は 42.4%、Opus 5.5 は 54.4%、GPT-6 Sol は 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% 対 Sonnet 5 34.1% 対 Opus 5.5 57.8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 対 Sonnet 5 1449 対 Opus 5.5 1846 対 GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 対 Sonnet 5 1359 対 Opus 5.5 1822 対 GPT-6 Sol 1483
• Humanity's Last Exam、ツール使用時 — Sonnet 5.5 64.5% 対 Sonnet 5 54.9% 対 Opus 5.5 67.7%
• OSWorld 2.1、一部 — Sonnet 5.5 80.1% 対 Sonnet 5 57.0% 対 Opus 5.5 81.8%
• チャート作成、ツールなし — Sonnet 5.5 61.6% vs Sonnet 5 15.6% vs Opus 5.5 64.4% vs GPT-6 Sol 53.6%
それらの行のうち2つには脚注が付いており、どちらも重要だ。GPT-6 Sol の GDPval-AA、AA-Briefcase、Chartography の数値は、OpenAI 側での画像理解の修正後に測定されたものとして Anthropic によって注記されており、Sonnet 5.5 の FrontierCode の数値はその Max-effort の結果で、Anthropic は同じ評価における自社の Xhigh の結果を下回ったと注記している。ベンダーが自ら運営するベンチマークで競合と自社を比較し、その脚注が双方に但し書きを付けるなら、それは中立的な証拠ではない。発売日に入手できる最良の証拠ではあるが、測定と同じものではない。
独立した数字が語ること、そして語らないこと
Artificial Analysisは最初の独立した実行結果を公開した。v4.3.2でIndex 56、Indexタスクあたりのコストは7.60ドル、冗長性の数値は出力トークン410Mで、中央値は88Mだった。この冗長性の数値は、現在得ている以上に注目に値する。それは、モデルが答えに至るまでに非常に多くのトークンを費やす傾向があることを意味し、Anthropic自身の表に由来しない唯一の効率性の主張の背後にある仕組みなのだ。
Anthropicは、Claude Sonnet 5.5はClaude Sonnet 5より30%高速に出力を生成し、トークンあたりの料金は同じでありながら「タスクあたり最大30%安い」と述べている。これら2つの主張を合わせると、より安い料金表ではなく、同じ仕事をより少ないトークンでこなすモデルを描写していることになる。それが成り立つかどうかは、まさに410Mトークンの冗長性測定の目的であり、1回の独立した実行では決着をつけるには不十分だ — しかし、マーケティングの文言と測定されたトークン数が逆向きを指していると言うには十分であり、請求書に現れるのは測定された方である。
また、独立系インデックスがまだ含んでいないものにも注目してほしい。Anthropic 以外の誰も、OSWorld、Terminal-Bench、CursorBench の再現結果を公開していない。そして 56 は複合値だ。その中の 10 個の評価のうちどれが Sol の 47 との差を生んだのかについては、何も語っていない。複合スコアで 9 ポイントのリードは、あなたのワークロードが依存するたった一つの評価における 15 ポイントの劣位を隠し得るのだ。
料金表では示せない形で、どこが異なっているのか
価格とインデックススコアは、比較しやすい2つの軸だ。移行を決めるのは行動面の軸であり、ここでは2つのモデルに大差がある。

Claude Sonnet 5.5ではアダプティブシンキングがデフォルトで有効になっており、デフォルトのエフォートはhighです。また、前世代では許容されていた3つのことができなくなります。1つ目は、次のものを送信することです。thinking: {"type": "disabled"}を送信すると400が返されるようになり、代わりに次のものを使う必要があります:between_tools。2つ目は、強制ツール使用です — tool_choiceを"any"または名前付きツールに設定すると、即座に400が返されます。3つ目は、旧来のcomputer_20251124 computer-useツールが、ツールセットの採用によりClaude APIとGoogle Cloudで拒否されることです。さらに、思考ブロックは生成元のモデルに紐づけられるようになったため、会話をClaude Sonnet 5からClaude Sonnet 5.5へ移して推論を保持することはできますが、その推論を伴ったまま再び元へ戻すことはできません。
エージェントループで tool_choice: "any" を設定してスキーマに準拠した呼び出しを強制している場合、Claude Sonnet 5.5 は、auto に strict tool use または structured outputs を組み合わせた形に切り替えるまでリクエストを拒否します。これは実際の移行作業であり、1行のモデルIDの差し替えが午後いっぱいの作業になる類のものです。
GPT-6 Sol への切り替えにかかるコストは、性質が異なります。というのも、それが置き換えるモデルは今もカタログに残り、今も呼び出されているからです。GPT-5.6 Sol は廃止されたわけではありません。Artificial Analysis では非推奨扱いとされ、新モデルの2倍の価格が付けられながら、依然としてトラフィックを受けています。OrcaRouter 自身の測定では、週におよそ9,500万トークンが流れており、これはまだ移行していない統合がどれほどあるかを示す妥当な目安です。GPT-6 Sol への移行は後からでも下せる価格判断であり、今すぐ下す必要はありません。
1つのキーで比較を実行中
2社を比較する際の実用的な問題は、何かを学ぶ前に通常2つのアカウント、2つのSDK経路、2セットのレート制限というコストがかかることです。OrcaRouterはそれを解消するために存在します。1つのOpenAI互換エンドポイント、200以上のモデル、プロバイダーの定価をマークアップなしでそのまま適用、そしてプロバイダー間の自動フェイルオーバー。
ここで重要な2つのモデルは、どちらも今日時点でそこでルーティング可能です。GPT-6 Solはカタログに$2 / $10で掲載されており、ロングコンテキスト階層もそのまま健在です、そしてClaude Sonnet 5 — Claude APIトラフィックの大半が今も流れているモデルで、実測で毎秒150出力トークン、p50の初回トークン時間は約5秒 — は6月30日から、Anthropic自身の$2 / $10でプラットフォーム上にあります。
Claude Sonnet 5.5 自体は、まだ当社のカタログにはありません。とはいえ、それに至る正直な道はベンダー自身の API と Anthropic が挙げる 3 つのクラウドであり、それを評価する正直な方法は、失っても構わないトラフィックの一部をそこに流してみることです。そのためにこそルーティング層があるのです。ある割合を昇格させ、失敗率を監視し、ロールバック計画としてではなくフォールバックとして前のモデルを維持する。
どれが本番環境に入りますか?
複合スコアではなく、ワークロードの形で選んでください。
Claude Sonnet 5.5 は、長コンテキストを扱う作業、Anthropic の tool-use および computer-use サーフェス向けにすでに書かれているもの、そしてプロンプトが日常的に25万トークンを超えるチームにとって、より良い選択だ——そこでは、定額レートのウィンドウが、どんなインデックス差分よりも価値がある。移行にはチェックリストが付いてくると受け入れよう。強制ツール使用、シンキングのトグル、advisor ツールの組み合わせ、そして computer-use ツールの変更だ。
GPT-6 Sol は、OpenAI 型のスタックにとってより安全な継続性の選択肢であり、プロンプトが短く、統合がすでに構築済みなら、より安価な選択肢でもある。その利点は能力ではない——総合評価では見劣りする——が、前任モデルがまだ稼働しており、移行に期限がないことにある。
今日入手できる数値で見る限り、Claude Sonnet 5.5 は独立系インデックスと長文脈の経済性において直接対決で勝利し、これまでに公表されたどの測定もベンダー自身の表が示す信頼度を超えて検出できないような点では、何も負けていない。それは発表資料が打ち出す主張よりも狭い主張であり、実際に行動する価値があるのはその主張だ。
答えを変えるのは、エージェント型評価における2回目の独立実行と、同一タスクにおける両モデルのタスクあたりトークン数の公開値だ。その両方が存在するまでは、総合指数は実行コストの低いモデルの9ポイントリードであり、総合指数での9ポイントのリードは、あなたのワークロードでの9ポイントのリードと同じではない。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
