
GPT-6 対 Claude Opus 5.5:誰もが手に入れたばかりのモデルと、今なお首位を走るモデル
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2026年10月7日、GPT-6は12億人を超える週間ChatGPTユーザーが会話するモデルになったが、それでも独立系ボードで最高スコアのモデルではない。GPT-6 Sol — OpenAIがChatGPT Plus、Pro、Business、Enterprise向けに有効化したティア — は、Artificial AnalysisのIntelligence Index v4.3.2で47.6を記録する。Anthropicが2026年9月22日に100万入力トークンあたり$4.00、100万出力トークンあたり$20.00で提供開始したClaude Opus 5.5は、同じリビジョンで57.6を記録する。両ベンダーのマーケティングチームが評価対象にされることを受け入れる唯一の測定基準で、10ポイントの差だ。
その差は本物だし、私もそれを軽く扱うつもりはない。だが、10月のこの組み合わせについて言えば、それは最も面白みのない事実でもある。なぜなら、今週変わったのはベンチマークではないからだ。GPT-6は、OpenAIがIntelligent UIと呼ぶ機能を備えてChatGPTに全員向けに登場し、その展開の有料ティアを支えるモデルはGPT-6 Solだ。つまり、有益な比較はもはや「どのAPIが優れているか」ではない——「GPT-6を手にしたばかりの12億人が実際に何を得たのか、そしてそれはビルダーやチームがClaude Opus 5.5への支払いをやめるに足るものなのか」だ。2つの答えは異なり、その違いは10ポイントではない。
10月7日に実際何が変わったのか
正確に言えば、これはローンチではない。GPT-6 SolとGPT-6 Lunaは2026年9月22日にAPIモデルとして提供開始された。フラッグシップであるGPT-6 Astraはそれより前で、OpenAIは2026年9月3日にリリースした。10月7日に起きたのは、GPT-6がPlus、Pro、Business、Enterprise向けにChatGPTのチャットタブへ全世界で到達したことで、FreeおよびGoティアは10月8日から続いた。エンタープライズアクセスは依然として職場の管理者の設定に依存する。これはリリースではなく配布イベントであり、この区別は古い報道を読む人にとって重要だ。
それに付随する機能こそが真に新しい部分だ。Intelligent UI により、GPT-6 は質問ごとに選ばれたテキスト、グラフィック、タップできるボタン、フォーム、グラフから回答を構成し、モデルが生成するのに合わせてインターフェースをストリーミングできる。OpenAI 自身の説明では、比較は並べて返り、説明はインタラクティブな図として返り、テキストが適切な答えである場合にはプレーンテキストの回答が返ることがある、というものだ。これに伴い、ベンダーが報告した 2 つの社内結果がある。価値の高い日常的なエージェントタスクでは、Extra High effort の GPT-6 が Medium の GPT-5.6 と同じ時間で回答を開始しつつ、Extra High の GPT-5.6 よりも総合的に良いスコアを出す。また、ウェブ検索を必要とする質問では、GPT-6 Instant が GPT-5.6 Instant より平均して 44% 早く回答を開始する。どちらも OpenAI の数字であり、同社自身の発表から再掲したもので、まだ独立した再現はない。
2つの料金表、そして10ポイントがどこで購入されるのか
今週、どちらのモデルも価格を変更していません。Claude Opus 5.5 は9月22日以降、入力$4.00、出力$20.00です。GPT-6 Sol は同じ日以降、$2.00と$10.00です。各次元につき1行、それぞれの行に両側を:
• 見出し入力 — GPT-6 Sol は100万トークンあたり2.00ドル、Claude Opus 5.5 は4.00ドル。Solは半額
• 見出し出力 — GPT-6 Sol は100万トークンあたり10.00ドル、Claude Opus 5.5 は20.00ドル。これもまた半額
• 長コンテキスト条項 — GPT-6 Sol は入力トークンが272,000を超えると、リクエスト全体を入力4.00ドル、出力15.00ドルで再価格設定する。Claude Opus 5.5 には、その100万トークンのウィンドウにおいて比較できる段階が存在しない
• キャッシュ入力 — GPT-6 Sol は100万トークンあたり0.20ドル、Claude Opus 5.5 は0.20ドル。同水準
• Intelligence Indexスイート全体を実行するコスト — Claude Opus 5.5 はタスクあたり5.98ドル、GPT-6 Sol は1.04ドル。その10ポイントと引き換えに支払う5.7倍の差
• コンテキストウィンドウ — GPT-6 Sol は1,050,000トークン、Claude Opus 5.5 は1,000,000トークンで、両者とも出力上限は128,000トークン

4行目は、実際の導入の大半を左右する行であり、マーケティングページに載っている行ではない。GPT-6 Solの長コンテキスト割増は、自社の見出し価格と比べて強気だ。入力トークン272,000を超えるリクエストを出すと、超過分だけでなくリクエスト全体が$4.00と$15.00で請求される。大きな文書をコンテキストに保持した長いセッションを続けるエージェントにとって、これは半額という利点の大半を静かに奪い去る。Claude Opus 5.5には同等の段階がないため、400,000トークンのリクエストでも4,000トークンのものと同じトークン単価になる。
10点がどこに存在するか、それらは均等に散らばっていないからだ
指数合成値は自らの構成要素を隠しており、これもまた異常に凸凹したプロファイルを隠している。両ベンダーの数値を突き合わせて読める個々の評価を引き出せ:
• Humanity's Last Exam — Claude Opus 5.5 61.4% 対 GPT-6 Sol 47.9%、抽象的推論で13.5ポイント差
• SciCode — Claude Opus 5.5 66.9% 対 GPT-6 Sol 57.6%、研究グレードのコードで9.3ポイント差
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% 対 GPT-6 Sol 43.9%
• 長文コンテキスト想起 — Claude Opus 5.5 84.7% 対 GPT-6 Sol 83.7%、1.0ポイント差で、このページで最も小さい
• マルチターンのエージェント型ツール使用 — 両モデルは τ²-Bench ファミリーで数ポイント以内の差にとどまり、どちらも高い性能を示す

分布こそがすべてだ。抽象的な推論——難しい試験問題や、模範となる既存の答えが存在しない研究課題——において、Claude Opus 5.5 は決定的に先行しており、その差はノイズと呼ぶにはあまりにも大きい。非常に長い入力から事実を1つ取り出すことにかけては、両者は実質的に互角であり、GPT-6 Sol のほうがコンテキストウィンドウはわずかに大きい。あなたのワークロードが長文書の検索と長時間セッションのエージェント作業なら、その10ポイントはおおむね他人事だ。それが真新しい推論なら、それはあなたの問題であり、それを避けるにはタスクあたり5.7倍のコストを払うことになる。
ChatGPTの展開が教えてくれることと教えてくれないこと
「週間12億ユーザーが今やGPT-6を利用している」を能力の証拠として読んでしまう誘惑がある。そうではない。それは普及に関する証拠であり、OpenAIは明言している——ChatGPTの展開は、有料プランではGPT-6 Sol、FreeとGoではGPT-6 Lunaが支え、どちらも「日常会話向けに調整」されており、API製品とは異なる最適化目標だ。WorkとCodexを支えるモデルはこのリリースでは変わっておらず、これは発表の中で、これが能力のリリースではなくコンシューマー向けサーフェスの出来事であることを示す最も明確なシグナルだ。「12億人が使っているGPT-6」をベンチマークする人は、自分が測定しているのはチャット向けに調整されたデプロイであり、APIエンドポイントではないと知るべきだ。
ロールアウトが変えるのはデフォルトだ。誰にでもただ存在しているモデルは、意図的に選ばなければならないモデルよりも、はるかに多くのプロトタイプ、社内ツール、未完成のサイドプロジェクトで使われる。長く使える何かのためにAPIを選ぶなら、そうした環境への自然な親しみには価値がある——だが、それはインデックス10ポイント分の価値はないし、推論負荷の高いパイプラインにおけるタスクあたりコスト5.7倍分の価値もない。
選ばずに両方を実行
ここで「乗り換えるべきか」に対する正直な答えは、この2つのモデルは求める役割が異なり、乗り換えの問いは主にルーティングの問いだということです。どちらもOrcaRouterのカタログにあり——GPT-6 Solはベンダーの$2.00/$10.00で、$4.00/$15.00の長コンテキスト階層は変更なしでそのまま通され、Claude Opus 5.5は$4.00/$20.00——1つのキーと1つのOpenAI互換エンドポイントの背後に、プロバイダー定価に対して0%のマークアップで提供されています。これは、ベンダーがコンシューマー向けの展開を変更した週にはいつも以上に重要です。なぜなら、私たちの価格ラインは私たちのものではなくプロバイダーのものだからです。
この組み合わせに適したパターンは分割だ。長文書と長時間セッションのトラフィックは、そのトークン数でより安い方へ送る——272,000トークンを超えると、それはもはやGPT-6 Solではない——そして新規推論のトラフィックはClaude Opus 5.5へ送り、GPT-6 Solは自動フェイルオーバーとして待機させておく。そうすれば、一方のルートでのレート制限があなたの側の停止になることはない。出荷するために10項目の議論に決着をつける必要はない。必要なのは、自分のリクエストのうちどれが、それが当てはまる分布の部分にあるのかを知ることだ。

評決、といっても大したものではないが
Claude Opus 5.5 は、両社が共通して公表している指標の上ではより優れたモデルであり、難度の高い推論で最も重要となる2つの評価では、その差は僅差ではない。GPT-6 Sol は、表示価格で半額、独立系スイートでのタスクあたりコストは5分の1、そして今や、同僚の大半がすでに開いているアプリの既定モデルだ。このどちらの事実も今週変わってはいない。変わったのは、GPT-6 が選ばなければならないものではなく、すでに手にしているものになったことだ。
注意すべきは、OpenAIの次の一手が能力面の一歩なのか、それともまた流通面の一歩なのかということだ。同社自身の発表はその期待を明示している——時間をかけて人々が必要とするインターフェースのより多くをChatGPTに作らせたいと同社は述べており——それは指数のポイントではなく、接点に関するロードマップだ。もしあなたの判断が指数に懸かっているなら、依然としてClaude Opus 5.5がそれを制する。もし判断が大量利用時のコストと、すでに誰もが知っているモデルであることに懸かっているなら、GPT-6 Solが今日のより安全な既定であり、長文コンテキスト条項が、その料金表で予算に織り込まなければならない唯一の行だ。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
