Claude Opus 5.5 vs GPT-6 Astra の生成されたタイトルカード。サブタイトルは「6ドルの差、および272,000トークンを超えると追加料金」。フラットな天秤のアイコンと、フッター行に「最大努力時の Artificial Analysis による Index、価格はベンダーによる。」と書かれている。本物の OrcaRouter ロゴが右下に合成されている。
Guides & Insights

Claude Opus 5.5 対 GPT-6 Astra:6ドルの差、そしてAstraが272K超で請求する第2の価格

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今月、2つのベンダーがそれぞれのフラッグシップ向けのベンチマーク表を公開したが、どちらも自社モデルが勝っていることを示しており、その2つのモデルを直接対決させた行はどちらの表にも1行も含まれていない。Claude Opus 5.5は2026年9月22日リリース、入力トークン100万あたり4ドル、そしてGPT-6 Astraは2026年9月3日リリース、入力トークン100万あたり10ドル——この両者の間で重複するベンチマークはちょうど2つしかなく、しかもそれを分け合っている。Anthropicの表ではOpus 5.5がAutomationBench関連の作業を取り、OpenAIの表ではAstraがそれを取っており、科学推論ではどちらの表でもAstraが明確にリードしている。ベンダー資料から読み取れるのはこれだけだ。独立系の見方はより曖昧さが少なく、しかも逆方向を指しており、価格の面に至ってはどちらよりもさらに偏っている。

各陣営が公開したもの

AnthropicのOpus 5.5向けの表は、独自のハーネスと独自のエフォート設定を使用しており、Astraを掲載している箇所の数値はAnthropicのもので、再実行したものではない。セット全体をベンダー報告として扱うこと:

• Terminal-Bench 4.0 — Claude Opus 5.5 が 66.4% 対 GPT-6 Astra が 57.9%(Anthropic は、Opus の実行で xhigh エフォートが使用されたと注記)

• FrontierCode v1.1 — Claude Opus 5.5 54.4% 対 GPT-6 Astra 53.3%

• GDPval-AA v2.1、ナレッジワーク — Claude Opus 5.5 1,846 Elo 対 GPT-6 Astra 1,542

・AutomationBench — Claude Opus 5.5 40.0% 対 GPT-6 Astra 41.4%(Astra が優位)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 対 GPT-6 Astra 64.6%(Astra が優勢)

• Humanity's Last Exam、ツール使用時 — Claude Opus 5.5 67.7% 対 GPT-6 Astra 57.2%

OpenAI 側の比較材料を揃えるのはもっと難しい。なぜなら OpenAI は Astra を Anthropic の旗艦モデルとではなく、自社の前身モデルと比較して公表しており、選んだベンチマーク——コンピュータ操作、フロントエンドエンジニアリング、一般知識——の大半は Anthropic の表にはまったく出てこないからだ。それは不誠実さではなく、ローンチ時の通常の行動であり、まさに、2 社の表から組み立てた比較が、2 つのモデルの比較ではなく 2 つの選択の比較になる理由である。両方の表が一致している唯一の点は、Astra がエージェント的科学とコンピュータ操作に強いこと、そしてコーディングでは両モデルが十分に接近しており、ハーネスの選択次第で結果が変わり得ることだ。

どちらのベンダーも選ばなかった、独立した解釈

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysisはすべてのモデルを単一の公開構成で実行しているため、ここにある数値のうち、同一の評価者が同一の条件下で算出したものはこれだけです:

• Intelligence Index — Claude Opus 5.5 は58で210中1位、GPT-6 Astra は53で6位

• 構成ラベル — Claude Opus 5.5「Adaptive Reasoning, Max Effort, Default Fallback」、GPT-6 Astra「max」

• 出力速度 — GPT-6 Astra は52.5トークン/秒。Claude Opus 5.5(未公開)と比べ、同価格帯では下位に位置する

• 初回トークンまでの時間 — GPT-6 Astra 352.15秒 対 ボード中央値 3.83秒;Claude Opus 5.5 は未公開

• 価格 — Claude Opus 5.5 入力 $4.00 / 出力 $20.00(100万あたり)対 GPT-6 Astra $10.00 / $50.00

• コンテキストと出力 — GPT-6 Astra の1Mコンテキストと128K最大出力 対 Claude Opus 5.5 の1Mと128K

5ポイントのインデックス差はそれ自体では決定的ではなく、そう読むべきものでもない——両モデルは同じ能力帯に位置しており、それが今四半期における「フロンティア」の意味だ。Astraの行が確かに示しているのは、そのプレミアムが、両モデルが登場する唯一のボード上で能力面のリードを買っているわけではないということだ。レイテンシの行は正直なところ厄介な要素である。初回トークンまでの352秒は、このグループで断トツに高い。ただしこれは最大エフォートで測定されたものであり、出力する前に考える推論モデルはこの指標では常に遅く見える。52.5トークン/秒という数値のほうがより汎用的で、$10/$50のモデルとしては低めである。

Astraの第2価格、272,000トークン超

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

料金表のところで、この2つはまったく比較にならなくなる。Astraの価格には段階があるからだ。標準料金は100万トークンあたり、入力$10.00、キャッシュ済み入力$1.00、キャッシュ書き込み$12.50、出力$50.00。ただし入力トークンが272,000を超えると、リクエスト全体が再価格設定される——超過分だけでなく、呼び出し全体が——入力とキャッシュ料金は2倍、出力は1.5倍になる。その結果、長文コンテキストの処理は100万トークンあたりおよそ入力$20、出力$75になる。

Claude Opus 5.5 はそうなっていない。Anthropic は標準価格で 1M トークンウィンドウ全体を含めて $4.00 と $20.00 を請求し、900K トークンのリクエストは 9K トークンのものと同じトークン単価で請求されると明言している。したがって、この両者の見かけの比率——Astra は入力・出力の両方で Opus 5.5 の 2.5 倍かかる——は、両モデルが実際に販売されているワークロードに当てはまる比率ではない。大規模な作業コンテキストを抱える長期的なエージェントでは、比較は $20/$75 対 $4/$20 となり、入力で 5 倍、出力でほぼ 4 倍になる。バッチ料金はそれを解決するどころか増幅させる。Opus 5.5 は $2.00/$10.00 に半減する一方、Astra の flex ティアは、長コンテキストの場合ですでに 5 倍高いベースで $5.00/$25.00 に半減する。

これはこの対決で最も意思決定に関わる唯一の非対称性であり、どちらの企業のローンチ表にも見えません。なぜなら両ベンダーともヘッドライン料金を提示しているからです。プロンプトが272Kトークン未満なら、無視してください。リポジトリや文書セットを読むエージェントを構築しているなら、何かを比較する前に$20/$75で見積もってください。

アクセスは仕様の一部です

Astraは、同社独自のPreparedness Frameworkの下でCriticalサイバーセキュリティ能力閾値を初めて超えたOpenAIモデルであり、この展開は能力ではなくその分類を反映したものだ。アクセスはまず限られた一連の組織に開放され、エンタープライズアクセスでは管理者が有効化しない限りユーザーには表示されず、出荷されたモデルは一部のカテゴリの作業を outright に断る。Claude Opus 5.5は、同じ問題を逆方向から抱えた形で登場する。Anthropicが以前Claude Fable 5.1のために確保していたセーフガード階層を伴って出荷されており、つまり大半のサイバーセキュリティ関連の要求はClaude Opus 4.8に再ルーティングされ、生物学の作業はアカウントが検証されない限りClaude Opus 5にフォールバックする。

どちらの挙動も同じ場所、つまりあなたの評価に現れる。Artificial Analysis が Opus 5.5 の構成に「Default Fallback」というラベルを付けているのは、リクエストが、あなたが指定したモデルとは異なるモデルに到達しうるからであり、セキュリティやライフサイエンスのプロンプトではそれが日常的に起こる。あなたのワークロードがこれらの領域にある場合、リクエスト内のモデル文字列は、応答したモデルを保証するものではなく、品質の数値には、呼び出しのうち不明な割合で、より小さいモデルが含まれることになる。どちらのベンダーもこれを隠してはいない — 両者とも文書化している — が、どちらの見出しもそれについて言及してはいない。

それらの中から選ぶこと

この対決が実際に突きつける判断は、長文脈のワークロードがAstraの段階課金を正当化するかどうかであり、ほとんどのチームにとって答えはノーになるだろう。272K未満のすべての料金ラインでOpus 5.5のほうが安く、それを超えると劇的に安くなり、唯一の独立系ボードでもスコアが高く、しかも追加料金なしで1Mトークンのコンテキストに到達する。Astraの強みが当てはまる場面はより狭く、しかし現実に存在する——科学的推論、コンピュータ操作、そしてOpenAIエコシステムのツール群——であり、もし自社の評価でそれらにおいてAstraが上回るなら、割高な分は誤りではなく一つの経費項目である。

これが実用的になるのは、この2つを互いにどう競わせるかにかかっています。公平な比較には、両方のモデルを同じキーと同じ請求で動かす必要があるからです。どちらもOrcaRouterを通じて、プロバイダーの定価、マークアップ0%でルーティングできます — Claude Opus 5.5はAnthropicの$4.00/$20.00、GPT-6 Astraは$10.00/$50.00 — つまり、272Kの判断は2つのプレスリリースから論じるのではなく、自社のトラフィックでテストできます。Astraをそれが勝つタスククラスに固定し、自動フェイルオーバーに残りを担わせるのはルーティングルールであり、272Kの線を越えるリクエストは、コード変更なしでより安価な経路に送ることができます。なぜなら、そのルールはアプリケーションではなくルーターに存在するからです。

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

何が答えを変えるだろうか

一つだけ挙げるなら、共有ベンチマーク上で努力量を揃えた管理下の直接対決だ。どちらのベンダーもそれを公表しておらず、公表するインセンティブもない。そのため、利用可能な同一条件の比較は独立系インデックスだけになり——そしてそのインデックスでは、Opus 5.5 が Astra を5ポイント、5ランク上回り、しかもトークン価格は半分未満だ。注視に値する反論は、両モデルとも最大努力で採点された一方、Opus 5.5 はデフォルトで medium に設定されて出荷されるというものだ。もし長期的な科学作業における Astra の優位が、努力量を揃えた実行でも生き残るなら、プレミアム料金を正当化する根拠は弱まるどころか強くなる。誰かがそれを実行するまでは、擁護できる立場はこうだ——Astra は汎用モデルとして価格づけされた専門特化モデルであり、Opus 5.5 はたまたまより高いスコアを出す汎用モデルである。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新