
Claude Opus 5.5 vs GPT-6 Astra:ベンチマークを追い抜いたテイストテスト
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
誰かが Claude Opus 5.5に、ライバル研究室がナビエ・ストークス方程式を解く様子についての短い動画を作るよう頼み、その結果を投稿し、そしてこの比較を行う価値があると感じさせる一文を書いた。このモデルは「とても感じがよく」、「センスがいい」、そして Opus 4.7 以降で初めて、彼らが実際にヘビーに動かしたいと思える Claude だ——しかしそれでも、GPT-6 Astraと GPT-5.6 Sol を主力として使い続けている。なぜなら彼らの仕事は研究色が強いからだ。これは1つの投稿に3つの主張があり、それぞれ異なる方向を向いている。モデルは一緒に作業するのに最も快適な存在でありながら、それでも本番トラフィックを流す先ではないことがある。興味深い問いは、どちらのモデルが優れているかではない。その2つの評価のうち、どちらが数字と突き合わせても耐え、どちらが結局は好みについての表明にすぎないのか、ということだ。
この投稿は一人の実務者による報告であり、ベンチマークの実行結果ではない——モデルが創造的で自由な作業においてどう感じられるかについてのシグナルとして扱うべきで、能力に関する証拠として扱うべきではない。以下に挙げる数値はすべて、誰がそれを出したのかが明記されている。
味覚テストでわかることとわからないこと
ここで重要なのは成果物そのものだ。数学的結果についての動画を作ることは、合否の関門があるコーディング作業ではない。コンパイル手順も、テストスイートも、それがどれだけ優れているかを採点する Terminal-Bench のハーネスも存在しない。モデルは切り口を選び、何を見せるかを決め、一貫性を保ち、そしてやめる必要があった。実務者がモデルに「優れたセンス」があると言うとき、それが意味しているのはこれだ。つまり、仕様が意図的に曖昧な作業で現れる、範囲と強調についての判断である。
それは実際に備わった能力であり、ベンチマークスイートが最も苦手とする測定対象でもある。同じ人があるモデルを称賛しても、それに乗り換えない理由でもある。センスは、探索しているときこそ必要なものだ。20万行のコードを監査し、請求額を正当化しなければならないときには、必要なものではない。
Anthropic自身の発表時の説明は、動画ではなく文章で、同じ能力を指し示している。Claude Opus 5.5は、より「Claudish」の少ない文章を書くものとして売り込まれている——前置きが少なく、曖昧な言い回しも少なく、要点を先に置こうとする姿勢がより強い。独立した可読性スコアは、その程度について一致しない場合でも、この主張の方向性を支持している。ベンダーはまた、社内のファクトチェックテストで18回中16回に成功したと報告している。Claude Fable 5.1とClaude Opus 5はいずれも18回中0回だった。この数字はAnthropic自身によるもので、再現されておらず、結果ではなく主張として読むべきだ。
2つのスコアボード、1つの重大な食い違い

公開されている生のベンチマークでは、Claude Opus 5.5がGPT-6 Astraを上回ることのほうが多い。問題は、最も引用される2つの情報源の間で、その差がどの程度なのかについて見解が一致していないことだ。
Anthropicの発表表では、Claude Opus 5.5がTerminal-Bench 4.0で66.4%を記録し、GPT-6 Astraが57.9%、Claude Fable 5.1が55.8%となっている。これはエージェント型コーディングにおけるベンダー報告の8.5ポイントリードであり、マーケティング資料では議論を終わらせる類いの差だ。Artificial Analysisが独自のハーネスで測定したところ、同じベンチマークでClaude Opus 5.5は59.6%だった。xhigh effortのGPT-6 Astraと同等で、Claude Opus 5より約11ポイント高い。そのリードはどちらの測定でも実在する。ただし、その大きさは実在しない。
二つのモデルが入れ替わる箇所は、そうでない箇所よりも有益である:
• Terminal-Bench 4.0(エージェントコーディング)— Claude Opus 5.5 は Anthropic 自身の表で 66.4%、Artificial Analysis で 59.6%、GPT-6 Astra は 57.9%。
• 人類最後の試験(ツール使用時)——Claude Opus 5.5 はベンダー報告で 67.7%、独立測定では 61.4%、GPT-6 Astra は 57.2%。
• GDPval-AA v2.1(44職種にわたる実世界のナレッジワーク) — Claude Opus 5.5 1,846 Elo、GPT-6 Astra 1,542 Elo。両方の数値はArtificial Analysisの独立した評価ボードによるもので、ベンダーによるものではありません。
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64.6% 対 Claude Opus 5.5 58.7%。これはAstraの文句なしの勝利であり、科学色の強いエージェント型ベンチマークです。
AutomationBench — GPT-6 Astra 41.4% 対 Claude Opus 5.5 40.0%。僅差だが、またしてもAstra。
• FrontierCode v1.1 — Claude Opus 5.5 が54.4%、GPT-6 Astra が53.3%。わずか1ポイント差。
そのリストは、実務家の目で読んでほしい。研究色の強いワークロード——科学や文献の要素を含むもの、ツールを使う長いループを回し、モデルが足場を保ち続けることを要するもの——こそ、GPT-6 Astra が地歩を保つ領域だ。Claude Opus 5.5 が独走している知識労働とコーディングのボードは、もしあなたの仕事がソフトウェアを出荷することなら、あなたが指をさすものだ。この会話の二人はどちらも、自分が見ているベンチマークを正しく読んでいる。ただ、読んでいるベンチマークが違うだけだ。
エフォート設定のほうが、モデルよりも多くの仕事をしている
見出しの利益率が弱いのには、もう一つ、あまり褒められたものではない理由がある。ベンダー間の比較が同じ設定で行われていないのだ。
Claude Opus 5.5 の公表値は、推論エフォートを extra-high(xhigh)に設定した構成で得られたもので、GPT-6 Astra は high で比較されています。Artificial Analysis の独立した実行では、両モデルが xhigh に設定され、コーディングの差は消えます——ベンダー側の 8.5 ポイントのリードは引き分けになります。これは不正行為の告発ではありません。ベンダーが自社モデルを最もよく見せる設定を選び、独立系ラボが競合と条件を合わせた設定を選ぶと、こうなるのです。ベンチマーク表を根拠にワークロードを移行する前に、それがどのエフォート設定で実行されたかを確認してください。というのも、答えはしばしば「見栄えのよい方」だからです。
トークン請求額は、別の角度から同じ話を物語っている。Anthropic自身の発表資料では、Claude Opus 5.5は1問題あたりおよそ119,000トークンを消費し、そのうち約84,000が思考に充てられているのに対し、GPT-6 Astraは同等の問題をおよそ27,000トークンで解く。思考トークンは出力トークンとして課金される。出力価格が5分の1で4倍のトークンを使うモデルは、ほぼ差し引きゼロに近い——しかもこれは、安い方のモデルこそ、どのみちより高いeffort設定で走らせてもよかったものであることが多いという事実を考慮する前の話だ。
さらに一つ、特に Claude Opus 5.5 側に固有の注意点があります。Anthropic のセーフガードルーティングは、サイバーおよびバイオ関連のリクエストの一部を、より制限の厳しい経路に振り分けることがあり、その結果、それらの評価で公表されているスコアは、基盤モデルが本来出すであろう値よりも低く抑えられます。あなたの業務がこれらの領域に触れる場合、ベンチマークとあなたの実体験の間のギャップは現実のものとなり、しかもその方向は、ベンチマークのほうが楽観的であるという方向になります。
実際のタスクはそれぞれいくらかかるのか

Claude Opus 5.5は料金表の中でより安価なモデルであり、その差は大きい:
• Claude Opus 5.5 — 入力100万トークンあたり$4.00、出力100万トークンあたり$20.00、キャッシュ済み入力100万トークンあたり$0.20、キャッシュ書き込み100万トークンあたり$5.00。コンテキスト1Mトークン、最大出力128k。
• GPT-6 Astra — 入力100万トークンあたり$10.00、出力100万トークンあたり$50.00、キャッシュ済み入力100万トークンあたり$1.00、キャッシュ書き込み100万トークンあたり$12.50。単一リクエストで入力トークンが272,000を超えると、リクエスト全体が入力$20.00、出力$100.00で再価格設定されます。バッチティアは$5.00/$25.00です。
つまり、Claude Opus 5.5 は入力で2.5倍安く、出力でも2.5倍安く、キャッシュ済み入力なら5倍安い。タスクがトークン数的に似ているなら、それが判断のすべてであり、好みの話は飾りにすぎない。
上記のトークン使用量に関する注意点があるため、話はそれほど単純ではありません。そして、GPT-6 Astraの長文コンテキストの価格改定がもう一つの落とし穴です。1回のリクエストで272,000入力トークンを超えると、超過分だけでなくリクエスト全体が長文コンテキスト料金に移行します。大規模なコーパスを1回の呼び出しに詰め込むリサーチワークロードは、まさにそれを引き起こす典型的な形です。半額のバッチが正当な回避策ですが、それはより遅いキューにあります。
正直にまとめると、コストの見え方は何をしているかによって逆転する。両方のモデルが同程度のトークンを使うタスクなら、Claude Opus 5.5 が価格で大差をつけて勝つ。Anthropic 自身の発表資料が示すようにトークン数が大きく異なる長いエージェント型リサーチループでは、両者は収束する——これは40%のコスト削減という見出しよりずっと刺激が少なく、その実務者が報告していた内容に近い。
調査重視のユーザーが切り替えなかった理由
断片を組み合わせれば、「それでもAstraのほうが好み」という一言は「素晴らしい味」という一言と矛盾しなくなる。それは別の席から見た同じ観察なのだ。
ユーザーが挙げたワークロードは、長く、オープンエンドで、ツールを使い、1回の実行あたりのコストが高い。それらにおいて、GPT-6 Astra は科学と自動化のリーダーボードで首位を維持し、思考トークンはごく一部しか使わず、独立した測定によれば、両モデルを同じ努力量で動かしたときコーディングでは互角に並ぶ。Claude Opus 5.5 の優位性は、出力を見て判断できる作業に集中している。散文、デザイン上の選択、曖昧なブリーフのスコープ設定、ナビエ・ストークスに関する動画が実際に何を見せるべきかの判断だ。それはセンスであり、センスこそがベンチマークの軸には現れない部分そのものだ。
もし、どちらか一方のモデルが勝つという判定を期待していたなら、証拠はそれを支持していない。擁護可能な言い方はもっと狭い。Claude Opus 5.5 は判断がボトルネックになる作業により適したモデルであり、GPT-6 Astra は持続的な長文脈の取り組みがボトルネックになる作業により適したモデルであり、両者の価格差は後者の種類の作業ではほとんど無に縮まる。それは変換ではなく、ルーティングの決定である。
マイグレーションを行わずに両方を実行する

ここから、2つのモデルは二者択一ではなくなります。GPT-6 Astra は本日より OrcaRouter で OpenAI の定価でご利用いただけます — 入力 $10.00、出力 $50.00、キャッシュ読み取り $1.00、キャッシュ書き込み $12.50 — マークアップは 0%、プロバイダーの定価をそのまま反映。つまり、ベンダーの料金変更は、リセラーが同期するのを待つのではなく、当日中に当社側に反映されるということです。
Claude Opus 5.5 は Anthropic 自社の API と複数のサードパーティ製プラットフォーム経由で利用できます。当社はそれを提供対象として記載しているわけではなく、モデルが普及する前に、当社が提供しているなどと主張する人がいても懐疑的になるべきです。今日できるのは、両方のモデルを 1つのキーと1つのエンドポイント形状の背後に配置し、好みではなくワークロードごとにルーティングすることです。オープンエンドで判断の比重が大きいリクエストは Claude Opus 5.5 に、長いリサーチループは GPT-6 Astra に送り、2つの契約や2つのクライアント統合を維持する必要はありません。
自動フェイルオーバーがあるからこそ、それを安全にテストできるのです。 新しいモデルはまだ本番経路ではありませんし、単一のエンドポイント経由でルーティングするということは、プロバイダーの障害やレート制限が起きたときに、リクエストが失敗するのではなく別の経路へ回されるという意味です。自分の仕事でそのテイストの差が実在するかどうかを確かめたいなら、それが安上がりな確かめ方です — すでに使っているものと置き換えるのではなく横に並べて実行し、ローンチ時の表ではなく自分のテストスイートに判断させてください。
ベンチマークが答えられない問い
注目すべき点は2つあり、どちらも新たなベンチマークのスコアではない。
第一は、エフォート設定の非対称性が解消されるかどうかだ。現時点では、ベンダーの表で xhigh 対 競合の high という条件は8.5ポイントのリードを生むが、設定を揃えた独立テストでは引き分けになる。独立系ラボが、GPT-6 Astra が現在首位に立つ科学・自動化のボードで、設定を揃えた実行結果を公表するにつれて、その見方はどちらにも動き得る——そしてそれは、誰かのフレーミングではなく証拠に基づいて動く。
第二は、トークン効率の問題だ。Claude Opus 5.5の思考オーバーヘッドがポイントリリースで下がれば、その2.5倍の料金表上の優位性は相殺されなくなり、価格の論拠が完全に勝利する。そうならなければ、GPT-6 Astraをメインドライバーとして使い続けた実務者は、ニュースサイクルに遅れているわけではない。彼らは自分のワークロードを正しく読み取っていたのであり、発表時の表は単にそれを測っていなかっただけだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
