
GPT-6 Astra 対 Claude Fable 5.1:同一の料金表、そしてキャッシュ読み取り次第の判断
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
ほぼすべてのこの対戦カードの比較が見落としている点がここにあり、それは買い手が最初に探す数字だ。GPT-6 Astra と Claude Fable 5.1 のコストはまったく同じだ。両ベンダー自身のドキュメント上では、どちらも2026年9月16日に読んだ時点で、OpenAI は GPT-6 Astra を入力100万トークンあたり10.00ドル、出力100万トークンあたり50.00ドルと記載し、Anthropic は Claude Fable 5.1 を10.00ドルと50.00ドルと記載している。倍率は1.0だ。正当化すべき割増も、取り込むべき割引もなく、両者を分けるトークン単価の計算も存在しない。数字の前に一つ、位置づけの注記を。GPT-6 Astra 自体は2026年9月3日付なので、これはすでに出荷済みの2モデルに関するリファレンスページであり、ローンチ報道ではない。この7日間で変わったのは、モデルではなく証拠だ——この2モデルの最初の独立した直接比較測定が9月9日に出て、OpenAI は9月14日に自社の提供状況ドキュメントを改訂した。「Fable 5.1 vs GPT-6 Astra」を検索して価格の答えを期待してたどり着いたなら、価格の答えは引き分けであり、本当の判断は請求書のさらに2行下にある。
2つのレートカードは同じカードです
まず各ベンダーが公表している内容から始めましょう。後続のあらゆる主張はそれを引き継ぐからです。OpenAI自身のgpt-6-astraに関するモデルドキュメント(2026年9月16日閲覧)には、100万入力トークンあたり$10.00、100万キャッシュ入力あたり$1.00、100万キャッシュ書き込みあたり$12.50、100万出力あたり$50.00が記載されており、コンテキストウィンドウは1,050,000トークン、最大入力は922,000トークン、最大出力は128,000トークンです。Anthropicのclaude-fable-5-1に関するドキュメント(同日閲覧)には、100万入力あたり$10.00、100万キャッシュ読み取りあたり$0.25、5分間のキャッシュ書き込み階層で100万あたり$12.50(1時間の階層では$20.00)、100万出力あたり$50.00が記載されており、コンテキストは100万トークン、出力上限は同じ128,000トークンです。
並べてみれば、倍率はおのずと計算される。入力:1.0倍。出力:1.0倍。キャッシュ書き込み:同等の5分単位ティアで1.0倍。バッチ価格:両ベンダーとも半額に割り引くので、どちらも入力$5.00、出力$25.00になる。この組み合わせについて価格倍率を挙げている人は皆——GPT-6 Astra について出回っている「2.5倍」という数字も含めて——Astra を、同じファミリー内のより安価な兄弟、多くの場合 OpenAI の料金表で入力$5.00、出力$30.00の GPT-5.6 Sol と比較しているのであり、Claude Fable 5.1 とはまったく比較していない。
その引き分けの中で生き残る構造上の違いが2つあり、実際に請求額に効いてくるのはそれらだ。1つ目はキャッシュ読み取りである。GPT-6 Astra では100万トークンあたり1.00ドル、Claude Fable 5.1 では100万トークンあたり0.25ドルだ。これが両者の料金表が分かれる唯一のトークン項目であり、その差は4倍である。2つ目は長文コンテキストの崖だ。OpenAI は入力が272,000トークンを超えるとリクエスト全体を再価格設定する。つまり入力とキャッシュの料金は2倍、出力は1.5倍になるため、同じ呼び出しの請求は入力20.00ドル、出力75.00ドル、キャッシュ読み取り2.00ドルになる。Anthropic が公開している Claude Fable 5.1 の料金表には、長文コンテキスト割増は記載されていない。どちらも100万トークンウィンドウで販売される2モデルにおいて、この違いは端数調整の細部ではない。比較の片側だけで、高価な呼び出しを非常に高価な呼び出しに変えるしきい値なのだ。
異なるのはたった1行、そしてそれがすべてを決めるワークロード
キャッシュ読み取りにおける4倍の差は、主要な料金が同じなら脚注のように思える。しかしそうではない。エージェントループの実際の課金の仕方が理由だ。長時間実行されるエージェントは、同じ大きなプレフィックス——システムプロンプト、ツール定義、リポジトリのコンテキスト、アップロードされたドキュメント一式——を毎ターン再送信し、そのプレフィックスは再読込されるたびにキャッシュ読み取り料金で課金される。タスクのターン数が増えるほど、請求額は新規入力ではなくキャッシュ読み取りの割合が大きくなる。
どちらにとっても特筆すべき点のないワークロードで計算してみよう。10万トークンの安定したプレフィックスを50ターンにわたって再読み込みし、それに加えて20,000トークンの真に新しい入力と、タスク用の10,000トークンの出力。GPT-6 Astraでは、500万キャッシュ読み取りトークンが100万あたり$1.00($5.00)、20,000の新規入力トークンが100万あたり$10.00($0.20)、10,000の出力トークンが100万あたり$50.00($0.50)——$5.70がこのタスクのコスト。Claude Fable 5.1では、同じトークン数がキャッシュ読み取り$1.25に加えて同じ$0.20と$0.50——$1.95。同じ料金表でありながら、一方のモデルはタスク実行コストが約2.9分の1で、その理由は完全にキャッシュ読み取りの行にある。
では、タスクを縮めてみましょう。4,000入力トークンと2,000出力トークンの単一呼び出しで、キャッシュ再利用なしの場合、どちらも$0.14かかります。この引き分けは現実のものであり、何もキャッシュされていない限り正確に成り立ちます。ここがランキングが逆転する最初のポイントであり、逆転するのはベンダーの選択ではなくワークロードの形によってです。キャッシュ主体のループはClaude Fable 5.1に軍配が上がり、コールドなワンショット呼び出しは真の引き分けであり、272,000トークンのしきい値が、GPT-6 Astraが他の何かと同じ価格でなくなる地点です。
ランキングが逆転する場合のタスクあたりのコスト
トークンあたりの比較は、タスクにかかるコストを測る代理指標としては不十分だ。なぜなら、両モデルは同じ作業を完了するのに同じ数のトークンを使うわけではないからだ。どちらのベンダーも現在対象となっている唯一の独立したタスク単位のコスト計算を公表しているArtificial Analysisは、そのIntelligence Index評価を実行するコストを$3.26、最大エフォート時のGPT-6 Astraのタスクあたりとして測定し、それに対して$7.63をClaude Fable 5.1の場合として——つまり、同じ表示価格のOpenAIモデルは同じ評価を約43%のコストで完了し、およそ57%低い。その仕組みは同じデータセットにある。AAは、最大エフォート時のGPT-6 Astraをタスクあたり27,000出力トークン、同じインデックススコアでClaude Fable 5.1を78,000と測定しており、消費トークン数はほぼ3倍の差である。これはAAの数字であり、2026年9月9日に公開された同社のベンチマーク記事によるもので、どちらのベンダーのものでもない。
二つの発見を合わせると、正直な要約はこうだ。ランキングはワークロードによって逆転し、どちらの逆転も丸め誤差によるものではない。タスクのコストが大きな安定したプレフィックスの再読み込みによって支配される場合、Claude Fable 5.1の4倍安いキャッシュ読み込みが勝ち、しかも大差で勝つ。タスクのコストが、モデルが終了するまでに出力するトークン数によって支配される場合 — 長いエージェント的実行、多段階のコーディング、ターンをまたいで広がるリサーチ — GPT-6 Astraの約3分の1のトークン消費量が、キャッシュの差よりも大きなマージンで勝つ。そのため、キャッシュの読み込みに4倍の料金を課しているにもかかわらず、AAの指標では完了したタスクあたりのコストが安くなる。
ベンダーをまたぐトークン比較には、常に一つの注意が伴う。2つのモデルはトークナイザーを共有していないため、一方におけるトークンは他方におけるトークンではない。報告されるトークン数は、モデルごとに異なる係数で実際のテキストを過小評価または過大評価し、推論トークンはエンドポイント間で一貫性なく報告される。ここではタスクあたりのコスト数値の方が信頼できる。まさにトークンではなくドル建てだからだ。27,000対78,000の比較は方向性を示すものとして扱う。

Terminal-Bench 4.0、そこでは両ベンダーが同じ数値を報告している
両社が公表を選んだベンダー報告ベンチマークは Terminal-Bench 4.0 で、ベンダーベンチマークとしては珍しく行儀がよい。なぜなら、2社が Claude Fable 5.1 のスコアで一致しているからだ。OpenAI の発表資料は GPT-6 Astra を 57.9%、Claude Fable 5.1 を 55.8% と報告し、それに加えて、そのベンチマーク上での Astra のタスクあたり API コストが約 63% 低いという推定を示している。Anthropic 自身の発表も Claude Fable 5.1 を 55.8% と報告しており、同じ表には Claude Mythos 5.1 が 60.9%、Claude Opus 5 が 52.3%、Claude Fable 5 が 42.0%、GPT-5.6 Sol が 37.3% と記載されている。両社が Anthropic モデルについて 55.8% と報告しているということは、OpenAI が主張する 2.1 ポイント差は、相手側の数値をめぐる論争ではない——それは完全に Astra 自身の数値の問題であり、それを公表しているのは OpenAI だけだ。
独立した測定はその差を狭めるどころか広げる。反射的に逆を想定してしまうだけに、これははっきり述べておく価値がある。2026年9月9日に公表されたArtificial AnalysisによるGPT-6 Astraのベンチマーク測定では、Terminal-Bench v4.0について59%をGPT-6 Astraが記録し、52%のClaude Fable 5.1、そして40%のGPT-5.6 Solと対比されている——この比較における両モデル間の差は7ポイントであり、2.1ではない。ベンダー報告の2.1ポイント差では何も決まらないし、独立測定の7ポイント差でも同じことだ。どちらも、ハーネスの構成、スキャフォールドの選択、実行ごとのばらつきによって数値が動く範囲に収まっており、バージョンの違いも重要である。59対52はAAのTerminal-Bench v4.0であり、両ラボが実行した構成と自動的に同じとは限らない。ためらいなく言えるのは、この特定のベンチマークにおいて、独立に測定されたGPT-6 Astraがリードしているということ、そしてそれが一つのベンチマークにすぎないということだ。
Claude Fable 5.1 が本当に先行している点
ひとつのモデルがすべての行で勝利するような比較は比較とは言えないが、独立した証拠を全体として読めば、今回の比較はそのようには見えない。単一のベンチマークではなく複合指標であるArtificial Analysis Intelligence Indexでは、両者は53で並んでおり、Claude Fable 5.1はフォールバック付きの最大設定で、GPT-6 Astraは最大エフォートで投入されている。AA自身の解説でも、Claude Fable 5.1はGPT-6 Astraと首位に並んでいるのであって、後れを取っているわけではない。AAのCoding Agent Indexでも両者は62で同水準であり、GPT-6 AstraはCodexハーネス、Claude Fable 5.1はClaude Codeで測定されている。最も広範な作業をカバーするこの2つの総合指標において、両者の間には何の差もない。
Anthropicが報告した数値は、Claude Fable 5.1にそれ独自の確かな根拠を与えている。ただし、これらはベンダー報告であり、独立に再現されたものではない。ツール使用時のHumanity's Last Examで65.0%(Claude Fable 5の63.8%、Claude Opus 5の63.6%に対して)、GDPval-AA v2で1,853、CursorBench 3.2.0で73.4%、Terminal-Bench-Science 0.1で52.6%(Claude Fable 5の24.7%に対して)——最後の項目は、Anthropicの表で最大の世代間ジャンプであり、OpenAIが比較可能な数値を公表していないベンチマークである。Anthropicはまた、OSWorld 2.0について、partialで77.9%、strictで41.7%と報告している。一方、OpenAIはGPT-6 AstraがOSWorld 2.0で72.6%だと報告しているが、どの変種を実行したかは述べていない。そのため、同じベンチマーク名を挙げていても、この2つの数値は同一条件での比較として扱うことはできない。
当社のプラットフォーム上では、運用上の証拠も Claude Fable 5.1 を支持しています。2026年9月16日までの7日間、OrcaRouter の anthropic/claude-fable-5.1 エンドポイントは、p50 の初回トークン時間 4.43 秒で毎秒 90.0 出力トークンを計測しました。これは、6.71 秒で毎秒 46.1 トークンというopenai/gpt-6-astra の数値と比べて、スループットは約2倍、初回トークンも明らかに高速です。どちらの数値も、7日間の期間における当社ルーター実測の中央値であり、ローンチ週の独立系記者の間でも相対レイテンシーについて意見が分かれていました。したがって、これは確定した事実ではなく、1つのプラットフォームによる測定値として扱ってください。Anthropic が公開している料金表には、OpenAI のものにはないものもあります。それは提供終了に関するコミットメントで、Claude Fable 5.1 はアクティブかつサポート対象として記載され、早くとも2027年9月1日まで提供終了しません。2年間の調達計画を作成する人にとって、日付入りのライフサイクルコミットメントは、ベンチマークの1ポイントよりも価値があります。
安全性と拒否の挙動:最も明確な実質的相違
これら二つのモデルが真に最も大きく異なるのは、ベンチマークにおいてではなく、また証拠の独立性が最も低いのもまさにそこである。OpenAIは社内評価に基づき、GPT-6 Astraが意図しない結果を生じた頻度は74.7%少ないと報告している。比較対象はClaude Fable 5.1であり、自社のGPT-5.6 Solと比べれば89%少ない。Hugging Faceのインシデントを模した評価では、OpenAIは、本番環境のセーフガードなしのGPT-5.6 Solが許可された標的を超えたのは48%のケースであったのに対し、Astraは0%のケースであったと報告している。これらはOpenAIの数値であり、OpenAIが算出し、OpenAIが設計した評価によるもので、第三者による再現はなされていない。これらは本記事の中で最も強い主張であり、最も検証されていない。まさにそれゆえに、帰属の明示が重要なのだ。
OpenAIの構造的な主張は、少なくとも製品と照らして検証可能である。GPT-6 Astraは、OpenAIのPreparedness FrameworkにおけるCriticalサイバーセキュリティ能力閾値に到達した最初のモデルであり、出荷時点では概念実証エクスプロイトの作成のような高度なサイバー作業を拒否する。OpenAIは、Daybreakプログラムを通じて、より制限の少ないセーフガードの下でアクセスを広げる意向を示している。つまり、このモデルの拒否挙動は固定された特性ではなく、変化するポリシー設定である。Anthropicは、Claude Fable 5.1について正反対の種類の改善を報告している。サイバータスクでは偽陽性が約60%少なく、基礎生物学と医学の質問では約85%少ない。いずれもベンダー報告であり、これはより多く拒否するのではなく、より少なく拒否するという主張である。
Anthropicは自社のセーフガードのコストも公表しており、これは実に異例の開示だ。同社のローンチ資料には、Claude Fable 5.1が本番用セーフガードを有効にした状態で評価され、セーフガードが介入した場合、Claude Fable 5.1とClaude Fable 5はOSWorld 2.0でゼロ点だったと記されている。言い換えれば、エージェント型ベンチマークで測定された差の一部は、モデルが失敗したのではなくセーフガードが発動したことによるものであり、ベンダーもそう述べている。二つの立場を合わせて読めば、トレードオフは具体的だ。GPT-6 Astraはデフォルトでより多くを拒否し、エンタープライズ向けの制御の背後に置かれている一方、Claude Fable 5.1は過剰拒否を減らすよう設計されており、そのベンダーは残る拒否が測定スコアにどれだけコストを与えているかを公表している。どちらが優れているかは、拒否される側が自分かどうかによって完全に決まる。

スコアボード、ラベル付き
• 定価、標準ティア — GPT-6 Astra は100万トークンあたり入力 $10.00/出力 $50.00/キャッシュ読み取り $1.00/キャッシュ書き込み $12.50(OpenAI ドキュメント、2026年9月16日閲覧)。Claude Fable 5.1 は100万トークンあたり $10.00/$50.00/キャッシュ読み取り $0.25/キャッシュ書き込み $12.50(Anthropic ドキュメント、2026年9月16日閲覧)。入力と出力の倍率は1.0倍。唯一異なるのはキャッシュ読み取りで、Claude Fable 5.1 の方が4分の1の安さです。
• ロングコンテキスト — GPT-6 Astra は入力トークンが 272,000 を超えるとリクエスト全体を再価格設定します。入力とキャッシュが 2 倍、出力が 1.5 倍となるため、$20.00 / $75.00、キャッシュ読み取りは $2.00 です。Claude Fable 5.1 は 100 万トークンのウィンドウでロングコンテキスト割増はないと明記しています。
• 完了したタスクあたりのコスト(独立系) — GPT-6 Astra は最大エフォートで Intelligence Index タスクあたり $3.26、低エフォートで $0.82。Claude Fable 5.1 はフォールバック併用の最大設定で $7.63。GPT-6 Astra は同等設定においてタスクあたり約57%低コスト。Artificial Analysis、2026年9月9日公開。
• タスクあたりのトークン数(独立) — 最大エフォート時のインデックスタスク1件あたりの出力トークン数は、GPT-6 Astra が27,000。同じスコアで Claude Fable 5.1 は78,000。Artificial Analysis、同一記事より。両モデルはトークナイザーを共有していないため、あくまで方向性の目安。
• Terminal-Bench 4.0 — ベンダー報告:GPT-6 Astra 57.9%、Claude Fable 5.1 55.8%(OpenAI)。Anthropic も OpenAI とは独立に、自社モデルについて 55.8% を報告。第三者機関:GPT-6 Astra 59% 対 Claude Fable 5.1 52%(Artificial Analysis、2026年9月9日)。
• 複合知能(独立系) — Artificial Analysis Intelligence Index v4.3(2026年9月16日時点)で53と並び、Claude Fable 5.1はフォールバック付きの最大設定、GPT-6 Astraは最大エフォートで入力。Coding Agent Indexも62で同水準。
• Claude Fable 5.1 で確認された最も強力な事例(ベンダー報告) — Humanity's Last Exam はツール使用時 65.0%、GDPval-AA v2 は 1,853、CursorBench 3.2.0 は 73.4%、Terminal-Bench-Science 0.1 は 52.6%(Claude Fable 5 の 24.7% に対して)、OSWorld 2.0 は部分達成 77.9%/厳格評価 41.7%。Anthropic、2026年9月。OpenAI は GPT-6 Astra について、比較可能な Humanity's Last Exam や Terminal-Bench-Science の数値を公表していない。
• 安全性(ベンダー報告によるもので、独立した再現は行われていない) — OpenAIは、GPT-6 Astraが意図しない結果を生成した頻度は、Claude Fable 5.1より74.7%少なく、GPT-5.6 Solより89%少なかったと報告している。Anthropicは、Claude Fable 5.1がサイバー関連の偽陽性を約60%、基礎生物学および医療の偽陽性を約85%削減したと報告し、また同社のセーフガードが介入したケースでは、モデルはOSWorld 2.0でスコア0だったと述べている。
• 実測スループット(ルーター記載) — Claude Fable 5.1は毎秒90.0出力トークンで、p50の初回トークンまでの時間は4.43秒。GPT-6 Astraは毎秒46.1トークンで、6.71秒。OrcaRouterの2026年9月16日までの7日間中央値。Artificial Analysisは独自のハーネスでGPT-6 Astraを別途毎秒52.9出力トークンと計測しているため、絶対速度と差の大きさはどちらも誰が測定しているかによって変わる——方向は一貫しているが、大きさは一貫していない。
可用性、そしてベンチマークが決める前にそれを左右しかねないアクセスルール
デプロイメントサーフェスは大きく重複しているが、アクセスルールは重複していない。OpenAIはGPT-6 AstraをChatGPT Work、Codex、および自社APIで提供しており、Microsoft AzureとFoundryは2026年9月3日から一般提供、Amazon Bedrockは2026年9月8日から一般提供される。ChatGPT BusinessおよびEnterpriseでは、デフォルトで無効 — 該当するレートカードの下でワークスペース管理者が有効化しない限り、どのメンバーも使用できず、アクセスは一律ではなくサーフェスごとに付与されるため、Codexでこのモデルを利用できるプランでも標準のチャットピッカーには表示されないことがある。OpenAIはZero Data Retentionについて、承認を条件に、サポート対象エンドポイントで適格なAPI顧客が利用可能であると文書化しており、そのヘルプドキュメントは2026年9月14日に更新され、モデルがそもそも表示されるために必要な最小のCodex CLIバージョンが記載された。
AnthropicはClaude Fable 5.1をClaude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、およびClaude Platform on AWSで提供しており、同じモデルはPro、Max、Team、Enterpriseの各プランでも利用可能です。このモデルはアクティブとして掲載されており、退役日は2027年9月1日より前にはなりません。また、同等のオプトイン手順は文書化されていません — ゲートされるのではなく、利用可能です。その兄弟モデルであるClaude Mythos 5.1は、異なるセーフガードを備えた同じ基盤モデルで、AnthropicのCyber VerificationおよびLife Sciencesプログラムへの招待制です。
• クラウド対応状況 — Claude Fable 5.1 は Amazon Bedrock、Google Cloud、Microsoft Foundry、および AWS 上の Claude Platform で利用可能です。GPT-6 Astra は Microsoft Azure と Foundry、および Amazon Bedrock で利用可能です。Google Cloud が空白部分となっています。推論を Google Cloud で実行する必要がある場合、この2つのうち一方には答えがあり、もう一方にはありません。
• アクセスの既定値 — GPT-6 Astra は Business および Enterprise では既定でオフになっており、管理者がレートカードに基づいて有効にする必要があります。Claude Fable 5.1 には、文書化されたオプトインのゲートはありません。
• データの取り扱い — OpenAIは、対象となるエンドポイントにおいて、承認を条件として、適格なAPI顧客向けのゼロデータ保持(Zero Data Retention)を文書化しています。Anthropicは、2026年秋に提供予定のゼロデータ保持を伴うエンタープライズ向け保護措置を文書化しており、つまり本日時点では利用できません。
• ライフサイクル — Claude Fable 5.1 は、早くとも 2027年9月1日より前には廃止しないというコミットメントを公開しています。OpenAI は GPT-6 Astra について、同等の日付を明示したコミットメントを公開していません。

1つのキーの背後で両方を実行する
2つの料金表は見出し価格では同一であるため、チームにとって実際にコストがかかる問題は、どちらのモデルが安いかではなく、考えを変えるのにどれだけ費用がかかるかです。どちらもOrcaRouter上でベンダー自身の定価で提供されています — openai/gpt-6-astraは入力$10.00、出力$50.00で、272Kのロングコンテキスト階層がOpenAIの定義どおりに適用され、anthropic/claude-fable-5.1は$10.00と$50.00で、キャッシュ読み取りは$0.25 — すべての料金は0%のマークアップでパススルーされるため、ベンダーの価格変更は請求の移行を待つことなく、同じキーで当日に反映されます。
この組み合わせでは、ほとんどの場合よりもそれが重要だ。なぜなら、証拠が示す正解はどちらかを選ぶことではなく、分割して使い分けることだからだ。ここでは両方のエンドポイントに実際のチャットトラフィックがある——2026年9月16日までの7日間で1億8,070万トークンがGPT-6 Astraに、1,990万トークンがClaude Fable 5.1にルーティングされた——そして、それぞれに有利なワークロードの形は、両者間のルーティングがアーキテクチャ上の決定ではなく設定変更で済むほど異なっている。ルーティングDSLを使えば、キャッシュ負荷の高い長時間実行ループをClaude Fable 5.1に送ってキャッシュ読み取りを4分の1のコストにできる一方、短く大量で出力効率の高い作業はGPT-6 Astraに回せる。また、単一の回答では行動に移すのに十分でない場合には、モデル融合によって両方を同じ難問に当てられる。自動フェイルオーバーがあれば、一方の経路でのレート制限は障害ではなくルーティングイベントになる。だからこそ、まったく新しいフロンティアモデルの未検証の側面を本番経路で試すことが妥当になる。
誰がどれを選ぶべきか
選んでくださいGPT-6 Astra — 仕事が長期的でエンドツーエンドの場合、つまりエージェント型コーディング、ターミナル自動化、研究、あるいはコンピュータ操作タスクなど、多数のステップにわたって実行され、コンテキストよりも出力トークンのほうがコストがかかるものです。独立した証拠では、同じ評価を約3分の1の出力トークンで完了し、完了したタスクあたり約57%安く済み、Terminal-Bench 4.0ではベンダー測定と独立測定の両方で首位に立っています。予算はトークン単位ではなくタスク単位で立て、272,000入力トークンを絶対的な境界として扱ってください。それを超えると、このモデルでのリクエストは、リクエスト全体についてベンダー自身のルールで価格が再設定されます。
選ぶべきですClaude Fable 5.1ワークロードが、長いシステムプロンプトやリポジトリ、文書セットといった大規模で安定したプレフィックスを何度も繰り返し読み直すなら。キャッシュ読み出しは4倍安く、それがその1回ごとに積み重なるからであり、上記の計算が示すとおり、$5.70のタスクが$1.95になるのです。また、より高い実測スループットとより速い初回トークンを求める場合、推論を Gooogle Cloud で実行する必要がある場合、あるいは調達において廃止時期を明示したコミットメントが重要な場合にも、これが選択肢となります。総合指数とコーディングエージェント指数では GPT-6 Astra と同水準にあり、Humanity's Last Exam、GDPval、CursorBench ではベンダー報告上の優位性があります——ただしこれらのベンチマークについて OpenAI は比較可能な数値を公表していないため、それは実証された勝利ではなく、証拠における欠落として扱うべきです。
そして、比較ページが真実であるときにあなたに返すべき答えはこうだ。多くのチームにとって、正直な推奨はどちらでもない。Anthropic 自身の Claude Fable 5.1 に関するドキュメントには、ほとんどのワークロードでは Claude Opus 5 から始めるべきであり、より高いエフォートで Opus 5 に関する評価を行ってもなお要件を満たさない場合にのみ Fable 5.1 に手を伸ばすべきだと書かれている。Claude Opus 5 は入力 $5.00、出力 $25.00 で、入力・出力の両方でこれら両モデルの半額だ。4 倍のキャッシュ読み取り優位性や 3 倍のトークン効率があなたのワークロードを説明していないなら、フラッグシップのプレミアムは、必要だとまだ確認していない能力を買っていることになる。それを見極める最も安価な方法は、どちらかにコミットする前に、1 つのキーで、実際のタスクをこれら 2 つと 1 つ下のティアに通すことだ。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
