
Claude Opus 5.5 対 Claude Fable 5.1:より安価なモデルが独立系インデックスで勝利
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Anthropicは現在、ラインアップの最上位で2つのモデルを販売しており、2.5倍のコストがかかるほうが、表の頂点に立っているほうではない。Claude Opus 5.5は2026年9月22日にリリースされ、入力100万トークンあたり4ドル、出力100万トークンあたり20ドルで、Artificial Analysis Intelligence Indexでは58を記録している。Claude Fable 5.1は9月1日からフラッグシップの座を保っており、入力10ドル、出力50ドルで、スコアは53。どちらの数値も同じ評価者によるもので、同じ構成ファミリーで測定されており、その差は価格表示とは逆方向に開いている。これがこの比較が出発点とすべき事実だ。というのも、先週のローンチ記事のほぼすべてが、Opus 5.5をFable 5.1の割引版、つまりほとんどの作業で高価なモデルに「匹敵する」安価なモデルとして位置づけているからである。独立した数値は、割引モデルのほうが先行していると言っている。
それが実際に導入するものを変えるべきかどうかは別の問題であり、その答えは5ポイントの差よりも、誰も見出しにはしない2つの設定——各モデルがデフォルトでどのエフォートレベルを使うか、そしてどちらを高速化できるか——に左右される。
独立した数字たち、そしてそれらが共有する唯一のこと

Artificial Analysisはモデルごとに1つの構成を公開しており、これらの両方については「適応推論、最大努力、デフォルトフォールバック」とラベル付けされています。同じラベル、同じ評価者、同じ実行 — これにより、どちらのモデルにとっても最もクリーンな一対一の比較となります:
• Intelligence Index — Claude Opus 5.5 58(210中1位)対 Claude Fable 5.1 53(4位)
• 出力速度 — Claude Fable 5.1 は 65.8 tokens/秒で、ボード中央値の 71.0 を下回る。一方 Claude Opus 5.5 はボードにまだ未公開
• 初回トークンまでの時間 — Claude Fable 5.1 は274.43秒、ボード中央値は3.83秒。Claude Opus 5.5 は未公開
• インデックスにおける冗長性 — Claude Opus 5.5 は 2億6,000万 の出力トークンを生成したのに対し、全体の中央値は 8,800万 でした
• 価格 — Claude Opus 5.5 は100万トークンあたり $4.00 / $20.00、Claude Fable 5.1 は $10.00 / $50.00
これらの行のうち2つは、引用するのではなく読み解く必要がある。1つ目は「Max Effort」ラベルだ。どちらのモデルのスコアも出荷時のデフォルトを反映しておらず、両者のデフォルトは同じではない。これについては後述する。2つ目は冗長性の行で、これは Opus 5.5 が売り込まれてきたやり方と相反する。Anthropic の効率性に関する説明は、モデルがより少ないトークンで同じ答えに到達するというもので、ローンチ資料は、出力トークンが3分の1から半分減少したと報告するパートナーを引用している。Index 上では、引用ではなく実測で、Opus 5.5 は 260M トークンを出力し、ボード中央値は 88M だった。比較対象の典型的なモデルよりおよそ3倍おしゃべりである。両方とも真であり得る。Claude Opus 5 より少ないトークンを使いつつ、絶対量としては依然として冗長なモデルである可能性がある。しかし「より少ないトークン」という文言から見積もりを立て、自分の請求額から見積もっていないなら、確認すべきは独立した測定の方だ。
{{1}}プラス{{/1}}{{2}}6ドルで何が{{/2}}{{3}}買えるか{{/3}}

ベンチマークを取り除いてしまえば、違いは料金表にすぎない。ここにあるものはすべて、Anthropicが公開している料金ページのもので、今日時点で検証できる:
• 入力 — Opus 5.5では100万あたり$4.00、Fable 5.1では$10.00
• 出力 — 100万あたり$20.00 対 $50.00
• キャッシュ読み取り — Opus 5.5 では100万あたり$0.20、Fable 5.1 では$0.25
• キャッシュ倍率 — Opus 5.5 はキャッシュヒットをベース入力の0.05倍で請求し、Fable 5.1 は0.025倍で請求する。より高いベースに対する、より有利な倍率だ
• キャッシュ書き込み — Opus 5.5 では5分間のウィンドウで100万あたり$5、1時間で$8。一方 Fable 5.1 では$12.50と$20
• バッチAPI — Opus 5.5は半額の$2.00 / $10.00、Fable 5.1は半額の$5.00 / $25.00
• 高速モード — Opus 5.5 は $8.00 / $40.00 でこれをサポートし、出力速度は最大でおよそ 2.5 倍になります。Fable 5.1 は高速モードに一切対応していません
キャッシュの行は二度見する価値がある。というのも、この2つのモデルは通常のパターンを逆転させているからだ。Fable 5.1 のほうが倍率はより積極的で、ベース入力の 2.5% 対 Opus 5.5 の 5% だが、そのベースが $4 ではなく $10 であるため、キャッシュ読み取りは依然として絶対額では2つの中で高価なほうだ。上位モデルがキャッシュされたコンテキストのトークンで有利になる構成は存在しない。そして、倍率は移植できるものではない。Fable 5.1 のキャッシュ挙動に合わせて調整されたエージェントループは、Opus 5.5 ではキャッシュヒットあたり比例して多く支払うことになる。新規トークンあたりの支払いは減るとしても。
ファストモードこそが、より際立った非対称性だ。Anthropicのドキュメントでは、ファストモードはClaude Opus 5.5、Claude Opus 5、Claude Opus 4.8について記載されているが、Fable 5.1はそのリストに含まれていない。つまり、安価なモデルには高価なモデルには存在しないレイテンシーの調整手段があるということだ。しかも$8/$40で、これはFable 5.1の標準の$10/$50という出力レートを依然として下回っている。初回トークンの遅さが製品上の問題になるほどワークロードが対話的であるなら、Fable 5.1の実測の初回トークン時間が274秒である点に留意されたい。その数値は最大努力推論による産物であり、欠陥ではないが、評価者が記録した数値ではある。
デフォルトは同じではありません。そして、それこそが罠なのです
Anthropic自身のモデルドキュメントはこの2つのモデルを並べて示しており、実際の比較の多くを左右する行は価格ではありません。それはデフォルトのエフォートレベルです:mediumはClaude Opus 5.5、highはClaude Fable 5.1。どちらもオフにできない適応型思考を実行し、その深さはエフォートパラメータによってのみ制御されます。スケールはlow、medium、high、xhigh、maxです。
これが、「Opus 5.5はほとんどの作業でFable 5.1と同等」という発表時の一文と、その下にあるベンチマーク表が食い違って見える理由です。AnthropicのOpus 5.5の直接対決の行は、デフォルトより高いエフォート設定でラベル付けされていることがよくあります。Terminal-Bench 4.0の、Fable 5.1の55.8%に対する66.4%という数値は、mediumではなくxhighエフォートで実行されました。一方、Fable 5.1自身の数値は、そのより高いデフォルト設定で生成されました。異なるエフォート設定で比較された2つのモデルは、そもそも比較されているとは言えません。そしてAnthropicも自身の発表資料で、この能力レベルにおけるベンチマークの差は、スコアが示唆するほど実世界での違いを示す信頼できる指標ではないと警告しており、同じことを述べています。
実際問題として、これは選択ではなくチューニングの作業に決定を変えてしまう。Fable 5.1 から Opus 5.5 に移行するときに effort設定をそのまま引き継げば、モデルがどれだけ思考するかが知らぬ間に変わり、その後に得られる品質とコストのあらゆる数値が交絡してしまう。Anthropic の指針は、旧モデルの設定を移植するのではなく、複数の effort レベルをテストすることだ。それは手軽にできるのに、ほとんど誰もやらない。自分の評価を二度実行する必要があるからだ。
この組み合わせが元を取れる唯一の場面
両方を維持することを正当化するパターンはアドバイザーループだ。Opus 5.5が作業をこなし、難しい判断についてはFable 5.1に相談する。Anthropicはそれを測定しており、実際に精度は上がる——ただしコストとレイテンシは増える。これは、より遅いモデルをループに入れることから当然予想されるトレードオフだ。変わったのは、その背後にある算術だ。能力差がもっと大きかった頃は、$5/$25のワーカーを監督するために$10/$50を払う価値は明らかにあった。今や独立した指標でワーカーがアドバイザーを上回っているため、アドバイザーの貢献は、それ自身の評価がOpus 5.5を上回る特定のタスクに狭まり、しかもそれらのタスクは自分で特定しなければならない。ループは難しい一部分には依然として意味があるが、包括的な設定としては意味をなさなくなる。
どちらもキー1つ分の距離です
ここでチームがつまずく移行のポイントは、APIの表面ではありません。同じベンダーのモデルでありながら、エフォートのスケール、キャッシュ乗数、デフォルト設定がそれぞれ異なるという点であり、公平に比較するには、条件を揃えた構成で両方を自社のプロンプトに対して実行する必要があります。Claude Opus 5.5 は OrcaRouter 上で Anthropic 自身の $4.00 / $20.00、そしてClaude Fable 5.1 は OrcaRouter 上で $10.00 / $50.00 — プロバイダーの定価を0%のマークアップでそのまま適用しているため、Anthropic が価格を変更すればその日に両方の数字も動き、どちらも別契約や別 SDK を必要としません。

それこそが、この分割を理論ではなく実用的なものにしている。トラフィックの大部分を Opus 5.5 に送り、本当に難しいケースを Fable 5.1 にエスカレーションするルーティングルールを固定するのは、2つの統合ではなく、1つのエンドポイント上の設定だ — そして、一方のモデルが下書きし、もう一方が検証するように呼び出しを構成するのは、構築して維持しなければならないパイプラインではなく、ルーティング DSL の1行だ。エスカレーション経路が自分のワークロードに合わないと判明した場合でも、自動フェイルオーバーによって、リクエストは完全に失敗するのではなく、すでに特性を把握しているモデルに着地し続ける。
それを解決するものは何だろう
この比較の正直な現状はこうだ。Anthropic が公開した表では安価なモデルがほとんどの行で勝ち、Artificial Analysis が公開した別の表ではそれが完全に勝っている。しかもどちらも、あなたが実際に運用していないエフォート設定で実行されたものだ。どちらもデフォルトを揃えた管理された直接対決ではなく、第三者がそれを実施したこともない。それでもなお残る差——Claude Opus 5.5 は料金表のどの行でも実質的に安く、Fable 5.1 にはない高速モードをサポートし、両モデルが持つ唯一の独立スコアでも劣っていない——は、立証責任が移るほど大きい。もしあなたがデフォルトで Fable 5.1 を使っているなら、もはや問いは Opus 5.5 が十分に良いかどうかではない。あなたのワークロードのうち、どの具体的なタスクがmediumエフォートで失敗するか、だ。なぜなら、それらこそがあなたが割増料金を支払っている対象なのだから。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
