
Claude Sonnet 5.5 vs Claude Fable 5.1:安価なモデルが3ポイント先行
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 983 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 196 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
Claude Sonnet 5.5は2026年9月28日に、入力トークン100万個あたり2.00ドル、出力トークン100万個あたり10.00ドルで登場した。ベンダーが9月1日に投入したMythosクラスのモデル、Claude Fable 5.1は、同じ2つの料金行で10.00ドルと50.00ドルになっている。誘惑される要約は、Fable 5.1のほうが高価であり、したがって優れているというものだが、Artificial Analysis Intelligence Indexでは順序が逆になる。Claude Sonnet 5.5は56、Claude Fable 5.1は53だ。それは丸め誤差の産物ではなく、話のすべてでもない。同じ評価者が同じスイートで両者をタスクあたり3セント以内に置いているからだ — 7.60ドル対7.63ドル。料金表における5倍の差は、タスクが終わるころにはほとんど消えている。残るのは、スコアの違いではなく形の違いの集まりであり、この2つから選ぶことは、主に自分のワークロードがどの形をしているかという問題だ。
2枚の料金表、そして差が5倍ではない唯一の行
トークン単位の比較はあまりにも明白で、解釈の余地はない。
• 入力 — Claude Sonnet 5.5 が100万トークンあたり2.00ドル、それに対して Claude Fable 5.1 は10.00ドルで、5倍の差
• 出力 — 100万あたり$50.00に対して$10.00、ここでもちょうど5倍
• キャッシュ読み取り — 100万あたり $0.25 に対して $0.20。これは長時間のエージェント実行を支える項目であり、割引は 5× から 20% へと急落する。
• キャッシュ書き込み — 標準の5分間ウィンドウで100万トークンあたり$2.50 対 $12.50、どちらのカードでも単一で最大の差
• バッチ — Anthropicのバッチモードは、Fable 5.1に対するようには、これらのカードのどちらにも適用されません。Fable 5.1はバッチ料金で登場し、入力$5.00、出力$25.00に半減しました。ファミリー全体に引き継がれると想定する前に、Anthropic自身の料金ページでバッチの行を確認してください。
• コンテキストと上限 — どちらもコンテキスト 1,000,000 トークン、最大出力 128,000 トークン。Message Batches API では、Claude Sonnet 5.5 はベータヘッダー output-300k-2026-03-24 により最大 300,000 出力トークンをサポートしており、これはバルク生成にとって実際の上限の違いであって、マーケティング上のものではない
Claude Sonnet 5.5 にとって有利な、料金表が過小評価しているささやかな点が一つある。Anthropic によれば、このモデルは同じ作業をするのに前世代よりもはるかに少ないトークンで済むことが通常であり、それによってタスクあたりのコストが最大30%削減されると同社は述べている。それは別の比較——Sonnet 5.5 対 Sonnet 5——についてのベンダー側の主張であり、今回の対決に関する証拠ではない。しかし、それは独立した測定が明らかにした内容を説明する仕組みではある。
5倍の価格差はどこへ消えるのか
Artificial Analysisは2026年9月29日に、単一のハーネスと1つの構成ラベル「Adaptive Reasoning, Max Effort, Default Fallback」の下で、Intelligence Index v4.3上で両モデルを実行した。2つの主要な数値は、Claude Sonnet 5.5が56、Claude Fable 5.1が53である — 同じ評価者が中央値モデルを26と位置づける尺度で、より安価なモデルが約3ポイント先行している。どちらも同じページ上でベンダー名モデルとしてラベル付けされているため、これは1つの計器と1つのスナップショットであり、2つではない。
次にコスト列、そしてこの組み合わせが明白ではなく興味深い理由です。同じインデックス実行で、Claude Sonnet 5.5 はタスクあたり $7.602633、Claude Fable 5.1 はタスクあたり $7.629706 かかります。その差はわずか 0.027 ドルです。分解すると奇妙なのはここです。Claude Fable 5.1 の入力側だけでタスクあたり $3.73 で、Sonnet 5.5 の入力コンポーネントはかなり小さいのに対して、その推論トークンだけでタスクあたり $2.36 かかります。トークンあたりで5倍安いモデルが、完成したタスクあたりではまったく安くないのです。
原因は量にあり、2つのモデルは正反対の方向に失敗する。
• インデックススイート全体の出力トークン — Claude Sonnet 5.5 は 410,577,501 を生成し、Claude Fable 5.1 は 188,465,663 だった。追跡中央値が 8,800 万のスイートにおいて。どちらも中央値を大きく上回っており、Sonnet 5.5 は Fable 5.1 の 2 倍以上、中央値のほぼ 5 倍である
• タスクあたりの出力トークン数 — Sonnet 5.5 が 192,838 に対し Fable 5.1 が 78,111、うち推論の割合は 142,386 対 47,240。Sonnet 5.5 はタスクあたりおよそ 3 倍長く思考する
• インデックススイート全体の入力トークン — Sonnet 5.5 が185億、Fable 5.1 が56億。Sonnet 5.5 は3倍多く読み込んでおり、これはこのペアではより控えめな数字であり、安価な入力レートを食う側の数字だ
• 入力:キャッシュ読み取り:出力 = 7:2:1 の混合におけるブレンド価格 — Sonnet 5.5 の $1.54 に対し、Fable 5.1 は $7.17。これは料金表に一致する行であり、短く境界が明確な出力を持つワークロードを表す行です。
これらを合わせると、正直に言えるのはこうだ。ブレンド価格のギャップは実在するが、タスク単位のギャップはそうではない。その2つの数字のどちらがあなたの請求額を表すかは、あなたのタスクが終了するか、だらだら続くかに完全にかかっている。そして index suite は、それらがだらだら続くように作られている。
エフォートラダーこそが実際の意思決定です。
両モデルは effort パラメータ(low、medium、high、xhigh、max)を公開しており、どちらも 2026-09-29 にすべての段階で測定されました。これは料金表では決して表せない比較の一部分です。というのも、低い段階における安価なモデルは、低い段階における高価なモデルを大差で上回り、高価なモデルが差を付けるのは上位付近だけだからです。
• 低エフォート — Claude Sonnet 5.5 はタスクあたり $0.41 で 35.84 を記録し、Claude Fable 5.1 は $2.37 で 46.82 を記録します。最下位の段階では、高価なモデルがほぼ6倍の費用で11ポイント先行しています
• 中程度のエフォート — $0.59で40.74 対 $2.98で48.92。Fable 5.1は5倍のコストで8ポイントのリードを維持
• 高エフォート — 1.08ドルで46.74、それに対して3.91ドルで51.15。差は4.5ポイントに縮まり、コスト比は約3.6倍を維持している。
• Xhigh effort — 51.85($2.74)対 53.20($5.98)。1と3分の1ポイント差で、価格は46%。
• 最大エフォート — $7.60 で 55.98 に対し、$7.63 で 53.35。順序が逆転し、コストは 0.5% 以内に収束する
4行目と5行目を合わせて読むと、この対決の構図が見えてくる。xhigh の Claude Sonnet 5.5 は 51.85 を出し、これはどのエフォートでも Claude Fable 5.1 の最高スコアと 1.5 インデックスポイント以内であり、タスクあたり $2.74 対 $7.63 だ。あなたの仕事がフロンティアそのものではなく、フロンティアの近くであればよいなら、その行が答えのすべてであり、完了タスクあたり 64% を節約する。Sonnet 5.5 を max まで引き上げると、2.8 倍の金額でさらに 3 ポイントを買うことになり、Fable 5.1 の max と同じ請求額で、わずかに良いスコアと大きく異なる推論プロファイルに到達する。
あの最後の文は、突き詰めて確認する価値がある。直感に反するので、二度確認したくなるほどだ。最大エフォートを揃えた場合、料金表が5分の1のモデルは、高価な料金表のモデルと同じタスクあたりコストになる。そこに至るのは、2.5倍の出力トークンを生成し、そのうち推論が占める割合が3倍だからだ。Anthropic自身のドキュメントがこの仕組みの一部を説明している。トークナイザーが変わり、同じテキストでもClaude Sonnet 5.5では以前のモデルより約30%多くのトークンが生成される。これはいくつかある寄与要因の一つであり、トークナイザーの改訂をまたいで出力トークン数を比較する場合は、そのことを明示しなければ比較できないという有用な注意喚起でもある。
レイテンシは、両者が似なくなるポイントだ
スコアの収束は時間には及ばない。同じ2026-09-29のスナップショットにおいて、Artificial Analysisは、長いプロンプトのスライスでClaude Fable 5.1の初回トークンまでの時間が254.41秒、Claude Sonnet 5.5が2.80秒であり、出力速度の中央値はそれぞれ毎秒67.9トークンと49.4トークンだと報告している。これは、呼び出し側が何か届くまでに待つ時間における2桁の差であり、この比較で運用上最も重大な単一の数値である。
両方の数値には、その限定条件を明確に示す必要がある。Fable 5.1のTTFTは長いプロンプト種別で測定されている。同じモデルの同日における評価者の中程度プロンプトのスライスは117.60秒なので、254秒という数値は裾であり、定数ではない。Sonnet 5.5の2.80秒は全体の中央値であり、評価者自身の分散帯は第5百分位の1.91秒から第95百分位の4.23秒に及ぶ。Anthropicのプラットフォームドキュメントは、Fable 5.1の比較レイテンシをより遅い、Sonnet 5.5のそれを高速と記述しており、これは測定値ではないものの方向性としては一致している。
私たち自身のインフラは第三の測定値をもたらす。なぜなら、私たちは Claude Fable 5.1 をルーティングし、実際に提供しているものを測定しているからだ。9月28日までの7日間、OrcaRouter 自身のトラフィックでは、Claude Fable 5.1 の最初のトークンは中央値 6,973 ミリ秒、95パーセンタイルは 10.0 秒、出力速度は毎秒 65.8 トークン、エラー率は 0.349% だった。この p50 は、評価者の長いプロンプトでの数値より100倍以上速い。これは矛盾というより、用語の定義の違いである。短いプロンプトにおける開発者向けの最初のトークンと、長いプロンプトにおけるベンチマークの最初のトークンは、異なるものを測定しているのだ。リーダーボードの数値を前提に計画している人は、自分がどちらを買っているのかを知るべきだ。

ソーシングにおける誠実さ、定着、そして誰も口にしない移行
ベンダーのベンチマーク表と独立系評価は異なる計器であり、互いから差し引くべきではない。Anthropic自身のClaude Sonnet 5.5の発表時表では、Terminal-Bench 4.0が70.6%と報告されている。Artificial Analysisは独自のハーネスを実行し、同じモデルについて同名の評価で63.6%を報告している。Claude Fable 5.1では、この分かれ方は逆方向になる。Anthropicは発表時に55.8%と報告し、独立系ハーネスでは52.0%となる。どちらの組も、もう一方を訂正したものではない。それぞれを独自の基準で判断し、本番トラフィックをどこに送るかを決める際には、独立系の方を優先せよ。
データ保持の姿勢も異なります。そしてそれは、調達レビューでしか表面化しない種類の違いです。Anthropic は、Claude Sonnet 5.5 がゼロデータ保持で利用可能だと述べています。Opus 5.5 と Sonnet 5 で取ったのと同じ姿勢です。Claude Fable 5.1 の発表資料では、それと併存する段階的なデータ利用ポリシーと、Project Glasswing の下での別のデプロイについて説明されています。そのデプロイは安全監視のためにデフォルトで 30 日間の保持期間を伴い、ゼロ保持の取り決めは暫定状態と説明されています。あなたのチームがデータ処理レビューに答える立場にあるなら、その区別は脚注ではなく実際の明細項目です。そして、その要約(これを含む)ではなく、Anthropic の現在のポリシーページを読む価値があります。
移行コストは非対称であり、その実態がローンチ時の報道に取り上げられることはほとんどない。Claude Sonnet 5.5 への移行は、モデル文字列の変更ではない。Anthropic の移行ガイドによれば、デフォルト以外の temperature、top_p、top_k の値は 400 エラーを返すようになり、tool_choice に any または名前付きツールを指定すると即座に拒否され、up-front thinking をオフにして実行していた場合、thinking: {"type": "disabled"} は between_tools にしなければならない。between_tools タイプは low、medium、high の effort で受け付けられ、xhigh または max では 400 を返す。Claude API と Google Cloud では、computer use は computer_toolset_20260801 ツールセットを通じてのみサポートされ、古い computer_20251124 は拒否される。こうしたことは、Fable 5 からの同ファミリー内アップグレードである Claude Fable 5.1 への移行には当てはまらず、Fable 5.1 には独自の破壊的変更が3つある。両者を並行した移行先として比較検討しているなら、より安価なモデルのほうが採用には高くつく。

どれをどこに置くか
数字から導かれる判断とは、あなたのトラフィックのどれだけが適切にスコープ設定されているかについての判断です。
• 範囲が限定された、大量の、ツール駆動型の作業 — 最先端に近づく必要があるなら、xhigh effort での Claude Sonnet 5.5。Fable 5.1 の最高スコアより 1.5 インデックスポイント低いだけで、完了したタスクあたりのコストは 64% 少ない。最初のトークンを約 3 秒で返し、キャッシュ書き込みの料金が安いため、再構築されたコンテキストプレフィックスを手頃なコストで利用できる。
• 長期的な視野で取り組む、正解を間違えると高くつくオープンエンドな作業 — Claude Fable 5.1。Sonnet 5.5 の最高スコアを同じタスクあたりのコストで達成しつつ、そこに至るまでに推論トークンは3分の1、入力は4分の1で済みます。これは、タスクが真にオープンエンドで、評価スイートの形があなたの問題に似ている場合に重要です。
• レイテンシに制約されるインタラクティブなサーフェス——Claude Sonnet 5.5、そしてこれは接戦ですらない。評価者自身のスナップショットでは、長いプロンプト種別における初回トークンの差は2桁に達し、中程度のプロンプトの測定値でもそれは約118秒までしか縮まらない。バッチ処理やストリーミングで回避しない限り、Fable 5.1の数値の上にチャットサーフェスを構築することはできない。
• 長い出力を伴う一括生成 — Claude Sonnet 5.5。output-300k-2026-03-24 ヘッダーの背後で Message Batches API において利用可能な 300,000 トークンの出力上限に対し、それ以外のすべての環境では 128,000 トークンの上限となっているためです。コミットする前にバッチ料金を必ず確認してください。バッチ適用時のレートは、2 つのカードで同一ではありません
• アカウントをまたぐ必要がある作業、またはシステム間で推論を引き継ぐ作業 — そのどちらに着手する前にも、Anthropic の preserved-thinking ドキュメントを確認してください。Thinking ブロックは、それを生成したモデルとアカウントに紐づけられます。また、Sonnet 5.5 は、推論の抽出を防ぐ分類器を搭載した最初の Sonnet です。これはコンプライアンス機能であると同時に制約でもあります。
• 規制対象またはデータ保持に敏感なワークロード — リリース時の公表内容ではなく、現在のポリシーを確認してください。Claude Sonnet 5.5 は、ゼロデータ保持が利用可能な状態でローンチしました。Fable 5.1 の資料では、1つのデプロイメントでデフォルト30日間の保持期間を設け、ゼロ保持を暫定状態とする段階的なポリシーが説明されています。

OrcaRouterでは、Claude Fable 5.1 と Claude Sonnet 5 はどちらも1つの認証情報で利用でき、プロバイダーの定価でマークアップは0%です。そのため、それらを切り替えたときに請求額を動かすのは、キャッシュ読み取りの行とトークナイザーの変更だけです。Claude Sonnet 5.5 はまだ当社のプラットフォーム上のルートではありません — このモデルは登場から1日しか経っていません — ですので、正直に言えば、今日それを利用するには Anthropic 自身の API 経由になります。Fable 5.1 を当社経由で実行している人なら、統合の他の部分を何も変更せずに、提供開始日に切り替えの価格を見積もることができます。それまでの間、プロバイダー間の自動フェイルオーバーが、稼働し続けなければならない経路でこれほど新しいモデルを試すことを安全にしてくれます。
結論の差は、価格差が示唆するほど大きくはない。Claude Sonnet 5.5 は、ほぼすべての範囲が定まった作業にとって、より良いデフォルトだ——独立系の指標では3ポイント高いスコアを記録し、数秒で応答し、xhigh では1タスクあたりのコストを半分はるかに下回りながら、Fable 5.1 の上限まで1.5ポイント以内に迫る。Claude Fable 5.1 には、依然として1つだけ本物の主張が残っている。そしてそれは、Anthropic 自身の比較表が提示しているものだ。作業がオープンエンドで、誤るコストがより長く考えるコストを上回る場合、入力価格が5倍なのは、同じスコアに到達するのに3倍の推論トークンを費やさずに済むモデルを手に入れるためだ。選ぶ際の基準にすべきはタスクの形であり、料金表の大きさではない。なぜなら、推論努力の段階の最上位では、その2つのモデルの請求額は同じだからだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
