
Claude Fable 5.1 vs GPT-5.6 Sol:新たなNo.1対価格で挑む下剋上
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123知能49コーディング
2026年9月第1週のClaude Fable 5.1とGPT-5.6 Solに関する報道をどれでも手に取れば、同じ一文にでくわすだろう。Anthropicの新フラッグシップは2026年9月1日にリリースされ、Anthropicが実施したほぼすべてのベンチマークでOpenAIのGPT-5.6 Solを上回った、と。その一文は事実であり、また物語の小さな半分でもある。大きな半分はこうだ。GPT-5.6 Sol、つまり2026年7月9日から本番稼働しているOpenAIのフラッグシップは、定価でおよそ2.5倍安く、同じ作業で使うトークンが測定上約3分の1少なく、そして——9月8日のEpoch AIの価格再分析によれば——プロンプトが短ければ短いほど一層魅力的に見える。Claude Fable 5.1は独立系インデックスで新たに1位となり、66に対しGPT-5.6 Solは61。その5ポイント差に支払う価値があるかどうか、それがまさにこのページの論点のすべてである。
スコアボードと、各数値を報告した人
まず、どちらのベンダーも支配できない唯一の数値から始めよう。Artificial Analysis Intelligence Index(最大努力時)では、Claude Fable 5.1 は66点を記録しており、これはAAがこれまでに記録した最高値である。一方、GPT-5.6 Sol は61点である。ただし、Anthropicが実際に提供しているデフォルトフォールバック構成についてAAのモデルページに記載されているスコアは53で、それでも201モデル中1位である。これが両者の対戦を最も明確に示す第三者機関の評価だ。Anthropicの旗艦モデルが現在の上限であり、OpenAIとの差は確かにあるが、それほど大きなものではない。
その下にあるコンポーネントベンチマークは、誰が実行したかによって分かれており、そこは混同しないように整理しておく価値がある。AnthropicはClaude Fable 5.1について、Terminal-Bench-Science 0.1で52.6%(GPT-5.6 Solの22.4%に対し)、Terminal-Bench 4.0で55.8%(同37.3%に対し)、CursorBench 3.2.0で73.4%(同67.2%に対し)、GDPval-AA v2で1,853(同1,711に対し)と報告している。一方OpenAIは、GPT-5.6 SolがSWE-bench Verifiedで約96%と報告している。これはソフトウェアエンジニアリングの指標であり、AnthropicがFable 5.1について公表しているどの数値よりも高い。Anthropicはそのベンチマークを一切報告していないからだ。このパターンを正直に読み取るべきだ。各ベンダーは自分が公表することを選んだ指標ではリードしているが、両社が共通して受けるベンチマークはほとんどなく、コンポーネントの数値はベンダー自己報告による方向性の目安として扱い、ベンダー間の事実として扱ってはならない。インデックスと自前の評価だけが、直接比較できる唯一のシグナルである。
スペックシートを並べて表示
• 価格 — Claude Fable 5.1 は 1M あたり $10.00 / $50.00 で、長さに関係なく一定。一方、GPT-5.6 Sol は入力が272Kまでは 1M あたり $4.00 / $20.00 だが、それを超えるとリクエスト全体が $8.00 / $30.00 に再設定される(Epoch AI の9月8日の分析による)。キャッシュ読み取りは $0.25 対 $0.40。
• コンテキスト / 最大出力 — Claude Fable 5.1: 入力1M / 出力128K。GPT-5.6 Sol: 入力約1.05M / 出力128K。
• 入力 — どちらもテキストと画像を受け付けます。
• 独立スコア — Claude Fable 5.1 はAAインテリジェンス指数(最大)で66、GPT-5.6 Sol は61。
• トークナイザー — OpenAIによると、GPT-5.6 Solのトークナイザーは一般的なテキストで約34%少ないトークンを使用しており、これはレートカードには決して載らない値下げです。
• ステータス — Claude Fable 5.1 GA 2026-09-01; GPT-5.6 Sol GA 2026-07-09(プロモーションの入出力レートが2026年後半まで適用中)


価格ギャップ、トークンギャップ、そして崖
計算は定価から始まり、そこからさらに興味深くなっていく。$4 / $20 と $10 / $50 を比べると、GPT-5.6 Sol はトークンあたり2.5倍安い。OpenAI が報告するトークナイザー効率、つまり同じテキストで約34%少ないトークンという要素を加えると、同じ論理的なタスクは、レートカードの比率が示唆する以上に Sol では大幅に低コストになる。これこそが、Anthropic の発表時の報道が代わりにキャッシュリードに注目した理由である。Claude Fable 5.1 の $0.25 キャッシュリード価格は確かに安く、それが長い再読エージェントセッションを $10 / $50 という見出しの数字から救っているのだ。100Kトークンのコンテキストを50回再読する場合、Claude Fable 5.1 では $1.25 かかるのに対し、GPT-5.6 Sol では $0.40 のキャッシュレートで $2.00 かかる。
そして、逆方向に働く崖もある。GPT-5.6 Solの$4/$20ティアは入力272Kトークンまでにしか適用されず、それを超えると、Epoch AIの9月8日の分析によれば、リクエスト全体が$8入力/$30出力に再価格設定される。Claude Fable 5.1にはそのような崖はない。$10/$50はどの長さでも一定で、非常に長い入力サイズでは、この定額料金がSolの再価格設定ティアを完全に下回ることがある。プロンプトが定期的に25万トークンを超えるチームにとっては、「安いOpenAIモデル」という枠組みは崩壊する。それ以外の全員にとっては、Solの価格とトークナイザーの利点が見出しとなる。
5つのインデックスポイントが買えるもの
5ポイントのインデックス格差は、早い段階で諦めるモデルが実行全体を台無しにする作業に、まさに集中している。Anthropicが報告したTerminal-Bench-Science(52.6%対22.4%)とAutomationBenchのマージンは、現在のフラッグシップ同士のいかなる組み合わせと比べても最大であり、Artificial Analysis自身のモデルページはその実際のコストを示している:インデックスを実行するのにモデル費用が$7.63、出力トークンが190M(中央値は92M)。より強いモデルは停止するまでに遥かに多くを書き出すからだ。あなたの仕事が自律研究、長期にわたるエージェント、または初期の誤った判断が複合的に悪化するようなタスクであれば、そのプレミアムは現在の上限を買うことになる。あなたの仕事が、GPT-5.6 Solがすでに評価を通過しているソフトウェアエンジニアリングであれば、5ポイントは税金である。
誠実な選び方
ここに安定した勝者はいません。そうでないふりをするのは、チームが過払いする道です。妥当な立場は、Claude Fable 5.1 を性能上限とし、GPT-5.6 Sol を価値基準として、自分のワークロードをその両方に照らして測定することです。それが低コストで済むのは、Claude Fable 5.1 と GPT-5.6 Sol がどちらも OrcaRouter 上でプロバイダーの定価で提供されており、マークアップなしで単一の OpenAI 互換エンドポイントの背後にあるからです。長期的なタスクとエージェント的なトラフィックは Claude Fable 5.1 にルーティングし、高ボリュームのソフトウェアエンジニアリングトラフィックは GPT-5.6 Sol 上に維持し、評価(evals)や価格表が変わりしだい、ルーティングDSLがモデルを上下に動かせるようにします。OpenAI のプロモーション料率が期限を迎え、Anthropic のポイントリリースが投入され、トークナイザーの利点はコーパスごとに異なって現れます。モデルは何度も入れ替わるでしょう。そうした入れ替わりに対応できる構成は、どちらの旗艦モデル単独よりも価値があります。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
