
Claude Fable 5.1 vs Grok 4.6:9つのインデックスポイントと8倍の出力価格——その差が実際に買えるもの
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
Claude Fable 5.1 と Grok 4.6 は、現在の世代の価格帯を両端で挟む2つのクローズド・フロンティアモデルです。Anthropic の新しい旗艦モデルは2026年9月1日にリリースされ、入力トークン100万個あたり10.00ドル、出力トークン100万個あたり50.00ドルを請求します。また、Artificial Analysis の Intelligence Index の現在のバージョンでは53に位置し、同指数が追跡する201モデルのうち1位です。SpaceXAI の Grok 4.6 は8月12日から利用可能で、同じ単位に対して2.00ドルと6.00ドルを請求し、指数は44で、201中20位です。この2つを隔てる指数ポイントは9です。出力価格は8倍の差があります。特定のワークロードが気にすべきは、その2つの数字のどちらなのかという点がすべてであり、それらはモデルに何を任せるかによって異なる方向を示します。
情報源について、先に明言しておきます。Artificial Analysisは9月にIntelligence Indexを再スコアリングしたため、ここに示す数値は2026年9月10日に取得した現行版に基づくものであり、8月の多くの報道でいまだに引用されている旧スケールによるものではありません。バージョンが異なるインデックス・スコアは比較できないため、以下の数値は各モデルの発表時に読んだ数字より低く見えるかもしれません。ベンダー報告と表示されているものはすべて、発表元ラボの評価シートに由来しており、中立機関による再現は行われていません。この但し書きの重みはここでは一様ではありません——Grok 4.6は1か月にわたって外部の精査を受けていますが、Claude Fable 5.1は登場から9日しか経っておらず、その主要な数値について公に知られていることの大半は依然としてAnthropicの発表によるものだからです。
2つのラボ、2つの異なるセール品
Anthropicの9月のリリースは、安全性のストーリーを後付けにした能力勝負の一打である。Claude Fable 5.1は、審査済みのサイバーセキュリティおよびライフサイエンス組織のみに提供される安全制限版の姉妹モデルであるClaude Mythos 5.1の一般提供版ツインだ。同じベースモデルで、異なるガードレールを持つ。Anthropicが売りにしているのは、独立系インデックスのトップ、100万トークンのコンテキストウィンドウ、単一レスポンスで最大128K出力トークン、そしてClaude CodeとClaudeアプリを中心に構築されたエージェントエコシステムである。その売り文句は明白だ。間違った答えがトークン代よりも高くつくほど難しい仕事のときに呼ぶべきモデル、それがこれだ。
SpaceXAIは、より狭く、そして時間とともにより攻撃的なものを売り出している。つまり、依然としてフロンティア級でありながら最も安価なモデルで、他の何かでエージェントを構築することが贅沢に見えるほど低価格に設定されている。Grok 4.6はスケールアップではない。Grok 4.5と同じ基盤に、より長い追加学習とより重い強化学習を施したものであり、ベンダーによれば「GPT-5.6 SolやClaude Fable 5に匹敵する知能」をもたらすという。$2/$6という価格で、しかもインデックスのトップ20圏内に留まる—それがこのモデルの全ての主張だ。それはまた、単なる価格ではなく戦略でもある。SpaceXAIはCursorを所有し、モデル公開の前日にGrok Botブラウザエージェントをリリースし、自社の消費者向けチャットアプリも運営している。コモディティ価格のフロンティアモデルは、それらすべての燃料となる。イーロン・マスクの公の算段—AI収益が他すべての事業部門を上回る、10GWの計算能力—も同じ方向を指している。このモデルはAPIマージンを最大化するように価格設定されていない。
仕様書、寸法ごとに
• 100万トークンあたりの価格 — Claude Fable 5.1 入力$10.00 / 出力$50.00 vs Grok 4.6 入力$2.00 / 出力$6.00。
• キャッシュ入力 — Claude Fable 5.1 は100万トークンあたり$0.25、Grok 4.6 は$0.50、そしてArtificial Analysisでは実効キャッシュ割引が75%に対して98%と記載されている。
• 長文コンテキストの価格設定 — Claude Fable 5.1 は、ウィンドウを100万トークンまでフラットな価格で提供します。一方 Grok 4.6 は、入力トークンが200Kを超えた瞬間にリクエスト全体を $4.00 / $12.00 / $1.00 に再価格設定するため、その割引は、長時間のエージェント実行が行われるまさにその領域で薄くなります。
• コンテキストと出力 — Claude Fable 5.1は、Grok 4.6の500Kコンテキストウィンドウ、lowからxhighまでの推論努力ダイヤル、および2倍のレートの高速バリアントに対して、1Mトークンのコンテキストウィンドウと最大128Kの出力トークンを備えています。
• 独立したスコア、速度、コスト — Artificial Analysisは、現在のIntelligence IndexでClaude Fable 5.1を53(201中1位)、出力トークン毎秒67.2、インデックスタスクあたり$7.63と評価しています。Grok 4.6は44(201中20位)、トークン毎秒52.8、タスクあたり$1.86です。どちらもその測定では「非常に冗長」または「やや冗長」と評価されています — Claudeモデルの出力トークンは1億9000万に対して、Grokは9400万です。
• ベンダーのベンチマーク主張 — Anthropic は Terminal-Bench-Science 0.1 で 52.6%(Claude Fable 5 の 24.7% の2倍以上)、Terminal-Bench 4.0 で 55.8%、Claude Fable 5.1 について GDPval-AA v2 で 1,853 を報告。SpaceXAI は Grok 4.6 について DeepSWE v1.1 で 65.9%、CursorBench v3.2 で 69.9% を報告し、さらに Terminal-Bench v3.0 で自己申告の 26% を報告している — これはベンダー自身の表の中で特に弱い行である。
• それぞれが動作する場所 — AnthropicのAPI、Claudeアプリ、Claude Code、Amazon Bedrock、Google Cloud、Microsoft Foundry vs SpaceXAI API、Cursor、Grok Build、Grok Botエージェント、Grokコンシューマーアプリ、Amazon Bedrock GovCloud。
• リリース — 2026年9月1日にClaude Fable 5.1、2026年8月12日にGrok 4.6。

9つのインデックスポイントが実際に表すもの
現在の独立した指標では、9月時点の順位に曖昧さはありません。Claude Fable 5.1 はスコア53で201モデル中1位、Grok 4.6 はスコア44で20位です。再スコアリングされた指標については、ひとつ明確にしておく必要があります。というのも、これは後から見ると発表週の数字が間違っていたように見える類のものだからです。Artificial Analysis は9月に Intelligence Index を組み替え、それに伴って両モデルの公表スコアも下がりました。9ポイントの差は実際のものですが、この指標は加重複合指標であり(エージェント型のタスクに大きく偏り、背後にはコーディング、科学的推論、一般的な能力がある)、次元ごとに混在した状況をひとつの数値に圧縮しているのです。
各次元のエビデンスはノイズが多く、その分より有用です。Anthropic自身のTerminal-Bench-Science 0.1のスコア——52.6%、前世代の24.7%の2倍以上——は、エージェント型AIの購入検討者が重視する長期的な科学・研究ワークフローをまさに標的としており、この特定のベンチマークに匹敵する現行モデルはありません。SpaceXAIのベンダーテーブルは、ソフトウェアエンジニアリング(65.9% DeepSWE v1.1、69.9% CursorBench v3.2)で最も強く、ターミナル主体のエージェントループで最も弱いものです。後者では、Grok 4.6のTerminal-Bench v3.0における26%は、GPT-5.6 Sol Maxの34.6%とClaude Fable 5 Maxの34.1%を下回っています。どちらのテーブルもベンダーによる自己申告であり、第三者による再現はされていません。これらは各ラボが自らの強みと考える領域を示すものであって、誰が勝つかを示すものではありません。

安いトークンの注意書き
Grok 4.6の価格優位性は本物であり、短い・中程度のコンテキストではその差は絶大です。出力が多いワークロードでは、生成トークンあたりのコストがClaude Fable 5.1と比べておよそ83%安くなります。しかし、この料金表には、最先端モデルの比較では通常見落とされる3つの側面があります。
1つ目は200Kのしきい値です。200,000入力トークンを超えると、リクエスト全体を$4/$12に再価格設定し、しきい値を超えたトークンだけが対象となるわけではありません。コンテキストを蓄積していく長時間のエージェント実行(両モデルの売りであるまさにそのワークロード)では、実効レートは警告なしに2倍になり、Claudeの価格の5分の1ではなくなります。2つ目は高速バリアントで、基本レートの2倍のコストがかかり、モデルの平均以下の出力速度を修正する、宣伝されている唯一の方法です。3つ目はサーバーサイドのツール呼び出しで、呼び出し1,000回ごとに別途課金されます。
Claude Fable 5.1の9月の価格改定は逆方向に作用する。名目上の$10/$50は変わらなかったが、キャッシュ読み出し価格は75%下落して100万トークンあたり$0.25となった。これは、長時間のエージェント型セッションが実際に費用を費やす部分、つまりツールの出力、ファイルの内容、過去のターンを何度も読み直すことに当たる。Artificial Analysisによると、その結果としての実効キャッシュ割引率は98%で、Grokの75%に対してである。再読み取りトークン100万あたり25セントを支払うことで、数時間にわたるエージェントの計算は、見出しのレートでは決して示されない形で変わる。
正直なカウンターウェイトは冗長性であり、それが実際のコスト差が8倍にならない理由である。Claudeモデルは同じインデックスタスクを完了するのに約2倍のトークンを出力するため(190M対Grokの94M)、Artificial Analysisのタスクあたりコスト指標は、Grok 4.6の1.86ドルに対してClaude Fable 5.1では7.63ドルとなる。これは8倍ではなく約4倍であり、予算を計画する際の基準となる数字である。
テーブルに決して載らない違い
インタラクティブ製品において、この2つのモデルが分かれるのはレイテンシーの部分であり、その結果は価格表示が示唆するものとは正反対です。Artificial Analysis は Claude Fable 5.1 を毎秒67.2出力トークンと測定しており(クラス平均を上回る数値です)。一方、Grok 4.6 は52.8で、同じ測定では平均を下回っています。Grok のインデックス要約は、Grok が同クラスの他モデルより遅いと明確に指摘しており、まさにそれが SpaceXAI が2倍の料金で高速版を販売している理由です。同じ独立した評価によれば、Anthropic のモデルは2つのうちでより冗長でもあります。つまり、安いモデルのほうが遅く、高いモデルは必要以上に長く書き出すのです。これらは互いに反対方向に作用する2つのコストであり、どちらも料金表には載っていません。
今日はどちらかにコミットせず、両方に電話をかける
9ポイントの差、タスクあたりコストの4倍の差、そして多数のティアからなる価格表の実務的な帰結は、ほとんどのチームが両方を実行すべきだということです。そして、興味深い問題は切り替え位置がどこにあるかです。それを実行するのは聞こえるより安価です。Claude Fable 5.1 と Grok 4.6 はどちらも OrcaRouter 上で、プロバイダーの定価のままマークアップゼロで提供されています。上記の $2/$6 と $10/$50 は請求書に記載される額であり、ベンダーの価格変更は同日中に反映され、リセラーのマージンに吸収されることはありません。1つのエンドポイントが両方をカバーするため、エスカレーションのパターンは2つ目の契約ではなくルーティングルールになります:Grok 4.6 に大量で範囲の明確な作業を送信し、推論の上限が必要なタスクは Claude Fable 5.1 にエスカレーションし、自動フェイルオーバーには、安価なモデルのスループットが締め切りに間に合わないケースをカバーさせます。ルーティングDSLはその連鎖を1つの場所で表現し、モデルフュージョンは、1つの意見では足りないほど重要なタスクでは、複数のモデルが一緒に回答できるようにします。すると価格差は、一度だけ下す判断ではなくなり、ワークロードのミックスが動くにつれて調整するラインになります。

誰がどれを選ぶべきか
誤った回答や放棄された回答のコストがトークンのコストを上回る場合は、Claude Fable 5.1を選択してください。具体的には、長期的なエージェント型リサーチ、高度な推論、Anthropicのセーフティ体制と段階的なゼロデータ保持制御が重要となる規制業務、そしてClaude Code内で動作するすべてのものが該当します。一方、作業が大量で範囲が明確かつスループットに寛容な場合 — バッチコーディング、抽出、生成、ターンが短く200Kの再価格ラインを下回るエージェントループ — そして、モデルがコンポーネントであり、タスクあたりのコストがビジネスケース全体を左右するエージェントを構築する場合は、Grok 4.6を選択してください。
{{1}}どちらの選択肢が固まる前に{{/1}}、注視に値する未解決のループが2つある。SpaceXAIはすでに近い将来に向けて{{2}}Grok 4.7{{/2}}を再びほのめかしており、もし同じ価格帯のまま能力が向上するなら、今日の割安モデルは数週間以内にミッドレンジになる。一方、Anthropicはほぼ毎月のペースで更新を行い、基本料金には触れずにキャッシュ価格を引き下げる姿勢を見せている。これは、{{3}}今回の対決の次の一手は指標ではなくコスト面にあるかもしれない{{/3}}ことを示唆している。どちらのループも今日のモデルの動作を変えるものではないが、モデルIDを設定値として維持する理由にはなる。パススルー価格とフェイルオーバーを備えた単一のエンドポイントでは、{{4}}それはプロジェクトではなくデフォルトである{{/4}}。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
