Muse Spark 1.2 対 Claude Fable 5
Guides & Insights

Muse Spark 1.2 vs Claude Fable 5:6つの指標ポイントが実際にいくらかかるのか

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Artificial Analysisは、ほとんどのベンチマーク表が省略しているもの、つまり費やした金額を公開しています。その9つの評価からなるIntelligence Indexの実行費用は、$637.85ではMuse Spark 1.2$5,630.52ではClaude Fable 5でした。同一のベンチマークスイート、同一のハーネスで、一方の請求額は他方の8.8倍です。Fable 5は60点、Muse Spark 1.2は54点でした。

その差を割ると、この比較が本当に問題にしている数字がわかります。つまり、そのワークロードでは、インテリジェンスの最後の6ポイントは、およそ$832/ポイントのコストがかかります。それを支払うべきかどうかはベンチマークの問題ではありません。それは、実際にあなたのトラフィックのどのくらいがそれらのポイントを必要としているかという問題であり、ほとんどのチームにとってその答えは、小さくて特定可能な一部分です。

限界指数点には価格があり、それは高額である。

両方の数値は、同じ独立系評価機関が同じ複合ベンチマーク — GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR — を実行した結果に基づいています。どちらもベンダーによる主張ではありません。Fable 5は185モデル中3位、Muse Spark 1.2は13位で、クラスの中央値は32です。両方とも平均を大きく上回っていますが、最先端にあるのは片方だけです。

Muse Spark 1.2 vs Claude Fable 5

定価はその差の大部分を説明しており、残りの部分を過小評価している:

入力 — Muse Spark 1.2 は100万あたり$1.25、Claude Fable 5 は$10.00。8倍。

出力— $50.00に対して$4.25。ほぼ12倍です。

キャッシュ入力 — $0.15 対 $1.00。約7倍です。さらに Fable 5 はキャッシュへの書き込みに100万件あたり $12.50、または1時間の TTL に対して $20.00 を請求しますが、Muse Spark 1.2 はキャッシュ書き込みの個別料金を一切公表していません。

ブレンドレート — Artificial Analysisによると、Muse Spark 1.2は100万トークンあたり0.78ドル、Fable 5は7.70ドル。ちょうど10倍弱です。

Fable 5は、発売時点でArtificial Analysisがこれまでベンチマークした中で最も高価なモデルであり、現在もその座を維持しています。その理由を正確に述べる価値があります。このモデルがインデックスを通過する際に消費したのは、Muse Spark 1.2より少ない出力トークン(87M対95M)でした。つまり、コスト差の全体はレートによるものであり、冗長性によるものではありません。Fable 5は無駄遣いではありません。単にフロンティア製品として価格設定されているのです。

リポジトリのコンテキスト60,000トークンを読み込み、3,000トークンのパッチを書き込むエージェントステップ1回に換算すると、約8.8セント(Muse Spark 1.2)、約75セント(Claude Fable 5)。1日1,000ステップなら$88対$750。1年なら$32,000対$274,000。

Claude Fable 5 が代替できない場面

コスト面の議論は、その6つのポイントが違いのすべてであれば、一方的なものになるだろう。しかし実際はそうではなく、差が広がるのは、まさにMetaがMuse Spark 1.2を競争用に再ポジショニングした領域なのである。

Fable 5はDesign Arenaのヘッドツーヘッドラダーの広い範囲にわたって首位を保持しています:ゲーム開発では1399 Eloでランク1、ASCIIアートでは1367でランク1、SVG生成では1353でランク1、さらにエージェントアリーナではGodotゲーム開発(1344)、Androidネイティブ(1318)、エージェンティックゲーム開発(1300)、HTMLスライド(1260)でランク1を獲得し、ウェブアプリとフルスタック開発では2位です。Muse Spark 1.2はDesign Arenaのエントリーが一切なく、前身バージョンは立派な中位の成績を残していました(ゲーム開発では1334でランク5、一般的なコードカテゴリでは1309でランク9)が、新しいバージョンは一度も評価されていません。

次元ごとの指標も同じ方向を示している。Artificial Analysis は Claude Fable 5 を、コーディング指標 76.5、エージェンティック指標 52.8 と評価している。Muse Spark 1.1 は 71.3 と 37.5 で、コーディングでは5ポイント、エージェンティックな作業では15ポイント遅れていた。1.2 については次元別の数値はまだ公表されていないため、正直なところ、総合スコアが3ポイント差に縮まったことは分かっているが、そのうちどれだけがエージェンティック軸に影響したかは分からない。

Muse Spark 1.2 vs Claude Fable 5

{{1}}Fable 5の自社製品のポジショニングは、リードがタスクの長さと複雑さに応じて広がると主張しています。{{/1}}{{2}}これはベンダーの主張であり、記載されたままでは未検証ですが、独立したデータの形状とは一致しています。{{/2}}{{3}}Fable 5の最大の差は、単発生成ではなく、モデルが多数のターンにわたってプランを維持する必要があるエージェント領域にあります。{{/3}}

Muse Spark 1.2 がまさに正解となる場所

六つの点にかかわらず、三つのことがそれを正しい選択にしている。

音声・映像入力。Metaのリスト掲載では、テキスト、画像、動画、音声、PDFが謳われている。Claude Fable 5はテキスト、画像、ファイルを受け付けるが、音声も動画も受け付けない。録音や映像を扱うパイプラインにとって、これはトレードオフではなく、厳しいフィルターである。正直な注意点をひとつ:Artificial AnalysisのMuse Spark 1.2の仕様カードには、評価済みとしてテキストと画像のみが記録されており、より広い対応範囲は謳われているだけで、独立に検証されたわけではない。

速度。165.0トークン/秒(71.7に対して)。Muse Spark 1.2は、出力を2倍をはるかに超える速さでストリーミングし、速度ではクラスの中央値71に対して185件中16位です — Fable 5は中央値に位置しています。

ボリューム時のコスト。 前のセクションのすべて。

本当に巨大なリクエストを行う人のために、4つ目を追加します。両モデルとも約100万トークンのコンテキストを宣伝しています(Muse Spark 1.2は1,048,576、Fable 5は1,000,000)。しかし、Muse Spark 1.2はそのすべてに対して定額料金を請求するのに対し、Fable 5のキャッシュ書き込み価格設定では、大きな安定したプレフィックスを保持するのに、節約効果が得られる前に前払いで実費がかかります。

これらのどちらも速いモデルではありません。

これはほとんどの直接対決記事が飛ばすセクションであり、請求書ではなくアーキテクチャを変えるものです。

最大推論努力時において、Artificial Analysis は Muse Spark 1.2 の最初のトークンまでの時間を 26.12 秒、Claude Fable 5 では 141.26 秒と測定しており、Fable 5 のエンドツーエンド応答時間は 148.24 秒です。これらの設定では、どちらもユーザーの前に置かれるべきものではありません。

本番環境の数値ははるかに良好で、知る価値があります。OrcaRouterでは、Claude Fable 5は最初のトークンまでの時間のp50は7.04秒、p95は10.00秒という結果を、直近1週間にわたって示しています。これは、呼び出し側が要求する任意の努力レベルでの実際のトラフィックであり、最大努力でのベンチマークではありません。参考までに、Muse Spark 1.1のp50は1.84秒です。Muse Spark 1.2にはまだ本番環境のテレメトリがありません。

Muse Spark 1.2 vs Claude Fable 5

構造的な要点: 両モデルとも必須推論を備えている。Fable 5の努力ダイヤルは低から最大までの範囲で、デフォルトは高。Muse Spark 1.2は最小からxhighまでの範囲で、デフォルトは中。どちらも思考をオフにすることはできない。サブ秒の応答が必要なら、この比較全体は間違った棚だ — それはLunaクラスやFlash-Liteクラスのモデルのためのものだ。

2モデル構成、価格設定済み

これを勝者総取りの選択として捉えること自体が誤りだ。トラフィックは均一ではないからだ。ほとんどすべての本番エージェントには、定型的なステップ——ファイルを読む、diffを要約する、パッチを整形する、次に呼び出すツールを決める——のロングテールと、真に難しく誤答が1時間のコストを伴う問題のショートヘッドが存在する。

1日に同じ1,000件のエージェントステップを実行する場合。すべてClaude Fable 5で実行する場合: 約$750。すべてMuse Spark 1.2で実行する場合: 約$88。900件の定型タスクを安価なモデルに、100件の難しいタスクを高価なモデルに分割する場合: 約$79プラス$75、あるいは1日$154。これは、全Fable利用時の請求額の5分の1であり、実際にその能力が必要な10分の1の呼び出しに対して最先端の能力を維持します——そして、1つのエージェントループで年間約$220,000の差になります。

スプリットを説明するだけでなく実際に構築する価値がある理由は、以前は2つのベンダー関係、2つのSDK、2組の認証情報が必要だったからです。今はそうではありません。Claude Fable 5はOrcaRouterカタログに$10.00と$50.00で掲載されています — ベンダーリスト価格を0%マークアップでそのまま通した価格です — そしてMuse Spark 1.1も同じ条件で$1.25と$4.25で、同じOpenAI互換エンドポイントの背後にあります。ルーティングDSLを使えば、「まず安価なモデルを使い、低信頼度またはテスト実行の失敗時にエスカレーションする」という処理を、自分で保守するオーケストレーションコードではなく単一の呼び出しとして表現できます。またモデルフュージョンを使えば、真に曖昧なステップを複数のモデルのパネルに一度に送って比較できます。Muse Spark 1.2自体はまだカタログにありません — Metaが唯一のプロバイダーとして直接提供しています — そのため、現在このスタックに最も近い構成は、安価な側に1.1を使用したものになります。

その単一プロバイダーという点は、リスク評価書の中で独立した項目に値する。Claude Fable 5 には複数のサービングルートがあり、それらの間で自動フェイルオーバーが行われる。Muse Spark 1.2 は Meta が運営するエンドポイントをただ1つだけ持つ。それが停止した場合、同じモデルによるフォールバックは存在しない。

コストモデルであり、判決ではない

この比較の有益な出力は「どのモデルが勝つか」ではありません。それは、自身のワークロードに対して計算できる閾値です。

まず、Muse Spark 1.2 クラスの回答が失敗し、Fable 5 クラスの回答が成功する呼び出しの割合を見積もってください。その割合に、失敗のコスト(エンジニアの工数、不適切なマージ、再試行ループ、顧客)を掛けてください。その結果を、ステップあたり 66 セントと比較してください。66 セントとは、上記の 60K 入力 / 3K 出力の例で、単一の呼び出しを Muse Spark 1.2 から Claude Fable 5 にアップグレードするのにかかるコストです。誤った回答による期待損失が 66 セントを超える場合は、そのステップを Fable 5 にルーティングしてください。超えない場合は、ルーティングしないでください。

ほとんどのチームにとって、その計算では、Fable 5 はコードレビュー、最終パッチ生成、アーキテクチャ計画、および本番データに触れるあらゆる作業に割り当てられ、Muse Spark 1.2 はそれ以外のすべて—ファイル読み取り、要約、テストのトリアージ、ツール選択、コストは現実に発生するが1回の呼び出しあたりの重要度は高くないエージェントループの中間部分の大量処理—に割り当てられます。

注目し続けるべき点が一つあります。それは、Design Arenaのラダーと、Muse Spark 1.2の次元別インデックスです。どちらもまだ存在していません。Fable 5の最も有力な証拠は、まさにMetaの新モデルが一切の記録を持たない直接対決のアリーナにあります。その記録が現れたとき、この閾値は——おそらく大幅に——動くことになるでしょう。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube