Muse Spark 1.2 vs Claude Haiku 4.5: 同一のブレンド価格、思考に対する正反対の考え
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: 同一のブレンド価格、思考に対する正反対の考え

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Artificial Analysis の価格設定では、Muse Spark 1.2はブレンド価格でトークン100万個あたり0.78ドル、そしてClaude Haiku 4.5は0.77ドル。1セント差だが、それ以外は何ひとつとして一致していない2つの研究所によるものだ。Meta のモデルは推論をやめられない。Claude Haiku 4.5 は頼まれたときにだけ推論する。Meta は 1,048,576 トークンのコンテキストを提供する一方、Claude Haiku 4.5 は 200,000 だ。Meta はこれを 2026年8月5日に、ターミナルエージェントを備えたコーディングモデルとしてリリースした。Claude Haiku 4.5 は 2025年10月に、より大きなモデルから指示を受ける、高速で安価なワーカーとしてリリースされた。トークンあたりの価格は同じだが、まったく別のマシンだ。

その偶然の一致は、比較を始めるのに有用な出発点となる。なぜなら、それは人々が通常、判断材料とする変数を取り除き、問題を必然的に形の問題にするからである。以下では、独立した数値が存在する場合はそれを用いる。インデックススコアとラボでのレイテンシーには Artificial Analysis、実トラフィックのレイテンシーには OrcaRouter 自身の7日間の本番テレメトリーを使用し、ベンダーが報告した数値はその旨を明記する。これには、第三者による相当する数値が存在しないベンダーのベンチマーク見出し数値も含まれる。

仕様の対比、一度に一つの次元ずつ

価格 — Muse Spark 1.2は、100万トークンあたり入力$1.25 / 出力$4.25。Claude Haiku 4.5は、100万トークンあたり入力$1.00 / 出力$5.00。Metaは入力が安く、Claude Haiku 4.5は出力が安い。

キャッシュ — Muse Spark 1.2 キャッシュヒットでは100万回あたり$0.15(88%割引)、Claude Haiku 4.5 キャッシュ読み取りでは100万回あたり$0.10(90%割引)、キャッシュ書き込みは$1.25で課金されます。

コンテキスト — 1,048,576 トークン vs 200,000。5.2倍の差であり、両者の間で最大の開きです。

最大出力 — Claude Haiku 4.5は64,000トークンの上限を宣言しています。Muse Spark 1.2エンドポイントは最大完了長を一切宣言しておらず、これは想定せずにテストする価値があるほど異例です。

推論 — Muse Spark 1.2 では必須で、努力レベルは最小から xhigh までの5段階あり、デフォルトは medium です。Claude Haiku 4.5 ではオプションで、拡張思考をオンにして思考予算を設定しない限り、推論を行わないモデルです。

入力 — Metaはテキスト、画像、動画、音声、PDFに対応しています。Claude Haiku 4.5はテキストと画像を受け付けます。どちらもテキストを返します。

重みとプロバイダ — 両方ともクローズド。Muse Spark 1.2 は Meta 自身の Model API からのみ提供され、Claude Haiku 4.5 はベンダーおよび通常のクラウドリセラーやアグリゲーターから利用できます。

年齢 — Muse Spark 1.2は登場からまだ数日しか経っていない。Claude Haiku 4.5は2025年10月15日から本番運用されており、2025年7月の知識カットオフと、9か月分の蓄積された現場経験を背景に持っている。

インデックス・ギャップは実在する。誰もが引用する数字はそうではない。

Artificial Analysisは、Intelligence IndexでMuse Spark 1.2に54点をつけ、185モデル中13位と評価している。Claude Haiku 4.5の現在のスコアは24だ。この2つを並べれば見出しになるが、実際のエントリーの中身を見ると、その見出しは成り立たなくなる。

54は、Muse Spark 1.2をxhighで評価したもので、これは最も高コストな推論設定です。24は、Claude Haiku 4.5を非推論モデルとして評価したもので、思考はオフであり、Artificial Analysisはこれを完了した実行ではなく推定値としてフラグしています。同じインデックスの以前のバージョンでは、v4.1の再重み付けの前に、Artificial AnalysisはClaude Haiku 4.5を推論オンで55、オフで42としていました。これらの古い数値も54とは比較できません。なぜなら、インデックスのバージョンは再スケールされ、v3時代のスコアはv4.1のスコアではないからです。

つまり、正直な言明はリーダーボードが見せているほど広範なものではありません。Muse Spark 1.2は最大努力設定で現在の指標において54点を記録しています。一方、Claude Haiku 4.5は拡張思考をオンにした場合のv4.1スコアが公開されておらず、この2つの全力同士の比較はまだ存在しません。54対24を見せてくる人は誰でも、完全な熟考を行ったモデルと、熟考しないよう指示されたモデルを比較しているのです。

ベンダーが数値を公表している場合、それは具体的な数値です。Claude Haiku 4.5はSWE-bench Verifiedで73.3%を記録しており、128Kの思考予算で50回の試行を平均したものです。{{1}}これはベンダー公表の数値であり、その思考予算はスピードを売りにするモデルとしては驚異的に大きい——しかし、これは業界がフロンティアモデルに対して引用するのと同じ評価であり、Haikuをその価格からは想像もつかない層に位置づけています。{{/1}}{{2}}Meta側のMuse Spark 1.2に関する同等の主張は、Terminal-Bench 2.1で82.9%、DeepSWE v1.1で59.3%であり、これもベンダーによる実行で、Meta独自のハーネス上で各競合モデルをそれぞれの専用エージェント製品と組み合わせたものです。{{/2}}2社、2つのベンチマーク、重複はゼロ。現時点では、これら両方のモデルについて、同一の評価者による公表スコアが存在する単一の評価はありません。

4つのレイテンシ数値、2つの異なるストーリー

レイテンシは、「同じ価格」という枠組みが単なる好奇心の対象ではなくなり、意思決定の対象となる地点であり、また測定ソースが最も重要となる地点でもあります。

ベンチマークハーネスでは、Artificial AnalysisはMuse Spark 1.2のxhigh設定におけるファーストトークンまでの時間を26.12秒、Claude Haiku 4.5では1.00秒と記録している。26倍の差であり、もしそれが全体像ならば、この比較は終わっていただろう。

{{1}}本番環境では逆転します。OrcaRouter 上の7日間の実際のトラフィック(呼び出し元が実際に必要とする任意の労力を使用)において、Claude Haiku 4.5 は、最初のトークンまでの p50 時間が 3.84 秒、p95 が 10.00 秒、毎秒 214 トークン、エラー率 1.0% を示しています。{{/1}}{{2}}カタログにある Meta のモデルのバージョンである Muse Spark 1.1 は、p50 が 1.84 秒、p95 が 6.00 秒、毎秒 519 トークン、記録されたエラーはゼロです。{{/2}}{{3}}ライブトラフィックでは、Meta のモデルが高速です。{{/3}}

両方の数値セットはどちらも真実であり、それぞれ異なるものを測定しています。ラボの数値は、コールドキャッシュで最大限の熟考を行った各モデルのものであり、上限を測るには公正なテストですが、チャットボックスを測るには不適切なテストです。本番環境の数値には、キャッシュヒット、短いプロンプト、低い努力レベル、そして実際のアプリケーションが行うその他すべてが含まれており、中央値を測るには公正ですが、最悪のケースについてはまったくテストしていません。罠は、一方を引用して他方について推論することです。ユーザー向けのタイムアウトを設計するなら、p95があなたの数値です。深いエージェント的ステップが壁時計時間でどれだけかかるかを問うなら、ベンチマークの数値がより真実に近いです。そして正直な注意点として、Muse Spark 1.2自体の本番環境の数値はまだ存在しません。なぜなら、それは新しすぎて、広くルーティングされていないからです。

両方のラボがあなたにサブエージェントを売り込んだ。だが、彼らが意味していたのは別物だった。

「Claude Haiku 4.5」に関するベンダーの売り込み文句は、階層構造について明確だった。Sonnetクラスのモデルが計画を立てて統括し、その下でHaikuインスタンスが並列に実行する。安価で、高速で、使い捨て可能、しかも同時に多数動かせる。製品設計もそれに沿っている。20万トークンのコンテキストウィンドウは、範囲を限定したサブタスクには十分だが、リポジトリ全体には意図的に不足している。思考機能がデフォルトでオフなのは、熟考するワーカーはオーケストレーターのコストを食うワーカーだからだ。そして、ベンダー自身のマーケティングはリアルタイムチャット、カスタマーサービス、ペアプログラミングをターゲットに挙げている。

MetaによるMuse Spark 1.2の売り込みは、同じ階層構造の両端を主張している。Metaのコピーによれば、このモデルは、コンテキストを収集し、計画し、委任するプライマリエージェントにも、その下で並列に実行するサブエージェントにもなり得るという。それと同時にリリースされたターミナルエージェントであるMuse Codeは、再生完全一致のイベントログランタイム上で、隔離されたワークツリー内のタスクごとに複数の永続サブエージェントを調整する。百万トークンのウィンドウと常時稼働の推論は、プランナーが必要とするものだ。ファンアウトワーカーには、まさに選ばないであろうものだ。なぜなら、すべての並列インスタンスが、あなたが求めていない熟考に対してコストを支払っているからだ。

マーケティングではなくアーキテクチャとして読むこと、それが本当の違いだ。ベンダーはワーカーを構築し、あなたがオーケストレーターを持ち込むことを期待している。Metaはオーケストレーターを構築し、それも機能すると主張している。すでに階層を運用しているなら、興味深い実験は二者択一ではない——Muse Spark 1.2が計画し、Claude Haiku 4.5が実行するという形だ。これは、どちらのベンダーもパッケージとして売ってくれない形態である。

それぞれにおける実際の1ステップのコストはいくらか

推論モデルでは、100万トークンあたりの料金は何も決定づけない。モデル自身が使うトークン数を選ぶからだ。価格はステップ単位にすべきだ。

スコープを絞ったコードタスクを考えてみましょう。リポジトリコンテキスト60,000トークンの入力、パッチ3,000トークンの出力です。コールドスタートの場合、Claude Haiku 4.5は入力$0.060プラス出力$0.015で、7.5セントになります。Muse Spark 1.2は$0.075プラス$0.013で、8.8セントです。ブレンドレートが約束したとおり、誤差の範囲内でほぼ同額です。

次に、ブレンドレートが隠しているものを加えます。Muse Spark 1.2 は推論をオフにできず、デフォルトの中程度の設定では、このようなステップはパッチ適用前に数千の推論トークンを生成する可能性があり、それらは出力として課金されます。3,000 を追加すると、同じステップは $0.075 + $0.026 = 10.1セント、同一入力での Haiku より約 35% 高い値段です。推論オフの Claude Haiku 4.5 は、思考に費用がかからず、7.5セントのままです。大きな思考予算の場合、Claude Haiku 4.5 は Muse Spark 1.2 を上回ります。なぜなら Claude Haiku 4.5 は出力100万トークンあたり5.00ドルで、Meta の4.25ドルに対して高いからです。

{{1}}キャッシングによって、重点は再び変わります。{{/1}}{{2}}リポジトリのコンテキストを安定に保ってキャッシュにヒットさせれば、{{/2}}{{3}}Haikuの入力コストは$0.006に下がり、{{/3}}{{4}}Muse Spark 1.2の入力コストは$0.009になります。{{/4}}{{5}}入力側はまったく重要ではなくなり、{{/5}}{{6}}比較全体は出力トークンをめぐる争いになります。{{/6}}{{7}}つまり、各モデルがどれだけ考えるかという争いです。{{/7}}{{8}}コンテキストを繰り返すワークロードでは、{{/8}}{{9}}キャッシュキーの安定性はモデルの選択よりも価値があり、{{/9}}{{10}}そのことはこれら両方のモデルに当てはまります。{{/10}}

1Mウィンドウは、計算がまったく合わない唯一の箇所です。1回の呼び出しで本当に20万トークン以上を必要とするものは、どんな価格でもClaude Haiku 4.5では実行できません。チャンク化してオーケストレーションするか——それがベンダーの意図するところですが——あるいは余裕のあるモデルを使うかのどちらかです。

2つ目の契約なしで両方を試す

Claude Haiku 4.5はOrcaRouterカタログに$1.00と$5.00で掲載されています。これはベンダーの定価です。OrcaRouterはマークアップ0%でプロバイダーの価格をそのまま透過しているためです。つまり、ベンダーの価格変更は次の契約サイクルを待たずに、同じ日に当社側で反映されます。上記の本番レイテンシー数値は、同じルーティングレイヤーから取得されたものです。

Muse Spark 1.2はカタログに含まれていません。MetaのModel APIが現在これを呼び出せる唯一の場所であるため、今日の真の直接比較は、当社経由の統合1件とMetaとの直接統合1件を意味します。Muse Spark 1.1はホスティングされており、Metaが1.2に対して請求するのとまったく同じ$1.25と$4.25です。そのため、このファミリーのコストとレイテンシの特性については妥当な代替となりますが、1.2が売りにしているコーディング面での利点は代替できません。1.2がルーティング可能になると、比較は同じキーによる1行のモデル文字列の変更で済みます。また、前述のオーケストレーターとワーカーを組み合わせた実験では、ルーティングDSLを使用して、プランナーとファンアウトワーカーを単一の呼び出しに組み込み、自分でハンドオフを構築する必要をなくせます。

作品の形で選べ。スコアではなく。

選択してくださいClaude Haiku 4.5これは、作業が限定的でユーザーが待っている場合に適しています。サポートエージェント、分類、抽出、チャット、ペアプログラミングの補完、およびエージェント階層の並列ワーカーティアに対応しています。実績のある製品で、9か月のフィールド履歴があります。思考はオプションなので、必要なときだけ推論にコストを払えばよく、200Kのコンテキストはほとんどの範囲限定サブタスクに十分です。公開されているSWE-bench Verifiedの結果によれば、その結果が使用した思考予算を費やす用意があれば、価格が示唆するよりもはるかに優れた能力を持っています。

選ぶのはMuse Spark 1.2です。作業単位がリクエストではなくリポジトリである場合がこれにあたります。複数ファイルのリファクタリング、長時間のデバッグ、プロジェクト全体の生成、誰もスピナーを見ていない長期的なエージェントループ。100万トークンのウィンドウにより、Haiku がどんな価格でも解決できないチャンキング問題が解消されます。また、間違った計画が遅い計画よりもコストがかかる状況では、チャットでは邪魔になる必須の推論が、むしろ正しいデフォルトとなります。

それを決めるべきなのは、インデックス番号ではない。代わりに2つの質問をしよう。単一の呼び出しが20万トークン以上を処理する必要があるか、そして最初のトークンを人間が待っているか。最初の質問がイエスならMetaを指す。2番目の質問がイエスならベンダーを指す。両方がイエスなら、2つのモデルが必要だ。これは、どちらのベンダーのマーケティングが認めるよりも頻繁に当てはまる正直な答えだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube