
Muse Spark 1.2 vs Claude Haiku 4.5: Identischer Mischpreis, gegensätzliche Ansichten über das Denken
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenNEUQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekNEUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 1604 tok/s
- orcaNEUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenz69Coding60Mathe
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
Der Spec-Vergleich, eine Dimension nach der anderen.
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• Cache — 0,15 $ pro Million bei einem Muse Spark 1.2 Cache-Treffer, ein Rabatt von 88 %; 0,10 $ pro Million bei einem Claude Haiku 4.5 Cache-Lesevorgang, ein Rabatt von 90 %, wobei Cache-Schreibvorgänge mit 1,25 $ berechnet werden.
• Kontext — 1.048.576 Token gegenüber 200.000. Ein 5,2-facher Unterschied und die mit Abstand größte Lücke zwischen ihnen.
• Maximale Ausgabe — Claude Haiku 4.5 gibt eine Obergrenze von 64.000 Token an; der Muse-Spark-1.2-Endpunkt hingegen gibt überhaupt keine maximale Ausgabelänge an, was ungewöhnlich genug ist, um es zu testen, statt es anzunehmen.
• Reasoning — Pflicht auf Muse Spark 1.2, mit fünf Aufwandstufen von minimal bis xhigh und einem Standardwert von medium; optional auf Claude Haiku 4.5, das ein Modell ohne Reasoning ist, bis du erweitertes Denken aktivierst und ihm ein Denkbudget gibst.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• Alter — Muse Spark 1.2 ist erst wenige Tage alt. Claude Haiku 4.5 ist seit dem 15. Oktober 2025 in Produktion, mit einem Wissensstand von Juli 2025 und neun Monaten gesammelter Praxiserfahrung im Hintergrund.
Die Indexlücke ist real. Die Zahl, die alle zitieren werden, ist es nicht.

Artificial Analysis bewertet Muse Spark 1.2 mit 54 auf seinem Intelligence Index, Rang #13 von 185. Der aktuelle Eintrag für Claude Haiku 4.5 liegt bei 24. Stellt man diese nebeneinander, hat man eine Schlagzeile; schaut man sich an, was die Einträge tatsächlich sind, zerfällt die Schlagzeile.
Die 54 ist Muse Spark 1.2, bewertet mit xhigh, der teuersten Reasoning-Einstellung. Die 24 ist Claude Haiku 4.5, bewertet als Nicht-Reasoning-Modell – Denken aus – und Artificial Analysis kennzeichnet es als Schätzung statt als abgeschlossenen Lauf. In einer früheren Version desselben Index, vor der v4.1-Neugewichtung, bewertete Artificial Analysis Claude Haiku 4.5 mit 55 bei aktiviertem Reasoning und mit 42 ohne. Diese älteren Zahlen können ebenfalls nicht mit 54 verglichen werden, da Indexversionen neu skalieren und ein Wert aus der v3-Ära kein v4.1-Wert ist.
Die ehrliche Aussage ist also enger, als die Rangliste vermuten lässt: Muse Spark 1.2 erreicht bei maximalem Aufwand 54 Punkte auf dem aktuellen Index; für Claude Haiku 4.5 mit aktiviertem erweitertem Denken gibt es keinen veröffentlichten v4.1-Wert, sodass ein direkter Vergleich dieser beiden bei vollem Aufwand noch nicht existiert. Wer dir 54 gegen 24 zeigt, vergleicht ein Modell mit voller Bedenkzeit mit einem Modell, dem gesagt wurde, es solle nicht nachdenken.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
Vier Latenzzahlen, zwei verschiedene Geschichten

Latenz ist der Punkt, an dem die „gleicher Preis“-Darstellung aufhört, eine Kuriosität zu sein, und zu einer Entscheidung wird – und es ist auch der Punkt, an dem die Messquelle am wichtigsten ist.
In der Benchmark-Umgebung verzeichnet Artificial Analysis eine Zeit bis zum ersten Token von 26,12 Sekunden für Muse Spark 1.2 bei xhigh und 1,00 Sekunde für Claude Haiku 4.5. Eine Lücke von 26×, und wenn das das ganze Bild wäre, wäre der Vergleich vorbei.
In Produktion kehrt es sich um. Über sieben Tage mit echtem Verkehr auf OrcaRouter – Anrufer, die beliebig viel Aufwand verwenden, wie sie es tatsächlich wollen – zeigt Claude Haiku 4.5 eine p50-Zeit bis zum ersten Token von 3,84 Sekunden und eine p95 von 10,00 Sekunden, bei 214 Token pro Sekunde und einer Fehlerrate von 1,0 %. Muse Spark 1.1, die Version von Metas Modell, die im Katalog steht, zeigt eine p50 von 1,84 Sekunden und eine p95 von 6,00 Sekunden, bei 519 Token pro Sekunde und ohne aufgezeichnete Fehler. Bei Live-Verkehr ist das Meta-Modell das schnellere.
Beide Zahlensätze sind wahr und messen unterschiedliche Dinge. Die Laborzahl ist jedes Modell bei maximaler Bedenkzeit mit einem kalten Cache, was ein fairer Test der Obergrenze und ein schlechter Test für eine Chat-Box ist. Die Produktionszahl umfasst Cache-Treffer, kurze Prompts, niedrige Aufwandsstufen und alles andere, was reale Anwendungen tun, was ein fairer Test des Medians und überhaupt kein Test des schlechtesten Falls ist. Die Falle besteht darin, eine zu zitieren und über die andere zu argumentieren. Wenn Sie ein benutzerseitiges Timeout dimensionieren, ist p95 Ihre Zahl. Wenn Sie fragen, was ein tiefer agentischer Schritt in Wanduhrzeit kostet, ist die Benchmark-Zahl näher an der Wahrheit — und der ehrliche Vorbehalt ist, dass eine solche Produktionszahl für Muse Spark 1.2 selbst noch nicht existiert, weil es zu neu und nicht weit verbreitet geroutet ist.
Beide Labore haben dir einen Subagenten verkauft. Sie meinten unterschiedliche Dinge.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
Metas Pitch für Muse Spark 1.2 erhebt Ansprüche an beiden Enden derselben Hierarchie. Metas Werbetext besagt, dass das Modell der primäre Agent sein kann, der Kontext sammelt, plant und delegiert, oder ein Subagent, der parallel unter einem solchen arbeitet. Muse Code, der Terminal-Agent, der zusammen mit ihm ausgeliefert wurde, koordiniert mehrere persistente Subagenten pro Aufgabe in isolierten Worktrees auf einer replay-exakten Event-Log-Laufzeit. Das Millionen-Token-Fenster und das ständig aktive Reasoning sind das, was ein Planer braucht; sie sind genau das, was man für einen Fan-out-Worker nicht wählen würde, denn jede parallele Instanz zahlt für Überlegungen, die man nicht angefordert hat.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
Was ein echter Schritt jeweils kostet
Preise pro Million Token entscheiden bei Reasoning-Modellen nichts, weil das Modell selbst bestimmt, wie viele Tokens es ausgibt. Bepreise stattdessen den Schritt.
Nehmen wir eine klar abgegrenzte Code-Aufgabe: 60.000 Tokens Repository-Kontext hinein, 3.000 Tokens Patch heraus. Ohne Cache kostet Claude Haiku 4.5 $0,060 für Eingabe plus $0,015 für Ausgabe — 7,5 Cent. Muse Spark 1.2 kostet $0,075 plus $0,013 — 8,8 Cent. Nahe genug dran, um als Rauschen durchzugehen – genau wie es der Mischpreis versprochen hat.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
Caching verschiebt den Schwerpunkt erneut. Hält man den Repository-Kontext stabil, sodass er den Cache trifft, sinken Haikus Eingabekosten auf 0,006 $ und die von Muse Spark 1.2 auf 0,009 $ — die Eingabeseite spielt dann überhaupt keine Rolle mehr, und der gesamte Vergleich wird zu einem Wettstreit um Ausgabe-Tokens, also darum, wie viel jedes Modell denkt. Bei einer Arbeitslast, die Kontext wiederholt, ist die Stabilität des Cache-Schlüssels mehr wert als die Modellwahl, und das gilt für beide Modelle.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
Beides ohne einen zweiten Vertrag ausprobieren

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2 ist nicht im Katalog. Die Model-API von Meta ist derzeit der einzige Ort, um sie aufzurufen, sodass ein echter Direktvergleich heute eine Integration über uns und eine direkte mit Meta bedeutet. Muse Spark 1.1 ist gehostet, zu denselben 1,25 $ und 4,25 $, die Meta für 1.2 verlangt, was sie zu einem vernünftigen Stellvertreter für die Kosten- und Latenzstruktur der Familie macht, aber nicht für die Programmiervorteile, mit denen 1.2 beworben wird. Sobald 1.2 routbar wird, wird der Vergleich zu einer Ein-Zeilen-Änderung des Modell-Strings mit demselben Schlüssel – und für das oben beschriebene Orchestrator-plus-Worker-Experiment ist die Routing-DSL die Art und Weise, wie Sie einen Planer und einen Fan-out-Worker in einen einzigen Aufruf verdrahten, anstatt die Übergabe selbst zu konstruieren.
Wähle nach der Form der Arbeit, nicht nach der Punktzahl.
Wählen Sie Claude Haiku 4.5, wenn die Arbeit begrenzt ist und der Benutzer wartet. Support-Agenten, Klassifizierung, Extraktion, Chat, Pair-Programming-Vervollständigungen und die Parallel-Worker-Ebene einer Agentenhierarchie. Es ist eine bekannte Größe mit neun Monaten Praxiseinsatz; Denken ist optional, sodass Sie nur dann für das Denken zahlen, wenn Sie es möchten, und 200K reichen für fast jede abgegrenzte Teilaufgabe. Sein veröffentlichtes SWE-bench-Verified-Ergebnis besagt, dass es weitaus leistungsfähiger ist, als der Preis vermuten lässt, vorausgesetzt, Sie sind bereit, das Denkbudget aufzuwenden, das dieses Ergebnis verwendet hat.
Wählen Sie Muse Spark 1.2, wenn die Arbeitseinheit ein Repository und nicht eine Anfrage ist. Refactorings über mehrere Dateien, erweitertes Debugging, Generierung ganzer Projekte, langfristige Agenten-Schleifen, bei denen niemand auf einen Spinner schaut. Das Fenster mit einer Million Token eliminiert ein Chunking-Problem, das Haiku um keinen Preis lösen kann, und das obligatorische Reasoning, das es für den Chat verdirbt, ist die richtige Standardeinstellung, wenn ein falscher Plan mehr kostet als ein langsamer.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
