
Muse Spark 1.2 vs Claude Haiku 4.5: Identischer Mischpreis, gegensätzliche Ansichten über das Denken
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 477 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 186 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Artificial Analysis listet Muse Spark 1.2 für 0,78 $ pro Million Token (Mischpreis) und Claude Haiku 4.5 für 0,77 $. Ein Cent Unterschied, von zwei Laboren, die sich sonst in nichts einig waren. Metas Modell kann nicht aufhören zu denken; Claude Haiku 4.5 denkt nur, wenn man es darum bittet. Meta bietet 1.048.576 Token Kontext; Claude Haiku 4.5 bietet 200.000. Meta hat dieses Modell am 5. August 2026 als Codemodell mit einem Terminal-Agenten veröffentlicht; Claude Haiku 4.5 erschien im Oktober 2025 als der schnelle, günstige Helfer, dem ein größeres Modell sagt, was er tun soll. Gleicher Preis pro Token, völlig andere Maschinen.
Dieser Zufall ist der nützliche Ausgangspunkt für einen Vergleich, weil er die Variable beseitigt, anhand derer normalerweise entschieden wird, und die Frage stattdessen auf die Form lenkt. Im Folgenden werden unabhängige Zahlen verwendet, wo es sie gibt – Artificial Analysis für Indexwerte und Labor-Latenz, die eigene Sieben-Tage-Produktionstelemetrie von OrcaRouter für die Latenz bei realem Verkehr – und herstellerberichtete Zahlen werden als solche gekennzeichnet, einschließlich einer Benchmark-Schlagzeile des Herstellers, für die es kein Gegenstück von Drittanbietern gibt.
Der Spec-Vergleich, eine Dimension nach der anderen.
• Preis — Muse Spark 1.2 bei 1,25 $ Eingabe / 4,25 $ Ausgabe pro Million; Claude Haiku 4.5 bei 1,00 $ Eingabe / 5,00 $ Ausgabe. Meta ist günstiger bei der Eingabe, Claude Haiku 4.5 bei der Ausgabe.
• Cache — 0,15 $ pro Million bei einem Muse Spark 1.2 Cache-Treffer, ein Rabatt von 88 %; 0,10 $ pro Million bei einem Claude Haiku 4.5 Cache-Lesevorgang, ein Rabatt von 90 %, wobei Cache-Schreibvorgänge mit 1,25 $ berechnet werden.
• Kontext — 1.048.576 Token gegenüber 200.000. Ein 5,2-facher Unterschied und die mit Abstand größte Lücke zwischen ihnen.
• Maximale Ausgabe — Claude Haiku 4.5 gibt eine Obergrenze von 64.000 Token an; der Muse-Spark-1.2-Endpunkt hingegen gibt überhaupt keine maximale Ausgabelänge an, was ungewöhnlich genug ist, um es zu testen, statt es anzunehmen.
• Reasoning — Pflicht auf Muse Spark 1.2, mit fünf Aufwandstufen von minimal bis xhigh und einem Standardwert von medium; optional auf Claude Haiku 4.5, das ein Modell ohne Reasoning ist, bis du erweitertes Denken aktivierst und ihm ein Denkbudget gibst.
• Eingaben — Meta unterstützt Text, Bilder, Video, Audio und PDF; Claude Haiku 4.5 akzeptiert Text und Bilder. Beide geben Text zurück.
• Gewichte und Anbieter — beide geschlossen. Muse Spark 1.2 wird ausschließlich über Metas eigene Model API bereitgestellt; Claude Haiku 4.5 ist direkt beim Anbieter sowie über die üblichen Cloud-Reseller und Aggregatoren erhältlich.
• Alter — Muse Spark 1.2 ist erst wenige Tage alt. Claude Haiku 4.5 ist seit dem 15. Oktober 2025 in Produktion, mit einem Wissensstand von Juli 2025 und neun Monaten gesammelter Praxiserfahrung im Hintergrund.
Die Indexlücke ist real. Die Zahl, die alle zitieren werden, ist es nicht.

Artificial Analysis bewertet Muse Spark 1.2 mit 54 auf seinem Intelligence Index, Rang #13 von 185. Der aktuelle Eintrag für Claude Haiku 4.5 liegt bei 24. Stellt man diese nebeneinander, hat man eine Schlagzeile; schaut man sich an, was die Einträge tatsächlich sind, zerfällt die Schlagzeile.
Die 54 ist Muse Spark 1.2, bewertet mit xhigh, der teuersten Reasoning-Einstellung. Die 24 ist Claude Haiku 4.5, bewertet als Nicht-Reasoning-Modell – Denken aus – und Artificial Analysis kennzeichnet es als Schätzung statt als abgeschlossenen Lauf. In einer früheren Version desselben Index, vor der v4.1-Neugewichtung, bewertete Artificial Analysis Claude Haiku 4.5 mit 55 bei aktiviertem Reasoning und mit 42 ohne. Diese älteren Zahlen können ebenfalls nicht mit 54 verglichen werden, da Indexversionen neu skalieren und ein Wert aus der v3-Ära kein v4.1-Wert ist.
Die ehrliche Aussage ist also enger, als die Rangliste vermuten lässt: Muse Spark 1.2 erreicht bei maximalem Aufwand 54 Punkte auf dem aktuellen Index; für Claude Haiku 4.5 mit aktiviertem erweitertem Denken gibt es keinen veröffentlichten v4.1-Wert, sodass ein direkter Vergleich dieser beiden bei vollem Aufwand noch nicht existiert. Wer dir 54 gegen 24 zeigt, vergleicht ein Modell mit voller Bedenkzeit mit einem Modell, dem gesagt wurde, es solle nicht nachdenken.
Wo der Anbieter eine Zahl veröffentlicht hat, ist diese konkret: Claude Haiku 4.5 erzielt 73,3 % bei SWE-bench Verified, gemittelt über 50 Versuche mit einem Denkbudget von 128K. Das ist eine Herstellerangabe, und das Denkbudget darin ist enorm für ein Modell, das mit Geschwindigkeit wirbt – aber es ist dieselbe Evaluierung, die die Branche für Frontier-Modelle anführt, und sie bringt Haiku in eine Kategorie, die sein Preis nicht nahelegt. Die entsprechenden Angaben von Meta zu Muse Spark 1.2 sind Terminal-Bench 2.1 mit 82,9 % und DeepSWE v1.1 mit 59,3 %, ebenfalls vom Anbieter durchgeführt, auf Metas eigener Testumgebung, wobei jeder Wettbewerber mit seinem eigenen Agentenprodukt gekoppelt wurde. Zwei Anbieter, zwei Benchmarks, keine Überschneidung. Es gibt derzeit keine einzige Evaluierung, für die beide Modelle einen veröffentlichten Wert von demselben Auswerter haben.
Vier Latenzzahlen, zwei verschiedene Geschichten

Latenz ist der Punkt, an dem die „gleicher Preis“-Darstellung aufhört, eine Kuriosität zu sein, und zu einer Entscheidung wird – und es ist auch der Punkt, an dem die Messquelle am wichtigsten ist.
In der Benchmark-Umgebung verzeichnet Artificial Analysis eine Zeit bis zum ersten Token von 26,12 Sekunden für Muse Spark 1.2 bei xhigh und 1,00 Sekunde für Claude Haiku 4.5. Eine Lücke von 26×, und wenn das das ganze Bild wäre, wäre der Vergleich vorbei.
In Produktion kehrt es sich um. Über sieben Tage mit echtem Verkehr auf OrcaRouter – Anrufer, die beliebig viel Aufwand verwenden, wie sie es tatsächlich wollen – zeigt Claude Haiku 4.5 eine p50-Zeit bis zum ersten Token von 3,84 Sekunden und eine p95 von 10,00 Sekunden, bei 214 Token pro Sekunde und einer Fehlerrate von 1,0 %. Muse Spark 1.1, die Version von Metas Modell, die im Katalog steht, zeigt eine p50 von 1,84 Sekunden und eine p95 von 6,00 Sekunden, bei 519 Token pro Sekunde und ohne aufgezeichnete Fehler. Bei Live-Verkehr ist das Meta-Modell das schnellere.
Beide Zahlensätze sind wahr und messen unterschiedliche Dinge. Die Laborzahl ist jedes Modell bei maximaler Bedenkzeit mit einem kalten Cache, was ein fairer Test der Obergrenze und ein schlechter Test für eine Chat-Box ist. Die Produktionszahl umfasst Cache-Treffer, kurze Prompts, niedrige Aufwandsstufen und alles andere, was reale Anwendungen tun, was ein fairer Test des Medians und überhaupt kein Test des schlechtesten Falls ist. Die Falle besteht darin, eine zu zitieren und über die andere zu argumentieren. Wenn Sie ein benutzerseitiges Timeout dimensionieren, ist p95 Ihre Zahl. Wenn Sie fragen, was ein tiefer agentischer Schritt in Wanduhrzeit kostet, ist die Benchmark-Zahl näher an der Wahrheit — und der ehrliche Vorbehalt ist, dass eine solche Produktionszahl für Muse Spark 1.2 selbst noch nicht existiert, weil es zu neu und nicht weit verbreitet geroutet ist.
Beide Labore haben dir einen Subagenten verkauft. Sie meinten unterschiedliche Dinge.
Der Pitch des Anbieters für Claude Haiku 4.5 war explizit in Bezug auf die Hierarchie: Modelle der Sonnet-Klasse planen und orchestrieren, Haiku-Instanzen führen parallel darunter aus. Billig, schnell, wegwerfbar, viele auf einmal. Das Produktdesign folgt dem — ein 200K-Fenster ist reichlich für eine abgegrenzte Teilaufgabe und bewusst nicht genug für ein ganzes Repository, Denken ist standardmäßig deaktiviert, weil ein Arbeiter, der nachdenkt, ein Arbeiter ist, der den Orchestrator Geld kostet, und das eigene Marketing des Anbieters nennt Echtzeit-Chat, Kundenservice und Pair Programming als Ziel.
Metas Pitch für Muse Spark 1.2 erhebt Ansprüche an beiden Enden derselben Hierarchie. Metas Werbetext besagt, dass das Modell der primäre Agent sein kann, der Kontext sammelt, plant und delegiert, oder ein Subagent, der parallel unter einem solchen arbeitet. Muse Code, der Terminal-Agent, der zusammen mit ihm ausgeliefert wurde, koordiniert mehrere persistente Subagenten pro Aufgabe in isolierten Worktrees auf einer replay-exakten Event-Log-Laufzeit. Das Millionen-Token-Fenster und das ständig aktive Reasoning sind das, was ein Planer braucht; sie sind genau das, was man für einen Fan-out-Worker nicht wählen würde, denn jede parallele Instanz zahlt für Überlegungen, die man nicht angefordert hat.
Als Architektur statt als Marketing gelesen, das ist der eigentliche Unterschied: Der Anbieter hat einen Worker gebaut und erwartet, dass du einen Orchestrator mitbringst; Meta hat einen Orchestrator gebaut und behauptet, dass er auch funktioniert. Wenn du bereits eine Hierarchie betreibst, ist das interessante Experiment nicht die Wahl zwischen ihnen – sondern Muse Spark 1.2, der plant, und Claude Haiku 4.5, der ausführt, eine Konstellation, die dir kein Anbieter als Paket verkaufen wird.
Was ein echter Schritt jeweils kostet
Preise pro Million Token entscheiden bei Reasoning-Modellen nichts, weil das Modell selbst bestimmt, wie viele Tokens es ausgibt. Bepreise stattdessen den Schritt.
Nehmen wir eine klar abgegrenzte Code-Aufgabe: 60.000 Tokens Repository-Kontext hinein, 3.000 Tokens Patch heraus. Ohne Cache kostet Claude Haiku 4.5 $0,060 für Eingabe plus $0,015 für Ausgabe — 7,5 Cent. Muse Spark 1.2 kostet $0,075 plus $0,013 — 8,8 Cent. Nahe genug dran, um als Rauschen durchzugehen – genau wie es der Mischpreis versprochen hat.
Jetzt kommt noch das hinzu, was der Mischsatz verbirgt. Muse Spark 1.2 kann das Reasoning nicht abschalten, und bei seiner standardmäßigen mittleren Einstellung erzeugt ein solcher Schritt vor dem Patch plausiblerweise ein paar tausend Reasoning-Tokens – sie werden als Ausgabe abgerechnet. Addiert man 3.000, kostet derselbe Schritt $0,075 + $0,026 = 10,1 Cent, also etwa 35 % über Haiku bei identischen Eingaben. Claude Haiku 4.5 mit deaktiviertem Thinking zahlt nichts für Überlegungen und bleibt bei 7,5 Cent; mit einem großen Thinking-Budget wird es Muse Spark 1.2 übertreffen, denn Claude Haiku 4.5 verlangt $5,00 pro Million Output-Tokens gegenüber Metas $4,25.
Caching verschiebt den Schwerpunkt erneut. Hält man den Repository-Kontext stabil, sodass er den Cache trifft, sinken Haikus Eingabekosten auf 0,006 $ und die von Muse Spark 1.2 auf 0,009 $ — die Eingabeseite spielt dann überhaupt keine Rolle mehr, und der gesamte Vergleich wird zu einem Wettstreit um Ausgabe-Tokens, also darum, wie viel jedes Modell denkt. Bei einer Arbeitslast, die Kontext wiederholt, ist die Stabilität des Cache-Schlüssels mehr wert als die Modellwahl, und das gilt für beide Modelle.
Das 1M-Fenster ist die eine Stelle, an der die Rechnung nicht aufgeht. Alles, was wirklich mehr als 200.000 Tokens in einem einzigen Aufruf benötigt, lässt sich um keinen Preis auf Claude Haiku 4.5 ausführen. Entweder man teilt in Chunks und orchestriert – was der Anbieter beabsichtigt – oder man verwendet ein Modell mit dem entsprechenden Platz.
Beides ohne einen zweiten Vertrag ausprobieren

Claude Haiku 4.5 ist im OrcaRouter-Katalog für 1,00 $ und 5,00 $ erhältlich — der Listenpreis des Anbieters, denn OrcaRouter arbeitet mit 0 % Aufschlag und gibt die Anbieterpreise unverändert weiter. Das bedeutet auch, dass eine Preisänderung des Anbieters bei uns am selben Tag live ist und nicht erst im nächsten Vertragszyklus. Die oben genannten Produktions-Latenzzahlen stammen aus genau dieser Routing-Ebene.
Muse Spark 1.2 ist nicht im Katalog. Die Model-API von Meta ist derzeit der einzige Ort, um sie aufzurufen, sodass ein echter Direktvergleich heute eine Integration über uns und eine direkte mit Meta bedeutet. Muse Spark 1.1 ist gehostet, zu denselben 1,25 $ und 4,25 $, die Meta für 1.2 verlangt, was sie zu einem vernünftigen Stellvertreter für die Kosten- und Latenzstruktur der Familie macht, aber nicht für die Programmiervorteile, mit denen 1.2 beworben wird. Sobald 1.2 routbar wird, wird der Vergleich zu einer Ein-Zeilen-Änderung des Modell-Strings mit demselben Schlüssel – und für das oben beschriebene Orchestrator-plus-Worker-Experiment ist die Routing-DSL die Art und Weise, wie Sie einen Planer und einen Fan-out-Worker in einen einzigen Aufruf verdrahten, anstatt die Übergabe selbst zu konstruieren.
Wähle nach der Form der Arbeit, nicht nach der Punktzahl.
Wählen Sie Claude Haiku 4.5, wenn die Arbeit begrenzt ist und der Benutzer wartet. Support-Agenten, Klassifizierung, Extraktion, Chat, Pair-Programming-Vervollständigungen und die Parallel-Worker-Ebene einer Agentenhierarchie. Es ist eine bekannte Größe mit neun Monaten Praxiseinsatz; Denken ist optional, sodass Sie nur dann für das Denken zahlen, wenn Sie es möchten, und 200K reichen für fast jede abgegrenzte Teilaufgabe. Sein veröffentlichtes SWE-bench-Verified-Ergebnis besagt, dass es weitaus leistungsfähiger ist, als der Preis vermuten lässt, vorausgesetzt, Sie sind bereit, das Denkbudget aufzuwenden, das dieses Ergebnis verwendet hat.
Wählen Sie Muse Spark 1.2, wenn die Arbeitseinheit ein Repository und nicht eine Anfrage ist. Refactorings über mehrere Dateien, erweitertes Debugging, Generierung ganzer Projekte, langfristige Agenten-Schleifen, bei denen niemand auf einen Spinner schaut. Das Fenster mit einer Million Token eliminiert ein Chunking-Problem, das Haiku um keinen Preis lösen kann, und das obligatorische Reasoning, das es für den Chat verdirbt, ist die richtige Standardeinstellung, wenn ein falscher Plan mehr kostet als ein langsamer.
Den Ausschlag sollte nicht die Indexnummer geben. Stellen Sie stattdessen zwei Fragen: Muss ein einziger Aufruf jemals mehr als 200.000 Tokens verarbeiten, und wartet ein Mensch auf das erste Token? Ein Ja auf die erste Frage weist auf Meta hin. Ein Ja auf die zweite Frage weist auf den Anbieter hin. Ja auf beide bedeutet, dass man zwei Modelle möchte – was öfter die ehrliche Antwort ist, als es das Marketing beider Anbieter zugibt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
