Muse Spark 1.2 vs Claude Fable 5
Guides & Insights

Muse Spark 1.2 vs. Claude Fable 5: Was sechs Indexpunkte tatsächlich kosten

Autor

Jim Song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Artificial Analysis veröffentlicht etwas, das die meisten Benchmark-Tabellen auslassen: was es ausgegeben hat. Der Betrieb seines aus neun Bewertungen bestehenden Intelligence Index kostete 637,85 $ auf Muse Spark 1.2 und 5.630,52 $ auf Claude Fable 5. Identische Benchmark-Suite, identische Testumgebung, die eine Rechnung 8,8-mal so hoch wie die andere. Fable 5 erzielte 60 Punkte gegenüber den 54 von Muse Spark 1.2.

Teile die Differenz und du erhältst die Zahl, um die es bei diesem Vergleich wirklich geht: Bei dieser Arbeitslast kosten die letzten sechs Intelligenzpunkte ungefähr $832 pro Punkt. Ob du das bezahlen solltest, ist keine Benchmark-Frage. Es ist eine Frage danach, wie viel von deinem Traffic diese Punkte tatsächlich benötigt, und die Antwort für die meisten Teams ist ein kleiner und klar identifizierbarer Anteil.

Der marginale Indexpunkt hat einen Preis, und der ist hoch.

Beide Werte stammen von demselben unabhängigen Evaluator, der dieselbe Zusammenstellung ausführt – GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience und AA-LCR. Keiner der beiden ist eine Herstellerangabe. Fable 5 belegt Rang #3 von 185 Modellen; Muse Spark 1.2 bei #13, bei einem Klassenmedian von 32. Beide liegen weit über dem Durchschnitt; nur eines ist an der Spitze.

Muse Spark 1.2 vs Claude Fable 5

Die Listenpreise erklären den Großteil der Lücke und unterschätzen den Rest:

Eingabe — Muse Spark 1.2 $1,25 pro Million, Claude Fable 5 $10,00. Achtmal.

Output — $4,25 gegenüber 50,00 $. Fast zwölfmal.

Zwischengespeicherte Eingabe — $0.15 gegenüber $1.00. Ungefähr siebenmal so viel, und Fable 5 verlangt zusätzlich $12.50 pro Million für das Schreiben des Cache, oder $20.00 für eine einstündige TTL, während Muse Spark 1.2 überhaupt keine separate Cache-Schreibgebühr ausweist.

Mischrate — Laut Artificial Analysis kostet Muse Spark 1.2 0,78 $ pro Million Tokens und Fable 5 7,70 $. Knapp das Zehnfache.

Fable 5 war das teuerste Modell, das Artificial Analysis bei seiner Einführung je benchmarkt hatte, und diesen Titel hat es gehalten. Es lohnt sich, genau zu erklären, warum: Das Modell verbrauchte weniger Ausgabetokens als Muse Spark 1.2 beim Durchlaufen des Index — 87 Millionen gegenüber 95 Millionen — der gesamte Kostenunterschied liegt also in der Rate, nicht in der Ausführlichkeit. Fable 5 ist nicht verschwenderisch. Es ist einfach als Spitzenprodukt bepreist.

Übersetzt in einen Agentenschritt, der 60.000 Token Repository-Kontext liest und 3.000 Token Patch schreibt: etwa 8,8 Cent auf Muse Spark 1.2, etwa 75 Cent auf Claude Fable 5. Tausend Schritte am Tag sind 88 $ gegenüber 750 $. Über ein Jahr sind das 32.000 $ gegenüber 274.000 $.

Wo Claude Fable 5 nicht ersetzbar ist

Das Kostenargument wäre einseitig, wenn die sechs Punkte den gesamten Unterschied ausmachten. Das sind sie aber nicht, und genau dort, wo sich die Kluft vergrößert, hat Meta Muse Spark 1.2 neu positioniert, um zu konkurrieren.

Fable 5 belegt den ersten Platz in einem breiten Ausschnitt der Kopf-an-Kopf-Ranglisten der Design Arena: 1399 Elo und Rang 1 in Spieleentwicklung, 1367 und Rang 1 in ASCII-Kunst, 1353 und Rang 1 in SVG-Generierung, plus Rang 1 in der Agenten-Arena für Godot-Spieleentwicklung (1344), natives Android (1318), agentische Spieleentwicklung (1300) und HTML-Folien (1260), mit dem zweiten Platz bei Web-Apps und Full-Stack-Entwicklung. Muse Spark 1.2 hat keinerlei Einträge in der Design Arena – sein Vorgänger sammelte eine respektable Mittelfeld-Bilanz (1334 in Spieleentwicklung auf Rang 5, 1309 in allgemeinen Code-Kategorien auf Rang 9), aber die neue Version wurde kein einziges Mal bewertet.

Die Indizes pro Dimension weisen in dieselbe Richtung. Artificial Analysis bewertet Claude Fable 5 mit einem Coding-Index von 76,5 und einem Agentic-Index von 52,8. Muse Spark 1.1 lag bei 71,3 und 37,5 – fünf Punkte zurück beim Coding und fünfzehn bei den agentischen Aufgaben. Für 1.2 wurden noch keine Werte pro Dimension veröffentlicht, daher ist die ehrliche Aussage, dass wir wissen, dass der Gesamtwert um drei Punkte aufgeholt hat, aber nicht, wie viel davon auf der Agentic-Achse gelandet ist.

Muse Spark 1.2 vs Claude Fable 5

Fable 5s eigene Produktpositionierung behauptet, dass sich der Vorsprung mit Aufgabenlänge und -komplexität vergrößert. Das ist eine Herstellerangabe und in dieser Form unverifiziert, sie steht jedoch im Einklang mit der Form der unabhängigen Daten: Fable 5s größte Abstände zeigen sich im Agents-Bereich, wo ein Modell einen Plan über viele Turns hinweg aufrechterhalten muss, und nicht bei der Einzelgenerierung.

Wo Muse Spark 1.2 einfach die richtige Antwort ist

Drei Dinge machen es unabhängig von den sechs Punkten zur richtigen Wahl.

Audio- und Videoeingabe.Metas Auflistung bewirbt Text, Bilder, Video, Audio und PDF-Eingabe. Claude Fable 5 akzeptiert Text, Bilder und Dateien — kein Audio, kein Video. Für jede Pipeline, die Aufnahmen oder Filmmaterial verarbeitet, ist das kein Kompromiss, sondern ein hartes Ausschlusskriterium. Ein ehrlicher Vorbehalt: Die Spezifikationskarte von Artificial Analysis für Muse Spark 1.2 verzeichnet nur Text und Bild als evaluiert, die breitere Oberfläche wird also beworben, statt unabhängig verifiziert zu sein.

Geschwindigkeit. 165,0 Token pro Sekunde gegenüber 71,7. Muse Spark 1.2 streamt die Ausgabe mehr als doppelt so schnell und belegt bei der Geschwindigkeit Platz #16 von 185 bei einem Klassenmedian von 71 — Fable 5 liegt beim Median.

Kosten bei Volumen. Alles im vorherigen Abschnitt.

Fügen Sie einen vierten für alle hinzu, deren Anfragen wirklich enorm sind: Beide Modelle werben mit etwa einer Million Token Kontext – 1.048.576 für Muse Spark 1.2, 1.000.000 für Fable 5 – aber Muse Spark 1.2 berechnet einen festen Satz für alles, während die Cache-Write-Preise von Fable 5 bedeuten, dass das Halten eines großen stabilen Präfixes im Voraus echtes Geld kostet, bevor es anfängt, Ihnen etwas zu sparen.

Keines davon ist ein schnelles Modell.

Dies ist der Abschnitt, den die meisten Head-to-Head-Vergleiche überspringen, und er ändert die Architektur statt der Rechnung.

Bei maximalem Reasoning-Aufwand misst Artificial Analysis eine Zeit bis zum ersten Token von 26,12 Sekunden für Muse Spark 1.2 und 141,26 Sekunden für Claude Fable 5, mit einer End-to-End-Antwortzeit für Fable 5 von 148,24 Sekunden. Keines von beiden gehört bei diesen Einstellungen vor einen Benutzer.

Die Produktionszahlen sind weitaus freundlicher und es lohnt sich, sie zu kennen. Auf OrcaRouter zeigt Claude Fable 5 eine p50-Zeit bis zum ersten Token von 7,04 Sekunden und einen p95-Wert von 10,00 Sekunden über eine rollierende Woche hinweg — das ist echter Datenverkehr bei dem Aufwand, den die Aufrufer jeweils anfordern, kein Benchmark bei maximalem Aufwand. Muse Spark 1.1 hat zum Vergleich eine p50-Zeit von 1,84 Sekunden. Muse Spark 1.2 hat noch keine Produktionstelemetrie.

Muse Spark 1.2 vs Claude Fable 5

Der strukturelle Punkt: Beide Modelle haben verpflichtendes Reasoning. Der Aufwandregler von Fable 5 reicht von niedrig bis maximal und ist standardmäßig auf hoch eingestellt; der von Muse Spark 1.2 reicht von minimal bis extrahoch und ist standardmäßig auf mittel eingestellt. Bei keinem lässt sich das Denken abschalten. Wenn du Antworten in unter einer Sekunde benötigst, ist dieser gesamte Vergleich das falsche Regal – dafür ist ein Modell der Luna- oder Flash-Lite-Klasse gedacht.

Der Zwei-Modell-Stack, preislich ausgeschlossen.

Dieses Framing als eine Winner-takes-all-Entscheidung ist der Fehler, denn der Verkehr ist nicht homogen. Fast jeder Produktionsagent hat einen langen Schwanz von Routineschritten – eine Datei lesen, einen Diff zusammenfassen, einen Patch formatieren, entscheiden, welches Tool als Nächstes aufgerufen werden soll – und einen kurzen Kopf aus wirklich schwierigen, bei denen eine falsche Antwort eine Stunde kostet.

Nehmen Sie dieselben tausend Agentenschritte pro Tag. Alle auf Claude Fable 5: etwa 750 $. Alle auf Muse Spark 1.2: etwa 88 $. Verteilen Sie 900 Routineaufgaben auf das günstige Modell und 100 schwierige auf das teure: etwa 79 $ plus 75 $, also 154 $ pro Tag. Das ist ein Fünftel der reinen Fable-Rechnung, während die Spitzenfähigkeit bei den zehn Prozent der Aufrufe erhalten bleibt, die sie tatsächlich brauchen — und das ergibt bei einer Agentenschleife einen Unterschied von ungefähr 220.000 $ pro Jahr.

Der Grund, warum es sich lohnt, Split zu bauen, anstatt es nur zu beschreiben, ist, dass es früher zwei Anbieterbeziehungen, zwei SDKs und zwei Sätze von Anmeldeinformationen erforderte. Das ist jetzt nicht mehr der Fall. Claude Fable 5 ist im OrcaRouter-Katalog für 10,00 $ und 50,00 $ erhältlich – Listenpreis des Anbieters, ohne Aufschlag durchgereicht – und Muse Spark 1.1 ist dort zu 1,25 $ und 4,25 $ auf derselben Basis erhältlich, hinter demselben OpenAI-kompatiblen Endpunkt. Die Routing-DSL ermöglicht es Ihnen, „billiges Modell zuerst, Hochstufen bei geringem Vertrauen oder bei fehlgeschlagenem Testlauf“ als einen einzigen Aufruf auszudrücken, anstatt als Orchestrierungscode, den Sie warten müssen, und Modellfusion ermöglicht es Ihnen, die wirklich mehrdeutigen Schritte gleichzeitig an ein Gremium von Modellen zu senden und zu vergleichen. Muse Spark 1.2 selbst ist noch nicht im Katalog – Meta bietet es direkt an, als einziger Anbieter –, sodass das, was Sie diesem Stack heute am nächsten kommen können, 1.1 auf dem günstigen Arm verwendet.

Dieses Detail mit nur einem Anbieter verdient eine eigene Zeile in einer Risikobewertung. Claude Fable 5 hat mehrere Serving-Routen und automatisches Failover zwischen ihnen. Muse Spark 1.2 hat genau einen Endpunkt, der von Meta betrieben wird. Wenn er ausfällt, gibt es keinen Fallback, der dasselbe Modell ist.

Ein Kostenmodell, kein Urteil

Das nützliche Ergebnis dieses Vergleichs ist nicht „welches Modell gewinnt.“ Es ist ein Schwellenwert, den Sie für Ihre eigene Arbeitslast berechnen können.

Schätzen Sie den Anteil Ihrer Aufrufe, bei denen eine Antwort der Klasse Muse Spark 1.2 fehlschlägt und eine Antwort der Klasse Fable 5 erfolgreich ist. Multiplizieren Sie das mit den Kosten eines Fehlschlags – Ingenieurminuten, ein schlechter Merge, eine Wiederholungsschleife, ein Kunde. Vergleichen Sie das mit 66 Cent pro Schritt, was es kostet, einen einzelnen Aufruf von Muse Spark 1.2 auf Claude Fable 5 zu upgraden, im obigen Beispiel mit 60K-in / 3K-out. Wenn der erwartete Verlust durch eine falsche Antwort 66 Cent übersteigt, leiten Sie diesen Schritt an Fable 5 weiter. Wenn nicht, dann nicht.

Für die meisten Teams ordnet diese Berechnung Fable 5 dem Code-Review, der finalen Patch-Erstellung, der Architekturplanung und allem, was Produktionsdaten berührt, zu, und Muse Spark 1.2 allem anderen – Dateilesen, Zusammenfassung, Test-Triage, Tool-Auswahl, dem volumenreichen Mittelteil einer Agentenschleife, wo die Kosten real sind und die Einsätze pro Aufruf nicht.

Eine Sache, die man weiter beobachten sollte: die Design-Arena-Ranglisten und die Indizes pro Dimension für Muse Spark 1.2, von denen es noch keine gibt. Die stärksten Belege für Fable 5 liegen genau in den Head-to-Head-Arenen, in denen Metas neues Modell überhaupt keinen Eintrag hat. Wenn dieser Eintrag erscheint, verschiebt sich diese Schwelle – möglicherweise erheblich.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube