
Muse Spark 1.2 vs. GPT-5.6 Luna: Drei Indexpunkte für den 4,6-fachen Token-Preis
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Artificial Analysis ließ dieselbe Neun-Benchmark-Suite an beiden Modellen laufen und behielt die Belege. Das Durchlaufen von Muse Spark 1.2 durch die Suite kostete 637,85 $. Das Durchlaufen von GPT-5.6 Luna durch die Suite kostete 174,06 $. Bei dieser 3,7-fachen Kostendifferenz lag Metas Modell drei Punkte vorn – 54 gegenüber 51 im Intelligence Index. Ob das ein guter Handel ist, ist die eigentliche Frage, und die Antwort hängt weit weniger vom Benchmark ab als von zwei Dingen, über die fast niemand schreibt: wie Ihr Agent-Framework mit Prompt-Caching umgeht und ob Ihre Arbeitslast jemals etwas hören oder sehen muss.
Jede Abbildung unten ist entweder eine unabhängige Messung von Artificial Analysis, eine Live-API-Liste oder OrcaRouters eigene Produktionstelemetrie – Letzteres ist es wert, gleich zu Beginn hervorgehoben zu werden, weil sie den Benchmark-Zahlen in aufschlussreicher Weise widerspricht. Nichts hiervon ist eine als Ergebnis verkleidete Anbieterbehauptung; wo der Anbieter die einzige Quelle ist, sagt das der Satz.
Die Anzeigetafel ist näher beieinander, als der Preisschild vermuten lässt.
Muse Spark 1.2 erzielt 54 auf dem Artificial Analysis Intelligence Index bei seiner xhigh-Reasoning-Einstellung und belegt damit Platz 13 von 185 Modellen, gegenüber einem Klassenmedian von 32. GPT-5.6 Luna erzielt 51 bei maximalem Aufwand. Drei Punkte auf einem zusammengesetzten Wert aus GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience und AA-LCR.
Drei Punkte sind real, aber klein, und die Unterwerte, die für die vorherige Generation vorliegen, zeigen, woher sie kommen. Die dimensionsbezogenen Zahlen von Artificial Analysis setzen Muse Spark 1.1 auf einen Codierungsindex von 71,3 und einen agentischen Index von 37,5; GPT-5.6 Luna liegt bei 71,4 und 45,6. Beim Codieren war es ein Kopf-an-Kopf-Rennen, und Luna lag bei agentischen Aufgaben acht Punkte vorn – genau die Dimension, die Meta in der Produktbeschreibung von 1.2 umgeschrieben hat, um sie für sich zu beanspruchen. Der Gesamtwert bewegte sich um drei Punkte zugunsten von Meta. Noch niemand hat eine Aufschlüsselung nach Dimensionen für 1.2 veröffentlicht, daher ist unbestätigt, ob sich die agentische Lücke tatsächlich geschlossen hat.

Beim Token-Mischpreis ist der Unterschied alles andere als subtil. Der Mischpreis von Artificial Analysis setzt Muse Spark 1.2 bei 0,78 $ pro Million Token an, GPT-5.6 Luna dagegen bei 0,17 $. Listenpreise: 1,25 $ für Input und 4,25 $ für Output bei Muse Spark 1.2, 0,20 $ für Input und 1,20 $ für Output bei Luna.
Da der Preis pro Arbeitseinheit und nicht pro Token berechnet wird, kostet ein einzelner Schritt eines Codierungsagenten, der 60.000 Token Kontext liest und 3.000 Token Ausgabe schreibt, etwa 8,8 Cent auf Muse Spark 1.2 und etwa 1,6 Cent auf GPT-5.6 Luna. Bei tausend Schritten pro Tag sind das 88 $ gegenüber 16 $ – ein Unterschied von ungefähr 26.000 $ pro Jahr für eine einzige Agentenschleife.
Caching ist der Punkt, an dem sich die Lücke entweder schließt oder verdoppelt.
Beide Modelle bieten aggressive Preise für gecachte Eingaben, und das Verhältnis zwischen ihnen ist nicht dasselbe wie das Verhältnis zwischen ihren Listenpreisen. Muse Spark 1.2 liest gecachte Eingaben für 0,15 $ pro Million, ein Rabatt von 88 % gegenüber seinem Satz von 1,25 $. GPT-5.6 Luna liest gecachte Eingaben für 0,01 $ pro Million, ein Rabatt von 95 % gegenüber 0,20 $.
Führen Sie denselben Agentenschritt mit dem warm bereitgestellten 60.000-Token-Präfix erneut aus: Muse Spark 1.2 sinkt von 8,8 Cent auf etwa 2,2 Cent. Luna sinkt von 1,6 Cent auf etwa 0,4 Cent. Die absolute Differenz verringert sich von 7,2 Cent auf 1,8 Cent pro Schritt, aber das Verhältnis bleibt ungefähr gleich – Caching rettet das teurere Modell nicht, es macht beide nur um ähnliche Faktoren billiger. Was sich jedoch ändert, ist, welche Kostenposition dominiert: Im Cache-Modus entfallen bei Muse Spark 1.2 59 % der Kosten auf Ausgabe-Tokens statt 85 % auf Eingabe-Tokens, sodass die Ausführlichkeit des Modells wichtiger wird als seine Kontextgröße.
Das ist hier keine hypothetische Sorge. Muse Spark 1.2 erzeugte 95M Ausgabe-Token, die durch den Intelligence Index kamen, gegenüber einem Median von 65M. Die eigene Zusammenfassung von Artificial Analysis nennt es „etwas weitschweifig“. Luna verbrauchte 130M, was schlimmer klingt, bis man mit 1,20 $ statt 4,25 $ multipliziert.
Metas Produktbeschreibung behauptet, dass Prompt-Caching die effektiven Kosten je nachdem, wie viel Kontext sich wiederholt, um 60–80 % senken kann. Das ist eine Herstellerschätzung, keine Messung, aber die obige Rechnung liegt innerhalb dieser Spanne.
Latenz: die Achse, auf der der Benchmark die Wahrheit invertiert
Liest man nur die Latenzwerte von Artificial Analysis, würde man schlussfolgern, dass Muse Spark 1.2 der reaktionsschnelle ist. Zeit bis zum ersten Token: 26.12 Sekunden für Muse Spark 1.2, 126.99 Sekunden für GPT-5.6 Luna. Fast fünfmal schneller.
Beide werden bei der teuersten Reasoning-Einstellung jedes Modells gemessen — xhigh für Muse Spark, max für Luna. Keines davon ist das, was Sie sehen werden. Auf OrcaRouter zeigt GPT-5.6 Luna über eine Woche mit echtem Datenverkehr hinweg bei dem Aufwand, den die Aufrufer tatsächlich anfordern, eine p50-Zeit bis zum ersten Token von 1,84 Sekunden und eine p95-Zeit von 9,68 Sekunden. Muse Spark 1.1 zeigt eine identische p50-Zeit von 1,84 Sekunden mit einer engeren p95-Zeit von 6,00 Sekunden. Für 1.2 gibt es noch keine Produktionstelemetrie, da es zu neu ist.

Der strukturelle Unterschied ist nützlicher als jede der beiden Zahlen. Das Denkvermögen von GPT-5.6 Luna ist optional – der Aufwand-Regler reicht von keiner Stufe über niedrig, mittel, hoch, extra hoch bis maximal, und man kann das Denken für Klassifizierung, Routing oder Extraktion wirklich ganz ausschalten. Das Denkvermögen von Muse Spark 1.2 ist obligatorisch. Der Regler hat als untersten Wert minimal, und es gibt keine Einstellung, die dir die Gewichte liefert, ohne dass du für das Nachdenken bezahlst. Für alles, was ein hohes Volumen hat und latenzempfindlich ist, ist das eine Design-Beschränkung, kein Abstimmungsparameter.
Der anhaltende Durchsatz liegt nahe beieinander: 165,0 Token pro Sekunde für Muse Spark 1.2 gegenüber 177,9 für Luna, beide deutlich über dem Klassenmedian von 71.
Die Preisfußnote, über die jeder stolpern wird.
Der Preis von GPT-5.6 Luna wird derzeit an verschiedenen Stellen unterschiedlich ausgewiesen, und wenn Sie ein Kostenmodell aufbauen, sollten Sie das wissen, bevor Sie eine Zahl nennen. Artificial Analysis und der Katalog von OrcaRouter weisen beide $0,20 pro Million Input-Token und $1,20 pro Million Output-Token aus – der Tarif, der auf die GPT-5.6-Preissenkung vom Juli folgte, und der Tarif, den Artificial Analysis zur Berechnung der oben genannten Evaluierungsrechnung von $174,06 verwendet hat. Einige Marktplatz-Einträge zeigen derzeit $0,10 und $0,60 mit einer separaten, höheren Preisstufe, die oberhalb von 272.000 Prompt-Token greift. Der sichere Weg ist, den Preis an dem Endpunkt zu prüfen, den Sie tatsächlich aufrufen, statt den aus dem Vergleichsartikel.
Die Preisstaffelung ist real, unabhängig davon, welcher Basistarif gilt, und sie wird tatsächlich zu wenig beleuchtet: Der Preis von Luna steigt stufenweise an, sobald eine einzelne Anfrage ungefähr 272.000 Prompt-Token überschreitet. Der Input verdoppelt sich etwa, der Output steigt um die Hälfte, und die Cache-Lesezugriffe skalieren entsprechend. Wenn Sie sich Luna wegen seines 1,05-Millionen-Token-Kontextfensters ansehen, beachten Sie, dass Sie den beworbenen Tarif bereits nach etwa einem Viertel des Kontextfensters verlassen. Muse Spark 1.2 hat eine Flatrate über seine gesamten 1.048.576 Token ohne Langkontext-Zuschlag — bei wirklich langen einzelnen Anfragen verringert sich die effektive Lücke zwischen den beiden erheblich.
Was Luna um keinen Preis kann
Der Modalitätsunterschied ist der klarste Grund, das eine dem anderen vorzuziehen, und er taucht auf keiner Bestenliste auf.
• Eingaben — Muse Spark 1.2 akzeptiert Text, Bilder, Videos, Audio und PDF-Dokumente laut Metas Auflistung. GPT-5.6 Luna akzeptiert Text, Bilder und Dateien. Kein Audio, kein Video. Wenn Ihre Pipeline Aufnahmen oder Filmmaterial verarbeitet, ist Luna überhaupt kein Kandidat.
• Maximale Ausgabe — Luna deklariert eine Ausgabe-Obergrenze von 128.000 Token. Der Endpunkt von Muse Spark 1.2 gibt keine maximale Ausgabelänge an, was ungewöhnlich genug ist, dass Sie es testen sollten, anstatt sich bei der Planung darauf zu verlassen.
• Wissensstand — Luna's ist auf den 16. Februar 2026 datiert. Meta veröffentlicht keinen Wissensstand für Muse Spark 1.2, kalkulieren Sie also in jedem Fall Retrieval ein.
• Bereitstellung — Luna ist weltweit über mehrere Routen allgemein verfügbar. Muse Spark 1.2 wird von genau einem Anbieter bereitgestellt: Meta. Ein Endpunkt, eine Regionsrichtlinie, eine Sache, die ausfallen kann.
• Moderation — beide sind moderierte Endpunkte.
Ein ehrlicher Vorbehalt zum multimodalen Vorteil: Das technische Datenblatt von Artificial Analysis für Muse Spark 1.2 führt Text- und Bildeingabe als das auf, was es bewertet hat, nicht die vollständige Oberfläche mit fünf Modalitäten, die Meta bewirbt. Die API akzeptiert mehr, als irgendjemand unabhängig getestet hat.

Adoption, da es nun einmal messbar ist.
Benchmarks zeigen dir, was ein Modell kann; der Datenverkehr zeigt dir, was die Leute ihm anvertrauen. In einer gleitenden Woche bewegte GPT-5.6 Luna auf OrcaRouter 4.679,4 Millionen Tokens. Muse Spark 1.1 – gleicher 1M-Kontext, vergleichbarer Indexwert, vier Wochen älter im Katalog – bewegte 4,4 Millionen. Das ist ein Faktor von ungefähr tausend.
Ein Teil davon ist die Verteilung: Luna ist in mehr Werkzeugen als Standard enthalten und ist seit längerem weltweit allgemein verfügbar, während die Muse-Spark-Familie nur in den USA eingeführt wurde. Aber eine Kluft von tausend zu eins bei einem Router, bei dem beide nur eine Modellbezeichnung voneinander entfernt sind, ist nicht rein eine Verteilungsgeschichte. Es ist der praktische Grund, warum Luna der sicherere Standard ist und Muse Spark 1.2 das, was man bewusst evaluiert.
Es ist erwähnenswert, was man heute mieten kann und was nicht: GPT-5.6 Luna ist im OrcaRouter-Katalog für 0,20 $ und 1,20 $ erhältlich, dieselben Zahlen wie auf der eigenen Preisliste des Anbieters, da wir 0 % Aufschlag verlangen und den Listenpreis des Anbieters direkt weitergeben. Muse Spark 1.1 ist dort auf derselben Basis für 1,25 $ und 4,25 $ erhältlich. Muse Spark 1.2 ist noch nicht im Katalog – es wird direkt von Meta bereitgestellt. Der günstigste Weg, diesen Vergleich heute ehrlich durchzuführen, ist also Luna gegen Muse Spark 1.1 mit einem Schlüssel, wobei man zwischen den Durchläufen eine Zeichenkette ändert, und dann erneut gegen 1.2 zu testen, sobald es verfügbar ist.
Wähle eines.
Nehmen Sie GPT-5.6 Luna, wenn die Arbeitslast hohes Volumen hat und textbasiert ist: Chat, Klassifizierung, Extraktion, Routing, leichte Tool-Nutzung. Es kostet ein Viertel des Mischpreises, Sie können das Reasoning vollständig abschalten, seine 1,84-Sekunden-p50 ist eine real gemessene Produktionszahl und kein Benchmark-Artefakt, und es ist das Modell, hinter dem tausendmal so viel Live-Datenverkehr steht. Drei Indexpunkte überleben diese Rechnung nicht.
Nehmen Sie Muse Spark 1.2wenn die Arbeitslast aus langfristigem agentischem Coding besteht – Refactorings über mehrere Dateien, erweitertes Debugging, Arbeit am gesamten Repository – oder wenn Audio- oder Video-Eingaben beteiligt sind, bei denen Luna einfach nicht mithalten kann. Es ist auch die bessere Wahl für wirklich enorme einzelne Anfragen, da sein Preis über die gesamte Million Token hinweg konstant bleibt, während Lunas Preis über 272K hinaus ansteigt.
Nehmen Sie beide wenn Sie ehrlich darüber sind, wie Agentensysteme tatsächlich gebaut werden. Das Muster, das sich immer wieder durchsetzt, ist ein kostengünstiges Modell, das die routinemäßige Mehrheit der Anfragen übernimmt, und ein teures, das für die Schritte reserviert ist, bei denen sich Qualität auszahlt. Beide Modelle sitzen hinter einem OpenAI-kompatiblen Endpunkt, sodass diese Aufteilung eine Routing-Regel ist und keine zweite Anbieterbeziehung — und wenn der teure Arm mitten im Lauf ausfällt, bedeutet automatisches Failover, dass sich Ihre Auswertung nicht stillschweigend mit einem halben Datensatz vergiftet.
Das, worauf man im nächsten Monat achten sollte, ist die Aufschlüsselung nach Dimensionen. Das gesamte Verkaufsargument von Muse Spark 1.2 ist agentische Fähigkeit, und in der vorherigen Generation war das die Dimension, in der Luna mit acht Punkten führte. Bis jemand einen Agentik-Index für 1.2 veröffentlicht, ist der Drei-Punkte-Gesamtzuwachs der einzige Beweis dafür, dass Meta die Lücke geschlossen hat.
