
Muse Spark 1.3 Max Reasoning ist live: Die Einstellung hinter den Spitzenwerten von Meta ist jetzt für alle verfügbar.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Muse Spark 1.3 – das wegweisende Reasoning-Modell, das Meta Superintelligence Labs am 2. September veröffentlichte – hat gerade den Modus erhalten, auf dem seine eigene Bestenliste aufgebaut war. Am 4. September öffnete Meta nach zwei Tagen zusätzlicher Sicherheitstests die rechenintensivste „Max“-Reasoning-Einstellung des Modells für Entwickler in der Meta Model API und in Muse Code, seinem Terminal-Coding-Agenten. Chief AI Officer Alexandr Wang kündigte die Einführung auf X an, und der @AIatMeta-Account des Unternehmens bestätigte es; was beim Start eine Konfiguration war, die auf Meta und eine Partner-Vorschau beschränkt war, ist jetzt eine Reasoning-Stufe, die jeder Entwickler auswählen kann.
Die Reihenfolge ist wichtig, weil mehrere der Zahlen, die die Startberichterstattung zu Muse Spark 1.3 dominierten — 75,4 auf DeepSWE v1.1, 66,9 auf OSWorld 2.0, 1.754 auf GDPval-AA v2 — aus der Max-Konfiguration stammten, während das Modell, das die Entwickler tatsächlich aufrufen konnten, mit auf „xhigh“ gedeckeltem Reasoning-Aufwand ausgeliefert wurde. Meta war beim Start deutlich, dass Max sich noch in Sicherheitstests befand, doch die Trennung bedeutete, dass die Schlagzeilen-Tabelle und das aufrufbare Modell zwei Tage lang zwei verschiedene Dinge waren. Die Veröffentlichung am Donnerstag schließt diese Lücke – und zwar ohne den Preis pro Token anzutasten. Die Benchmark-Zahlen in dieser Liste stammen von Meta selbst und wurden von einem unabhängigen Testrahmen nicht reproduziert; alles, was in diesem Artikel von Anbietern berichtet wird, ist als solches gekennzeichnet.
Was zurückgehalten wurde — und was sich am 4. September änderte
Die Reasoning-Leiter von Muse Spark 1.3 hat dieselbe Form, seit die kostenpflichtige API der Familie geöffnet wurde: Reasoning ist immer aktiv, und der Effort-Parameter des Modells in der Meta Model API nimmt die Werte minimal, low, medium, high und xhigh an, wobei das Modell mit steigender Stufe mehr von seinem Output-Budget für das Denken aufwendet. Max steht über xhigh – mehr Rechenleistung, mehr Reasoning-Tokens und, so Meta, deutlich stärker bei langfristiger agentischer Arbeit. Beim Start am 2. September lieferte Meta alle Stufen bis einschließlich xhigh aus, ließ Max jedoch aus der öffentlichen API heraus, vorbehaltlich zusätzlicher Sicherheitstests, wie Meta es nannte, und teilte es nur einer begrenzten Gruppe von Partnern mit – genug für eine unabhängige Evaluierung, nicht genug für eine Produktionslast.
Am 4. September sagte Wang, dass die Tests abgeschlossen seien. Max ist nun eine auswählbare Einstellung in Muse Code – das Installationsskript befindet sich unter dev.meta.ai/install.sh – und für die Modell-ID muse-spark-1.3 über die Meta Model API, wo der effort-Parameter jetzt max akzeptiert. Wang beschrieb die zweitägige Staffelung als Metas Weg, den Zugriff „auf Konfigurationsebene“ zu begrenzen, und sagte gegenüber Axios, Meta habe seine übrige Arbeit wegen Sicherheitsbedenken nicht pausieren müssen. Das Zeitfenster war kurz, aber es ist ein echter Präzedenzfall: Meta ist nun bereit, einen bestimmten Reasoning-Modus hinter einer Sicherheitsprüfung zurückzuhalten, während der Rest eines Checkpoints sofort ausgeliefert wird.
Ein praktischer Warnhinweis für alle, die das Modell über ein Gateway statt über Metas eigenen Endpunkt aufrufen: Mehrere Drittanbieter-Dokumentationsseiten und Aggregator-Listen wurden am Starttag verfasst und führen den Reasoning-Effort weiterhin nur bis „xhigh“ auf. Der Maximalwert wird Meta-seitig ausgerollt. Prüfen Sie also, ob die Route, über die Sie aufrufen, ihre Parameteroberfläche aktualisiert hat, bevor Sie davon ausgehen, dass „max“ erreichbar ist – ein Proxy, der seine akzeptierten Werte am 2. September validiert hat, lehnt „max“ möglicherweise ab, bis seine Betreuer nachziehen.
Was max wirklich bringt — und wo es nicht hilft.
Die Materialien von Meta von Donnerstag enthalten eine explizite Aufteilung zwischen max und xhigh bei den Benchmarks, die es ausführt, und das ist das Nützlichste, was es bisher über das Modell veröffentlicht hat. All das beruht auf Herstellerangaben, erzeugt in Metas eigener Muse-Code-Testumgebung, und Meta gibt an, dass seine Vergleiche mit Claude Opus 5 und GPT-5.6 Sol "Best-Effort"-Läufe waren, die bei den maximalen Einstellungen dieser Konkurrenten durchgeführt wurden und "möglicherweise nicht die anbieteroptimierte Leistung widerspiegeln". Mit diesem Vorbehalt erzählt die Aufteilung eine klare Richtungsgeschichte:
• OSWorld 2.0 (Computer-Use-Agenten-Aufgaben) — 66.9 bei max vs. 57.2 bei xhigh
• GDPval-AA v2 (Elo des Wissensarbeits-Agenten) — 1.754 bei max vs. 1.709 bei xhigh
• JobBench (langfristige professionelle Aufgaben) — 64,9 bei max vs. 61,2 bei xhigh
• DeepSearchQA — Gleichstand bei 89,4
• Terminal-Bench 2.1 (Terminal-Agent-Codierung) — 89,2 bei xhigh gegenüber 88,8 bei max, die einzige Suite, bei der die am 2. September ausgelieferte Konfiguration gewinnt

Das Muster ist eine sorgfältige Lektüre wert. Max hilft am meisten dort, wo die Aufgabe eine lange agentische Schleife ist — einen Computer bedienen, ein Knowledge-Work-Briefing abarbeiten, einen Zeitplan von Teilaufgaben einhalten, so wie JobBench es tut. Bei einem Single-Turn-Terminal-Benchmark brachte es nichts und kostete ein wenig: Terminal-Bench ist die Erinnerung daran, dass „mehr Reasoning“ kein monotones Upgrade ist, und der Grund, max auf dem eigenen Workload gegen xhigh zu testen, anstatt anzunehmen, dass die höhere Einstellung überall besser ist. Meta kennzeichnet außerdem das DeepSWE-v1.1-Ergebnis von 75,4 — die Schlagzeile des ersten Tages, gestiegen von den 59,3, die Meta sechs Wochen zuvor für Muse Spark 1.2 gemeldet hatte — als Zahl einer max-Konfiguration. Das ist die Zahl, die unabhängige Evaluatoren zuerst erneut ausführen werden.
Der unabhängige Messwert beginnt aufzuholen.
Was beim Start fehlte, war jegliche unabhängige Messung, und diese Lücke schließt sich nach einem Zeitplan, der zufällig mit dem max-Rollout übereinstimmt. Der Coding-Agent-Index von Artificial Analysis – der jedes Modell in seiner nativen Coding-Agent-Umgebung bewertet und DeepSWE-, Terminal-Bench- und SWE-Atlas-Aufgaben kombiniert – platzierte Muse Spark 1.3 (max) im Muse-Code-Harness diese Woche bei 68, auf Platz zwei der Rangliste hinter Claude Opus 5 (xhigh) in Claude Code und vor Claude Fable 5 (max) mit 67 und GPT-5.6 Sol (max) mit 65. Dieselbe Rangliste bewertet die ausgelieferte xhigh-Konfiguration mit 64 im selben Muse-Code-Harness, was die bislang klarste Eins-zu-eins-Bewertung dessen ist, was max auf einem unabhängigen Aufgabensatz hinzufügt – etwa vier Indexpunkte. Diese Ranglistenzeile wurde veröffentlicht, während max sich noch in der Partnervorschau befand; die Konfiguration, die sie beschreibt, ist dieselbe, die am 4. September allgemein verfügbar wurde.
Artificial Analysis hat seit dem Rollout auch sein eigenes Modellkarten-Update für die Max-Konfiguration vorgenommen. Während des Vorschauzeitraums listete die Karte keinen Anbieter und keinen Preis; die Live-Karte listet nun Meta zum Standardpreis von 1,25 $ pro Million Eingabe-Token und 4,25 $ pro Million Ausgabe-Token – derselbe Listenpreis wie Muse Spark 1.2 – und fügt einen Einschränkungshinweis zur Ausführlichkeit hinzu: Der Evaluierungslauf von AA verbrauchte etwa 130 Millionen Token im Vergleich zu einem Median von 79 Millionen, kostete insgesamt etwa 1.335 $ und liegt bei etwa 0,95 $ pro Aufgabe auf der Schätzung von AA pro Aufgabe bei etwa 190 Ausgabe-Token pro Sekunde.
Eine Zahl aus früherer Berichterstattung verdient einen Versionsabgleich. Artificial Analysis hat seinen Intelligence Index diese Woche auf v4.2 aktualisiert – in derselben Woche, in der max ausgeliefert wurde – und dabei die Ergebnisse neu bewertet und die Mediane verschoben. Auf der aktuellen Karte erreicht die max-Konfiguration 53 gegenüber einem Median vergleichbarer Modelle von 29; die 62, die in der Startwochen-Berichterstattung kursierte, wurde mit der vorherigen Version des Index gemessen, und die beiden Werte sind nicht vergleichbar. Metas eigener xhigh-versus-max-Vergleich oben ist unabhängig vom AA-Index und bleibt von der Aktualisierung unberührt.

Was das Maximum kostet – die Abrechnung erfolgt über die Tokens, nicht über die Preisliste.
Meta veröffentlicht keinen separaten Preis für die max-Konfiguration und auch keine dedizierte Latenzanalyse. Der Preis pro Token ist identisch mit Muse Spark 1.2 und mit jeder anderen Aufwandsstufe bei Muse Spark 1.3: 1,25 $ pro Million Eingabe-Tokens, 4,25 $ pro Million Ausgabe und 0,15 $ für gecachte Eingabe auf dem Standard-Tarif. Reasoning-Tokens werden als Ausgabe-Tokens abgerechnet und auf das Ausgabebudget angerechnet. Die Wahl von max ist also keine Erhöhung eines einzelnen Preispostens – sondern das Versprechen, vor der Antwort mehr von diesem Budget für das Nachdenken aufzuwenden.
Das macht die eigentliche Kostenfrage zu einer Frage des Token-Volumens, und die frühen Daten zeigen, dass max genau dort teuer ist, wo xhigh sparsam ist. AAs instrumentierter Lauf verbrauchte etwa 130 Millionen Token bei einer einzigen Auswertung der Konfiguration. Für einen Entwickler, der bei xhigh bereits lange agentische Schleifen ausführt, ist der entscheidende A/B-Test nicht, ob max mehr Aufgaben besteht, sondern ob max genug zusätzliche Aufgaben besteht, um eine wesentlich höhere Token-Rechnung für dieselbe Arbeitslast zu rechtfertigen.
Metas Contributor-Stufe — 0,10 $ für Eingabe- und 0,20 $ für Ausgabe-Tokens pro Million, im Tausch dafür, dass Meta auf Ihren Prompts und Vervollständigungen trainieren darf — gilt für denselben Checkpoint, und Meta gibt an, dass ein beachtlicher zweistelliger Prozentsatz der Entwickler sie wählt. Da die Bedingungen von Contributor jede Einreichung zu Trainingsdaten machen und ihre Ratenlimits streng sind, ist sie eine schlechte Standardwahl für Production-Fan-out, aber ein legitimer Weg, teure Maximalexperimente günstig durchzuführen, wenn Ihnen der Datentausch zusagt.
Der Preisanker für all dies lässt sich leicht überprüfen, ohne Meta beim Wort nehmen zu müssen, denn der Checkpoint Muse Spark 1.3 ist preislich identisch mit dem Modell, das auf OrcaRouter bereits zu Metas eigenem Listenpreis gelistet ist: Muse Spark 1.2 ist auf OrcaRouter zu 1,25 $ pro Million Eingabetokens und 4,25 $ pro Million Ausgabetokens ohne Aufschlag gelistet, sodass die Behauptung „unveränderter Preis“ anhand einer Live-Seite überprüfbar ist, die genau diese Zahlen zeigt. Muse Spark 1.3 selbst ist noch nicht auf OrcaRouter gelistet. Sobald ein von uns geführter Anbieter beginnt, es mit max anzubieten, wird der auf unserer Seite angezeigte Preis Metas Listenpreis sein, der unverändert durchgereicht wird; wir schlagen keine Providerpreise auf. Jede Preissenkung von Meta wird am selben Tag wirksam, an dem Meta sie vornimmt. Bei einer Veröffentlichung wie dieser, bei der die interessante Ökonomie eher im Token-Volumen als im Schlagzeilenpreis liegt, sorgt genau diese Durchreichung dafür, dass der tatsächlich in Rechnung gestellte Betrag dem von Meta veröffentlichten Betrag entspricht.

Wer sollte zu max wechseln?
Die Entscheidung teilt sich klar:
• Wechsel für langfristige agentische Workloads — Computer-Nutzung, Wissensarbeits-Briefings, mehrstufige Tool-Schleifen in Muse Code — bei denen Metas eigener Split und AAs Coding-Agenten-Board beide die größten maximalen Zuwächse zeigen. Teste es zuerst per A/B gegen xhigh anhand einer Stichprobe deiner echten Aufgaben, denn die Ausführlichkeit ist real.
• Bleiben Sie bei xhigh für hochvolumige, latenzempfindliche oder kurze Single-Turn-Aufrufe, bei denen max hauptsächlich Tokens hinzufügt. Terminal-Bench ist der Beweis, dass es nicht immer die Leistungsfähigkeit erhöht.
Behalten Sie ab jetzt drei Dinge im Auge: das von Zuckerberg ohne Datum versprochene Open-Weights-Release, den Verbraucher-Rollout von Muse Spark 1.3 auf Instagram, Facebook und Meta AI in den kommenden Wochen sowie ob das Coding-Agent-Board von Artificial Analysis beginnt, die Max-Zeile zu bepreisen, da die Konfiguration nun allgemein verfügbar ist.
Das zweitägige Gate erwies sich als kurz, aber es verdeutlichte etwas, das den Rollout selbst überdauert: Metas stärkste Muse-Spark-1.3-Werte waren nie eine Illusion – sie warteten nur auf eine Sicherheitsprüfung. Ab dem 4. September sind das Modell, das ein Entwickler aufrufen kann, und das Modell auf der Bestenliste endlich dasselbe Modell. Ob max seine Tokens wert ist, ist nun eine empirische Frage, die jeder Entwickler über Metas API oder über jeden anderen Weg beantworten kann, den er bereits nutzt, um zur Muse-Spark-Familie zu gelangen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
