
Muse Spark 1.2 und Muse Code: Metas drittes Modell in vier Monaten liegt gleichauf mit Grok 4.5
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Meta hat Muse Spark 1.2 am 5. August 2026 veröffentlicht, vier Wochen nach Muse Spark 1.1 und etwa vier Monate nach dem ersten Muse Spark. Diese Version kam mit etwas, das die beiden vorherigen nicht hatten: einem eigenen Coding-Agenten von Meta, Muse Code, der in der Beta-Phase ausgeliefert wurde und gemeinsam mit dem Modell trainiert wurde, auf dem er läuft. Und auf der einen Rangliste, die weder Meta noch seine Rivalen kontrollieren, bringt die Veröffentlichung Meta in ein totes Rennen mit SpaceXAI – Muse Spark 1.2 und Grok 4.5 erreichen jetzt beide 54 auf dem Artificial Analysis Intelligence Index. Fünf Tage später kam die größere Entwicklung: Am 10. August kündigte Meta an, die Gewichte von Muse Spark 1.2 zu öffnen – eine Ankündigung, die, falls sie umgesetzt wird, das Modell zum stärksten aktuellen US-amerikanischen Open-Weight-Rivalen für chinesische Modelle machen würde.
Zwei Dinge sollte man voneinander trennen, bevor irgendeine der folgenden Zahlen etwas bedeutet. Der Intelligence-Index-Score, die Latenzwerte und die Token-Anzahl stammen von Artificial Analysis, das eigene Bewertungen durchführt und die Rechnung veröffentlicht; diese sind unabhängig. Die Programmierergebnisse, mit denen Meta seine Ankündigung anführte — Terminal-Bench 2.1, DeepSWE v1.1 und ein interner Benchmark — wurden von Meta auf Metas Testumgebung durchgeführt, wobei jedes konkurrierende Modell mit seinem eigenen Agentenprodukt gekoppelt wurde. Beide Arten von Zahlen sind nützlich. Sie sind nicht dieselbe Art von Belegen, und dieser Artikel hält sie auseinander.
Was Meta tatsächlich ausgeliefert hat

Die Ankündigung, die auf Metas KI-Forschungsblog veröffentlicht und auf den 5. August datiert wurde, behandelt zwei Produkte auf einmal.
• Muse Spark 1.2 — ein auf Codierung fokussiertes Update der Muse-Spark-Familie. Meta gibt an, die Trainings-Rechenleistung für Codierungsaufgaben erhöht und die Vielfalt der Trainingsumgebungen erweitert zu haben, während die allgemeine Agentenfähigkeit beibehalten wurde, mit der die 1.1-Version beworben wurde. Die angegebenen Trainingsziele sind langfristig angelegt: Generierung ganzer Repositories, große End-to-End-Projekte und das, was Meta Auto-Research nennt – mit Planung zur Sequenzierung von Aufgaben, Zielkonditionierung zur Aufrechterhaltung der Richtung über viele Schritte hinweg und Kontextkomprimierung, um den relevanten Zustand bei langen Sitzungen zu erhalten.
• Muse Code — ein Terminal-Coding-Agent in der Beta-Phase, der mit einem einzeiligen Shell-Skript von Metas Entwicklerdomäne installiert wird. Er führt persistente asynchrone Hintergrund-Agenten, die eine Sitzung überdauern, auf einer lokalen Event-Log-Laufzeitumgebung aus, die Meta als replay-exakt und neustartsicher beschreibt, und koordiniert mehrere Unter-Agenten pro Aufgabe in isolierten Worktrees. Er wird mit drei gebündelten Skills geliefert: /plan für genehmigungspflichtige Planung, /grill zum Stresstesten bereits erledigter Arbeit und /goal um eine Aufgabe zum Abschluss zu bringen.
Die Paarung ist kein Zufall. Meta sagt, dass die beiden gemeinsam trainiert wurden – das Modell wurde anhand von rejection-sampled Trajektorien aus der Harness abgestimmt, mit Rezeptoptimierungen für Ziele, Kompaktierung und Subagenten. Das ist dieselbe Co-Training-Strategie, die Claude Code und Codex hervorgebracht hat, und sie hat eine Konsequenz für alle, die Benchmark-Zahlen lesen: Die besten Codierergebnisse des Modells wurden innerhalb der Harness erzielt, gegen die es trainiert wurde. Das ist kein Betrug, sondern so funktioniert agentische Evaluierung heute. Es bedeutet jedoch, dass ein 1,2-Punktestand, der mit einem anderen Scaffold erzielt wurde, eine offene Frage ist und keine sichere Annahme.
Der Rest der Spezifikation ist unverändert gegenüber 1.1, die selbst informativ ist. Der Kontext bleibt bei 1.048.576 Tokens. Das Reasoning bleibt über fünf Aufwandstufen hinweg verpflichtend — minimal, niedrig, mittel, hoch, xhigh — wobei mittel die Standardeinstellung ist; es gibt keine Konfiguration, bei der man die Gewichte erhält, ohne für etwas Überlegung zu zahlen. Zum Start waren die Gewichte geschlossen, ohne Hugging-Face-Repository, und Metas eigene Model-API war der einzige Ort von Erstanbietern, um sie aufzurufen. Das soll sich nun ändern: Am 10. August kündigte Meta an, die Gewichte zu öffnen, und kehrte damit die Politik der geschlossenen Gewichte um, die die ersten drei Muse-Spark-Veröffentlichungen bestimmte.
43, dann 51, dann 54

{{1}}Artificial Analysis{{/1}} bewertet {{2}}Muse Spark 1.2{{/2}} mit {{3}}54{{/3}} Punkten im {{4}}Intelligence Index{{/4}} bei der Einstellung {{5}}xhigh reasoning{{/5}} und platziert es damit auf {{6}}Rang 13 von 185 Modellen{{/6}} gegenüber einem {{7}}Klassenmedian von 32{{/7}}. Der Index ist ein {{8}}gewichteter zusammengesetzter Wert aus neun Auswertungen{{/8}} – {{9}}GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience und AA-LCR{{/9}} – {{10}}gleichmäßig verteilt auf Agenten, Codierung, allgemeine Leistungsfähigkeit und wissenschaftliches Denken{{/10}}.
Betrachtet man die Entwicklung als Serie und nicht als Momentaufnahme, ist der Meta-Verlauf die eigentliche Geschichte. Der ursprüngliche Muse Spark erzielte im April 43 Punkte. Muse Spark 1.1 erreichte am 9. Juli 51 – ein Zuwachs von acht Punkten in einem Quartal. Muse Spark 1.2 legt in weniger als einem Monat drei weitere Punkte hinzu. Meta hat in vier Monaten 11 Indexpunkte zugelegt und liefert inzwischen schneller aus, als das Evaluations-Ökosystem mitkommen kann — es gibt immer noch keine veröffentlichte Aufschlüsselung nach einzelnen Benchmarks für 1.2 und überhaupt keinen Eintrag in Design Arena, während 1.1 beides hat.
Vierundfünfzig Punkte setzen Meta gleichauf mit Grok 4.5, dem Modell, das SpaceXAI einen Tag vor Muse Spark 1.1 veröffentlichte, und hinter einer dichten Spitzengruppe: Claude Opus 5 bei 61, Claude Fable 5 bei 60, GPT-5.6 Sol bei 59. Der Abstand nach oben beträgt sechs oder sieben Punkte. Der Abstand zu dem Stand, mit dem Meta das Jahr begonnen hat, beträgt elf. Ob sich das schließt, hängt davon ab, ob das Tempo gehalten wird, und Meta arbeitet derzeit im Vier-Wochen-Rhythmus.
Ein Gleichstand bei einem zusammengesetzten Index ist jedoch kein Gleichstand bei einer Aufgabe, und es ist wichtig zu sagen, was die 54 klärt und was nicht. Sie klärt, dass Muse Spark 1.2 bei der Gesamtfähigkeit in derselben Diskussion wie Grok 4.5 steht. Sie sagt Ihnen nicht, welches die besseren Patches schreibt, weil der Code-Subindex, der das beantworten würde, für 1.2 noch nicht veröffentlicht wurde.
Metas Codierungsnummern, sorgfältig lesen.
Metas Ankündigung führt in drei Diagrammen. Bei den eigenen Läufen, angegeben als pass@1 über fünf Versuche, wobei jedes konkurrierende Modell mit seinem eigenen Agentenprodukt gepaart wird:
• Terminal-Bench 2.1 — 82,9 % für Muse Spark 1.2, gestiegen von 76,2 % bei 1.1. Claude Opus 5 liegt mit 86,7 % vorn.
• DeepSWE v1.1 — 59,3 %, gestiegen von 53,0 %.
• Metas interner Programmier-Benchmark — 70,6 %, gestiegen von 68,3 %.
Die Deltas sind der glaubwürdige Teil. Ein Zuwachs von 6,7 Punkten bei Terminal-Bench und 6,3 bei DeepSWE – einen Monat auseinander auf dieselbe Weise und mit demselben Harness vom selben Team gemessen – ist eine vernünftige Einschätzung, wie viel 1.2 gegenüber 1.1 bei dem, was Meta optimiert hat, verbessert wurde. Die anbieterübergreifende Platzierung ist der Teil, den man nicht zu ernst nehmen sollte: Die Harness-Kopplung ist eine große freie Variable, und ein Labor, das sein eigenes Harness neben seinem eigenen Modell abstimmt, ist nicht in der Lage, die Harnesses aller anderen gleichermaßen gut abzustimmen. Meta war auf seiner eigenen Folie Zweiter, was zumindest nicht dem üblichen Muster eines Anbieter-Benchmarks entspricht, aber kein Dritter hat irgendetwas davon zum Zeitpunkt dieses Schreibens reproduziert.
Die zweite Preisliste
Das Bedeutsamste an diesem Release ist nicht in den Benchmark-Diagrammen zu sehen. Muse Spark 1.2 wird mit zwei Preislisten ausgeliefert.
• Standard-Stufe — 1,25 $ pro Million Eingabe-Tokens, 0,15 $ pro Million bei Cache-Treffer, 4,25 $ pro Million Ausgabe-Tokens. Gegenüber 1.1 bis auf den Cent unverändert. Ratenlimit bei etwa 3.000 Anfragen pro Minute. Web-Search-Grounding wird separat mit 2,50 $ pro tausend Abfragen abgerechnet.
• Beitragenden-Tarif — $0.10 Eingabe, $0.002 Cache-Eingabe, $0.20 Ausgabe. Das ist 12.5× günstiger bei der Eingabe und 21.25× günstiger bei der Ausgabe. Der Preis dafür ist die Erlaubnis für Meta, zukünftige Modelle mit deinem Datenverkehr zu trainieren, sowie ein Limit von 60 Anfragen pro Minute — 2% des Standardbudgets.
Bei 0,10 und 0,20 Dollar würde Muse Spark 1.2 nahezu jedes Frontier-nahe Modell auf dem Markt unterbieten, einschließlich der Budget-Stufe mit offenen Gewichten, der es preislich sonst unterlegen ist. Das ist die interessante Zahl bei diesem Launch, und es ist nicht wirklich eine Preisentscheidung. Sechzig Anfragen pro Minute schließen für sich genommen die meisten Produktions-Fan-out-Muster aus; die Stufe zielt also eher auf Experimente und Arbeit in kleinen Teams ab als auf das Serving. Und „wir dürfen auf Ihrem Datenverkehr trainieren“ ist eine Frage für diejenigen, die in Ihrer Organisation die Data Governance freigeben, nicht für diejenigen, die Modelle auswählen. Behandeln Sie es als eine Rechtsprüfung mit Rabatt, nicht als eine günstigere SKU.
Was die 54 in der Herstellung kostet

Artificial Analysis veröffentlicht, was die eigenen Evaluierungsläufe kosten, und in dieser Spalte zeigt sich die Form von Muse Spark 1.2. Das Absolvieren der Neun-Benchmark-Suite kostete 637,85 $ und verbrauchte 95 Millionen Ausgabe-Token, gegenüber 548,07 $ und 94 Millionen für Muse Spark 1.1 – bei identischer Preisgestaltung pro Token. Die zusätzlichen 16 % sind reine Überlegung.
Die Latenzwerte bewegen sich in dieselbe Richtung. Bei xhigh gemessen, beträgt die Zeit bis zum ersten Token für 1.2 26,12 Sekunden gegenüber 2,90 Sekunden für 1.1, und die Ausgabegeschwindigkeit sinkt von 213,5 auf 165,0 Token pro Sekunde. Meta erkaufte sich drei Indexpunkte mit Denkzeit, und das Design mit verpflichtendem Reasoning bedeutet, dass man den Kauf nicht ablehnen kann — nur wählen, wie viel davon man in Anspruch nimmt.
Diese 26-Sekunden-Zahl wird falsch zitiert werden, deshalb hier vorab die Korrektur: Es handelt sich um eine Messung auf der teuersten Anstrengungsstufe, die das Modell bietet, und die API verwendet standardmäßig mittel. Als Referenzpunkt aus echtem Datenverkehr statt aus einer Benchmark-Umgebung zeigt Muse Spark 1.1, bereitgestellt über OrcaRouter – unabhängig davon, welche Anstrengungsstufe Aufrufer tatsächlich anfordern – über 7 Tage einen p50-Wert für die Zeit bis zum ersten Token von 1,84 Sekunden und einen p95-Wert von 6,00 Sekunden, bei 519 Tokens pro Sekunde und einer Fehlerrate von null. Benchmark-Latenz bei maximaler Anstrengung und Produktionslatenz bei Standard-Anstrengung sind unterschiedliche Größen, und sie unterscheiden sich normalerweise um eine Größenordnung. Betrachten Sie 26,12 s als Obergrenze für tiefgehendes Denken, nicht als die tatsächliche gefühlte Latenz einer Anfrage.
Wo Sie es heute anrufen können
Muse Spark 1.2 wird über Metas eigene Model API bereitgestellt und derzeit nirgendwo sonst — es gibt noch kein Hugging-Face-Repository und es ist nicht im OrcaRouter-Katalog. Genau das soll die Ankündigung vom 10. August ändern: Meta sagt, die Gewichte würden 'in den kommenden Wochen' geöffnet, und sobald das geschieht, verlagert sich die Verfügbarkeitsfrage von 'Wo wird es bereitgestellt?' zu 'Welche Gewichte, unter welcher Lizenz und in welchen Laufzeitumgebungen?'. Muse Spark 1.1 ist im OrcaRouter-Katalog, zu 1,25 $ und 4,25 $ — dieselben Zahlen, die Meta verlangt, denn OrcaRouter nimmt 0 % Aufschlag und gibt den Listenpreis des Anbieters unverändert weiter.
Das ist für den Vergleich wichtiger als für das Modell selbst. Wenn Sie für dieses Release ein Kostenmodell aufstellen, stehen die Modelle, gegen die Sie es benchmarken würden — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — hinter einem einzigen Schlüssel zum Listenpreis, sodass die Zahl in Ihrer Tabellenkalkulation der Zahl auf der Rechnung entspricht und eine Preissenkung des Anbieters am selben Tag greift statt erst nach einer Verlängerung. Für Muse Spark 1.2 speziell lautet die Antwort heute: Metas Endpunkt, ein zweiter Vertrag und eine separate Rechnung — und sobald die Gewichte veröffentlicht sind, wird eine selbst gehostete Installation zur dritten Option.
Was hat sich am 10. August geändert
Fünf Tage nach der Veröffentlichung schlug Metas Haltung gegenüber seinem eigenen Flaggschiff um. In einer Ankündigung vom 10. August sagte Meta, dass es die Gewichte von Muse Spark 1.2 „in den kommenden Wochen“ öffnen werde, was es zur ersten Muse-Spark-Veröffentlichung macht, die ein Team selbst ausführen konnte. Die Aussage stammt von der Unternehmensleitung und ist nicht ausgeliefert: Es gibt noch kein Hugging-Face-Repository, und das genaue Datum, die Parameteranzahl und die Lizenz sind alle unbestätigt.
Es geht um den Wettlauf um die Frontier-Gewichte. Muse Spark 1.2 erreicht 54 Punkte auf dem Artificial Analysis Intelligence Index – mehr als jedes derzeit herunterladbare US-Open-Weight-Modell. Wenn die Gewichte also wie versprochen veröffentlicht werden, wäre es der stärkste amerikanische Open-Weight-Konkurrent der chinesischen Labore – eine Argumentation, die Zuckerberg am 10. August in einem Essay mit 6.500 Wörtern ausführlich dargelegt hat, in dem er den US-Beschränkungen für Trainingsdaten vorwarf, die Führung bei den Open-Weight-Modellen an ausländische Labore abzutreten. Der Kurswechsel hat bereits eine erste Auslieferung: Muse Glimmer, ein Modell mit 30 Milliarden Parametern, das am selben Tag unter einer Apache-2.0-Lizenz veröffentlicht wurde, aus Muse Spark destilliert und für lokale Agenten-Workloads entwickelt wurde. Metas eigene Benchmarks sehen es bei Agentenaufgaben vor Googles Gemma4-31B und Qwen3.6-27B; diese Zahlen stammen vom Anbieter und wurden bislang nicht unabhängig reproduziert.
Was die Ankündigung nicht beantwortet hat
• Keine unabhängige Coding-Kennzahl. Artificial Analysis veröffentlicht einen Composite-Wert für 1.2, aber noch nicht die Coding- und Agentic-Teilindizes, die es für 1.1 veröffentlicht hat (71,3 bzw. 37,5). Da agentische Arbeit bei 1.1 mit großem Abstand die schwächste Dimension war und agentisches Coding genau das ist, was 1.2 behauptet, behoben zu haben, wäre diese Zahl diejenige, die die Veröffentlichung entscheiden würde.
• Keine Reproduktion der Ergebnisse des Testrahmens. Alle Coding-Kennzahlen in der Ankündigung stammen aus Meta-Läufen. Niemand hat bisher Muse-Spark-1.2-Ergebnisse aus einem neutralen Gerüst veröffentlicht.
• Keine multimodale Verifikation. Die Muse-Spark-Listung bewirbt Text-, Bild-, Video-, Audio- und PDF-Eingaben. Die unabhängige Bewertung umfasst Text und Bild. Metas 1.2-Messaging hat sich fast vollständig auf Softwarearbeit verlagert, und der Mixed-Media-Anwendungsfall 1.1, der ausdrücklich für den Moment verkauft wurde, hat weder Marketing noch Messung dahinter.
• Keine Durchsatzhistorie. Das Volumen am Endpunkt ist noch zu niedrig, als dass sich die üblichen rollierenden Latenzstatistiken aufbauen könnten.
Was Sie in den nächsten vier Wochen sehen sollten
Vier Dinge werden darüber entscheiden, ob dieses Release dem entspricht, was Meta behauptet. Das erste ist ein unabhängiger Agentic-Score für 1.2 – wenn sich der Teilindex, der bei 1.1 noch bei 37,5 lag, deutlich bewegt hat, ist das Coding-Versprechen real. Das zweite ist, ob jemand das Terminal-Bench-Ergebnis außerhalb von Muse Code reproduziert; ein Modell, das nur innerhalb seiner eigenen Testumgebung gute Leistung bringt, ist ein Produkt, keine Fähigkeit. Das dritte ist, was mit der Contributor-Stufe passiert: Wenn die 60-Anfragen-Obergrenze gelockert wird, verändert ein Frontier-nahes Modell mit 0,10 $ bei Eingabe und 0,20 $ bei Ausgabe die Rechnung der Budget-Stufe auf eine Weise, wie es ein Indexgewinn von drei Punkten nie könnte. Das vierte ist das Versprechen zu den Gewichten: Meta sagt, die Gewichte von Muse Spark 1.2 würden „in den kommenden Wochen“ geöffnet, und ob das Repository in diesem Zeitrahmen erscheint – unter welcher Lizenz und wie schnell lokale Laufzeitumgebungen es aufgreifen – wird darüber entscheiden, ob die Wende zu offenen Gewichten real ist.
Und wenn der Rhythmus hält, ist Muse Spark 1.3 für Anfang September angekündigt. Gemessen an diesen Anzeichen ist die Zahl, die man beim Erscheinen im Auge behalten sollte, nicht der Index-Score. Entscheidend ist, ob Meta Fähigkeiten hinzufügen kann, ohne jedem Request weitere zwanzig Sekunden Denkzeit voranzustellen. Die erste Frucht dieser Neuausrichtung ist bereits draußen: Muse Glimmer, ein Open-Weight-Modell mit 30 Milliarden Parametern, das Meta am 10. August unter einer Apache-2.0-Lizenz veröffentlicht hat und das dafür gebaut ist, Agenten lokal auszuführen – die bisher engste Vorschau darauf, wie ein offenes Muse Spark 1.2 aussieht.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
