
Muse Spark 1.2 gegen GLM 5.2: Der geschlossene Coder gegen den offenen Generalisten
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Zwei Modelle mit 1.000.000-Token-Kontext, deren Preise pro Million Token nur fünfzehn Cent auseinanderliegen, beide auf coding-lastige Agentenarbeit ausgerichtet — und doch haben sie sonst fast nichts gemeinsam. Muse Spark 1.2, das Meta am 5. August 2026 zusammen mit einem gemeinsam trainierten Terminal-Agenten namens Muse Code veröffentlichte, hat geschlossene Gewichte, ist pro Token günstiger, erreicht 57 im aktuellen Artificial Analysis Intelligence Index und kann nicht ohne vorheriges Reasoning antworten. GLM 5.2, das Flaggschiff von Z.ai mit offenen Gewichten von Mitte Juni, ist MIT-lizenziert, selbst hostbar, etwa fünfmal schneller bis zum ersten Token und befördert immer noch viereinhalbmal so viel echten Traffic durch unser Gateway — 213 Millionen Token in den letzten sieben Tagen gegenüber 46 Millionen bei Muse Spark 1.2. Das Modell mit der höheren Punktzahl und dem günstigeren Preis pro Token ist das mit weniger Traffic. Das offene ist dasjenige, das die Leute tatsächlich routen.
Die ehrliche Version dieser Tatsache ist das Thema dieses Artikels. Bewertungen und Preise entscheiden weniger als die Frage, wie gut ein Modell in Ihre Pipeline passt – und diese beiden treffen bei jeder Achse, die die Passung bestimmt, gegensätzliche Entscheidungen. Wo unabhängige Zahlen existieren, stammen sie von Artificial Analysis; wo sie von Meta oder Z.ai stammen, sind sie als vom Anbieter gemeldet gekennzeichnet; die Latenz- und Verkehrswerte stammen aus OrcaRouters eigener Sieben-Tage-Produktionstelemetrie.
Der Spec-Vergleich, eine Dimension nach der anderen.
• Preis — Muse Spark 1.2 bei 1,25 $ Input / 4,25 $ Output pro Million Tokens, 0,15 $ bei Cache-Treffer; GLM 5.2 bei 1,40 $ Input / 4,40 $ Output, 0,26 $ gecacht. Meta ist in jeder Zeile günstiger.
• Kontext — beide 1.048.576 Tokens. Maximale Ausgabe: Meta dokumentiert eine Obergrenze von 131.072 Tokens für Muse Spark 1.2; GLM 5.2 gibt 128.000 an.
• Reasoning — Reasoning ist auf Muse Spark 1.2 über fünf Aufwandstufen hinweg verpflichtend (minimal bis xhigh, Standard medium); GLM 5.2 nutzt hybrides Reasoning, gesteuert durch reasoning_effort auf high oder max, wobei Deep Reasoning standardmäßig aktiviert ist.
• Eingaben — Muse Spark 1.2 unterstützt Text-, Bild-, Video-, Audio- und PDF-Eingaben; GLM 5.2 ist reine Text-zu-Text-Verarbeitung.
• Gewichte — Muse Spark 1.2 ist geschlossen, ohne Repository und ohne Selbsthosting-Pfad; GLM 5.2 bietet MIT-lizenzierte offene Gewichte, eine Mixture-of-Experts mit 753B Parametern, von denen etwa 40B pro Token aktiv sind.
• Alter — Muse Spark 1.2 ist zum Zeitpunkt des Schreibens drei Tage alt; GLM 5.2 ist seit dem 13. Juni in Produktion, mit acht Wochen Praxiserfahrung und einem ganzen Ökosystem an Hosts und darauf aufbauenden Tools.
Der Indexabstand beträgt vier Punkte. Die Versionsfalle ist real.
Der aktuelle Intelligence Index (v4.1.1) von Artificial Analysis bewertet Muse Spark 1.2 mit 57, auf Platz 12 von 185, und GLM 5.2 mit 53 – der höchste Open-Weights-Score auf der Rangliste, aber vier Punkte dahinter. Die meisten Berichte nennen für Muse Spark 1.2 weiterhin 54, weil dies die Bewertung am Starttag war; die Neubewertung mit v4.1.1 fügte 2,7 Punkte hinzu – die größte Steigerung aller Modelle in diesem Update. Wenn Sie irgendwo „54 vs 51“ oder „54 vs 53“ sehen, prüfen Sie, auf welcher Indexversion jede Zahl basiert, bevor Sie die Lücke als real betrachten.
Es lohnt sich zu sagen, was der Vier-Punkte-Abstand bedeutet und was nicht. Er bedeutet, dass Metas geschlossenes Modell im Gesamtvergleich über neun Benchmarks bei vergleichbarem Aufwand vor dem offenen Modell von Z.ai liegt. Er bedeutet nicht, dass Muse Spark 1.2 GLM 5.2 in allem schlägt, denn die beiden Modelle erreichen ihre Punktzahlen auf unterschiedlichen Wegen. GLM 5.2 ist ein Ausreißer bei Mathematik und logischem Denken — AIME 2026 bei 99,2 — aber es ist bekanntermaßen weitschweifig und seine Schwachstelle ist tiefgehende Arbeit auf Repository-Ebene. Muse Spark 1.2 ist das genaue Gegenteil: stark bei Terminal-Programmierung und Multi-Datei-Aufgaben und pro Aufgabe dramatisch billiger zu bewerten, weil es beim Denken weitaus weniger Tokens verbraucht.

Wo die Benchmarks tatsächlich auseinandergehen
Bei Terminal-Bench 2.1 liegen die beiden näher beieinander, als es der Indexabstand vermuten lässt, und die Quellenlage spielt eine größere Rolle als sonst. Auf derselben Testumgebung von Artificial Analysis erreicht Muse Spark 1.2 einen Wert von 80,1 und GLM 5.2 einen Wert von 77,9. Meta gibt für Muse Spark 1.2 in der eigenen Testumgebung 82,9 an; der beste von Z.ai berichtete Wert für GLM 5.2 liegt bei 82,7, womit es das erste Open-Weight-Modell mit mehr als 80 Punkten auf diesem Benchmark war. Gleicher Benchmark, vier verschiedene Zahlen – die Kopplung der Testumgebung verschiebt diese Werte in beide Richtungen um mehrere Punkte. Behandle daher jede einzelne Terminal-Bench-Angabe als eine Spanne.
Die Divergenz, auf die man achten sollte, ist DeepSWE 1.1, die Benchmark, die tiefes Denken über mehrere Dateien hinweg auf Repository-Ebene in einer langen Agenten-Schleife betont. Meta meldet 59,3 für Muse Spark 1.2 – ein Herstellerwert, den noch kein Dritter reproduziert hat. Der veröffentlichte DeepSWE-Wert von GLM 5.2 liegt bei 46,2, und sein Vorgänger GLM-5.1 lag bei 18,0 – das ist also die Dimension, in der sich Z.ai am meisten verbessert hat und in der es immer noch zurückliegt. Wenn Ihre Arbeitslast darin besteht, „fünfzig Dateien kohärent zu ändern“, erzählt diese Lücke die ganze Geschichte; wenn Ihre Arbeitslast aus Terminalbefehlen und Scaffolding besteht, fällt sie kaum ins Gewicht.
Noch ein Befund, der die naheliegende Darstellung auf den Kopf stellt. Die unabhängige Vals-AI-Suite, die Agenten-Workloads pro Domäne ausführt, platziert Muse Spark 1.2 insgesamt auf Platz fünf mit 71,88 % – und auf Platz eins beim Finance Agent, Platz eins bei TaxEval und Platz eins bei Harvey's Legal Agent Benchmark, gegenüber 44, 136 bzw. 31 Modellen – während Terminal-Bench 2.1 nur die vierzehntbeste der fünfzig Domänen ist. Meta hat dieses Modell als Coder vermarktet, und ein unabhängiger Bewerter fand heraus, dass es bei Finanz-, Steuer- und Rechtsdokument-Agenten am stärksten ist. Wenn Ihr Team Verträge schreibt oder Hauptbücher abgleicht, ist das die mit Abstand nützlichste Zahl in diesem Artikel.
Die Open-Weights-Frage ist die eigentliche Weggabelung.
Alles oben Genannte betrifft die Fähigkeit. Bei der Entscheidung geht es hauptsächlich um das Eigentum, und hier könnten die beiden nicht weiter auseinanderliegen.
GLM 5.2 ist MIT-lizenzierte Open Weights. Das verändert die Verhandlung, nicht nur die Rechnung: {{1}}Sie können es selbst hosten, wenn eine Arbeitslast sensibel ist oder das Volumen hoch ist;{{/1}} {{2}}Sie können es ohne erneute Integration zwischen Anbietern verschieben, denn die Gewichte gehören Ihnen;{{/2}} {{3}}und jeder Host, der es weiterleitet, muss bei Preis und Latenz konkurrieren,{{/3}} weshalb die Open-Weights-Linie mit der Zeit günstiger wird. Das 753B-MoE ist kein Laptop-Modell – die meisten Teams werden es weiterhin mieten, statt es selbst zu betreiben – aber die Option zu gehen oder dieselben Gewichte zu festen Kosten im eigenen Haus zu betreiben, setzt eine Untergrenze dafür, was Ihnen jemand berechnen kann.
Muse Spark 1.2 kauft das gegenteilige Paket. Die Gewichte sind geschlossen und der einzige First-Party-Weg ist Metas Model API, die wir jetzt ebenfalls routen. Im Gegenzug erhalten Sie ein gemeinsam trainiertes Produkt: Muse Code, der mit dem Modell ausgelieferte Terminal-Agent, wurde auf per Rejection-Sampling erzeugte Harness-Trajektorien abgestimmt und führt persistente, neustartfähige Subagenten auf einer replay-exakten Event-Log-Laufzeit aus, mit den gebündelten /plan, /grill und /goal Fähigkeiten. Das ist eine grundlegend andere Sache als „ein gutes Modell, das Sie in Ihr eigenes Harness einbinden“ – es ist ein Agent, der funktionierend ankommt. Der Kompromiss besteht darin, dass es nur auf Metas Weise, in Metas Werkzeug, unter macOS oder Linux funktioniert, ohne Windows-Client, ohne MCP und noch ohne IDE-Plugins.

Preis pro Token, Preis pro Aufgabe
Pro Token ist Muse Spark 1.2 bei Input und Output günstiger, und es bleibt auch pro Aufgabe günstiger, weil es auch das weniger wortreiche Modell ist. Artificial Analysis maß, dass GLM 5.2 – das wortreichste führende Modell im Feld – zum Start 141 Millionen Output-Token verbrannte, 95 % davon Reasoning-Token, nur um den Intelligence Index auszuführen. Muse Spark 1.2 verbrannte bei derselben Übung 95 Millionen bei 0,40 $ pro Aufgabe. Mehr Token zu einem höheren Satz bedeutet, dass sich die Kosten von GLM 5.2 pro Aufgabe in einer Weise vervielfachen, die sein Listenpreis verbirgt – und das ist der richtige Weg, Reasoning-Modelle zu vergleichen: Bepreise die abgeschlossene Aufgabe, nicht den Millionen-Token-Satz.
Es gibt einen dritten Preis, den nur eines dieser Modelle hat. {{1}}Muse Spark 1.2{{/1}} wird mit einer {{2}}Contributor-Stufe{{/2}} für {{3}}$0.10 in / $0.20 out{{/3}} geliefert — eine Größenordnung unter der Standard-Stufe und mit ähnlichem Abstand unter dem Listenpreis von {{4}}GLM 5.2{{/4}}. Der Preis für den Einstieg ist die Erlaubnis für {{5}}Meta{{/5}}, künftige Modelle anhand Ihres Traffics zu trainieren, plus ein {{6}}60-Requests-pro-Minute{{/6}}-Limit, das Produktions-Fan-out ausschließt. Behandeln Sie es als {{7}}rechtliche Prüfung{{/7}} mit angehängtem Rabatt, nicht als {{8}}günstigere SKU{{/8}}; für ein Team, das die Voraussetzungen erfüllt und unter dem Limit arbeitet, ist der Preisvergleich nicht mehr knapp.
Latenz: Die beiden Modelle invertieren
Wenn der Indexabstand Meta begünstigt, ist das Latenzprofil der Bereich, in dem GLM 5.2 beim Nutzergefühl eindeutig gewinnt. Über die letzten sieben Tage mit echtem Datenverkehr auf OrcaRouter zeigt Muse Spark 1.2 eine p50-Zeit bis zum ersten Token von 8,13 Sekunden und einen p95 von 10,00 Sekunden und rast dann mit 576 Ausgabe-Tokens pro Sekunde bei einer Fehlerquote von null. GLM 5.2 zeigt eine p50 von 1,55 Sekunden – mehr als fünfmal schneller bis zum ersten Token –, tröpfelt aber mit 78,5 Ausgabe-Tokens pro Sekunde bei einer Fehlerquote von 0,16 %. Im Labor bei maximalem Aufwand wird die Kluft größer: Artificial Analysis maß die Zeit bis zum ersten Token von Muse Spark 1.2 bei 26 Sekunden bei xhigh, der teuersten Reasoning-Einstellung.
Das eine Modell lässt einen warten und liefert dann schnell; das andere startet sofort und lässt sich Zeit. Bei allem, was ein Mensch beobachtet – einer Chat-Antwort, einer interaktiven Terminalsitzung – fühlt sich GLM 5.2 besser an, und deshalb dominiert es den interaktiven Datenverkehr über unser Gateway. Bei einer langen Generierung, einem großen Patch oder einem Dokumententwurf wird Muse Spark 1.2, sobald es startet, zuerst fertig, weil seine Ausgabegeschwindigkeit siebenmal so hoch ist wie die von GLM 5.2. Wer die falsche Kennzahl misst, wählt aus dem falschen Grund das falsche Modell.
Beides ohne einen zweiten Vertrag ausprobieren
Beide Modelle sind im OrcaRouter-Katalog zum Listenpreis des Anbieters geführt — Muse Spark 1.2 zu 1,25 $ und 4,25 $, GLM 5.2 zu 1,40 $ und 4,40 $ —, da OrcaRouter die Anbieterpreise ohne Aufschlag (0 % Marge) durchreicht. Dadurch basieren die Preisangaben auf der Rechnung und nicht auf dem Preisschild, und ein Wechsel zwischen den beiden erfordert lediglich eine einzeilige Änderung im Modellstring bei demselben Schlüssel, statt einer neuen Integration. Wenn ein Anbieter einen Preis senkt, schlägt sich die Senkung noch am selben Tag bei uns nieder.
Die Routing-Ebene zahlt sich hier genau deshalb aus, weil sich die beiden Modelle ergänzen. Die Schwäche von Muse Spark 1.2 ist ein langsames erstes Token und ein hoher Preis bei Skalierung; die Schwäche von GLM 5.2 ist Weitschweifigkeit und Deep-Repo-Reasoning. Eine Routing-Regel, die den Planungsdurchlauf an Muse Spark 1.2 und das parallele Worker-Fan-out an GLM 5.2 schickt — oder auf GLM 5.2 ausweicht, wenn der Endpunkt von Muse Code langsam ist — kostet keinen zusätzlichen Aufwand, weil beide hinter einem einzigen Endpunkt liegen. Und bei einem Modell, das erst drei Tage alt ist, ist automatisches Failover der Weg, es auszuprobieren, ohne einen Produktionspfad darauf zu verwetten.

Wer sollte welche auswählen?
Wählen Sie Muse Spark 1.2, wenn die Arbeitseinheit ein großes, zusammenhängendes Artefakt ist und jemand ein paar Sekunden warten kann, bis es startet: Multi-Datei-Refactorings, Generierung des gesamten Repositorys, lange Agent-Schleifen und — laut Vals AI — Finanz-, Steuer- und Rechtsdokumentarbeit. Der DeepSWE-Lead, die hohe Ausgaberate und die Contributor-Stufe weisen alle in dieselbe Richtung. Sie akzeptieren geschlossene Gewichte, Metas Tooling und einen langsameren ersten Token, und Sie sollten Metas 82,9 und 59,3 als Behauptungen und nicht als Tatsachen lesen.
Wählen Sie GLM 5.2, wenn Besitz und Bediengefühl wichtiger sind als der Gesamtwert: offene Gewichte, die Sie selbst hosten oder übertragen können, ein schnelles erstes Token für interaktives Arbeiten, ein Ökosystem aus Testumgebungen und Tools, das bereits damit funktioniert, und die stärkste verfügbare allgemeine Leistungsfähigkeit mit offenen Gewichten. Akzeptieren Sie die Ausführlichkeit, den 46.2-DeepSWE-Wert und einen Listenpreis, der pro Token bereits höher ist, noch bevor die Differenz bei der Token-Anzahl berücksichtigt wird.
Die meisten Teams werden feststellen, dass die ehrliche Antwort keines von beiden allein ist. Das offene ist das Arbeitstier, durch das du den Großteil des Datenverkehrs leitest; das geschlossene ist der Spezialist, den du auf die tiefgehenden Aufgaben und die sensiblen Dokumente ansetzt. Vier Indexpunkte auseinander in einer Gesamtwertung, eine Welt auseinander bei der Frage, wem die Gewichte gehören – das ist die Wahl, und sie ist viel klarer als die Bewertungen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
