Generierte Hero-Karte mit der Überschrift 'Step 5 Preview vs Muse Glimmer – die API und der Laptop'. Auf der linken Karte 'Step 5 Preview' steht: AA Index 44 gegenüber einem Klassenmedian von 26, StepFun, angekündigt am 20. Sep. 2026, etwa 600 Mrd. Parameter gesamt / 27 Mrd. aktiv, 1M-Token-Kontext, 1,00 $ Input / 2,70 $ Output pro 1 Mio. Token, läuft auf den Servern des Anbieters. Auf der rechten Karte 'Muse Glimmer' steht: AA Index 17, Meta Superintelligence Labs, veröffentlicht am 10. Aug. 2026, 30 Mrd. Parameter bei 4 Bit unter 20 GB, 131K-Token-Kontext, erweiterbar auf 262K, Apache 2.0, läuft offline auf Ihrer eigenen GPU. Eine Fußzeile lautet: 'Indexzahlen laut Artificial Analysis; Muse Glimmer-Spezifikationen laut Meta.'
Guides & Insights

Step 5 Preview vs. Muse Glimmer: Die Frontier-API und das Laptop-Modell

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Auf einer Rangliste: Step 5 Preview und Muse Glimmerliegen nicht dicht beieinander: 44 gegen 17 auf dem Artificial Analysis Intelligence Index – eine Lücke von siebenundzwanzig Punkten auf einer Skala, deren aktueller Spitzenreiter im hohen Fünfzigerbereich liegt –, die durch noch so viel Tuning nicht zu schließen ist. Bei der Frage, die ein Team tatsächlich beantworten muss – wo laufen meine Token –, sind sie direkte Konkurrenten. Step 5 Preview ist das Flaggschiff von StepFun, angekündigt am 20. September 2026, mit rund 600 Milliarden Gesamtparametern, davon 27 Milliarden aktiv, einem Kontext von 1 Mio. Token, für 1,00 $ pro Million Eingabe-Token und 2,70 $ pro Million Ausgabe-Token, und nur über ein Netzwerk erreichbar. Muse Glimmer ist das 30-Milliarden-Parameter-Agentenmodell mit offenen Gewichten von Meta Superintelligence Labs, veröffentlicht am 10. August 2026 unter Apache 2.0, in 4-Bit-Quantisierung ausgeliefert, sodass es unter 20 GB Speicher passt und auf einer einzelnen Consumer-GPU ohne Netzwerkverbindung läuft. Die richtige Art, diese Paarung zu lesen, ist nicht „Welches ist klüger“. Sondern „Welche der beiden Einschränkungen – Leistungsfähigkeit oder Perimeter – ist diejenige, die Ihre Workload nicht verschieben kann.“

Der Vergleich ist auch ein nützliches Korrektiv für eine Angewohnheit, die dieser Markt angenommen hat: einen zusammengesetzten Indexwert als den gesamten Wert eines Modells zu behandeln. Die 27-Punkte-Lücke ist real, und sie ist nicht die einzige Zahl in der Akte. Beim Long-Context-Retrieval setzt dasselbe unabhängige Gremium Muse Glimmer innerhalb eines halben Punktes von Open-Weight-Modellen aus einer viel größeren Gewichtsklasse, und Metas eigene agentische Benchmarks sind respektabel für ein Modell, das auf einem Laptop läuft. Unterdessen ist Step 5 Previews meistzitierte Schwäche überhaupt nicht die Leistungsfähigkeit, sondern die Ausführlichkeit, und es ist geschlossen, bis seine versprochenen Gewichte am 15. Oktober eintreffen.

Zwei Modelle, zwei völlig unterschiedliche Objekte

Step 5 Preview ist ein Mixture-of-Experts-System, das von StepFuns Infrastruktur bereitgestellt wird: etwa 600 Mrd. Parameter insgesamt, 27 Mrd. aktiv pro Token, Text- und Bildeingabe, ein Kontextfenster von 1 Mio. Token und ein unabhängiger Intelligence-Index-Wert von 44 gegenüber einem Median vergleichbarer Modelle von 26. Seine Ausgabe läuft mit 87 Token pro Sekunde gegenüber einem Durchschnitt von 78 bei der Messung desselben Boards, und es erzeugte etwa 160 Millionen Ausgabe-Token in der Index-Aufgabensuite, in der das Medianmodell etwa 82 Millionen erzeugt – ungefähr doppelt so viel Text pro Arbeitseinheit, abgerechnet mit 2,70 $ pro Million. Die BF16-Gewichte wurden für den 15. Oktober 2026 versprochen und sind noch nicht im Repository, daher existiert das Modell heute für Sie nur als API.

Muse Glimmer ist das entgegengesetzte Objekt. Es ist ein 30B-Parameter-Modell, das durch Logit-Destillation von Metas größerem Muse-Spark-Lehrer trainiert und anschließend auf long-context-agentischen Daten feinabgestimmt und für die Tool-Nutzung verstärkt wurde. Meta liefert es 4-Bit-quantisiert aus, wodurch der Speicherbedarf von über 55 GB bei voller Präzision auf unter 20 GB sinkt – innerhalb eines 24-GB- oder 32-GB-VRAM-Rahmens –, und es wurde von Meta auf einer Nvidia RTX 5090 sowie auf Apple M4 Max- und M5 Max-Silizium getestet. Es akzeptiert Text- und Bildeingaben in über hundert Sprachen, unterstützt einen Kontext von 131.072 Token, der auf 262.144 erweiterbar ist, und ist darauf ausgelegt, ein Ziel zu übernehmen, es in Schritte zu zerlegen, Tools aufzurufen und einen fehlgeschlagenen Aufruf zu wiederholen, statt abzubrechen. Es ist Apache 2.0 und läuft offline.

• Unabhängiger Score — Step 5 Preview: 44 gegenüber einem Median von 26 in seiner Klasse vs. Muse Glimmer: 17 auf demselben Index in seiner hohen Konfiguration.

• Skalierung — Step 5 Preview: insgesamt etwa 600B, 27B aktiv bei StepFun vs. Muse Glimmer: insgesamt 30B, auf 4 Bit quantisiert unter 20 GB.

• Kontextfenster — Step 5 Preview: 1 Mio. Token vs. Muse Glimmer: 131.072, erweiterbar auf 262.144, laut Meta.

• Preis — Step 5 Preview: 1,00 $ für Eingabe / 2,70 $ für Ausgabe pro Million Tokens, veröffentlicht vs. Muse Glimmer: keine Gebühr pro Token; Sie stellen die GPU bereit.

• Wo es läuft — Step 5 Preview: die Server des Anbieters, über HTTP vs. Muse Glimmer: Ihre eigene Hardware, offline.

• Lizenz — Step 5 Preview: geschlossene Vorschau, Gewichte für den 15. Oktober 2026 versprochen vs. Muse Glimmer: Apache 2.0, jetzt herunterladbar.

• Langkontext-Retrieval — Muse Glimmer erzielt 80,0 bei der Long-Context-Reasoning-Evaluation des Index Boards, innerhalb eines halben Punkts von Modellen, die ein Vielfaches seiner Preisklasse kosten, und nah genug an Step 5 Previews Ergebnis, dass der Unterschied für Find-the-Fact-Arbeit nicht entscheidungsrelevant ist.

Die siebenundzwanzig Punkte und was sie nicht messen

Ein 30B-Modell, das darauf destilliert wurde, in 20 GB Speicher zu laufen, wird auf einem Index für allgemeine Intelligenz gegen ein 600B-Flaggschiff verlieren, und Metas eigenes Material behauptet nichts anderes — eine seiner Formulierungen sagt unmissverständlich, dass Glimmer nicht darauf ausgelegt ist, die rohe Denkleistung von Cloud-Modellen in vollem Maßstab zu erreichen. Die Bewertung von 17 ist also kein Urteil über die Ingenieursleistung; sie ist das erwartbare Ergebnis der Abwägung eines anderen Ziels. Die richtige Frage ist, welche deiner Aufgaben die Lücke tatsächlich abdeckt.

Die Langkontext-Betrachtung ist der Punkt, an dem sich die beiden am nächsten kommen und an dem die Intuition versagt. Muse Glimmer erzielt 80,0 Punkte in der Langkontext-Reasoning-Bewertung des Boards – ein Wert, der für ein Frontier-Modell nichts Besonderes wäre und für eines, das auf einer Consumer-GPU läuft, bemerkenswert ist. Wenn Ihre Workload aus Retrieval, Zusammenfassung oder Extraktion über lange Dokumente besteht, ist ein lokales Modell auf diesem Niveau nicht offensichtlich das falsche Werkzeug, und die Tatsache, dass die Anfrage Ihren Rechner nie verlässt, ist ein Feature, das Sie von einer API zu keinem Preis kaufen können.

Dann gibt es den Teil des Vergleichs, den Metas Zahlen nicht zeigen. Eine peer-reviewte Studie zur Multi-Agenten-Orchestrierung testete Muse-Glimmer-30B in einem kontrollierten Setup – dieselbe Aufgabe, dieselbe Testumgebung, dieselben Berater – und stellte fest, dass es keinen der Kandidaten wiederherstellte, die von größeren Frontier-Modellen erzeugt wurden, und bei allen drei Versuchen in jeder Einstellung scheiterte. Das ist eine einzelne Studie zu einer einzigen Konfiguration, und es ist die Art von Beleg, die eine Modellseite nie zeigt. Für agentische Pipelines, in denen ein schwächerer Orchestrator sich von einem Fehler eines stärkeren Modells erholen muss, ist es das entscheidungsrelevanteste Ergebnis in diesem Beitrag, und es lohnt sich, es vor irgendeinem der von Meta als Anbieter gemeldeten Benchmarks zu lesen.

Diese Benchmarks sind der Vollständigkeit halber Metas eigene und nicht reproduzierte: 76,0 % auf SWE-Bench Verified, 51,2 % auf SWE-Bench Pro, 51,7 % auf TerminalBench 2.1, 65,9 % auf OSWorld-Verified, 83,5 % auf GPQA Diamond, 22 % auf Humanity's Last Exam und 75,5 bei MCP-Atlas. Sie werden gegen Modelle in seiner eigenen Größenklasse gemessen, und sie beschreiben eher einen leistungsfähigen lokalen Agenten als einen Frontier-Reasoner.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Wo die Grenze tatsächlich verläuft

Der strukturelle Vorteil von Step 5 Preview ist, dass es die Arbeit erledigt, die man lokal nicht erledigen kann. Ein Kontext von 1 Mio. Token, Bildeingabe, ein gemessener, frontier-naher Score und 87 Ausgabe-Token pro Sekunde, ohne Hardware kaufen zu müssen: Für Entwürfe, Planung, Code-Review über ein großes Repository hinweg oder alles, wo die Obergrenze des Modells der Engpass ist, gewinnt die API, und die siebenundzwanzig Punkte sind das ganze Argument. Der Preis dafür ist das Gegenteil von dem von Muse Glimmer: Prompts verlassen den eigenen Perimeter, der Preis fällt bei jedem Token erneut an, und die Ausführlichkeit des Modells macht Workloads mit langen Ausgaben teurer, als der Preis von 2,70 $ vermuten lässt.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Der Vorteil von Muse Glimmer ist, dass es die Arbeit erledigt, die nicht nach außen gehen darf. Wenn die Daten reguliert sind, wenn das Latenzbudget nur wenige Millisekunden beträgt, wenn die Maschine offline ist oder wenn die Grenzkosten der millionsten Anfrage null sein müssen, dann kommt keine API infrage – weder diese noch irgendeine andere. Der Preis dafür ist die Leistungsfähigkeit: Sie wählen eine 17, obwohl es eine 44 gibt, und bei agentischer Orchestrierung wählen Sie möglicherweise einen Koordinator, der sich von den Fehlern eines stärkeren Modells nicht erholen kann.

Für die meisten Teams ist die Antwort keine Wahl, sondern eine Aufteilung, und die Aufteilung braucht einen Ort, an dem sie leben kann. OrcaRouter leitet mehr als 200 Modelle hinter einem API-Schlüssel und einer Rechnung mit 0 % Aufschlag weiter, wobei die Listenpreise der Anbieter durchgereicht werden, plus automatisches Failover und eine Routing-DSL, um Traffic nach Aufgabe, Kosten oder Latenz zu lenken. Weder Step 5 Preview noch Muse Glimmer steht in diesem Katalog – StepFuns Flaggschiff wird nicht von uns geroutet, und Glimmer ist ein lokaler Download –, der gebotene Mehrwert ist also nicht der Zugang zu einem der beiden Modelle. Es ist das Set, gegen das Sie sie benchmarken würden, heute über einen einzigen Schlüssel aufrufbar, sodass die Entscheidung lokal versus remote durch Ihre eigene Aufgabenverteilung entschieden wird und nicht durch die Seite des Anbieters, die Sie zuletzt gelesen haben.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Wie man entscheidet

Wählen Sie Step 5 Preview, wenn die Obergrenze der begrenzende Faktor ist. Wenn Ihre Aufgaben offen, multimodal, Long-Context- oder agentisch in dem Sinne sind, dass sie einen leistungsfähigen Planer benötigen, ist das API-Modell das einzige der beiden, das sie bewältigen kann, und sein Preis ist für seine Klasse niedrig genug, dass ein Pilot damit eher eine Budgetposition als ein Projekt ist. Kalkulieren Sie Weitschweifigkeit ein, planen Sie ein, dass sich der Termin für die Gewichte am 15. Oktober verschiebt, und beziehen Sie die Workloads, die das Gebäude nicht verlassen dürfen, nicht mit ein.

Wählen Sie Muse Glimmer, wenn der Perimeter die Einschränkung ist. Wenn Ihre Daten nicht gesendet werden können, wenn Sie auf einem Flugzeug oder in einer Fabrik ausführen müssen oder wenn Ihre Volumina die Preisgestaltung pro Token absurd machen, ist ein 30B-Apache-2.0-Modell, das in 20 GB passt, die praktische Wahl, und sein Long-Context-Retrieval-Ergebnis ist gut genug, dass die Fähigkeitslücke nicht bei jeder Workload sichtbar wird. Testen Sie es in der Orchestrierung, bevor Sie sich dort darauf verlassen, denn dort ist die unabhängige Evidenz am schwächsten.

Wenn beide Einschränkungen gleichzeitig greifen, führe beide aus: lokal für die Daten, die nicht verschoben werden können, API für die Aufgaben, die ein größeres Modell benötigen, und lass die Routing-Entscheidung eine Konfigurationsänderung statt einer Migration sein. Der Vergleich, auf den es ankommt, ist nicht 44 gegen 17. Es ist die Frage, welche deiner Anfragen es sich leisten können, die Maschine zu verlassen, und das ist eine Frage, die nur dein eigener Datenverkehr beantworten kann.