Generierte Hero-Karte mit dem Titel Claude Sonnet 5.5 vs Muse Glimmer, untertitelt mit einem 30B-Laptop-Modell gegen das neue Sonnet, mit drei Statistik-Karten: Intelligence Index 56 vs 17, Kontextfenster 1M vs 131K Token und Gewichte geschlossen vs Apache 2.0, dazu eine Fußzeile mit Index laut Artificial Analysis v4.3.2; Muse Glimmer Spezifikationen laut Meta.
Guides & Insights

Claude Sonnet 5.5 vs. Muse Glimmer: Ein 30B-Laptop-Modell gegen den neuen Sonnet

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die grundlegende Frage für diese Seite ist, ob der Vergleich überhaupt legitim ist, und die ehrliche Antwort lautet, dass Claude Sonnet 5.5 und Muse Glimmer keine Konkurrenten im üblichen Sinne sind. Im Intelligence Index von Artificial Analysis, Revision v4.3.2, erreicht Claude Sonnet 5.5 56 Punkte und Muse Glimmer 17 Punkte, und diese Lücke ist kein Rauschen – sie entspricht ungefähr dem Abstand zwischen einem Frontier-Modell für allgemeine Zwecke und einem sehr guten kleinen Modell. Was das Paar dennoch lesenswert macht, ist, dass Muse Glimmer eine Eigenschaft besitzt, die das andere zu keinem Preis kaufen kann: Es ist ein Open-Weight-Modell mit 30 Milliarden Parametern, veröffentlicht von Meta am 10. August 2026 unter Apache 2.0, auf 4 Bit quantisiert, sodass es unter 20 GB VRAM passt, und dafür ausgelegt, ohne Netzwerkverbindung zu laufen. Claude Sonnet 5.5 erschien am 28. September 2026 als schnellstes und intelligentestes Sonnet des Anbieters, mit einem Preis von 2,00 US-Dollar pro Million Eingabe-Tokens und 10,00 US-Dollar pro Million Ausgabe-Tokens, und ist nur über ein Netzwerk erreichbar. Die eigentliche Entscheidung ist nicht, welches Modell besser ist. Entscheidend ist, wo Sie die Tokens laufen lassen möchten.

Zwei Modelle, zwei Definitionen der Aufgabe

Muse Glimmer stammt aus den Meta Superintelligence Labs und ist ein 30B-Parameter-Modell, das durch Logit-Destillation vom größeren Muse-Spark-Lehrermodell von Meta trainiert und anschließend auf langkontextigen agentischen Daten feinabgestimmt sowie für die Tool-Nutzung verstärkt wurde. Meta lieferte es bereits quantisiert aus: 4-Bit senkt den Speicherbedarf von über 55 GB bei voller Präzision auf unter 20 GB, wodurch es in den Rahmen einer Consumer-GPU mit 24 GB oder 32 GB passt. Meta testete es auf einer Nvidia RTX 5090 sowie auf Apple-Silizium vom Typ M4 Max und M5 Max. Es nimmt Text- und Bildeingaben entgegen, gibt Text zurück, verfügt über ein Kontextfenster von 131.072 Token, das laut Meta auf 262.144 erweitert werden kann, und hat einen Wissens-Cutoff vom Januar 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 ist das zweite Modell der 5.5-Generation von Anthropic und jenes, das das Unternehmen als die beste Kombination aus Geschwindigkeit und Intelligenz in seinem Lineup positioniert. Es läuft mit einem Fenster von 1.000.000 Token, bis zu 128.000 Ausgabe-Token synchron und 300.000 über die Message Batches API hinter dem output-300k-2026-03-24 Header, akzeptiert Text, Bilder und Dateien, bietet adaptives Denken mit wählbarem Aufwand und einem Trainings-Cutoff im Juni 2026 und ist ab dem Launch mit Zero Data Retention verfügbar. Die Speicherung kostet 0,20 US-Dollar pro Million Token bei Cache-Lesevorgängen und 2,50 US-Dollar pro Million bei Cache-Schreibvorgängen. Anthropic gibt an, dass es 30 % schneller läuft als Claude Sonnet 5 und bei unveränderten Preisen bis zu 30 % weniger pro Aufgabe kostet – Herstellerangaben, nicht unabhängig reproduziert.

Der Spec-Kontrast lohnt sich, in einem Durchgang betrachtet zu werden, denn fast jede Zeile ist eine andere Art von Sache und nicht eine bessere oder schlechtere:

• Gewichte — Muse Glimmer Apache 2.0, herunterladbar, auf 4-Bit quantisiert vs. Claude Sonnet 5.5 geschlossen

• Wo er läuft — Muse Glimmer auf deiner eigenen GPU, offline vs. Claude Sonnet 5.5 auf Anthropic-Infrastruktur

• Parameter — Muse Glimmer 30B insgesamt, unter 20 GB bei 4-Bit vs. Claude Sonnet 5.5 nicht offengelegt

• Kontext — Muse Glimmer 131.072 Token, erweiterbar auf 262.144 vs. Claude Sonnet 5.5 1.000.000 Token

• Preis pro Million — Muse Glimmer: keine Kosten pro Token, Ihre Hardware vs. Claude Sonnet 5.5: 2,00 $ Eingabe / 10,00 $ Ausgabe

• Intelligenz-Index v4.3.2 — Muse Glimmer 17 vs. Claude Sonnet 5.5 56

• Gemessene Kosten pro Index-Aufgabe — Muse Glimmer 0,06 $ vs. Claude Sonnet 5.5 7,60 $

Zwei Zahlen auf dieser Liste verdienen eine genauere Betrachtung, denn beide sind Fallen. Die erste ist die Zahl von 0,06 $ pro Aufgabe: Sie gibt an, was Artificial Analysis ausgegeben hat, um Muse Glimmer (high) über einen gehosteten Endpunkt bei 0,325 $ pro Million Eingabe-Token und 1,35 $ pro Million Ausgabe-Token aufzurufen, sie misst also die Wirtschaftlichkeit des Mietens dieses Modells, nicht die des Betreibens. Beim Selbsthosting entfallen die marginalen Kosten pro Token und werden durch eine GPU ersetzt, die Sie bereits besitzen oder kaufen müssen. Die zweite ist die Index-Lücke selbst – ein 30B-Modell, das in 20 GB quantisiert wurde, wird mit demselben Maßstab bewertet wie Frontier-Modelle, und die Rangliste sagt genau das, wenn sie Muse Glimmer in die oberste Handvoll Open-Weight-Modelle einordnet und dabei anmerkt, dass es für seine Größe teuer ist.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Wo Muse Glimmer wirklich gut ist – und wo es dann schiefgeht

Der Gesamtwert ist viel zu grob, um die ganze Antwort zu sein, denn Muse Glimmer ist nicht durchgängig siebzehn. Es ist schnell – Artificial Analysis misst 143,8 Ausgabe-Tokens pro Sekunde, vor den 138,7 von Claude Sonnet 5.5 – und es ist prägnant: In der Index-Bewertung erzeugt es 59 Mio. Tokens, gegenüber 410 Mio. bei Claude Sonnet 5.5. Und bei einer Bewertung ist es nahe an der Frontier: beim Langkontext-Recall, wo es 83,3 % gegenüber 82,7 % von Claude Sonnet 5.5 erreicht. Ein 30B-Modell, das bei Long-Context-Retrieval mit einem brandneuen Sonnet mithält, ist die überraschendste Zeile auf dieser Seite, und das deckt sich damit, wie Meta es trainiert hat – agentische Long-Context-Daten, Destillation von einem viel größeren Lehrer.

Die agentischen Ergebnisse sind der Bereich, in dem die Obergrenze des Modells sichtbar wird und das Ranking aufhört, schmeichelhaft zu sein. Bei Terminal-Bench 4.0 erreicht Muse Glimmer 0,5 % gegenüber 63,6 % von Claude Sonnet 5.5. Sein Wert im Automatisierungs-Benchmark liegt bei 0,068 gegenüber 0,713. Humanity's Last Exam: 22,0 % gegenüber 55,0 %. Ein Output in so geringer Größenordnung bei einem Ausführungs-Benchmark bedeutet, dass das Modell Aufgaben nicht abschließt, und keine Einsparung durch lokales Hosting macht eine Aufgabe, die nie abgeschlossen wird, billiger.

Auch die Forschungsliteratur ist diesbezüglich unverblümt, und es lohnt sich, dies zu sagen, statt es zu verschweigen: Eine peer-reviewte Studie zur Multi-Agenten-Orchestrierung, in der Muse-Glimmer-30B eines der getesteten Modelle war, ergab, dass es keinen seiner Kandidaten wiederfand. M​etas eigene Benchmark-Tabelle für das Modell ist ein Herstellerdokument und wird hier als solches gekennzeichnet; die oben genannten Zahlen von Artificial Analysis sind unabhängige Messungen, und auf sie stützt sich dieser Beitrag.

Die Trennung ist also klar erkennbar. Muse Glimmer ist für seine Größe stark darin, eine lange Eingabe zu lesen und Fragen dazu zu beantworten, schnell, günstig im Betrieb und passt in eine GPU der Laptop-Klasse. Es ist kein Modell, dem man eine mehrstufige Softwareaufgabe übergibt und sich dann abwendet. Das ist die ehrliche Grenze, und ein Vergleich, der sich allein auf zusammengesetzte Punktzahlen stützt, würde sie verbergen.

Was Sie zum Frontier-Tarif tatsächlich kaufen

Das Premium von Claude Sonnet 5.5 erkauft zuallererst Leistungsfähigkeit, und der Siebzehn-Punkte-Abstand im Index ist die Form, die dafür Schlagzeilen macht. Doch mit dem Output-Preis von 10,00 $ gehen drei weitere Dinge einher, die auf keinem Leaderboard auftauchen.

Das erste ist das Kontextfenster. Eine Million Token ist ungefähr siebeneinhalbmal so viel wie die 131.072 von Muse Glimmer, und A​nthropic berechnet dafür durchgängig den Standardtarif, wobei Cache-Lesevorgänge ein Zehntel des Eingabepreises kosten, sodass das Mitführen eines großen Kontexts über viele Aufrufe hinweg bezahlbar und nicht nur theoretisch möglich ist. Ein Prompt in Repository-Größe passt überhaupt nicht in das kleinere Kontextfenster; das ist also ein Unterschied bei der Leistungsfähigkeit und keine Präferenz.

Der zweite Punkt ist Tool-Treue. Fünf Verhaltensweisen haben sich zwischen Claude Sonnet 5 und Claude Sonnet 5.5 geändert, und alle fünf betreffen Tool-Nutzung und Reasoning: Nicht-Standard-Sampling-Parameter geben jetzt einen 400 zurück, thinking: {"type": "disabled"} gibt jetzt einen 400 zurück und wird zu between_tools, erzwungene Tool-Auswahl von "any" oder einem benannten Tool wird abgelehnt, sodass Schleifen wechseln müssen zu auto mit strikter Tool-Nutzung, das ältere computer_20251124-Tool wird auf der Claude API und Google Cloud abgelehnt, und Thinking-Blöcke sind jetzt an das erzeugende Modell und Konto gebunden. Eine sechste Änderung lässt nichts fehlschlagen, sondern wird still: Text zwischen Tool-Aufrufen wird innerhalb von Thinking-Blöcken zurückgegeben, sodass eine Streaming-Anwendung keine Ausgabe mehr anzeigt, bis sie einen Anzeigewert festlegt oder vorgelagertes Thinking ausschaltet. Das ist ein Tag Migrationsarbeit für alle, die Sonnet 5 nutzen, und es ist der Eintrittspreis für die agentische Zuverlässigkeit, die die Benchmark-Zeilen oben messen.

Der dritte Punkt sind Provenienz und Datenhandhabung. Zero Data Retention ist ab dem Start verfügbar, A​nthropic veröffentlicht eine garantierte Auslaufgrenze zum 28. September 2027, und das Modell ist über die Claude API, Bedrock, Goo​gle Cloud und Microsoft Foundry verfügbar. Für einen regulierten Einkäufer sind das Beschaffungsfakten, die den Kauf entscheiden, noch bevor es der Benchmark tut.

Offline ist eine Anforderung, keine Kosteneinsparung

Der Grund, warum diese Kombination auf eine Seite gehört, ist, dass Muse Glimmer für eine bestimmte Klasse von Deployments keine günstigere Option ist – sie ist die einzige Option. Eine Anfrage, die das Gerät nicht verlassen darf, eine Fabrikhalle oder ein Einsatzort im Feld ohne Konnektivität, eine air-gapped Umgebung, in der ein API-Aufruf ein Compliance-Verstoß ist, oder ein Latenzbudget, bei dem ein Round Trip bereits zu viel ist: Nichts davon wird durch ein besseres Modell hinter einem Netzwerk gelöst. Apache-2.0-Gewichte, die unter 20 GB passen und offline laufen, sind die ganze Antwort, und Claude Sonnet 5.5 spielt zu jedem Preis nicht in dieser Frage mit.

Metas veröffentlichte Tests auf RTX 5090 und Apples M4 Max- und M5 Max-Silizium sind die praktische Referenz dafür, was „lokal läuft“ hier bedeutet, und die 4-Bit-Quantisierung ist es, die diese Ziele überhaupt erreichbar macht – der Speicherbedarf in voller Präzision liegt bei über 55 GB. Wer eine Bereitstellung plant, sollte die Hardware-Zahlen als Metas Angaben und nicht als hier gemessene Werte behandeln.

Für alle anderen sind die beiden Modelle Komplemente statt Substitute, und der betrieblich unangenehme Teil ist, dass das Vorhalten eines Anthro​pic-API-Modells und eines selbst gehosteten M​eta-Modells normalerweise zwei völlig getrennte Stacks bedeutet. OrcaRouter stellt über 200 Modelle hinter einen einzigen Open​AI-kompatiblen Endpoint, wobei die Listenpreise der Anbieter durchgereicht und keine Aufschläge hinzugefügt werden, automatisches Failover zwischen Upstream-Anbietern und eine Routing-DSL zum Zusammensetzen von Aufrufen — was die gehostete Hälfte dieser Anordnung abdeckt, und M​etas größerer Muse Spark 1.2 Teacher ist hier routbar als meta/muse-spark-1.2 für 1,25 $ Input und 4,25 $ Output pro Million Tokens über ein Fenster von 1.048.576 Tokens, mit 0,15 $ für Cache-Reads. Er trägt 42,8 Millionen Tokens Traffic pro Woche durch diesen Katalog, was der nützliche Teil der Anordnung ist: Der gehostete Teacher läuft auf demselben Key wie alles andere, und das Modell, das Sie lokal betreiben, muss überhaupt kein Netzwerk berühren.

Drei Ehrlichkeitshinweise, weil sie leicht falsch verstanden werden. Muse Glimmer selbst ist keine unserer Routen — die Modellkarte existiert nicht in unserem Katalog, und diese Seite sagt das, statt etwas anderes anzudeuten. Der folgende Screenshot zeigt die Seite für das Modell, das tatsächlich existiert, Muse Spark 1.2, welches der Checkpoint ist, aus dem Muse Glimmer destilliert wurde, und nicht Muse Glimmer selbst. Claude Sonnet 5.5 ist ebenfalls nicht in unserem Katalog, einen Tag nach der Veröffentlichung; die Route dorthin ist Anthropics eigene API, und Claude Sonnet 5 ist hier seit dem 30. Juni zu 2,00 $ und 10,00 $ routbar für alle, die das Staging-Ziel wollen.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Wie man entscheidet

Beginne mit der Einschränkung, nicht mit der Punktzahl. Wenn die Anfrage eine Maschine oder ein Netzwerk nicht verlassen darf, ist Muse Glimmer die Antwort und die Index-Lücke ist irrelevant – ein 30B-Apache-2.0-Modell, das offline läuft und bei Long-Context-Recall mit einem Frontier-Modell mithält, ist für diese Aufgabe die beste verfügbare Option. Wenn die Anfrage eine mehrstufige Softwareaufgabe erledigen muss, ist ein 30B-Modell, das bei Terminal-Bench ein halbes Prozent erreicht, nicht im Rennen, unabhängig von der Hardware, die Sie bereits besitzen.

Zwischen diesen beiden Polen entscheidet die Messung, nicht die Meinung: Tokens pro abgeschlossener Aufgabe bei Ihrer eigenen Arbeitslast, zweimal bepreist – einmal zu den $2.00 und $10.00 von Claude Sonnet 5.5 und einmal zu den amortisierten Kosten der GPU. Die eine Zahl, die den gesamten Vergleich neu einordnet, $0.06 pro Index-Aufgabe gegenüber $7.60, ist eine Hosted-Rental-Angabe für ein Modell, das die meisten selbst betreiben werden; sie so zu zitieren, als wäre sie eine eins zu eins vergleichbare Einsparung, wäre der naheliegende Fehler, den diese Seite zu vermeiden sucht.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert