
GLM-5.3-Flash, fünf Wochen später: eine unabhängige 42, ein Exploit-Lauf auf Mythos-Niveau und der GLM-Agent, der seinen eigenen Serving-Stack neu aufgebaut hat
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 87 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
GLM-5.3-Flash bedient seit fünf Wochen Produktionsverkehr, und am 17. September 2026 äußerte sich Zhipu AI dazu, wo: Das Unternehmen gab bekannt, dass jede Produktionsanfrage für GLM-5.3-Flash jetzt auf einer Flotte von mehr als 100.000 im Inland hergestellten chinesischen KI-Beschleunigern läuft, dass es vom ersten Boot auf dieser Hardware bis zur Bewältigung seiner gesamten Live-Arbeitslast weniger als zwei Wochen brauchte und dass der End-to-End-Durchsatz im selben Zeitraum um das 3,2-Fache stieg. Das, was am weitesten reichte, ist, wer die Arbeit erledigt hat. Ein Großteil davon wurde nicht vom Infrastrukturteam erledigt, sondern von einem Agenten, der von GLM-5.3 selbst angetrieben wurde und Engpässe las, Korrekturen vorschlug und Code für Inferenzsysteme schrieb, während Ingenieure Ziele setzten, die Feedback-Umgebung aufbauten und alles prüften, was numerische Semantik, Nebenläufigkeit oder Produktionsrisiko berührte. GLM-5.3-Flash ist das multimodale Modell mit insgesamt 320 Milliarden Parametern und 18 Milliarden aktiven (320B-A18B), das Zhipu am 26. August 2026 einführte und als Open Source veröffentlichte – das anonyme „Ox Alpha“, das das Unternehmen an jenem Tag enthüllte –, und sein größeres Geschwister GLM-5.3 ist das 743B-Flaggschiff, gegen das es preislich antrat. Keine der drei Zahlen in der heutigen Offenlegung stammt von uns oder von irgendjemand anderem: Sie sind Zhipus eigene. Das Flaggschiff ist auch nicht mehr der einzige Vergleich, der zählt: Bei ExploitBench, einer unabhängigen Bewertung, wie weit ein Modell auf einer echten Chrome-Exploit-Leiter klettert, wurde GLM-5.3-Flash nun gleichauf mit Claude Mythos Preview gemessen, dem geschlossenen Frontier-Modell, das sein Entwickler nur an überprüfte Verteidiger herausgab, zu einem Bruchteil der Kosten pro Versuch.
Das sind die guten Nachrichten, und sie sind echt, aber sie stammen vom Anbieter. Drei weitere Dinge haben sich seit dem ersten Erscheinen dieses Beitrags am Starttag verändert, und zwei davon fallen in die andere Richtung aus. Artificial Analysis hat inzwischen seine eigene Messung des Modells veröffentlicht, und seine Zahl ist nicht die von Zhipu. Der Startrabatt, der dieses zum günstigsten leistungsfähigen Modell auf dem Markt machte, lief planmäßig am 9. September aus und wurde nicht verlängert. Und ein unabhängiges Evaluierungsunternehmen, Generality Labs, hat seinen eigenen ExploitBench-Durchlauf veröffentlicht, bei dem GLM-5.3-Flash über dem Dreifach-Durchschnitt von Claude Mythos Preview auf derselben Skala lag – für etwa sechs Cent pro Dollar. Für alle, die dieses Modell Ende August als „das Günstige“ gespeichert haben, ist die Rechnung heute anders als damals, und die ehrliche Schlagzeile ist gemischt: Die Serving-Ökonomie hat sich tatsächlich verbessert, der Preis ist gestiegen, weil eine Aktion endete, die viel zitierte Intelligenzzahl hat den ersten Kontakt mit einer unabhängigen Testumgebung nicht überstanden, und der Leistungsvergleich, der zugunsten des Modells ausfiel, ist ein einzelner nicht begutachteter Durchlauf, dessen eigene Autoren sagen, dass er nicht überinterpretiert werden sollte.
Zhipu ist die einzige Quelle für die Clustergröße, den Zwei-Wochen-Zeitrahmen und den Faktor 3,2 – es gibt für keine dieser Angaben eine unabhängige Prüfung, und das Unternehmen selbst sagt, dass es keine rekursive Selbstverbesserung erreicht hat, und beschreibt das Ergebnis als Schleife im Minimalmaßstab statt als die eigentliche Sache. Was überprüft werden kann, haben wir überprüft: Das einzige konkrete Artefakt in der Darstellung, das außerhalb von Zhipus Mauern existiert – eine Präzisionskorrektur in einem Flash-Linear-Attention-Kernel –, ist tatsächlich upstream zusammengeführt worden, und wir haben es bestätigt. Wenn eine weiter unten genannte Zahl von Zhipu stammt, steht das dabei. Wenn sie von Artificial Analysis stammt, steht stattdessen das dabei. Wenn sie von Generality Labs stammt – der Sicherheitsbewertungs-Einrichtung hinter den Exploit-Zahlen in diesem Beitrag –, steht das dabei, zusammen mit den Vorbehalten, die die Autoren selbst beigefügt haben: ein einziger Durchlauf, 41 Fehler, eine selbst veröffentlichte Methode, keine Reproduktion durch Dritte und eine Kontaminationsfrage, die sie aus eigener Initiative aufwerfen. Wenn eine Zahl von Anthropic stammt – es sind die einzigen Zahlen hier, die von einem Labor mit wettbewerblichem Interesse an der Antwort stammen –, gibt der Fließtext an, welches Modell tatsächlich gemessen wurde, denn nicht alle davon betreffen dieses Modell.
Was tatsächlich ausgeliefert wurde
GLM-5.3-Flash ist ein Mixture-of-Experts-Modell mit insgesamt 320B / 18B aktiven Parametern und 45 Schichten, womit seine aktive Größe etwas mehr als die Hälfte der rund 32B von GLM-5.2 beträgt. Die herausragende Fähigkeit ist die Modalität: Es verarbeitet nativ Text-, Bild- und Videoeingaben – als erstes GLM-5-Modell überhaupt –, statt Vision über einen separaten Adapter zu leiten. Der Kontext reicht bis zu 1 Million Token, und Zhipu behauptet, dass die Serving-Kosten für lange Kontexte bei etwa einem Drittel der von GLM-5.3 liegen.
Was die Architektur angeht, beschreibt Zhipu es als das erste Open-Source-Frontier-Modell, das hybride Sparse-plus-Linear-Attention mit Manifold-Constrained Hyper-Connections (mHC) zur Skalierung sowie einen IndexPool-Mechanismus kombiniert, der vier Indexer-Key-Vektoren zu einem gewichteten Pool komprimiert, um die Long-Context-Latenz zu senken. Das Pretraining lief auf einem multimodalen Korpus mit 30 Billionen Token. Nichts davon ist unabhängig geprüft – es ist Zhipu, das sein eigenes Modell beschreibt –, aber die Behauptungen zur Serving-Effizienz sind spezifisch genug, um sie jetzt zu testen, da die Gewichte vor dem Open-Source-Inferenz-Stack liegen, und der Bericht vom 17. September fügt das erste detaillierte Bild davon hinzu, wie die Serving-Seite tatsächlich gebaut wurde.
Das Datenblatt zum Marktstart, auf einen Blick:
• Parameter — 320B gesamt / 18B aktiv, 45 Schichten, MoE.
• Modalität — native Text-, Bild- und Videoeingabe; Textausgabe.
• Kontextfenster — bis zu 1.000.000 Token.
• Lizenz — MIT, offene Gewichte auf Hugging Face seit dem ersten Tag.
• Preis — 0,15 $ / 0,50 $ pro Million Tokens (Eingabe / Ausgabe), 0,03 $ pro Million gecachter Eingabe.

Diese Karte ist eine Momentaufnahme vom Launch-Tag, und zwei ihrer Zeilen haben sich seit dem 26. August geändert. Die AA-Index-Angabe ist weiterhin Zhipus eigene Behauptung und wird inzwischen durch unabhängige Messungen widerlegt – mehr dazu weiter unten. Der angezeigte Rabattpreis ist weg; die Aktion endete am 9. September. Die Parameteranzahl, das Kontextfenster, die Lizenz und die Modalität sind unverändert aktuelle Fakten, und darauf zielt das Bild hauptsächlich ab.
Die Ox-Alpha-Woche und was die kostenlose Verlosung wirklich testete
Die Enthüllung beendete eine Woche voller Spekulationen. Am 20. August erschien ein anonymes Modell auf einer KI-API-Plattform eines Drittanbieters mit einem Kontextfenster von 1 Million Token, Text-/Bild-/Videoeingabe und einem Preis von null, und es wurde schnell zum meistaufgerufenen Modell in den Wochencharts dieser Plattform. Die Community führte es innerhalb von 48 Stunden per Fingerprinting auf Zhipus GLM-Familie zurück – dasselbe Muster „anonym, dann beansprucht“, mit dem zuvor Modelle anderer chinesischer Labore identifiziert worden waren – und Analysten vermuteten weithin eine Flash-Variante von GLM-5.3. Die Ankündigung vom 26. August bestätigte die Vermutung: Die kostenlose Woche war ein absichtlicher Test, und das Unternehmen sagt, der anonyme Lauf habe in sechs Tagen mehr als 62 Billionen Token über die Coding-Plattformen hinweg verarbeitet, auf denen es angeboten wurde, und alles davon lief auf inländischen chinesischen Chips.
Diese letzte Klausel wirkte damals wie eine Fußnote. Sie entpuppte sich als der eigentliche Punkt. Die kostenlose Woche war in erster Linie kein Marketing-Gag und nicht einmal ein Lasttest des Modells; sie war ein Lasttest der darunterliegenden Beschleuniger-Flotte, durchgeführt in einem Maßstab, in dem ein Ausfall öffentlich und kostenlos gewesen wäre. Drei Wochen später beschreibt Zhipu dieselbe Flotte als diejenige, die 100 % des Produktions-Traffics des Modells trägt.

Die Preislogik jener Woche gilt weiterhin, mit einer Korrektur. Ein Modell, das eine Woche lang für 0 $ verschenkt und dann zu einem Zehntel des Preises des Flaggschiffs mit weiteren 50 % Rabatt eingeführt wurde, war ein bewusster Schritt der Marktgestaltung in der Budgetklasse, und der Zusatz „zeitlich begrenzt“ war immer der Teil, auf den man achten musste. Wir haben es als etwas gekennzeichnet, das zurückgenommen werden könnte. Es wurde planmäßig zurückgenommen – was man ruhig deutlich sagen sollte, denn das Auslaufen des Rabatts ist die einzige Änderung in dieser Geschichte, die sich auf einer Rechnung niederschlägt.
Der Serving-Stack, den ein Agent neu aufgebaut hat
Der technische Bericht von Zhipu vom 17. September ist die erste detaillierte Beschreibung davon, wie GLM-5.3-Flash auf chinesischem Silizium bereitgestellt wird, und seine zentrale Behauptung ist, dass ein Modell half, das System zu optimieren, auf dem es läuft. Das Unternehmen nennt den Mechanismus dichtes Feedback: Korrektheitstests, Ausführungslogs, Traces, Microbenchmarks und End-to-End-Metriken wurden so verdrahtet, dass ein Agent eine Hypothese lokal validieren konnte, anstatt nach jeder Änderung auf ein vollständiges Deployment und einen Lasttest zu warten. Damit das funktioniert, sagt Zhipu, musste das Feedback lokal, günstig und objektiv überprüfbar sein – an einen bestimmten Kernel oder Codepfad gebunden, schnell genug, um darauf zu iterieren, und wahr oder falsch, ohne dass ein Mensch eingreifen muss.
Nachdem diese Schleife eingerichtet war, fand der Agent drei Dinge, die das Unternehmen ausführlich beschrieben hat, und behob sie:
• Ein kontextparalleler Pfad im KDA-Kernel verlor mit zunehmender Sequenzlänge an Präzision, weil tl.dot trotz FP32-Eingaben standardmäßig TF32 verwendete, wodurch sich der Rundungsfehler mit der Kontextlänge verstärkte. Die Korrektur legt die Eingabepräzision auf tf32x3 fest, mit einem Fallback auf ieee auf Plattformen ohne TF32-Unterstützung. Diese ist die interessanteste der drei, denn sie ist die einzige Behauptung in dem Bericht, die über Zhipus eigene Infrastruktur hinausgeht: Die Änderung ist upstream in Flash Linear Attention als PR #1180 gemergt, was wir überprüft und am 27. August 2026 als gemergt bestätigt haben.
• Der KV-Transfer überlappte sich nicht mit dem Scheduling von DeepEP. Weder Intranode-Dispatch noch Intranode-Combine gaben in der verwendeten DeepEP-Version den Python-GIL frei, wodurch der Übertragungs-Thread hinter ihnen blockiert wurde; englischsprachige und chinesischsprachige Darstellungen desselben Berichts bezifferten den daraus resultierenden Overhead auf über 20 % bzw. über 30 %. Nach der Behebung gibt Zhipu an, dass der Abstand gegenüber seiner Prefill-only-Baseline unter 1 % gesunken ist.
• Ein Decode-Kernel berechnete dieselbe FP32-Normalisierung und dasselbe Gating viermal neu, einmal pro V-Dimensions-Kachel. Die Aufteilung der Divisionsarbeit senkte die Kernel-Zeit um 9,6 %, und das Zusammenführen der Kacheln zu einem einzigen Thread-Block – sodass die Normalisierung nur einmal läuft – ergab eine 1,71-fache Beschleunigung.
Rund um diese Korrekturen herum stehen die strukturellen Änderungen: ReplaySSM, das Rechenleistung gegen On-Chip-Speicher eintauscht, weil die Beschleuniger weniger davon haben als die GPUs, für die der Stack ursprünglich geschrieben wurde; Tensor-Parallelität innerhalb eines Knotens, um demselben Druck zu begegnen; gemischtes INT8-, FP8- und BF16-Caching, um die Kapazität zu strecken; und eine disaggregierte Encode-Prefill-Decode-Architektur, die die drei Inferenzphasen separat statt als eine Pipeline plant. Zhipu benennt auch die Einschränkungen ehrlich — begrenzter On-Chip-Speicher und begrenzte Interconnect-Bandbreite, unreife Software, unvollständige Kernel-Abdeckung und dünne Dokumentation — und gibt an, keine rekursive Selbstverbesserung erreicht zu haben, und beschreibt das Ergebnis als Schleife im Minimalmaßstab.
Lies den Bericht skeptisch, denn die Anreize liegen auf der Hand. Zhipu wird nicht sagen, wie viel von der Arbeit der Agent erledigt hat und wie viel die Ingenieure, und es gibt keine externe Prüfung des Durchsatzwerts, des Zwei-Wochen-Zeitplans oder der Clustergröße. Die Dense-Feedback-Rahmung ist zudem in einer bestimmten Weise eigennützig: Sie lässt die am beeindruckendsten klingende Behauptung („unser Modell hat sich selbst verbessert“) auf den am wenigsten überprüfbaren Belegen ruhen (einer internen Schleife, die niemand einsehen kann). Was die Geschichte davor bewahrt, reines Marketing zu sein, ist, dass ihre konkreteste Behauptung falsifizierbar ist und sich als wahr herausstellt — der tf32x3-Kernel-Fix ist tatsächlich im Upstream-Repository, datiert auf den 27. August, drei Wochen vor dem Pressezyklus darum.
Was es kostet, in tatsächlichen Dollars
Die Preisliste ist die von Zhipu, und sie ist einfach: 0,15 US-Dollar pro Million Input-Token, 0,50 US-Dollar pro Million Output-Token und 0,03 US-Dollar pro Million zwischengespeicherter Input-Token. Das ist der Listenpreis mit Stand heute. Die Einführungsaktion mit 50 % Rabatt lief bis zum 9. September 2026 und wurde nicht verlängert, sodass die Zahlen 0,075 / 0,25 / 0,015 US-Dollar, die Ende August weithin kursierten, über die eigene API des Anbieters nicht mehr verfügbar sind. Gegenüber den veröffentlichten 1,40 / 4,40 US-Dollar von GLM-5.3 landet das Flash zum Listenpreis weiterhin bei ungefähr einem Zehntel – der Rabatt war ein Bonus obendrauf auf einen Preis, der bereits der eigentliche Punkt war, nicht der Preis selbst. Artificial Analysis berechnet eine Mischrate von etwa 0,10 US-Dollar pro Million Token bei einem 7:2:1-Mix aus Cache-Hits/Input/Output und gibt die Ausgabegeschwindigkeit mit ungefähr 117 Token pro Sekunde an, was als bemerkenswert schnell beschrieben wird, wobei AA anmerkt, dass die Geschwindigkeitsangaben die First-Party-API des Modells beschreiben und nicht einen von AA durchgeführten Test.
Zhipus breitere Kostengeschichte ist der Grund, warum der Preis dort stehen kann. In seinen am 31. August veröffentlichten Halbjahresergebnissen erklärte das Unternehmen, die Inferenzkosten pro Token auf seiner inländischen Flotte mit 100.000 Beschleunigern seien seit Anfang 2026 um 80 % gefallen, und die API-Bruttomarge sei infolge von Skaleneffekten, Preisgestaltung und günstigerem Serving von -0,4 % auf 24,6 % gestiegen. Das sind Unternehmenszahlen eines Unternehmens, das seinen Aktionären Bericht erstattet, und sie sind von uns nicht geprüft; betrachten Sie sie als in der Tendenz klar, nicht als präzise. Die obige Darstellung des Servings ist der Mechanismus hinter der Behauptung – weniger redundante Kernel-Durchläufe, weniger Speicherdruck, bessere Überlappung –, was eine glaubwürdigere Geschichte ist als eine nackte Prozentzahl, auch wenn die Prozentzahl diejenige sein wird, die zitiert wird.
Die Effizienzangaben für das Flaggschiff sind unverändert: Der Attention-Compute sinkt um den Faktor 3,0 und der KV-Cache um den Faktor 4,4 im Vergleich zu GLM-5, angegeben vom Anbieter, wobei Zhipu einräumt, dass der KV-Cache etwas größer ist als der von DeepSeek V4 Flash und Kimi K3. Die zum Marktstart aufgestellte Behauptung einer 3-fachen End-to-End-Serving-Verbesserung auf inländischen Chips wird nun mit 3,2x angegeben, gemessen vom ersten Input bis zum vollständigen Produktionsverkehr. Beide Zahlen stammen von Zhipu, und die beiden Berichte, die sie enthalten, liegen drei Wochen auseinander – nichts davon wurde außerhalb des Unternehmens überprüft.
Warum die Enthüllung wichtig ist – und wo die Schlagzeilenzahl geblieben ist
Hier ist die Korrektur, die für alle am wichtigsten ist, die die Launch-Berichterstattung gelesen und sich die Zahl gemerkt haben. In Zhipus Materialien wird GLM-5.3-Flash mit 57 im Artificial Analysis Intelligence Index geführt, gleichauf mit Claude Opus 4.8. Artificial Analysis hat inzwischen seine eigene Messung des Modells auf Intelligence Index v4.3 veröffentlicht, und sie liegt bei 42 — gegenüber 47 für GPT-5.6 Sol (max) auf derselben Version. Die 57 war nie eine unabhängige Zahl; sie stammte von Zhipu, und die unabhängige Messung platziert das Modell etwa fünf Punkte unterhalb des frontier-nahen Bands und deutlich unter der vom Anbieter herausgestellten Zahl. Auf demselben aktuellen Index misst GLM-5.3 selbst 45, sodass die Zahl von 60 für das Flaggschiff, die in unserer Launch-Berichterstattung auftauchte, nicht mehr dem entspricht, was Artificial Analysis heute veröffentlicht. Die Lücke von 15 Punkten zwischen Behauptung und Messung ist kein Rundungsunterschied, und sie ist das mit Abstand Nützlichste, was ein Leser aus diesem Update mitnehmen kann — mit einer Einschränkung, die der Abschnitt unten hinzufügt, weil die zweite unabhängige Messung in dieser Geschichte in die entgegengesetzte Richtung deutet.
Was diese Korrektur überlebt, ist schmaler, aber immer noch real. GLM-5.3-Flash ist ein multimodales Open-Weights-Modell mit 1M-Kontext und nativer Bild- und Videoeingabe zu etwa einem Zehntel des Listenpreises seines Flaggschiff-Geschwistermodells – eine Kombination, für die es bei den US-amerikanischen Frontier-Laboren kein direktes Äquivalent gibt, deren vergleichbare multimodale Modelle deutlich mehr kosten und geschlossen ausgeliefert werden. Zhipus eigene Formulierung „Frontier-Intelligenz, Flash-Kosten“ ist der Teil, der den Treffer einstecken musste: Bei gemessenen 42 ist es ein starkes Budget-Modell, kein Frontier-Modell zum Sonderpreis. Eine unabhängige Messung verortet es zudem deutlich über dem Median für Open-Weight-Modelle ähnlicher Größe, was für ein Modell mit 18B aktiven Parametern und einem Zehntel der Inferenzkosten eine echte Leistung ist – es ist nur eine andere Leistung, als die Startberichterstattung nahelegte.
Die andere unabhängige Zahl – und sie fiel zugunsten des Modells aus.
Wenn das Ergebnis von Artificial Analysis GLM-5.3-Flash ein wenig herabgestuft hat, so geht dieses in die andere Richtung, und es ist die seltsamste Tatsache in der Geschichte. ExploitBench, entwickelt an der Carnegie Mellon, fragt nicht, ob ein Modell ein Ziel zum Absturz bringen kann. Es bewertet den Aufstieg: das Erreichen des anfälligen Codes, das Auslösen des Bugs, den Aufbau wiederverwendbarer Primitive und schließlich die vollständige Kontrollfluss-Übernahme mit beliebiger Codeausführung, mechanisch bewertet gegen Produktions-V8 mit aktivierter Sicherheits-Sandbox. Generality Labs hat GLM-5.3-Flash an 41 Bugs mit einem Budget von 1 Milliarde Token pro Bug getestet, anstatt der üblichen 300-Turn-Obergrenze des Benchmarks, mit der Begründung, dass Turns ein schlechter Proxy für das sind, was ein Käufer tatsächlich ausgibt, und Dollar die ehrliche Einschränkung sind. GLM-5.3-Flash erreichte bei 13 von 41 die vollständige beliebige Codeausführung und einen durchschnittlichen Fähigkeitswert von 64,8 % des Maximums der Leiter. Die drei veröffentlichten Läufe von Claude Mythos Preview erzielten 9, 10 und 11 auf derselben Leiter — einen Mittelwert von 10, oder 62,2 %. Generalitys eigene Darstellung, gedruckt unter dem Diagramm, besagt, dass GLM-5.3-Flash in dieser Messung „möglicherweise Mythos-Niveau im Cyber-Bereich“ erreicht. Anthropics eigener ExploitBench-Lauf, veröffentlicht am 29. September, berichtet dieselbe Reihenfolge bei viel niedrigeren absoluten Raten — allerdings für das Flaggschiff GLM-5.3, nicht für das Flash: Es zählt End-to-End-Exploits pro Versuch statt Fortschritt auf der Leiter und setzt GLM-5.3 bei 50 von 410 gegenüber Mythos Previews 56 von 410. Andere Zählregel, ähnliche Reihenfolge — genau deshalb sollte eine ExploitBench-Zahl niemals ohne die dazugehörige Regel zitiert werden.
Der entscheidende Grund ist der Nenner darunter. Der Durchlauf bepreiste die Ausgabe-Tokens von GLM-5.3-Flash mit 0,25 $ pro Million – sein Einführungspreis mit 50 % Rabatt, der inzwischen abgelaufen ist – gegenüber den historischen 125 $ pro Million von Claude Mythos Preview, ein 500-facher Abstand. Bei Kostenparität gab der Durchlauf 16,81 $ pro Schwachstelle aus gegenüber 297,17 $ bei Mythos, woraus die Zahl von rund 6 % stammt. Lies die Behauptung sorgfältig, denn die kursierende Version ist die falsche. Es ist nicht so, dass GLM-5.3-Flash ein besserer Exploit-Entwickler ist als Claude Mythos Preview. Sondern dass ein Dollar GLM-5.3-Flash-Tokens bei dieser speziellen Aufgabe ungefähr das kauft, was ein Dollar Mythos-Tokens kauft, und dass man sich von Ersterem deutlich mehr Dollar leisten kann.
Die eigenen Einschränkungen von Generality wiegen mehr als die Schlagzeile. Sie sagen klar, dass ein einzelner Durchlauf keine Parität für den Cyber-Bereich als Ganzes belegt, dass Kontamination eine offene Frage ist – ExploitBench könnte in irgendeiner Weise zum Trainingsgegenstand geworden sein – und dass vier der 41 Stichproben fehlerhaft waren und bewertet wurden, indem das zuletzt beobachtete Ergebnis fortgeschrieben wurde, was, wenn überhaupt, das Modell eher unterschätzt. Sie veröffentlichten außerdem am 28. September eine Follow-up-Analyse, die den gesamten Vergleich verkompliziert. Als man GLM-5.3-Flash mit einem Budget von 250 Millionen Token durch sieben verschiedene Agent-Harnesses laufen ließ, und zwar an zehn Stichproben, die so ausgewählt wurden, dass sie den Schwierigkeitsbereich abdecken, erzielten dieselben Gewichte unter dem Codex-Harness 10,6 – über dem Referenzwert von Claude Mythos Preview mit 10,02 – und 6,2 unter dem Claude-Code-Harness, niedriger als sogar die ursprüngliche, auf eine Turn-Anzahl begrenzte Konfiguration des Benchmarks mit 6,4. Der Harness hatte einen größeren Einfluss auf den Score als der Modellvergleich, und die Autoren sagen, dass die Teilmenge von zehn Stichproben wahrscheinlich nicht repräsentativ ist. Dass die Grafik am 2. Oktober weithin die Runde machte, mit dem Argument, dass Test-Time-Compute-Skalierung die Unterschiede zwischen Modellstufen einebnet, ist eine Aussage über die Branche, kein Befund der Evaluation: Was die Evaluation herausfand, ist, dass ein günstiges offenes Modell, wenn ihm Budget statt eines Turn-Limits gegeben wird, auf einer Leiter an den Exploit-Spezialisten eines Frontier-Labors heranreichen kann.
Das ist längst nicht mehr die Geschichte eines einzelnen Labors. Die Einschätzung von Anthropics eigenem Frontier Red Team, veröffentlicht am 29. September, ließ GLM-5.3-Flash — das kleinere Geschwistermodell — in einer Human-in-the-Loop-Sitzung laufen: Ihm wurden öffentliche Details einer gepatchten Chrome-Schwachstelle plus einer weiteren übergeben, ohne nennenswerte Anleitung, und das Modell verkettete sie zu einem zuverlässigen ARM64-Exploit, der die Pointer-Authentication-Härtung umging – in 20 Minuten menschlicher Aufmerksamkeit und acht Stunden Modellarbeit – 20,40 US-Dollar zu Zhipus API-Preisen. Dieselbe Einschätzung ist die Quelle der oben genannten ExploitBench-Zahl von 50 von 410, und dieser Teil davon maß GLM-5.3, das 743B-Flaggschiff, nicht das Flash – eine Unterscheidung, die die Berichterstattung über den Bericht weitgehend eingeebnet hat. Zwei unabhängige Parteien, unterschiedliche Testumgebungen, unterschiedliche Budgets, dieselbe Richtung. Beide sind zudem einzelne Laborläufe, und keiner davon ist ein reproduziertes Ergebnis, und nur der Generality-Lauf nennt einen Dollar-Betrag für das Flash statt für das Flaggschiff. Die praktische Lesart ist die, die Anthropic unumwunden nennt: Die Gewichte sind herunterladbar, das Abliterieren von GLM-5.3-Flash dauerte ungefähr 600 GPU-Stunden, und ein Modell, dessen Betrieb unter einem Dollar pro Stunde kostet, ist eine andere Art von Verfügbarkeitsproblem als eines hinter einem Prüfprogramm.
Probieren Sie es aus – und wie die Routing-Schicht dazu passt
Der Zugang ist unkompliziert. Zhipus eigene API bietet es zum oben genannten Listenpreis an, die MIT-lizenzierten Gewichte sind auf Hugging Face unter zai-org/GLM-5.3-Flash in FP8 und BF16 verfügbar, und Zhipus Coding-Produkte — ZCode und der GLM Coding Plan — enthalten es. Für Self-Hosting unterstützen sowohl vLLM als auch SGLang es. Zwei praktische Hinweise, falls Sie diesen Weg gehen: SGLangs Cookbook enthält eine Warnung vor einer offenen Änderung, dass Vision-Eingaben bei Transformers-Builds vor 5.13 stillschweigend verworfen werden können, was keinen Fehler auslöst und Ihnen einfach eine reine Textlesung einer Bildanfrage liefert; und der AMD-Pfad ist noch kein Rezept. Der ursprüngliche PR zur gfx950-Aktivierung am Starttag (sgl-project/sglang #37653) wurde am 6. September ungemergt geschlossen und durch eine breitere Gruppe von gfx950-Day-Zero-Pull-Requests ersetzt — mHC über AITER, k-pool-DSA-Indexer, FP8- und MXFP4-Serving — von denen mehrere am 17. September noch offen waren. Die Aktivierung auf Hardware der MI350X-Klasse ist in Arbeit, noch nicht ausgeliefert, und es gibt immer noch keine unabhängige AMD-Durchsatzangabe.
Auf der Routing-Seite hat sich die Lage seither geändert: GLM-5.3-Flash ist jetzt im Portfolio von OrcaRouter, zusammen mit dem Rest der GLM-Reihe. Wir geben den Listenpreis der Anbieter mit 0 % Aufschlag weiter und ohne Router-Zuschlag – und genau das ist der Mechanismus, der bei einem Modell zählt, dessen Preis sich gerade bewegt hat: Der Rabatt, der auf Zhipu-Seite ausläuft, ist der Preis, den Sie hier zahlen, am selben Tag, ohne einen zweiten Vertrag neu zu verhandeln und ohne Codeänderung. Diese Weitergabe schneidet in beide Richtungen, und es lohnt sich, das ausdrücklich zu sagen: Eine abgelaufene Aktion ist eine echte Preiserhöhung auf Ihrer Rechnung, und sie geschieht hier im selben Moment wie upstream. Wenn Sie das Flash gegen GLM-5.3 oder ein anderes Budget-Modell abwägen: Beide liegen hinter einem Schlüssel mit automatischem Failover zwischen Anbietern, und das ist der günstige Weg, ein Modell auszuprobieren, dessen unabhängige Bewertungen sich noch einpendeln, ohne einen Produktionspfad darauf zu verwetten. Es hat auch die richtige Form für das obige Ergebnis – und das aus einem nüchterneren Grund als Bequemlichkeit: Dieselben Gewichte erzielten im selben Benchmark 10,6 oder 6,2, je nachdem, welches Agent-Harness sie steuerte. Was ein Käufer also tatsächlich testet, ist eine Kombination aus Scaffold und Modell, und das Modell hinter einem festen Scaffold unter einem Schlüssel auszutauschen ist billiger, als sich auf eines von beiden festzulegen.

Was als Nächstes ansehen
Vier Dinge entscheiden den Rest dieser Geschichte. Erstens, ob sich die 42 bewegt: Das Modell ist seit August breit öffentlich im Einsatz, wenn also Zhipus interne Bewertung und AA's Harness aus einem strukturellen Grund voneinander abweichen — Abrechnung von Reasoning-Tokens, Weitschweifigkeit, eine Bewertung, die der Anbieter stark gewichtet hat —, dann sollte das bei der Überarbeitung des Index sichtbar werden und nicht als einmalige Lücke. Zweitens, ob sich das Exploit-Ergebnis reproduziert. Generality Labs hat 41 Bugs einmal auf seinem eigenen Harness laufen lassen und sagt das auch; die Harness-Nachuntersuchung zeigt, dass dieselben Gewichte allein durch die Wahl des Harness um vier Punkte schwanken, die Zahl, die das klären würde, ist also ein zweites Team, das die 41 erneut laufen lässt, mit in Dollar festgelegtem Budget und konstant gehaltenem Harness. Drittens, ob die Darstellung zur inländischen Siliziumbasis eine zweite Quelle bekommt. Zhipu ist die einzige Partei, die die Clustergröße, den Zwei-Wochen-Zeitplan und den Faktor 3,2 nennen kann, und die einzige darin unabhängig überprüfbare Aussage — der zusammengeführte Kernel-Fix — ist eine kleine. Viertens, der Preis: Der Rabatt ist weg, und die interessante Frage ist, ob er als Werbeaktion zurückkehrt, wenn Zhipu Volumen braucht, oder ob der Listenpreis jetzt die Untergrenze ist.
Der rote Faden ist, dass GLM-5.3-Flash zwei verschiedene Dinge gleichzeitig beweisen soll – dass ein billiges Modell gut genug sein kann und dass chinesische Beschleuniger es im großen Maßstab bedienen können –, und die Offenlegung vom 17. September ist Zhipus Antwort auf die zweite Frage, vorgelegt von einem Modell, das mitgeholfen hat, sie zu verfassen. An die erste Frage knüpfen sich nun zwei unabhängige Zahlen, und sie weisen in entgegengesetzte Richtungen: eine 42 auf dem Intelligenzindex, deutlich unter der vom Anbieter in den Vordergrund gestellten Zahl, und ein Exploit-Durchlauf, der auf dem Niveau eines Spezialisten eines Frontier-Labors landet – bei einem Zwanzigstel der Kosten. Beides kann gleichzeitig zutreffen, und die Lücke zwischen ihnen – nicht die eine oder die andere Zahl – ist der Punkt, an dem die Entscheidungen tatsächlich getroffen werden.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
