
GLM-5.3-Flash VRAM-Anforderungen: Wie viel Speicher Sie benötigen, um ein 320B MoE auszuführen
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
GLM-5.3-Flash passt auf keine Consumer-GPU. Die kleinste nutzbare Version, 2bit-lite, benötigt ~102 GB an Gewichten und 112 GB RAM. Ein Mac mit 128 GB ist der Einstieg; eine einzelne H200 hat Platz für 2bit-lite und lässt ~39 GB übrig; alle anderen sollten die gehostete API z-ai/glm-5.3-flash verwenden.
Das ist die ganze Antwort in einem Atemzug, und es ist wert, es hier unverblümt zu sagen: Es gibt keine Consumer-Hardware-Konfiguration, die dieses Modell ausführt. Das 320B-Parameter-Vision-Language-Mixture-of-Experts-Modell von Z.ai, veröffentlicht am 26. August 2026, benötigt in jeder Quantisierung Speicher der Serverklasse. Die Angabe „18B aktiv“ beschreibt die Berechnung pro Token, nicht den residenten Speicher – alle 320B Gewichte bleiben geladen. Die realistischen lokalen Zielsysteme sind große Macs mit einheitlichem Speicher, Multi-GPU-Server und eine einzelne H200 mit 141 GB. Wenn Sie keines davon besitzen, sind die Zahlen unten keine Einkaufsliste; sie sind der Grund, das Modell stattdessen über eine API aufzurufen.
Eine Anmerkung zur Einordnung vor den Zahlen: Bei den Speicherwerten in diesem Beitrag handelt es sich um Erkenntnisse aus der Community, nicht um Herstellervorgaben. Z.ai veröffentlicht Gewichte und API-Spezifikationen; es veröffentlicht keine Speicheranforderungen für lokale Inferenz. Die Tabelle nach Quantisierungsstufen stammt aus der Modellkarte von orcarouter/GLM-5.3-Flash-MLX auf Hugging Face, einer MLX-Quantisierung der offenen Gewichte, die von einer Community-Gruppe gepflegt wird, und die Bereitstellungszahlen stammen von Praktikern, die das Modell tatsächlich geladen haben. Wo eine Zahl vom Hersteller stammt – Preise und die Behauptungen zur KV-Cache-Effizienz der Architektur – kennzeichnen wir sie als solche.
Die kurze Antwort: was auf das passt, was du besitzt
Gehen Sie von dem aus, was Sie tatsächlich haben, denn die Quantisierungsleiter ergibt nur in Bezug auf eine Zielmaschine Sinn:
• Consumer-GPU (RTX 4090, RTX 5090 und alles darunter) — nein. Keine einzige Consumer-Karte hat genug VRAM: Das kleinste Modell umfasst allein etwa 102 GB an Gewichten, also ungefähr den Gegenwert von fünf RTX 5090. System-RAM ändert daran nichts, denn die Gewichte müssen auf dem Gerät vorgehalten werden.
• 128-GB-Mac (M4 oder M5 Max) — der 2bit-lite-Build (~102 GB Gewichte / 112 GB Mindest-RAM), und nur nach Anheben der Grenze für verdrahteten Speicher. Mehr dazu weiter unten. Dies ist die einzige Maschine der Verbraucherklasse, auf der das Modell Platz findet.
• 192 GB und 256 GB Mac Studio — 3-bit (~184 / 200 GB) und 2-bit (~145 / 160 GB) werden erreichbar; 4-bit benötigt ~224 GB, was nur die 256-GB-Stufe annähert.
• Ein einzelnes H200 (141 GB VRAM) — 2bit-lite passt hinein, wobei etwa 39 GB für den KV-Cache übrig bleiben, was nur kurze Kontexte bedeutet.
• Multi-GPU-Server — alles, einschließlich 4-Bit, 6-Bit und des ~328-GB-FP8-Referenz-Builds.
• Alle anderen – die gehostete API, z-ai/glm-5.3-flash. Das ist kein Trostpreis; dort ist das Modell tatsächlich schnell und günstig zu nutzen, und es wird unten auf dieser Seite behandelt.
Zwei Zahlen, nicht eine: Gewichte vs. Gesamtspeicher
Jede Quantisierung auf der Modellkarte hat zwei Spalten – Gewichtsgröße und Mindest-RAM – und die Lücke dazwischen ist der Teil, den die meisten Artikel auslassen. Die Gewichtsspalte stellt die Modelldateien dar: Jeder Parameter ist in dieser Genauigkeit im Speicher resident. Die Mindest-RAM-Spalte ist das, was die Maschine zur Laufzeit bereithalten muss: die Gewichte plus den KV-Cache, die Aktivierungen und die Puffer, die mit der Kontextlänge wachsen.
Die 18B-aktive Kennzahl ist die Stelle, an der Menschen in die Irre geführt werden. GLM-5.3-Flash ist ein MoE mit 320B Gesamtparametern / 18B aktiven Parametern: Pro Token rechnen nur etwa 18B Parameter. Das ist eine Rechenersparnis, keine Speicherersparnis. Alle 320B Gewichte liegen unabhängig davon, welche Experten feuern, im Speicher, denn der Router weiß nicht, welche Experten er benötigt, bis er den Token sieht. MoE erkauft Geschwindigkeit, keinen kleineren Speicherbedarf – ein Punkt, den das Datenblatt des Modells selbst beispielhaft verdeutlicht, wenn es die 320B Gesamtparameter zusammen mit den 18B aktiven ausweist.
Wenn ein Build also "~204 GB Gewichte / 224 GB min. RAM" angibt, sind die zusätzlichen ~20 GB Laufzeit-Overhead — KV-Cache, Aktivierungen, Kontextpuffer. Erhöht man die Kontextlänge, wächst diese Differenz. Die Min-RAM-Spalte, nicht die Gewichtsspalte, ist diejenige, nach der man eine Maschine dimensioniert.

Das Modell selbst — Architektur, Lizenz und Z.ai's eigene Einordnung — ist auf der offiziellen Karte des Anbieters dokumentiert, die oben gezeigt wird. Der lokale Speicher wird dort nicht abgedeckt; deshalb existiert diese Seite. Die Zahlen unten stammen aus dem Community-MLX-Port der offenen Gewichte.
Die Quantisierungsleiter
Die Tabelle auf der orcarouter/GLM-5.3-Flash-MLX-Karte ist die, aus der Praktiker heute tatsächlich laden. Sie listet fünf quantisierte Builds plus die FP8-Referenz auf, jeweils mit Gewichtsgröße und Mindest-RAM:
• FP8-Referenz — ca. 328 GB Gewichte. Der unquantisierte Referenzpunkt, mit dem die offenen Gewichte ausgeliefert werden.
• 6-Bit — ~296 GB Gewichte / 320 GB min. RAM. Nahezu verlustfrei; die qualitativ beste Variante.
• 4-bit — ~204 GB / 224 GB. Die empfohlene Standardeinstellung für den Alltag.
• 3-bit — ~184 GB / 200 GB. Aggressiv, aber nutzbar.
• 2-bit — ~145 GB / 160 GB. Best-effort.
• 2bit-lite — ~102 GB / 112 GB. Die kleinste Version; die einzige, die auf einen 128-GB-Mac oder eine einzelne H200 passt.
Die Qualität fällt, wenn die Bits fallen, und die Karte quantifiziert das. Relativ zur FP8-Referenz verschlechtert sich die Perplexität um +0,24 % bei 6 Bit, +2,96 % bei 4 Bit, +9,96 % bei 3 Bit, +56,9 % bei 2 Bit und +141 % bei 2bit-lite (Perplexitätswerte aus derselben Modellkarte). Die eigenen Anwendungsempfehlungen der Karte: 6 Bit für nahezu verlustfreie Ergebnisse, 4 Bit als Alltagsstandard, 3 Bit und 2 Bit, wenn der Speicher knapp ist, 2bit-lite nur, wenn sonst nichts hineinpasst – und lange Codegenerierung ist bei 2bit-lite nicht zuverlässig. Diese letzte Warnung ist wichtig für ein 320B-Reasoning-Modell: 2bit-lite ist das, was einem den 128-GB-Mac verschafft, und die Qualitätssteuer landet genau dort, wo Programmierarbeit am meisten wehtut.

Zwei Zahlen in dieser Leiter verdienen einen genaueren Blick, weil sie die gesamte Hardware-Frage entscheiden.
Warum 2bit-lite existiert
2bit-lite ist keine zusätzliche Qualitätsstufe – es ist eine Größenstufe, die aus einem einzigen Grund geschaffen wurde: reguläres 2-bit passt nicht. Mit ~102 GB Gewichten ist es der einzige Build, der unter die ~112 GB nutzbaren Speichers eines 128-GB-Macs passt, und der einzige, der in die 141 GB einer einzelnen H200 passt und dabei noch Platz für einen KV-Cache lässt. Die Modellkarte sagt genau das: Reguläres 2-bit passt nicht in einen 128-GB-Mac; 2bit-lite schon, mit einem erhöhten Wired-Memory-Limit. Auf einer H200 passt es „mit ~39 GB übrig für den KV-Cache“ (die Worte der Karte). Diese 39 GB sind das gesamte Arbeitsbudget für alles, was das Modell nach dem Laden tut – und damit kommen wir zum Kontext.
Was der KV-Cache bei langem Kontext kostet
GLM-5.3-Flash verfügt über ein Kontextfenster von 1M Token, und genau bei langen Kontexten scheitern Pläne für lokale Speicherung. Die hybride Sparse-plus-Linear-Attention des Modells — NoPE-MLA mit einem Index-Pool-Mechanismus — ist wirklich effizient: Z.ai gibt an, dass der Attention-Rechenaufwand um das 3,01-fache und die KV-Cache-Größe um das 4,44-fache gegenüber dem eigenen GLM-5.3 reduziert werden (vom Anbieter gemeldete Zahlen). Aber „4,44× kleiner als GLM-5.3“ hinterlässt bei Annäherung an einen vollständigen 1M-Kontext immer noch einen Cache in der Größenordnung von zig GiB.
Die beste öffentliche Zahl, die wir haben, stammt aus einer Community-Bereitstellung, die das Modell auf vier DGX-Spark-Knoten ausgeführt hat: 16 GiB KV-Cache pro Rang — insgesamt etwa 64 GiB über alle vier — um einen vollständigen 1M-Token-Kontext zu halten, dimensioniert, um ein paar gleichzeitige Vollkontextanfragen zu unterstützen. Das ist mehr als das gesamte Speicherbudget der meisten einzelnen Maschinen, noch bevor auch nur ein einziges Gewicht geladen ist. Auf einer einzelnen H200 ist die Rechnung der Punkt dieser Seite: 2bit-lite lässt ~39 GB für alles nach den Gewichten übrig — komfortabel für einen kurzen Chat, in Minuten aufgebraucht, wenn der Kontext auf 100.000 Token ansteigt.
Die praktische Regel: Die Min-RAM-Spalte setzt einen angemessenen Kontext voraus. Wenn Ihre Workloads lange Dokumente, Agenten-Schleifen oder Code auf Repository-Ebene umfassen, planen Sie zusätzlich KV-Cache-Speicher ein — und für alles nahe 1 Million Tokens hören Sie auf zu rechnen und nutzen Sie die API. Diese Beobachtungen zur Dimensionierung sind Erkenntnisse aus der Community; für die KV-Cache-Budgetierung gibt es keine Herstellervorgaben.
Die Grenze des verdrahteten Speichers in macOS: Warum ein Mac mit 128 GB trotzdem nicht lädt.
Der von Praktikern am häufigsten gemeldete Fehler ist nicht „nicht genug RAM". Es ist ein 128-GB-Mac mit einem ~102-GB-Modell, das sich weigert zu laden. Die Ursache ist die Begrenzung des verdrahteten Speichers von macOS. Auf Apple Silicon kann die GPU nicht den gesamten Unified Memory adressieren: Metal gibt ein „empfohlenes maximales Working Set" von etwa zwei Dritteln des physischen RAM an, und Zuweisungen, die darüber hinausgehen, schlagen fehl, selbst wenn die Maschine über freien Speicher verfügt.
Das Standard-Metal-Budget eines 128-GB-Macs liegt also irgendwo zwischen 80 und 90 GB – unter dem, was der 2bit-lite-Build benötigt (~112 GB Mindest-RAM bei einem ~102 GB großen residenten Modell). Das Laden scheitert am Metal-Budget, nicht an der RAM-Kapazität. Der Fix in jedem uns bekannten Praktikerbericht ist derselbe: Erhöhen Sie das Wired-Limit mit `sudo sysctl iogpu.wired_limit_mb=…`, setzen Sie einen Wert oberhalb des gesamten Speicherbedarfs des Modells in MB, und erwarten Sie, dass es nach einem Neustart zurückgesetzt wird. Einige Community-Anleitungen setzen das Wired-Limit auch aus Python über `mlx.metal.set_wired_limit()`, damit die Gewichte des Modells angeheftet werden und macOS aufhört, im Leerlauf befindliche Metal-Seiten zu komprimieren.
Noch eine Besonderheit: Laufzeitumgebungen verhalten sich unterschiedlich. MLX setzt das Metal-Budget durch und bricht hart ab, wenn es überschritten wird, während Laufzeitumgebungen auf llama.cpp-Basis (der GGUF-Pfad) es in der Regel nicht durchsetzen und stattdessen macOS auslagern lassen. Deshalb kann sich dasselbe Modell in einer Laufzeitumgebung weigern zu laden und in einer anderen „laden“ – und warum ein ausgelagertes Modell so langsam sein kann, dass es unbrauchbar wird. Dies sind Erkenntnisse der Community über das Verhalten von macOS, keine Anleitung von Apple.
Die gehostete Alternative: z-ai/glm-5.3-flash
Für alle, die die obigen Zahlen ausschließen – und das sind die meisten –, serviert Z.ai das Modell selbst als z-ai/glm-5.3-flash, und genau hier zeigt sich das „Flash“ im Namen tatsächlich. Z.ais Listenpreis beträgt 0,15 $ pro Million Input-Token, 0,03 $ pro Million gecachte Input-Token und 0,50 $ pro Million Output-Token; ein Einführungsangebot läuft bis zum 9. September 2026 zu 0,075 $ / 0,015 $ / 0,25 $ (vom Anbieter gemeldete Preise, Stand zum Zeitpunkt des Schreibens). Gecachter Input zu einem Fünftel des frischen Inputs ist der größte Kostenhebel: Jede Arbeitslast mit einem wiederverwendbaren Präfix – System-Prompts, Tool-Definitionen, lange gemeinsame Dokumente – sollte die Cache-Read-Preise nutzen.
Die Speicherberechnung gehört in die Entscheidung. Ein 320B-Modell selbst zu hosten bedeutet, 112–320 GB Speicher dafür bereitzustellen, ob es nun im Leerlauf ist oder voll ausgelastet. Der gehostete Endpunkt verlagert all das von deinen Maschinen weg, und zu Einführungssonderpreisen kostet das Modell pro Token weniger als viele Modelle, die nur ein Zehntel so groß sind – genau das ist der Sinn einer MoE mit 18B aktiven Parametern.
Dies ist auch der natürliche Ort für den Routing-Punkt. Über OrcaRouter ist z-ai/glm-5.3-flash eines von über 200 Modellen hinter einer einzigen API, zum Listenpreis des Anbieters mit 0 % Aufschlag — das Einführungsangebot und jede künftige Preissenkung sind also am selben Tag live, an dem sie angekündigt werden. Automatisches Failover bedeutet, dass ein drei Tage altes Modell mit einem wackligen Serving-Pfad keine Wette auf deinen Produktionsstack ist: Wenn der Provider einen Fehler meldet oder gesättigt ist, wechselt die Anfrage zu einem intakten Provider, statt zu scheitern. Genau dafür ist ein Router da: ein unerprobtes Modell sicher auszuprobieren.

FAQ
Kann ich GLM-5.3-Flash auf einer RTX 5090 ausführen?
Nein. Die kleinste Variante umfasst allein ~102 GB an Gewichten, und eine RTX 5090 hat 32 GB VRAM. Keine Consumer-GPU kommt auch nur annähernd heran; das Modell benötigt Macs mit Unified Memory, eine einzelne H200 oder einen Multi-GPU-Server.
Bedeutet 18B aktiv, dass GLM-5.3-Flash auf Consumer-Hardware läuft?
Nein. Die Zahl von 18B aktiven Parametern bezieht sich auf die Rechenleistung pro Token. Alle 320B Parameter bleiben im Speicher resident, weil der Router nicht wissen kann, welche Experten ein Token benötigt, bis er das Token sieht. MoE spart Rechenleistung, nicht Speicher.
Was ist der günstigste Weg, GLM-5.3-Flash auszuprobieren?
Die gehostete API, z-ai/glm-5.3-flash. Zum Einführungspreis kostet sie 0,075 $ pro Million Input-Tokens, und zwischengespeicherte Input-Tokens kosten 0,015 $. Das Selbsthosting des kleinsten Builds bedeutet, etwa 112 GB RAM dafür zu reservieren, was nur sinnvoll ist, wenn man die Hardware bereits besitzt.
Die ehrliche Zusammenfassung: GLM-5.3-Flash ist in jedem Build ein Server-Modell. Der 128-GB-Mac erhält das eine Build, das passt – 2bit-lite, mit einer Anhebung des Limits für verdrahteten Speicher, kurzen Kontexten und einer dokumentierten Qualitätseinbuße bei langem Code. Eine einzelne H200 erhält dasselbe Build mit rund 39 GB KV-Headroom. Serverhardware erhält die volle Abstufung, von 4-bit als Standard bis zu nahezu verlustfreiem 6-bit. Und für alle anderen – die meisten Leser – ist der gehostete z-ai/glm-5.3-flash-Endpoint die richtige Antwort, und die obigen Zahlen sind der Grund, keine Einkaufsliste. Für die Schritt-für-Schritt-Installation auf einem MacBook Pro deckt unsere MacBook-Installationsanleitung den gesamten Ablauf von Anfang bis Ende ab; für den Vergleich der Quantisierungs-Builds hinsichtlich Qualität und die Frage, wann man welches wählen sollte, enthält der MLX-Build-Leitfaden die Details; und die Veröffentlichungsberichterstattung enthält den Launch-Kontext und die Benchmark-Angaben.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
