Hero-Titelkarte für den Artikel 'So führen Sie GLM-5.3-Flash auf einem MacBook Pro aus' mit dem Untertitel 'Das 2bit-Lite MLX-Playbook', die ein stilisiertes MacBook Pro zeigt, mit einem dezenten neuronalen Netzwerk-Motiv über der Tastatur und drei Chips, die mit '2bit-lite', '~102 GB' und '128 GB Mac' beschriftet sind.
Guides & Insights

So führen Sie GLM-5.3-Flash auf einem MacBook Pro aus: Das 2bit-Lite MLX-Playbook

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Ausführen von GLM-5.3-Flash auf einem MacBook Pro bedeutet genau eine Maschine: ein 128 GB M4/M5 Max MacBook Pro mit dem 2bit-lite-Build unserer MLX-Konvertierung, mit erhöhtem macOS-Wired-Memory-Limit. Wenn Ihr MacBook Pro weniger als 128 GB hat — ein 36 GB M4 Pro, ein 48 GB M4 Max — ist dieses Playbook nichts für Sie; springen Sie zum letzten Abschnitt und nutzen Sie stattdessen die gehostete z-ai/glm-5.3-flash-API. GLM-5.3-Flash (Gewichte unter zai-org/GLM-5.3-Flash) ist Z.ais 320-Milliarden-Parameter-Mixture-of-Experts-Modell mit 18B aktiven pro Token — veröffentlicht am 26. August 2026, das erste nativ multimodale GLM-​5 — und selbst der kleinste Build unseres MLX-Ports benötigt ~102 GB Gewichte und ~112 GB Speicher. Das ist der gesamte Markt, und wir werden das nicht beschönigen.

Dies ist eine Dokumentation aus erster Hand, kein Launch-Bericht: Die unten genannten Gewichte sind OrcaRouters eigener Build (orcarouter/GLM-5.3-Flash-MLX, MIT), erstellt mit unserer kalibrierungsfreien OrcaSAQ-Quantisierungsmethode. Wir haben sie am 26. August veröffentlicht und am nächsten Tag öffentlich den Kurs korrigiert, weil der ursprüngliche Quantisierungsbereich die Nutzung auf dem MacBook Pro für die meisten Menschen unpraktikabel machte — der reguläre 2-Bit-Build benötigte immer noch etwa 160 GB, was kein Laptop hat. Am 27. August haben wir die kleinste Variante als 2bit-lite neu aufgebaut, speziell um in ein MacBook Pro mit 128 GB zu passen, und dieser Beitrag ist der ehrliche Bericht darüber, was man dafür bekommt und was es kostet. Jede Zahl, die als Feldnotiz unten markiert wurde, wurde in unserem einzelnen H200-Verifikationslauf gemessen; nichts hier ist ein Anbieter-Benchmark. Wo wir Praktiken aus der Community übernehmen — den Wired-Memory-Befehl, die Versionierung von mlx-vlm — kennzeichnen wir sie als solche.

Welcher Build passt zu welchem Mac (lesen Sie dies, bevor Sie etwas herunterladen)

Die fünf Builds im Repo entsprechen jeweils einem Mindest-RAM-Wert. Auf einem MacBook Pro gibt es auf „welcher Build“ genau eine Antwort — alles über 2bit-lite ist eine Mac-Studio-Angelegenheit:

6-Bit — ~296 GB Gewichte / ~320 GB RAM / nahezu verlustfrei. Nur für Mac Studio mit 512 GB.

4-bit — ~204 GB / ~224 GB / unsere empfohlene Standardeinstellung. Mac Studio 256 GB. Das ist es, was das Repo-Root spiegelt.

3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.

2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. Dies war das kleinste Build, das wir am ersten Tag ausgeliefert haben, und es war der Fehlschlag.

2bit-lite — ~102 GB / ~112 GB. Der einzige Build, der in eine 128-GB-Maschine passt — ein 128-GB-M4/M5-Max-MacBook-Pro oder ein 128-GB-Mac-Studio oder Mac mini. Jedes 128-GB-Apple-Silicon-Laptop (M3 Max oder neuer) ist dieselbe Geschichte, nur langsamer.

Die in dieser Leiter versteckte Falle: Der Standard-Download-Befehl der README lädt den 4-Bit-Build (~204 GB) herunter, was auf einer 256-GB-Maschine die richtige Standardeinstellung ist, auf einem Laptop jedoch nutzlos. Wenn du auf einem MacBook Pro dem Standardbefehl folgst, erhältst du ein Modell, das nicht allokiert werden kann. Der 2bit-lite-Pfad erfordert ein explizites --include, wie unten beschrieben.

Es gibt auch eine harte Obergrenze, auf die Sie stoßen werden, bevor die obige Mathematik überhaupt greift. macOS erlaubt es einem Prozess nicht, den gesamten einheitlichen Speicher eines 128-GB-Macs zu beanspruchen; die standardmäßige für die GPU nutzbare Obergrenze liegt bei etwa 91–96 GB (von der Community per Reverse Engineering ermittelt und in mehreren Beiträgen zu MLX-Setups mit großen Modellen bestätigt). Das liegt unter den ~102 GB allein für die Gewichte, also selbst 2bit-lite lässt sich erst laden, wenn Sie das wired-memory-Limit anheben. Dieser Schritt ist obligatorisch und wird in Abschnitt 4 behandelt.

Installiere mlx-vlm — und nur mlx-vlm

GLM-5.3-Flash ist ein Vision-Language-Modell, läuft also unter mlx-vlm, nicht mlx-lm. Das ist der mit Abstand häufigste Grund, warum Leute hängen bleiben, also sagen wir es früh: mlx-lm ist für reine Textmodelle; wenn man ein multimodales Modell darüber ausführt, erzeugt das einen verwirrenden Ladefehler. Installieren Sie das VLM-Paket in Version 0.6.17 oder höher:

pip install -U "mlx-vlm>=0.6.17"

Die Versionsbindung ist keine Dekoration. glm5_next — die hybride Sparse-plus-Linear-Attention-Architektur hinter GLM-5.3-Flash — wurde erst am selben Tag in mlx-vlm integriert, an dem das Modell erschien (26. August 2026), und alles Ältere wird die Konfiguration nicht erkennen. Die Architektur ist aus einem zweiten Grund wichtig: Es handelt sich um eine völlig neue Topologie, und die ersten Ports hatten echte Korrektheitsfehler, die eine flüssige Ausgabe nicht offenbaren würde. Ein Community-Laufzeitaudit des frühen glm5_next-MLX-Pfads fand und behob vier davon — eine nicht angewendete SwiGLU-Klemmung in jedem FFN-Block, auf Mannigfaltigkeiten eingeschränkte Hyperverbindungstensoren, die in den falschen dtype gecastet wurden (was die Aufmerksamkeitsmischungsmatrix unbemerkt beschädigte), zwei Epsilon-Abweichungen in den Attention-Normen und bf16-Router-Logits, während die Referenz float32 verwendet. Nach den Korrekturen stimmte die Numerik mit der Referenz auf etwa 1e-7 überein. Die Lehre für dich: Halte mlx-vlm aktuell und behandle die allererste Version eines jeden Ports einer neuen Architektur mit Misstrauen.

Laden Sie die Gewichte herunter: die Exclude-Flags und das Include, das Sie tatsächlich benötigen.

Der Repository-Stamm entspricht dem 4-Bit-Build, und alle fünf Varianten werden als Unterordner ausgeliefert. Der Standardbefehl lädt den Stamm herunter und verwendet --exclude sodass keiner der fünf Varianten-Ordner (die zusammen etwa 800 GB umfassen) mitgeladen wird:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

Auf einem MacBook Pro ist dieser Befehl für dich falsch — er liefert dir die 4-Bit-Root. Für einen 128-GB-Laptop hole nur den 2bit-lite Unterordner:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

Das ist der Download mit ~102 GB, und er ist in sich geschlossen – der Ordner 2bit-lite/ enthält sein eigenes config.json, du kannst den Generator also direkt darauf richten. Wenn hf nicht in deinem PATH ist, installiere es: pip install -U huggingface_hub. Bevor du beginnst, stelle sicher, dass du ~110 GB freien Speicherplatz hast und dass auf deinem Mac nicht nur die letzten 100 GB frei sind – MLX bildet die Gewichte per Memory-Mapping ab, und eine fast volle SSD führt dazu, dass diese Setups mitten im Download absterben.

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

Erhöhen Sie das Wired-Memory-Limit — der Schritt, den alle vergessen

Das ist der entscheidende Schritt auf einem 128 GB MacBook Pro, und die README-Karte setzt voraus, dass du ihn kennst, anstatt den Befehl ausdrücklich zu nennen. Die Standard-Obergrenze des Metal-Working-Sets auf einem 128-GB-Mac liegt bei ungefähr 91–96 GB, was unter den ~102 GB der 2bit-lite-Gewichte liegt – ohne diesen Schritt schlägt die Modellallokation fehl und der Ladevorgang bricht ab. Der übliche Fix in der Community ist ein sysctl, das die Obergrenze des GPU-gebundenen Speichers in Megabyte anhebt:

sudo sysctl iogpu.wired_limit_mb=114688

Das setzt eine Obergrenze von ~112 GB fest, sodass etwa 14 GB als Reserve für das Betriebssystem bleiben. Bei 128-GB-Maschinen liegen die in der Community verwendeten Werte typischerweise zwischen ~114688 (112 GB) und ~122880 (120 GB); setze es nicht auf das Maximum — macOS benötigt Spielraum, sonst kommt es unter Speicherdruck zu Window-Server-Rucklern und System-Hängern. Nach dem Setzen lade das Modell und beobachte den Aktivitätsmonitor: Wenn der Speicherdruck gelb wird, reduziere den Wert.

Zwei praktische Hinweise, beide aus der Community-Praxis statt aus unseren Feldnotizen. Erstens: Der sysctl-Wert wird bei einem Neustart zurückgesetzt und gilt nur für die Terminalsitzung, in der du ihn gesetzt hast. Plane also, ihn erneut auszuführen (oder per LaunchAgent zu skripten) — ihn nach einem Neustart zu vergessen ist der klassische „Hat gestern doch noch funktioniert“-Fehler. Zweitens bietet MLX auch eine prozessinterne Stellschraube, mlx.core.metal.set_wired_limit(bytes), unter macOS 15.0 und neuer; sie muss unter der sysctl-Obergrenze bleiben und ist die portablere Option, wenn du in einem Notebook arbeitest. Welche Variante du auch verwendest, der Effekt ist derselbe: Ohne sie läuft hier nichts.

Führen Sie es aus: Text, Bild und die Python-API.

Mit den Gewichten an Ort und Stelle und dem erhöhten Limit ist die Generierung ein einziger Befehl. Text:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Erkläre die Quantenverschränkung in einem Satz." --max-tokens 256

Die Bildeingabe funktioniert genauso mit einem --image-Flag — genau hier beweist das multimodale Modell seinen Nutzen auf einem Laptop, da der Vision-Tower im OrcaSAQ-Layout in höherer Präzision bleibt:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Beschreibe dieses Bild." --max-tokens 256

Für ein Skript hat die Python-API dieselbe Form, die mlx-vlm-Benutzer kennen:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Beschreibe dieses Bild.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

Halten Sie --max-tokens in Grenzen. Bei unserem H200-Feldnotiz-Lauf kommt 2bit-lite auf ungefähr 10 tok/s, sodass eine Antwort mit 1.024 Token bereits eine Wartezeit von zwei Minuten bedeutet — und gerade bei langen Outputs schlagen das KV-Budget und der Qualitätskollaps zu (siehe unten). Auf einem Laptop sollte man damit rechnen, dass es sich langsamer anfühlt, nicht schneller, bis ein Messwert vorliegt.

Welche Qualität Sie tatsächlich erhalten (die gemessene Leiter)

Hier ist der ehrliche Teil des Playbooks, und wir werden ihn nicht beschönigen. OrcaSAQ degradiert anmutig bis auf 3-Bit, dann steigen die Kosten schnell. Im Vergleich zur FP8-Referenz (Perplexität 2,7797):

6-bit — Perplexität 2,7864 (+0,24 %), Top-1-Token-Übereinstimmung 97,76 %. Nahezu verlustfrei, wie versprochen.

4-bit — Perplexität 2,8620 (+2,96 %), Top-1 96,13 %. Der empfohlene Standardwert.

3-bit — Perplexität 3,0566 (+9,96 %), Top-1 92,06 %. Aggressiv, aber brauchbar.

2-bit — Perplexität 4.3622 (+56.9%), Top-1 86.56%. Ein echter Preis.

2bit-lite — Perplexität 6.7018 (+141%), Top-1 77.19%. Der kleinste Build und der einzige, den ein MacBook Pro aufnehmen kann.

Das sind gemessene Zahlen aus unserer eigenen Konvertierungs-Pipeline. 2bit-lite ist eine 141%ige Perplexitätsregression und eine Top-1-Token-Übereinstimmung unter 78 % – Sie führen ein deutlich verschlechtertes Modell aus, und die unten beschriebenen Fehlermodi zeigen, wie diese Verschlechterung in der Praxis aussieht. Es ist eine brillante Demo und ein brauchbarer Kurzform-Assistent; es ist kein Ersatz für das Modell mit voller Präzision.

Was die Geschwindigkeit angeht, schulden wir Ihnen dieselbe Ehrlichkeit. Die veröffentlichte Feldnotiz lautet H200: ~10 tok/s, stabil über mehrere Turns, für alltägliches Q&A und kurze Texte völlig in Ordnung. Wir haben noch keinen gemessenen MacBook-Pro-Wert für 2bit-lite, und wir werden uns keinen ausdenken — der Apple-Silicon-Durchsatz hängt hier von Speicherbandbreite, Thermik und der MLX-Kernel-Abdeckung für die hybride Aufmerksamkeit ab, und nichts davon haben wir für diesen Build auf diesem Laptop gemessen. Der nächstgelegene veröffentlichte Apple-Silicon-Datenpunkt, auf den wir Sie verweisen können, ist ein unabhängiger Wert von ~450 tok/s für einen 4-Bit-GLM-5.3-Flash-Build auf einem 512-GB-Mac unter einer anderen MLX-Laufzeit — ein anderer Build, eine andere Präzision und ein Desktop-Rechner, also lesen Sie daraus auch nicht Ihren Wert ab. Rechnen Sie mit Langsamkeit; seien Sie angenehm überrascht, wenn es nicht langsam wird.

KV-Cache und langer Kontext: auf den Headroom achten

GLM-5.3-Flash wirbt mit einem Kontextfenster von 1M Token. Diese Zahl ist auf dieser Hardware irrelevant, und eine Anleitung, die etwas anderes behauptet, würde dir einen Bärendienst erweisen. Die Feldnotiz umfasst eine Zeile: Gib der Laufzeit genügend KV-Budget für deine Ziellänge. Auf einer einzelnen H200 lässt 2bit-lite nach dem Laden der Gewichte etwa 39 GB Spielraum für den KV-Cache. Bei einem 128-GB-MacBook Pro ist die Rechnung härter: ~102 GB Gewichte gegenüber einer ~112-GB-Obergrenze lassen ungefähr 26 GB übrig, bevor macOS seinen eigenen Arbeitsspeicher beansprucht – und die hybriden Linear-Attention-Schichten machen den KV-Fußabdruck dieses Modells im Vergleich zu einem dichten Modell dieser Größe klein, aber er wächst dennoch linear mit dem Kontext.

Serverseitige Hinweise aus der breiteren Community untermauern den Punkt: Eine Konfiguration, die bei einem 8K-Kontext problemlos lädt, kann bei 128K aus dem Speicher laufen. Auf dem Laptop sollten Sie die Kontexte kurz halten – ein paar tausend Token für Fragen und Antworten oder ein einzelnes Bild – und versuchen Sie nicht, ihm ein Buch zu füttern. Sobald eine Arbeitslast wirklich einen langen Kontext benötigt, sind Sie im letzten Abschnitt dieses Artikels.

Die Generierung von langem Code ist bei 2bit-lite nicht zuverlässig (lies das zweimal).

Dies ist der Abschnitt, ohne den eine Anleitung, die ihre Fehlermodi verbirgt, wertlos wäre, also bekommt er eine eigene Überschrift. Die H200-Feldnotizen sind eindeutig: alltägliche Fragen und Antworten sowie Kurztexte funktionieren einwandfrei, und die Generierung von langem Code ist bei dieser Präzision nicht zuverlässig. Drei Fehlermodi wurden in unserem Verifikationslauf reproduziert:

Wiederholungsschleifen — das Modell beginnt, dieselben Zeilen oder Blöcke zu wiederholen, anstatt Fortschritte zu machen, typischerweise nach einigen hundert Tokens.

Fehlender Klebecode — Importe, Verdrahtung und Fehlerbehandlung wurden stillschweigend weggelassen. Die generierte Funktion sieht isoliert betrachtet richtig aus und läuft nicht, weil das umgebende Gerüst schlicht fehlt.

Umschreib-Churn — statt einer minimalen Änderung schreibt das Modell große Teile einer Datei neu, und aufeinanderfolgende Ausgaben widersprechen sich gegenseitig.

Diese sind bei 2bit-lite reproduzierbar, und genau das sind die Dinge, die eine 77%ige Top-1-Übereinstimmung vorhersagt. Was Praktiker, die den Laptop-Build beibehalten, tatsächlich tun:

• Verwenden Sie es für Erklärungen, Zusammenfassungen, Q&A und Bildverständnis — kurze Arbeiten, bei denen es wirklich gut ist.

• Wenn du nach Code fragen musst, frag nach einer kleinen Funktion auf einmal mit expliziter Signatur, und überprüfe jede einzelne, bevor du weitermachst. Gib ihm nicht eine ganze Datei und bitte nicht um ein Feature.

• Für alles Längere — ein vollständiges Modul, ein Refactoring, eine lange Agenten-Sitzung — leiten Sie an die Vollpräzisions-API weiter. Das ist kein Workaround; es ist die richtige Architektur, und es ist der letzte Abschnitt.

Wann man dies überhaupt nicht tun sollte: stattdessen z-ai/glm-5.3-flash aufrufen.

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

Die ehrliche Entscheidungsregel: Führen Sie 2bit-lite auf einem 128 GB M4/M5 Max MacBook Pro nur dann aus, wenn Sie gezielt ein 320B multimodales Modell wünschen, auf einem Laptop, den Sie tragen können — Offline-Q&A, private Dokumente, Bildverständnis, ohne dass etwas die Maschine verlässt. Wählen Sie die API für alles andere:

Jedes MacBook Pro mit weniger als 128 GB — es gibt keinen Build für dich. Versuche nicht, ihn zu laden; nutze die API.

Lange Codegenerierung oder Reasoning über lange Kontexte — 2bit-lite scheitert genau daran, und das zuverlässig. Nutzen Sie die API.

Qualitätskritische Arbeit — 77,19 % Top-1-Übereinstimmung und +141 % Perplexität sind ein echter Rückgang, kein Rundungsfehler. Verwende die API.

Garantierter Durchsatz oder vorhersehbare Latenz — einen gemessenen Laptop-Wert gibt es noch nicht, und die Feldnotiz beträgt 10 tok/s. Nutze die API.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

Das gehostete Modell ist z-ai/glm-5.3-flash, das in voller Präzision auf OrcaRouter zu den aktuellen Preisen von Z.ai angeboten wird – 0,07 $ pro Million Input-Tokens und 0,25 $ pro Million Output zum Zeitpunkt dieses Textes (Einführungspreise; die veröffentlichte Liste von Z.ai liegt bei 0,15 $ / 0,50 $). Das ist der vom Anbieter gemeldete Preis, der ohne Aufschlag (0 %) weitergereicht wird – eine Preissenkung von Z.ai schlägt sich also noch am selben Tag bei uns nieder. Sie erhalten einen einzigen API-Schlüssel, der auch die anderen 200+ Modelle erreicht, die wir routen. Automatisches Failover bedeutet, dass ein Experiment mit diesem neuen Modell Ihren Produktionspfad nicht auf einen einzelnen Anbieter setzt. In der Zeit, die nötig ist, um 102 GB herunterzuladen und die erste Kaltstart-Generierung abzuwarten, hat die API bereits Fragen für eine Woche beantwortet – und zwar in voller Präzision.

Lokale Inferenz lohnt sich, wenn der Grund lokal ist — Privatsphäre, Offline-Arbeit, keine Ratenbegrenzungen, eine Demo, die mit Akku läuft. Sie lohnt sich aus keinem anderen Grund, rechnet man Kosten oder Qualität durch, und auf einem Rechner mit weniger als 128 GB lohnt sie sich überhaupt nicht.

FAQ

Kann ein Mac mit 64 GB oder 96 GB GLM-5.3-Flash lokal ausführen? Nein. Die kleinste Variante, 2bit-lite, benötigt inklusive macOS-Overhead mindestens etwa 112 GB, und selbst ein Mac mit 128 GB muss das Limit für den nicht auslagerbaren Speicher erhöhen, um sie zu laden. Wenn Ihr Mac weniger als 128 GB hat, gibt es keinen lokalen Weg; leiten Sie z-ai/glm-5.3-flash stattdessen über die API weiter.

Ich habe mlx-vlm installiert und das Modell lässt sich nicht laden – was ist falsch? Die beiden üblichen Ursachen sind, in dieser Reihenfolge: eine Version unter 0.6.17, die vor der glm5_next-Unterstützung stammt und die Architektur nicht erkennt; sowie die nicht erhöhte Grenze für den verdrahteten Speicher, da die ~102-GB-Version unter dem standardmäßigen Metal-Limit von ~91–96 GB auf einem 128-GB-Mac nicht genug Speicher zuweisen kann. Beheben Sie beides (Paket aktualisieren, sysctl ausführen), dann lädt es.

Ist der lokale 2bit-lite-Build dasselbe Modell wie die z-ai/glm-5.3-flash-API?Gleiche zugrunde liegende GLM-5.3-Flash-Gewichte, aber nicht dieselbe Qualität. 2bit-lite ist eine 2-Bit-Quantisierung mit 77,19 % Top-1-Token-Übereinstimmung gegenüber der FP8-Referenz, und die Generierung von langem Code ist unzuverlässig. Die API liefert volle Präzision. Sie sind nur für kurze, qualitätstolerante Arbeiten austauschbar.

Die 30-Sekunden-Version

Eine Maschine, ein Build, ein obligatorisches Sysctl. Wenn du ein MacBook Pro mit 128 GB und M4/M5 Max hast: installiere mlx-vlm>=0.6.17, lade nur 2bit-lite/ (~102 GB) herunter, erhöhe das Wired-Memory-Limit mit sudo sysctl iogpu.wired_limit_mb=114688 und starte mlx_vlm.generate — für Q&A, kurze Texte und Bilder. Akzeptiere, dass die Generierung von langem Code bei dieser Präzision nicht zuverlässig ist, dass es noch keinen gemessenen Laptop-Durchsatz gibt und dass ein 128-GB-Mac die Untergrenze ist, nicht der Standard. Wenn einer dieser Vorbehalte ein Ausschlusskriterium ist — oder dein Mac unter 128 GB hat — ist dasselbe Modell in voller Präzision nur einen API-Aufruf entfernt auf z-ai/glm-5.3-flash.

Nicht auf einem Mac mit 128 GB? z-ai/glm-5.3-flash bietet dasselbe Modell in voller Präzision auf OrcaRouter an — ein API-Schlüssel, Weitergabe der Anbieterpreise ohne Aufschlag (0 %) und kein 102-GB-Download.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube