Ein Titelbild für Qwen3.8-27B mit MLX auf Apple Silicon, das ein minimalistisches Laptop-Symbol mit einem MLX-Engine-Abzeichen und einem Preisschild mit der Aufschrift „kostenlos" zeigt – auf deinem Mac.
Guides & Insights

Qwen3.8-27B mit MLX auf Apple Silicon: Ja, es läuft — Hier ist, was du wirklich brauchst

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen3.8 27B läuft heute auf Apple Silicon über MLX. Das Tag ist qwen3.8:27b-mlx in Ollama, hinzugefügt in Ollama v0.32.12, und der 4-Bit-Build lädt mit etwa 18 GB herunter und benötigt ungefähr 16–19 GB Unified Memory — was einen 24 GB+ Mac als realistische Untergrenze und einen 16 GB Mac als No-Go erscheinen lässt. Die Gewichte sind Apache 2.0, kostenlos bei der Nutzung auf Hardware, die du besitzt, was der ganze Sinn des Modells ist. Die Veröffentlichung von Ali​baba ist zwei Tage alt (13.–14. August 2026), daher ist jede Zahl unten gekennzeichnet: was aus der Modellkarte von Ali​baba stammt, was wir heute auf der Ollama-Seite verifiziert haben und was eine Drittanbieter-Projektion oder -Messung ist.

Das 30-Sekunden-Faktenblatt

Qwen3.8 27B ist Ali​babas dichtes Modell mit 27 Milliarden Parametern, veröffentlicht vom 13. bis 14. August 2026 unter Apache 2.0 — die Gewichte erschienen am 13. auf Hugging Face und ModelScope, mit der LICENSE-Datei, die am nächsten Morgen hinzukam. Es ist das einsatzbereite dichte Schwestermodell des 2,4-Billionen-Parameter-Modells Qwen3.8-Max. Laut Modellkarte stammen alle Angaben von Ali​baba und wurden noch nicht unabhängig reproduziert:

Größe — 27B dicht, 27,78B Gesamtparameter inklusive Vision-Encoder.

Architektur — 64 Ebenen, verborgene Größe 5.120, Vokabular 248.320.

Hybrid-Attention – 16 Full-Attention-Schichten plus 48 lineare Gated-DeltaNet-Schichten, ein Verhältnis von 3:1.

Kontext — 262.144 Token nativ, über YaRN auf 1M erweiterbar (Ollama listet den Tag mit 256K).

Eingabe — natives Bild- und Videoverständnis zusätzlich zu Text, von Dokumenten bis zu stundenlangen Videos.

Gewichte — 55,6 GB in BF16, inklusive MTP-Spekulations-Dekodierungskopf.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

Auf der MLX-Seite heute verifiziert: Ollama liefert qwen3.8:27b-mlx aus — einen MLX-nativen Build für Apple Silicon mit einem ~18 GB großen 4-Bit-Download — und die Versionshinweise zu v0.32.12 heben die Apple-Silicon-Optimierung hervor. mlx-lm, Apples Python-Toolchain, unterstützt die Architektur für Generierung und Konvertierung, und MLX-Quantisierungen (3/5/6-Bit, plus MXFP4 und NVFP4) erschienen innerhalb von Stunden nach den Gewichten. Der Rest dieses Artikels setzt einen M-Series-Mac mit 24 GB oder mehr Unified Memory voraus.

Was MLX am Speicher ändert

Bei Apple Silicon gibt es keinen separaten VRAM. MLX läuft auf dem einheitlichen Speicherpool der M-Serie, also ist die entscheidende Zahl der gesamte RAM in deinem Mac abzüglich dessen, was macOS und alles andere belegt. Ein Modell, das „in 17 GB passt“, benötigt einen Rechner mit deutlich mehr Speicher.

Die gute Nachricht ist, dass Qwen3.8 27B günstiger zu halten ist, als seine Parameteranzahl vermuten lässt. Da nur die 16 Full-Attention-Layer einen KV-Cache behalten — die 48 linearen Layer nicht — kostet der Cache etwa 64 KB pro Token, ungefähr ein Viertel dessen, was ein herkömmliches dichtes Modell mit 64 Layern zahlt. Am äußersten Ende benötigt das volle 262K-Fenster etwa 16,4 GB Cache zusätzlich zu den Gewichten, was ein Serverbudget ist, kein Laptop-Budget.

Die realistische Leiter für einen Mac, Dateigröße plus Cache-Spielraum:

4-bit MLX — insgesamt ~16–19 GB. Passt auf einen 24-GB-Mac mit einem Kontextfenster von etwa 64K–96K; die sinnvolle Standardeinstellung.

6-bit MLX — ~21–22 GB. Für 32-GB-Rechner; der Qualitätssprung gegenüber 4-Bit ist gering.

8-bit MLX — ~27–30 GB. Maschinen mit 48 GB+; nahezu verlustfrei.

BF16 — ca. 55,6 GB. Nur die Spitzenmodelle der M-Serie Max und Ultra Studio-Computer.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Sourcing: Die 4-Bit-Zahl folgt den gemessenen GGUF-Q4_K_M-Werten (17,1 GB, unsloth, 14. August) und dem 18-GB-Ollama-Download; die 8-Bit- und BF16-Zahlen folgen Alibabas eigener BF16-Karte und der Qwen3.6-27B-Linie. Der Cache-Wert von 64 KB pro Token leitet sich aus der Architektur ab und steht nicht auf einem Datenblatt; er gilt nur für Laufzeitumgebungen, die den KV-Cache bei den linearen Ebenen überspringen, so wie MLX es tut.

Drei Möglichkeiten, es auszuführen, von der einfachsten bis zur größten Kontrolle.

Pfad A — Ollama, der einfachste

Aktualisieren Sie auf Ollama 0.32.12 oder neuer, dann:

ollama pull qwen3.8:27b-mlx — lädt den ~18 GB MLX-Build herunter.

ollama run qwen3.8:27b-mlx — interaktiver Chat mit dem Denk-Template eingerichtet.

ollama serve — stellt die OpenAI-kompatible API auf localhost:11434 für deine Apps bereit.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Eine bekannte Schwachstelle, aus einem aktuellen GitHub-Issue zum Zeitpunkt des Schreibens: qwen3.8:27b-mlx lehnt die Rolle „developer“ am /v1/responses-Endpunkt ab, was die Ausführung von ollama launch codex für dieses Modell unterbricht — während direktes ollama run einwandfrei funktioniert. Wenn Sie eine Codex-artige Agenten-Loop auf dem MLX-Build aufbauen, testen Sie den exakten Endpunkt, den Sie verwenden möchten, bevor Sie den Loop darauf riskieren.

Pfad B — mlx-lm, die meiste Kontrolle

Apples eigenes Toolkit. Installiere es mit pip install mlx-lm, und ziehe dann entweder einen vorquantisierten MLX-Checkpoint oder konvertiere die offiziellen BF16-Gewichte selbst:

mlx_lm.generate --model <checkpoint> — einen Checkpoint direkt ausführen; Community-4-Bit- und 8-Bit-Quants des 27B landeten innerhalb von Tagen nach der Veröffentlichung in mlx-community.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — einmal konvertieren; kostet etwa einen Download.

mlx_lm.server --model <checkpoint> — OpenAI-kompatibler Server, der die Chat-Vorlage für Denkblöcke für Sie anwendet.

Wenn das gewünschte Quant noch nicht verfügbar ist, dauert die Konvertierung von den offiziellen Gewichten auf jedem Mac mit M-Serie nur kurz und beseitigt jeden Zweifel daran, was ein Drittanbieter geliefert hat.

Pfad C — LM Studio, die Ein-Klick-Lösung

LM Studio nutzt auf Apple Silicon das MLX-Backend und hat Qwen3.8 27B bei der Veröffentlichung aufgenommen: Suche nach dem Modell, wähle eine Quantisierung, die zu deinem RAM passt, und es wird heruntergeladen und ausgeführt. Wenn du eine GUI bevorzugst, ist dies der benutzerfreundlichste Weg, und unser begleitender Leitfaden deckt ihn von Anfang bis Ende ab – siehe "How to Run Qwen3.8 27B Locally" in den untenstehenden verwandten Artikeln.

Die Vorlagenfalle

Qwen3.8 27B denkt standardmäßig, und die Denkblöcke werden von der Chat-Vorlage gerendert, nicht vom Modellkern. Drittanbieter-Tests aus den ersten 48 Stunden stellen fest, dass die offizielle Vorlage jede Assistenten-Antwort in einen Denkblock verpackt — sogar leere — und dass in Multi-Turn-Agenten-Schleifen die Blöcke verschachtelt werden und der Verlauf abgeschnitten wird, was sich wie Amnesie liest. Es liegt nicht an der Quantisierung. Wenn eine Runtime eine korrigierte Vorlage mitbringt, verwende sie; wenn du eine Agenten-Schleife baust und das Reasoning nicht benötigst, deaktiviere das Denken pro Anfrage — die Chat-Vorlage stellt ein enable_thinking-Flag bereit, und das Modell akzeptiert einen reasoning_effort von xhigh, medium oder low.

Wie es sich tatsächlich anfühlt

Ein unabhängiger Test auf einem Mac mini M4 mit 32 GB einheitlichem Speicher, der den MLX-4-Bit-Build ausführt, maß ungefähr 5–6 Tokens/s Generierungsrate. Diese Zahl sollte die Erwartungen setzen: gut für interaktives Entwerfen, langes Denken und gelegentliche Agentenaufrufe; mühsam für lange Agenten-Schleifen und Batch-Jobs. Die Anekdote desselben Testers – ein mehrminütiges Nachdenken gefolgt von einer kleinen Anwendung, die richtig aussah, aber tatsächlich nicht aufging – ist eine gute Erinnerung daran, dass ein 27B auf einem Laptop ein fähiger, aber nicht unfehlbarer Assistent ist.

Die Geschwindigkeit skaliert mit der Chip-Klasse: Ein M-series Max mit mehr Speicherbandbreite und Kernen läuft deutlich schneller als der Basism4 im Mini. Aber 5–6 tok/s am Einstiegspunkt ist die ehrliche Basislinie, und Sie sollten jede Schlagzeile, die „läuft auf Apple Silicon“ behauptet, daran messen.

Der 262K-Kontext ist eine Serverfunktion.

Das native 262K-Fenster von Qwen3.8 27B ist wirklich nützlich – aber auf einem Mac wird es durch den Speicher begrenzt, nicht durch das Modell. Bei 64 KB KV-Cache pro Token kostet ein 8K-Fenster etwa 0,5 GB, 32K etwa 2 GB, 128K etwa 8 GB und die vollen 262K etwa 16,4 GB zusätzlich zu den Gewichten. Auf einer 24-GB-Maschine mit 4-Bit liegt die realistische Obergrenze bei etwa 64K–96K Token; Richtung 128K+ bedeutet eine Maschine mit 32 GB oder mehr, und das volle Fenster erfordert eine Maschine, deren Unified Memory größtenteils aus Cache besteht. Plane den Kontext, den du tatsächlich brauchst, und begrenze ihn in der Laufzeitkonfiguration – das Modell ist zufrieden, und deine Auslagerungsdatei bleibt ruhig.

Wenn Apple Silicon die falsche Antwort ist

Nimm einen anderen Weg, wenn einer dieser Punkte zu deiner Arbeitslast gehört:

• Du hast einen 8 GB oder 16 GB Mac. Der 4-Bit-Build benötigt bereits ~17 GB Unified Memory; bei weniger wird geswappt und das Modell wird unbrauchbar. Das ist der mit Abstand häufigste Fehler, und keine Quantisierungs-Tricks beheben das.

• Sie benötigen das volle 262K-Fenster oder die 1M-YaRN-Erweiterung. Dieses KV-Budget ist ein Server-Budget, kein Laptop-Budget.

• Du bedienst andere Benutzer. Ein Laptop ist ein Einzelplatz; für Mehrbenutzer-Durchsatz braucht es eine GPU-Box oder eine gehostete API.

• Sie müssen sich bei langen Agentenschleifen schnell bewegen. 5–6 Tok/s sind für einen mitlesenden Menschen in Ordnung, für einen Sub-Agenten jedoch langsam.

Die ehrliche Einordnung: Das Versprechen von Qwen3.8 27B ist, dass es auf eigener Hardware bei der Nutzung kostenlos ist — das Gegenteil eines API-Modells, das pro Token abrechnet. Genau deshalb ist es nicht im OrcaRouter-Katalog enthalten (der Katalog führt die frühere Qwen3.6/3.5-27B-Generation und die gehostete Qwe​n-API-Linie). Wir sind das falsche Werkzeug für die Free-Local-Geschichte, und genau das ist der Punkt: Wenn eine Arbeitslast einen Mac überfordert, sind die Alternativen eine GPU-Box, eine gemietete GPU oder eine gehostete Qwe​n-API — nicht ein Router, der zufällig genau dieses 27B-Modell führt.

Fazit

Qwen3.8 27B auf Apple Silicon ist real, es ist gut, und es ist eng begrenzt. Der 4-Bit-MLX-Build passt in einen Mac mit 24 GB+ Arbeitsspeicher, lässt sich in Ollama als qwen3.8:27b-mlx herunterladen, kostet nichts pro Token und ist das erste wirklich brauchbare agententaugliche Open-Source-Modell, das in einen Laptop passt. Die Kompromisse sind Geschwindigkeit (5–6 tok/s auf einem M4 mini) und Kontext (begrenzen Sie ihn deutlich unter 262K, es sei denn, Sie haben den Arbeitsspeicher). Wenn Sie einen Mac mit 24 GB+ und eine Arbeitslast haben, die ein 27B bewältigen kann, ist dies das beste kostenlose lokale Modell, das diese Woche verfügbar ist. Wenn Sie einen Mac mit 16 GB haben oder Produktionsdurchsatz benötigen, ist es das nicht – und die Alternative ist ein kostenpflichtiger Weg, was eine ganz andere Entscheidung ist.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube