Ein Titelbild für den Artikel Qwen3.8-27B auf Ollama, das ein minimalistisches Terminalfenster mit dem Befehl 'ollama run qwen3.8:27b' und einem blinkenden Cursor zeigt, drei Badges mit den Aufschriften '18 GB Download', 'Q4_K_M Standard' und '262K Kontext' sowie die Bildunterschrift 'kostenlos ausführbar, deine Hardware'.
Guides & Insights

Qwen3.8-27B auf Ollama: Ein Befehl, vier Quants und was „kostenlos“ wirklich kostet

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Führen Sie es mit einem einzigen Befehl aus: ollama run qwen3.8:27b. Das ist die vollständige Antwort auf die Frage, um die es auf dieser Seite geht.Qwen3.8 27B — Ali​babas dichtes Modell mit 27 Milliarden Parametern, dessen Gewichte am 14. August 2026 unter Apache 2.0 freigegeben wurden — ging diese Woche in der Ollama-Bibliothek live, und der Standard-Build ist bereits ein vernünftiges 18-GB-Q4_K_M-Quant (17 GB Gewichte plus ein 931-MB-Vision-Encoder). Es läuft bei normalen Kontextlängen vollständig auf einer 24-GB-GPU, lagert auf die CPU aus, wenn Ihre Karte kleiner ist, und kostet nichts pro Token.

Alles hier ist auf den 15. August 2026 datiert. Die Spezifikationen stammen aus der Qwen3.8-27B-Modellkarte; Download-Größen, Tags und Download-Zahlen stammen von der Live-Ollama-Bibliotheksseite; die Benchmark-Zahlen wurden von Alibaba gemeldet und sind noch nicht unabhängig repliziert. Das Modell wurde vor einigen Tagen veröffentlicht, daher ist alles, was sich ändern kann, als vorläufig zu betrachten.

Der Einzeiler, der tatsächlich funktioniert

Wenn du Ollama bereits installiert hast, bist du nur zwei Wörter entfernt:

ollama run qwen3.8:27b

Ollama-Support ist in v0.32.12 angekommen — der Versionshinweis lautet schlicht: „Diese Version fügt die Unterstützung von Qwe​n 3.8 27B hinzu." Der erste Start lädt den Standard-Build herunter (ca. 18 GB, Q4_K_M) und führt dann in ein Chat-REPL, bei dem der Denkmodus standardmäßig aktiviert ist. Die Bibliotheksseite listet den Build mit den Fähigkeits-Tags „vision tools thinking 27b", woran man erkennt, dass die Vision- und Tool-Calling-Pfade in denselben Download integriert sind. Zum Zeitpunkt dieses Schreibens zeigt die Seite mehr als 40.000 Downloads und eine Tag-Liste, die bereits elf Varianten umfasst.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Zwei Varianten, nach denen Sie tatsächlich greifen werden:

• ollama run qwen3.8:27b-mlx — die Apple-Silicon-Version, gleicher 18-GB-Speicherbedarf, aber für Metal kompiliert; sie ist diejenige, die Ollamas Versionshinweis speziell optimiert „für maximale Leistung und Ausgabequalität, geeignet für wiederholte Aufgaben und Codierungsagenten.“

• ollama run qwen3.8:27b-q8_0 — ein 30-GB-8-Bit-Quant, für den Fall, dass du den VRAM hast und die Gewichte näher an voller Präzision haben möchtest.

Was Sie tatsächlich herunterladen

Der Name sagt 27B, aber die vollständige Parameteranzahl beträgt 28B: ein dichtes Sprachmodell mit 27.3B Parametern plus einen 461M-Vision-Encoder, der ihm native Bild- und Videoeingabe verleiht. Der Rest der wichtigsten Spezifikationen, direkt aus der Modellkarte:

• 64 Schichten, verborgene Größe 5,120, Vokabular 248,320.

Hybride Aufmerksamkeit: 16 vollwertige Gated-Attention-Schichten und 48 lineare Gated-DeltaNet-Schichten — ein schlank-linearer 3:1-Mix und der Grund, warum ein 27B-Modell ein natives Kontextfenster von 262.144 Token (erweiterbar auf 1M) halten kann, ohne dass der KV-Cache ein ganzes Rechenzentrum verschlingt.

• Natives Bild- und Videoverständnis — „von STEM-Diagrammen und Dokumenten bis zu stundenlangen Videos" ist Alibabas Formulierung.

• Apache 2.0. Laden Sie es herunter, modifizieren Sie es, verkaufen Sie ein Produkt darauf. Diese Lizenz ist die rechtliche Tatsache, an der die wirtschaftlichen Überlegungen des restlichen Artikels hängen.

Die Referenz in voller Präzision ist BF16, weshalb die 56-GB-Tags existieren; jedes kleinere Tag ist ein Tausch von Präzision gegen Speicherplatz, und die eigenen Benchmarks der Modellkarte sind das, wogegen du handelst.

Wähle eine Quantisierung, dann prüfe deinen VRAM, nicht umgekehrt.

Ollama gibt Ihnen elf Tags, aber die Entscheidung reduziert sich auf drei Größen.

18 GB — Q4_K_M (Standard).Passt vollständig auf eine 24-GB-Karte (RTX 4090 / 5090-Klasse) bei normalem Kontext und auf 16-GB-Karten mit teilweisem CPU-Offload — langsamer, aber es funktioniert. Das ist der Build für „Einfach ausführen.“

30 GB — Q8_0. Gewichte nahe voller Präzision, benötigt etwa 40 GB VRAM, um vollständig auf der GPU zu bleiben. Bei einem 27B solltest du bereits wissen, warum du die zusätzliche Wiedergabetreue möchtest, bevor du dafür zahlst.

56 GB — BF16. Die Referenzversion. Erfordert H100-Klasse- oder 96-GB-Hardware. Niemand führt das auf einer Consumer-GPU aus, und das ist auch gut so.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Die Zahl, über die Leute stolpern, ist der KV-Cache. Der 18-GB-Download bedeutet nicht, dass 18 GB VRAM für eine Sitzung mit 262K-Kontext ausreichen — bei langem Kontext kommen durch den Cache mehrere Gigabyte zu den Gewichten hinzu, weshalb eine 24-GB-Karte dieses Modell bei 8K–32K Kontext bequem hält, aber nicht bei 262K. Bei einer Grenzkarte reduziere den Kontext, nicht die Quantisierung.

Apple Silicon ist hier eine erstklassige Zielplattform.

Ollamas Versionshinweise zu v0.32.12 erwähnen macOS ausdrücklich. Konkret benötigt `ollama run qwen3.8:27b-mlx` etwa 18 GB einheitlichen Speicher, sodass ein Mac mit 24 GB+ das Modell vollständig auf der GPU ausführt und dabei noch Spielraum für den Kontext bleibt. Es gibt außerdem einen 32-GB-mxfp8-MLX-Tag und einen 56-GB-mlx-bf16-Tag für die 64–128-GB-Modelle. Wenn Ihr Mac mit M-Serie die Neuigkeiten zu den Desktop-Modellen verfolgt hat, ist dies das Build, auf das Sie gewartet haben.

262K auf dem Datenblatt, im Sitz weniger

Die Modellkarte listet {{1}}262.144 native Token, erweiterbar auf 1M{{/1}}; Ollamas Bibliotheksseite gibt dasselbe Fenster mit {{2}}256K{{/2}} an. Beides stimmt — {{3}}262.144 ist 256K mal 1024{{/3}} — und keines von beiden bedeutet, dass du diese Zahl in {{4}}--num-ctx{{/4}} auf einer 24-GB-Grafikkarte eingeben solltest. Der KV-Cache wächst ungefähr linear mit dem Kontext, also wirst du dich auf Consumer-Hardware bei {{5}}16K–64K{{/5}} bewegen, nicht bei {{6}}262K{{/6}}. Beginne mit der Ollama-Standardeinstellung, erhöhe {{7}}--num-ctx{{/7}} nur, wenn eine Aufgabe es tatsächlich benötigt, und denke daran, dass die {{8}}1M{{/8}}-Angabe den Erweiterungsmechanismus plus den VRAM erfordert, um ihn zu versorgen.

Was noch wackelig ist — lesen Sie dies, bevor Sie darauf wetten

Noch keine unabhängigen Benchmarks. Jede Zahl auf der Modellkarte ist Ali​babas Wort, Stand 15. August. Die behaupteten Verbesserungen gegenüber Qwen3.6-27B sind groß — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — und sie alle klingen plausibel, und keine davon wurde von einer externen Testumgebung reproduziert. Stützen Sie eine Produktionsentscheidung nicht allein auf sie.

Der Vision-Stack ist erst wenige Tage alt. Ein früher Bug-Report (ollama Issue #17753) zeigte, dass der Q4-Build die Vision-Eingaben über den Qwen3.5-Parser leitete und bei Bildern scheiterte; dies wurde innerhalb weniger Tage in PR #17755 behoben, aber der multimodale Pfad bei einem eine Woche alten Modell ist genau der Ort, an dem du testen solltest, bevor du dich darauf verlässt.

Das Standard-Build enthält MTP. Der q4_K_M-Tag ist auch das Multi-Token-Prediction-Build — schnellere Dekodierung und der Grund, warum „18 GB“ und „27B“ ohne Widerspruch nebeneinander bestehen können.

Quant-Labels können auf Apple irreführend sein.Die 18-GB-Tags „mlx“ und „nvfp4“ unterscheiden sich in der Quantisierung — NVFP4 ist ein NVIDIA-FP4-Format — bevorzugen Sie auf einem Mac daher den einfachen -mlx-Build, es sei denn, Sie benötigen speziell eine FP8/FP4-Variante für eine Blackwell-GPU.

"Free" leistet in dieser Schlagzeile eine Menge Arbeit.

Self-hosting einer 27B ist pro Token kostenlos, aber nicht kostenlos. Die ehrliche Darstellung besteht aus drei Optionen, die unterschiedliche Währungen kosten:

Betreiben Sie es selbst (Ollama). $0 pro Token, offline, unbegrenzt, privat — und die Hardware gehört Ihnen. Eine 24-GB-GPU oder ein Mac mit 18 GB+ ist eine echte Anschaffung, ebenso wie die Stromkosten und die Einrichtungszeit. Das ist die richtige Entscheidung, wenn Qwen3.8 27B zum täglichen Begleiter wird.

Eine $0-API mit Ratenlimit aufrufen. OrcaRouter stellt Qwen3.8 27B auf eigener Infrastruktur kostenlos bereit (Modell-ID qwen/qwen3.8-27b-free, $0 pro Anfrage, Ratenlimit) — da die Gewichte offen sind, gibt es keine Anbieterkosten pro Token, die weitergereicht werden müssten. Das ist die richtige Wahl, wenn du das Modell ausprobieren möchtest, ohne Hardware zu kaufen, um eine Version zu testen, die erst eine Woche alt ist.

Rufen Sie eine unbegrenzte API auf.Das gleiche Modell ohne das Rate-Limit kostet $0,33 pro Million Eingabe-Token und $2,40 pro Million Ausgabe-Token auf OrcaRouter (qwen/qwen3.8-27b, 262K Kontext, Text-, Bild- und Videoeingabe). Das ist die richtige Wahl, wenn Sie Produktionsmaßstab benötigen und keine GPU hüten möchten.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Die Mathematik, die zwischen ihnen entscheidet: Gelegentliche Nutzung rechnet sich bei $0 oder bei $0,33/$2,40 besser als zum Preis einer GPU; tägliche interaktive Nutzung ist lokal günstiger; dauerhafter Produktionsdurchsatz ist am günstigsten als API, die man nicht am Laufen halten muss. Datenschutz- und Offline-Anforderungen bringen dich ganz gleich, was die Mathematik sagt, in die erste Spalte.

Wenn diese Empfehlung falsch ist

Du brauchst wirklich 100K+ Kontext. Das Modell kann es; deine 24-GB-Grafikkarte kann es nicht. Bei echtem Long-Context ist eine 40-GB+-GPU oder eine API mit längerem Kontext kein Luxus.

Sie brauchen heute Video in der Produktion. Der Parser-Bug im Vision-Pfad wurde gerade behoben; Video in der Produktion auf einem eine Woche alten multimodalen Modell ist eine Wette, die Sie ohne Fallback nicht eingehen sollten.

Du willst Parallelität. Eine einzelne Consumer-GPU streamt jeweils eine oder zwei Generationen. Eine 27B ist keine Serving-Box.

Du bist auf CPU-only-Hardware. Ein 27B-Modell mit 4-bit auf der CPU ist eine langsame Demonstration, kein Werkzeug. Eine API ist die ehrliche Wahl, bis du eine GPU hast.

Das Fazit

Qwen3.8 27B auf Ollama ist der einfachste Weg, ein 27B-Modell der aktuellen Generation auszuführen, das bisher jemand veröffentlicht hat: ein einziger Befehl, eine Standardgröße von 18 GB, die auf eine 24-GB-Karte passt, ein erstklassiger Apple-Silicon-Build und Apache-2.0-Freiheit. Das Quant, das du wählen solltest, ist fast immer das Standard-Q4_K_M – wechsle nur zu q8_0, wenn du den Unterschied messen kannst. Und das »frei« ist an Bedingungen geknüpft: Wenn du das Modell nur gelegentlich nutzt, ist die API mit Ratenlimit für 0 $ freier, als Hardware zu kaufen; wenn es zu deinem täglichen Begleiter wird, ist die lokale Kopie das Günstigste, was du besitzt. Überprüfe die Zahlen, bevor du darauf aufbaust – alles in diesem Artikel war am 15. August 2026 wahr, und dieses Modell verändert sich täglich.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube