
Qwen3.8-27B GGUF: Welches Quant für deine GPU herunterladen
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Laden Sie das unsloth/Qwen3.8-27B-GGUF-Paket herunter und passen Sie die Datei an die Karte an, die Sie tatsächlich besitzen. Das ist die ganze Antwort: Eine 24-GB-GPU (RTX 4090 oder 3090) sollte Q4_K_M mit 17,1 GB; eine 16-GB-GPU sollte IQ4_XS mit 15,7 GB (oder Q3_K_M mit 13,8 GB, wenn Sie Kontextspielraum möchten); eine 12-GB-GPU ist auf die 2-Bit-Dateien beschränkt, UD-IQ2_XXS mit 9,0 GB, und das ist ein Kompromiss, den man bewusst eingeht. Qwen3.8 27B – Alibabas dichtes Modell mit 27 Milliarden Parametern, Apache-2.0-Gewichte, veröffentlicht vom 13. bis 14. August 2026 – läuft lokal ungewöhnlich günstig, weil seine hybride Attention nur 16 seiner 64 Schichten zwischenspeichert, so dass eine 4-Bit-Quantisierung bei 24 GB bequem 32K–64K Token Kontext trägt. Und das GGUF ist der einzige Weg mit null Grenzkosten: kein API-Schlüssel, keine Abrechnung pro Token, keine Daten, die Ihren Rechner verlassen.
Zur Quellenlage: Architektur, Kontextfenster und Lizenz sind offiziell und stammen vom Qwen3.8-27B-Modellblatt auf Hugging Face, verifiziert am 15. August 2026. Die GGUF-Größen stammen vom selben Tag aus den GGUF-Repositorys von unsloth und ggml-org. Die VRAM-Empfehlung pro GPU ist die offizielle Empfehlung von unsloth. Die Byte-Schätzungen für den KV-Cache und die Tokens-pro-Sekunde-Werte wurden in den ersten Tagen nach der Veröffentlichung von der Community gemessen, nicht vom Anbieter spezifiziert. Jede unten genannte Benchmark stammt von Alibaba und wurde nicht unabhängig reproduziert.
Der Dateiauswähler, eine Zeile pro Quant
• UD-IQ2_XXS — 9,0 GB — die einzige komfortable Lösung für eine 12-GB-Karte; mit sichtbarem Qualitätsverlust ist zu rechnen.
• UD-Q2_K_XL — 10.7GB — 12GB-Karten, mit fast keinem Kontext mehr übrig.
• Q3_K_M — 13.8GB — für 16GB-Karten, die Kontext-Spielraum möchten.
• IQ4_XS — 15,7 GB — 16-GB-Karten: die größte Quantisierung, die vollständig hineinpasst.
• Q4_K_M — 17,1 GB — 24-GB-Karten: der Sweet Spot und die Datei, auf die dieser Artikel verweist.
• Q5_K_M — 19.8GB — 24GB, tauscht Kontextspielraum gegen einen kleinen Qualitätsgewinn ein.
• Q6_K — 22,9 GB — passt in 24 GB, wenn man es quetscht; nahezu verlustfrei.
• Q8_0 — 29,0 GB — 32 GB, eine Aufteilung auf zwei Karten oder CPU-Offload.
• BF16 — 54.7GB — Serverkarten und RAM-intensive CPU-Setups; Referenzpräzision.
Zwei Pakete, zwei Q4_K_M-Größen: unsloths ist 17,1 GB; ggml-orgs ist 19,0 GB. Das unsloth-Paket verwendet die Vorschau-Quantisierung Dynamic V3.0 für seine UD-*-Dateien und ist das, auf das die meisten lokalen Apps standardmäßig zugreifen; das ggml-org-Paket wird mit den Standard-K-Quants plus dem separaten Multi-Token-Prediction-Head ausgeliefert, der für spekulatives Dekodieren verwendet wird. Beide Q4_K_M-Varianten funktionieren — der Unterschied liegt bei ein paar hundert Megabyte und der MTP-Datei.

Warum diese 27B auf Karten passt, die kleiner sind als die meisten
Qwen3.8 27B hat 64 Schichten, aber nur 16 verwenden vollständige Aufmerksamkeit. Die anderen 48 verwenden Gated-DeltaNet-Linearattention, die einen rekurrenten Zustand fester Größe anstelle eines wachsenden Key-Value-Caches beibehält. Das Blocklayout der Modellkarte selbst ist 3×(Gated DeltaNet → FFN) für jedes 1×(Gated Attention → FFN) – ein 3:1-Hybridverhältnis. Der praktische Effekt: Der KV-Cache ist etwa ein Viertel dessen, was ein herkömmliches 27B-Dichtemodell für denselben Kontext benötigt. Messungen der Community diese Woche beziffern den Cache auf etwa 0,5 GB bei 8K-Kontext, 2,0 GB bei 32K und 16,4 GB beim vollen nativen 262K-Fenster. Das kehrt die übliche Empfehlung um – der Großteil deines VRAM-Budgets fließt in die Gewichte, nicht in den Kontext, und eine 24-GB-Karte kann Q4_K_M mit 64K–96K-Kontext mühelos ausführen. Du kannst den Cache weiter verkleinern mit dem --cache-type-k-Flag von llama.cpp, das den Cache selbst quantisiert.

Drei Stolperfallen, die dir am ersten Tag ein Bein stellen werden.
• Alte llama.cpp-Builds lehnen die Datei ab.Die GGUF-Datei registriert die neue qwen35-Architektur, daher benötigst du einen aktuellen Build – jeder Build von vor der Veröffentlichungswoche weigert sich, sie zu laden, und wirft einen Architekturfehler. Aktualisiere zuerst llama.cpp, bevor du herunterlädst.
• Die Vorlagenfalle.Die offizielle Jinja-Chatvorlage verpackt jede Assistentenantwort in einen Denkblock, selbst wenn die Denkspur leer ist, was bei Chats mit mehreren Runden zu verschachtelten Blöcken und abgeschnittenem Verlauf führt — es sieht so aus, als hätte das Modell vergessen, was du gesagt hast. Führe llama.cpp mit --jinja aus und bevorzuge ein Paket, das eine korrigierte chat_template.jinja mitliefert.
• Vision benötigt eine separate Datei. Text funktioniert ohne zusätzliche Einrichtung; Bilder und Videos bewirken stillschweigend nichts, es sei denn, du lädst auch den mmproj-Projektor, etwa 0,9 GB. Er ist nicht auf der GGUF-Repo-Seite von unsloth aufgeführt — lade ihn aus dem Basis-Repository oder dem ggml-org-Paket. Wenn du Dokumente oder Screenshots verarbeiten möchtest, füge --mmproj zum Serverbefehl hinzu.
Führe es aus: die Befehle
llama.cpp, sobald Sie einen aktuellen Build haben:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...und füge --mmproj Qwen3.8-27B-mmproj-bf16.gguf hinzu, wenn du Vision benötigst.
Ollama, wenn du den Bibliothekseintrag möchtest: ollama pull qwen3.8:27b, dann ollama run qwen3.8:27b. LM Studio und Unsloth Desktop übernehmen die Chat-Vorlage und die RAM-Auslagerung automatisch – sie sind der unkomplizierteste Weg für den ersten Start.
Lokal vs. API: die ehrliche Kostenwahrheit
Der GGUF ist der kostenlose Weg: null Grenzkosten, keine Ratenlimits, nichts verlässt Ihren Rechner. In absoluten Zahlen ist er nicht der billige Weg — Sie stellen die 24-GB-GPU bereit (eine gebrauchte RTX 3090 oder eine neue RTX 4090, plus Strom), und eine 2-Bit-Datei auf einer 12-GB-Karte ist eine beeinträchtigte Erfahrung.
Der API-Weg existiert, weil die Gewichte unter Apache 2.0 lizenziert sind, sodass die Grenzkosten für die Bereitstellung nahezu null sind und jeder hosten kann. Qwen3.8 27B ist heute auf OrcaRouter live zu $0,33 pro Million Input-Token und $2,40 pro Million Output – der Listenpreis des Anbieters ohne Aufschlag – und da die Gewichte offen sind, gibt es auch einen ratenbegrenzten kostenlosen Tarif, der $0 pro Anfrage verlangt und HTTP 429 zurückgibt, wenn man sein Limit überschreitet. Ein repräsentativer Monat mit 10 Millionen Token bei 70 % Input-Anteil kostet auf dem bezahlten Tarif etwa $9,51. Wenn man die GPU bereits besitzt, gewinnt lokal beim Preis; wenn nicht, ist das Mieten der Token besser, als für ein Nebenprojekt eine Karte zu kaufen.

Wenn diese Empfehlung falsch ist
Q4_K_M auf 24GB ist der Standard, nicht die universelle Antwort. Wähle etwas anderes, wenn:
• Sie benötigen maximale Qualität auf einem Server oder einer Workstation — Q8_0 bei 29 GB oder BF16 bei 54,7 GB mit CPU- und RAM-Auslagerung, keine 4-Bit-Datei.
• Du verwendest eine Grafikkarte der Blackwell-RTX-50-Serie – die NVFP4-Variante ist bei gleichen 24 GB VRAM etwa 1,5× schneller und nutzt einen FP8-KV-Cache für längeren Kontext. Auf einer 5090 schlägt NVFP4 jedes GGUF bei diesem Modell.
• Du benötigst den vollen 262K-Kontext — kalkuliere mit einem Cache von etwa 16 GB zusätzlich zu den Gewichten; das bringt eine 24-GB-Karte auf Q3_K_M herunter oder erzwingt KV-Quantisierung.
• Sie verlassen sich auf spekulative Dekodierung — wählen Sie das ggml-org-Paket, das den Multi-Token-Vorhersagekopf beibehält; einige Quants entfernen ihn, um etwa 0,5 GB einzusparen.
• Du hast nur 12GB — eine ehrliche Antwort: ein 2-Bit-27B ist deutlich schlechter als dasselbe Modell, das richtig betrieben wird. Probier den kostenlosen API-Tarif aus, bevor du dich auf ein lokales 2-Bit-Setup festlegst; wenn er gut genug ist, kann das GGUF warten, bis die Hardware aufholt.
Fazit
Qwen3.8 27B ist das seltene 27B-Modell, das ohne Kompromisse auf eine 24-GB-Grafikkarte passt: ein 17,1-GB-Q4_K_M-Download, ein aktueller llama.cpp-Build und ein KV-Cache, der so günstig ist, dass langer Kontext fast nichts kostet. Lade diese Datei herunter, wenn du die Hardware besitzt, denke daran, dass Vision das separate mmproj benötigt, und erwarte die Template-Falle, wenn ein Multi-Turn-Gespräch zum ersten Mal vergesslich wirkt. Wenn du die Hardware nicht besitzt, ist dasselbe Modell eine API für 0,33 $/2,40 $ mit einem kostenlosen, ratenbegrenzten Tarif, also gibt es keinen Grund, eine 2-Bit-Datei auszuführen, mit der du nicht zufrieden bist. Das GGUF ist der kostenlose Weg; es ist nur nicht mehr der einzige Weg.
