Eine Hero-Titelkarte mit der Aufschrift Qwen3.8-27B mit Unsloth, mit dem Untertitel ‚lokal ausführen, quantisieren oder feinabstimmen‘, einem Terminalfenster-Symbol und Chips mit der Aufschrift ‚UD-Q4_K_XL 17.9GB‘ und ‚Studio no-config‘.
Guides & Insights

Qwen3.8-27B mit Unsloth: Lokal ausführen, quantisieren oder feinabstimmen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ja — Unsloth führt Qwen3.8 27B aus, und es ist der schnellste Weg, Ali​babas neues Apache-2.0-Modell auf Ihre eigene GPU zu bringen. Die ganze Antwort in einem Satz: Öffnen Sie Unsloth Studio, suchen Sie nach „Qwen3.8 27B", wählen Sie UD-Q4_K_XL (17.9GB) auf einer 24-GB-Karte, und chatten Sie in unter einer Minute. Hinter diesem Klick hat Unsloth in derselben Woche, in der die Gewichte erschienen (13.–14. August 2026), drei Dinge ausgeliefert: das unsloth/Qwen3.8-27B-GGUF Paket, das auf der Quantisierung von Unsloth Dynamic V3.0 (preview) basiert, volle Unterstützung in Unsloth Studio und Desktop sowie das v0.1.800-beta Release mit GGUF-Export, imatrix-Erkennung und Verbesserungen bei der VRAM-Anpassung. Unsloth feintunt das Modell ebenfalls — das Unternehmen verspricht 2× schnelleres Training mit 70% weniger VRAM. Qwen3.8 27B ist ein dichtes Vision-Language-Modell mit 27 Milliarden Parametern, dessen hybride Attention nur 16 der 64 Schichten in voller Attention hält, weshalb eine 4-Bit-Datei auf Karten passt, für die die meisten 27B-Modelle nicht ausreichen.

Zur Quellenlage: Die Modellfakten sind offiziell, vom Qwen3.8 27B-Modellblatt auf Hugging Face, geprüft am 15. August 2026. Der Unsloth-Support, die Quantisierungsgrößen, die VRAM-Anforderungen und die Installationsbefehle stammen aus Unsloths Versionshinweisen und Dokumentation, ebenfalls am selben Tag. Der API-Preis stammt live aus dem Katalog von OrcaRouter, ebenfalls am selben Tag. Unsloths Angaben „2× schneller, 70 % weniger VRAM" und „mit Abstand das stärkste Modell seiner Größe" sind Herstellerangaben und wurden nicht unabhängig reproduziert.

Was "Qwen3.8 + Unsloth" bedeutet: vier verschiedene Dinge

Unsloth besteht aus vier separaten Dingen, und die Keyword-Suchergebnisse vermischen sie. Zu wissen, welches man braucht, ist die halbe Einrichtung:

unsloth/Qwen3.8-27B-GGUF — die quantisierten Gewichtsdateien auf Hugging Face, 21 Quants plus ein Vision-Projektor. Gebaut mit Dynamic V3.0 (Vorschau), nicht mit dem älteren Dynamic 2.0 (der am 24. April 2025 angekündigt wurde und älter als dieses Modell ist). Dies ist der Weg „Datei herunterladen“, der aus jedem llama.cpp-Build verwendet werden kann.

Unsloth Studio — die Browser-App, die du installierst oder von einem Hugging Face Space aus ausführst. Durchsuche den Modell-Hub, klicke auf ein Quant, chatte mit Tools. Keine manuelle Template- oder Inferenzparameter-Konfiguration.

Unsloth Desktop – die lokale GUI-App für macOS, Windows und Linux, die Studio plus Training bündelt. Hier findet das Fine-Tuning mit „2× schneller mit 70% weniger VRAM" statt.

Die unsloth-Python-Bibliothek — from unsloth import FastLanguageModel, die QLoRA-Feintuning-API, die in Notebooks und Skripten verwendet wird.

Unsloths Versionshinweise für v0.1.800-beta mit dem Titel „Release Qwen3.8 27B“ besagen, dass {{1}}Qwen3.8 27B{{/1}} und das 2,4-Billionen-Parameter-Modell {{2}}Qwen3.8-2.4T-A95B{{/2}} {{3}}jetzt lokal in Unsloth ausgeführt werden können{{/3}}, dass die 27B-Version {{4}}mit 17 GB RAM über Unsloth Dynamic GGUFs läuft{{/4}} und dass {{5}}man Qwen3.8 27B in Unsloth auch feinabstimmen kann{{/5}}. Dieselbe Version fügt NVFP4-Quantisierungen hinzu, prüft den Speicherplatz vor GGUF-Exporten, erkennt echte GGUF-Imatrix-Unterstützung in Studio und macht die Inferenz bei GGUF mit einem einstellbaren VRAM-Limit um {{6}}bis zu 10 % schneller{{/6}}.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Wähle dein Quant nach VRAM, nicht nach Vibes.

Unsloths Speichertabelle bezieht sich auf den gesamten RAM plus VRAM (oder einheitlichen Speicher), und das ist die offizielle Richtlinie. Ein 4-Bit-Qwen3.8 27B benötigt 17–19 GB; eine 24-GB-RTX-4090, RTX-5080 oder ein Mac mit 24 GB einheitlichem Speicher ist die realistische Untergrenze für ein komfortables 4-Bit-Setup. Die drei Empfehlungen, die fast jeden abdecken:

12GB → UD-IQ2_XXS bei 9.0GBdie einzige Datei, die vollständig passt; mit sichtbarem Qualitätsverlust ist zu rechnen. Treffen Sie diese Entscheidung bewusst.

16GB → UD-Q3_K_XL bei 13.4GB — die beste 3-Bit-Datei, laut Unsloths eigenem Picker.

24GB → UD-Q4_K_XL bei 17.9GB — die empfohlene 4-Bit-Datei und die Standardantwort dieses Artikels.

48–64GB → UD-Q8_K_XL bei 31.5GB — nahezu verlustfrei auf einer Workstation oder einem Dual-GPU-Setup.

Die vollständige Quantisierungsleiter aus der Dateiliste von unsloth/Qwen3.8-27B-GGUF und Unsloths Dokumentation, beide verifiziert am 15. August 2026: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Standard-K-Quants (Q4_K_M 17,1 GB, Q8_0 29,0 GB) sind ebenfalls vorhanden, und das Paket enthält einen Vision-Projector (mmproj-BF16, 931 MB), sodass Bilder und Videos funktionieren, wenn man ihn lädt. Unsloth nennt die gesamte Leiter „Dynamic V3.0 (Preview)“ – neuer als das Dynamic 2.0, das man in älteren Artikeln sieht und das für Modelle entwickelt wurde, die über ein Jahr zuvor erschienen sind.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Führen Sie es mit Unsloth in drei Minuten aus.

Der Ein-Klick-Weg: Unter macOS oder Linux curl -fsSL https://unsloth.ai/install.sh | sh ausführen, dann unsloth studio -p 8888 starten und http://127.0.0.1:8888 öffnen. Unter Windows: irm https://unsloth.ai/install.ps1 | iex. Wenn du ganz ohne Installation auskommen willst: Unsloths Studio ist auch als Hugging Face Space veröffentlicht — öffne es im Browser, suche nach „Qwen3.8 27B“ und wähle ein Quant passend zu deinem Speicher. Das Studio stimmt die Sampling-Parameter und das Chat-Template automatisch ab, lagert bei knappem VRAM in den RAM aus und erkennt Multi-GPU-Setups — der „No-Config“-Teil ist real, und es ist der schnellste Weg, das Modell dieser Woche zum Laufen zu bringen.

Der Datei-zuerst-Ansatz, falls du bereits llama.cpp verwendest: Lade ein Quant herunter und führe es direkt aus. Dies sind Unsloths eigene Befehle, verifiziert anhand ihrer Dokumentation:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Diese Sampling-Werte sind die empfohlenen Denkmodus-Einstellungen der Modellkarte. Ersetzen Sie den --include-Glob für *UD-Q3_K_XL* auf einer 16-GB-Karte, und fügen Sie --mmproj hinzu, das auf die mmproj-BF16.gguf des Pakets verweist, falls Sie Vision benötigen. Eine Stolperfalle: llama.cpp muss ein aktueller Build sein – die Datei registriert die neue qwen35-Architektur, und alles von vor der Veröffentlichungswoche weigert sich, sie zu laden.

Feinabstimmen mit Unsloth

Fine-Tuning ist der Bereich, in dem sich Unsloth seinen Ruf verdient: Die Bibliothek verspricht 2× schnelleres Training bei 70% weniger VRAM gegenüber Standard-Transformers + PEFT, was QLoRA auf einem 27B-Modell auf einer einzelnen Consumer-Grafikkarte ermöglicht. Der Einstiegspunkt für das Fine-Tuning ist das reine unsloth/Qwen3.8-27B-Repository (safetensors, 28B-Dateiseite) statt des GGUF-Pakets. Das Standard-QLoRA-Muster von Unsloth, angewendet auf dieses Modell:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

dann eine standardmäßige trl.SFTTrainer-Schleife über deinen Datensatz. Dieses Snippet ist das Standard-QLoRA-Muster aus Unsloths Dokumentation – die Trainings-Benchmark-Behauptungen stammen von Unsloth selbst und wurden von mir nicht reproduziert – und es gelten zwei Einschränkungen: Unsloths Kernel patchen die Text-Transformer-Schichten, plane also, den Vision-Encoder separat zu behandeln, und halte das unsloth-Paket auf dem aktuellen Stand, da diese Architektur erst wenige Tage alt ist und Versionskonflikte lautstark scheitern.

Was Unsloth Studio für dich übernimmt

Ein GGUF von Hand auszuführen bedeutet, einen Drahtseilakt aus Kontextgröße, RAM-Offloading und Tool-Aufrufen zu vollführen. Studio fasst das in Standardwerte zusammen: Es dimensioniert den Kontext auf Grundlage des tatsächlich freien Speichers, entlädt untätige Vision-Modelle, um VRAM für Chat oder Training freizugeben, erkennt Multi-GPU-Layouts und richtet Websuche, Codeausführung und Agentenverbindungen (Claude Code, Codex, MCP) von Haus aus ein. Die v0.1.800-beta-Version hat auch die in der Praxis problematischen Stellen verbessert: GGUF-Exporte prüfen jetzt den Speicherplatz, bevor ein langer Merge startet, anstatt mittendrin zu scheitern. Studio erkennt, ob das zu exportierende GGUF tatsächlich imatrix unterstützt (damit man keinen Durchlauf verschwendet), und die Speicherwächter reservieren keinen GPU-Speicher mehr übermäßig. Für ein Modell, das erst drei Tage alt ist, leistet „no-config“ echte Arbeit.

Lokal kostenlos vs. API kostenpflichtig: die ehrliche Kostenrechnung

Der Kernunterschied zwischen Unsloth und einer API ist nicht die Qualität — es ist die Frage, wem die Hardware gehört. Unsloth ist der kostenlose Weg: null Grenzkosten pro Token, nichts verlässt deinen Rechner, keine Ratenlimits und volle Kontrolle über die Gewichte. Es ist nicht absolut gesehen kostenlos: Du stellst die GPU und den Strom bereit, und eine 2-Bit-Datei auf einer 12-GB-Grafikkarte ist eine beeinträchtigte Erfahrung. Qwen3.8 27B ist dicht und visionfähig, also sind 4-Bit 17,9 GB an Gewichten vor dem Kontext; die Maschine ist der Eintrittspreis.

Die API-Route existiert, weil die Gewichte unter Apache-2.0 lizenziert sind, sodass sie jeder zu nahezu null Grenzkosten hosten kann. Qwen3.8 27B ist heute im OrcaRouter-Katalog erhältlich für $0,33 pro Million Input-Token und $2,40 pro Million Output-Token, das Modell selbst gehostet auf unserer eigenen Infrastruktur – ohne durchgereichten Anbieterpreis – mit einem Kontextfenster von 262K Token sowie Text-, Bild- und Videoeingabe. Da die Gewichte offen sind, gibt es auch eine ratenbegrenzte kostenlose Stufe, die $0 pro Anfrage berechnet. Ein repräsentativer Monat mit 10 Millionen Token kostet bei einem Input-Anteil von 70 % auf der kostenpflichtigen Stufe etwa $9,51. Wenn du bereits eine 24-GB-Karte besitzt, ist lokales Hosting kostengünstiger; wenn nicht, schlägt das Mieten von Token zu diesem Preis den Kauf einer Karte für ein Nebenprojekt, und die kostenlose Stufe ist der ehrliche Weg, das Modell zu testen, bevor du dich auf Hardware festlegst.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Wenn Unsloth die falsche Antwort ist

Unsloth Studio und das GGUF-Pack sind die richtige Wahl für einen einzelnen Rechner. Sie sind die falsche Wahl, wenn:

Du besitzt eine Grafikkarte der Blackwell-RTX-50-Serie. Die unsloth/Qwen3.8-27B-NVFP4-Quants sind bei gleichem VRAM etwa 1,5× schneller als BF16 und nutzen einen FP8-KV-Cache für längeren Kontext. Dieser Weg führt über vLLM oder SGLang, nicht über GGUF und nicht über Studio.

In der Produktion benötigen Sie das volle native 262K-Fenster oder die 1M-YaRN-Erweiterung. Ein dichtes Vision-Modell bei langem Kontext ist schwer; Unsloths Kontext-Sizing läuft für Sie gerne mit kürzeren Kontexten, aber ein Serving-Stack mit ordentlichem KV-Management schlägt eine lokale App.

Sie bedienen viele Nutzer. Unsloth ist eine lokale App und eine Fine-Tuning-Bibliothek, kein Multi-Tenant-Server. Für Nebenläufigkeit, Autoscaling und Uptime-Garantien benötigen Sie einen gehosteten Endpunkt.

Du hast überhaupt keine GPU. Eine ehrliche Antwort: Ein 2-Bit-27B-Modell auf einer 12-GB-Karte ist deutlich schlechter als dasselbe Modell, das ordentlich bereitgestellt wird. Nutze zuerst die kostenlose API-Stufe; wenn das gut genug ist, kaufe Hardware, wenn der Anwendungsfall erwiesen ist.

Sie möchten die Vision-Komponente feinabstimmen. Die Beschleunigungen von Unsloth zielen auf die Text-Transformer-Ebenen ab; ein vollständiges multimodales Feintuning erfordert einen anderen Stack.

Fazit

Qwen3.8 27B mit Unsloth ist seit dieser Woche ein gelöstes Problem: Studio installieren, UD-Q4_K_XL für eine 24-GB-Karte wählen (UD-Q3_K_XL für 16 GB, UD-IQ2_XXS für 12 GB), und das Modell läuft ohne Konfiguration und ohne Abrechnung pro Token. Der Fine-Tuning-Weg ist real, und Unsloths Geschwindigkeitsangaben sind der Grund, warum 27B-QLoRA auf einer einzigen Karte praktikabel ist. Beachte: Die Quantisierungsleiter ist Dynamic V3.0 (Vorschau), nicht das Dynamic 2.0, das ältere Artikel beschreiben; halte llama.cpp aktuell; und wenn du die Hardware nicht besitzt, sind dieselben Gewichte als API für 0,33 $/2,40 $ verfügbar, mit einem kostenlosen, ratenbegrenzten Tarif – es gibt also keinen Grund, eine 2-Bit-Datei auszuführen, mit der du nicht zufrieden bist. Lokal ist der kostenlose Weg, und zum ersten Mal in dieser Gewichtsklasse ist es auch der einfache Weg.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube