
Qwen3.8-27B auf Hugging Face: das offizielle Repository, was es enthält und wie man es herunterlädt
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 pro 1 Mio. Tokens · 22 tok/s
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1349 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 284 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
Qwen3.8 27B ist auf Hugging Face unter Qwen/Qwen3.8-27B, veröffentlicht von der Qwen-Organisation am 14. August 2026 unter der Apache-2.0-Lizenz. Das Repository enthält 55,6 GB an safetensors im BF16-Format, verteilt auf 18 Shards, sowie den Tokenizer, die Chat-Vorlage und die Konfiguration, die dazugehören – kostenlos herunterladbar, frei für die kommerzielle Nutzung und ohne Gebühr pro Token. Zwei Dinge sorgen oft für Verwirrung: Das offizielle Repository enthält ausschließlich safetensors, während die GGUF-Quantisierungen, die man auf Consumer-GPUs ausführt, in separaten Community-Repositories liegen; und vor der Veröffentlichung tauchten Nachahmer-Repositories auf, daher ist nur die Kopie der Qwen-Organisation echt. Dieser Artikel ist die Download-Anleitung: was im Repository enthalten ist, die drei Möglichkeiten, es herunterzuladen, und wie man überprüft, dass man die echten Gewichte erhalten hat.
Die wichtigsten Fakten, geprüft am 15. August 2026
• Repo — Qwen/Qwen3.8-27B auf Hugging Face, Herausgeber ist die Qwen-Organisation; gespiegelt bei Qwen/Qwen3.8-27B auf ModelScope.
• Veröffentlicht — die Gewichte wurden am 14. August 2026 freigegeben; die zeitzonenbezogene Berichterstattung nennt auch den 13. August, und Vorabartikel aus der Vorwoche berichteten, dass sie noch ausstehend seien.
• Lizenz — Apache 2.0: herunterladen, modifizieren und weiterverbreiten, kommerzielle Nutzung inbegriffen.
• Größe — 55,57 GB an safetensors über 18 Shards (je 2,1–3,99 GB); die Repo-Seite rundet die Gesamtgröße auf 55,6 GB.
• Modell — 27B dichte Parameter (28B inklusive Vision-Encoder), 64 Schichten, verborgene Dimension 5.120, Vokabular 248.320.
• Aufmerksamkeit — hybrid: 48 Gated-DeltaNet-Schichten (lineare Aufmerksamkeit) gegenüber 16 vollständigen Gated-Attention-Schichten, mit Multi-Token-Prädiktion trainiert — das 3:1-Verhältnis ist der Grund, warum 262,144 Token nativen Kontexts auf einem 27B-Modell laufen.
• Kontext — 262.144 Token nativ, erweiterbar auf 1.000.000 durch YaRN-RoPE-Skalierung.
• Eingabe — native Bild- und Videoinhalte neben Text; gibt Text zurück.
• Signal — 91.917 Downloads auf dem rollierenden 30-Tage-Zähler der Modellkarte, geprüft am 15. August 2026.
Alle obigen Abbildungen stammen von der Hugging-Face-Modellseite, dem Repository-Baum und der Konfiguration für Qwen3.8 27B, abgerufen am 15. August 2026. Die Benchmark-Behauptungen auf der Modellkarte (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) stammen von Alibaba; Stand heute hat kein unabhängiges Labor sie reproduziert.
Warum es herunterladen: die Frage „lokal versus API“
Offene Gewichte sind die einzige Kategorie von Modellen, bei der die Grenzkosten für die Verarbeitung eines Tokens genau das sind, was dein Strom kostet. Keine Lizenzgebühr, kein Preis pro Token, kein Ratenlimit und nichts verlässt deinen Rechner. Qwen3.8 27B ist unter Apache 2.0 lizenziert, somit ist diese Freiheit dauerhaft: Alibaba kann die Gewichte nicht zurückziehen, neu lizenzieren oder sie dir in Rechnung stellen.
Der Haken sind Hardware und Einrichtung. Die vollständigen BF16-Gewichte benötigen bei nativer Präzision eine GPU der 80-GB-Klasse, und 55,6 GB ist ein ordentlicher Download. Wenn du das Modell testen möchtest, bevor du dich darauf festlegst, ist der API-Weg schneller: Qwen3.8 27B wird über OrcaRouter zu Qwens Preisen von $0,33 pro Million Input-Tokens und $2,40 pro Million Output-Tokens ohne Aufschlag durchgereicht – und OrcaRouter bietet für dasselbe Modell auch ein Free-Tier mit Ratenlimit an, sodass ein kostenloser Smoke-Test überhaupt keinen Download benötigt. Aber die API ist eine Annehmlichkeit, keine Abhängigkeit – die Gewichte sind das Produkt, und sie sind kostenlos.
Was ist eigentlich im Repo?
Das Repo besteht nicht nur aus Gewichten. Es ist ein vollständig lauffähiges Paket: 18 Shards plus die Metadatendateien, die Transformers, vLLM und SGLang benötigen. Wenn man es von oben bis unten durchgeht:
• model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — die Gewichte, 2,1–3,99 GB pro Shard, insgesamt 55,57 GB.
• model.safetensors.index.json — ordnet jeden Tensor seinem Shard zu; das ist es, was ein Loader zuerst liest.
• config.json — die Architektur: 64 Schichten, versteckte Größe 5.120, Vokabular 248.320 und das Gated-DeltaNet-/Gated-Attention-Layout.
• tokenizer.json (12,8 MB), tokenizer_config.json, vocab.json (6,72 MB), merges.txt (3,35 MB) — der Tokenizer.
• chat_template.jinja — das Chat-Template, einschließlich des Denkblocks; llama.cpp benötigt es als Jinja-Template übergeben, sonst antwortet dir das Modell in Denk-Tags.
• preprocessor_config.json und video_preprocessor_config.json — Bild- und Videovorverarbeitung.
• crc32.txt — Prüfsummen pro Shard; damit lässt sich ein Download verifizieren, und eine beschädigte Übertragung ist kein Rätsel mehr.
• README.md (die 65-kB-Modellkarte), LICENSE (Apache 2.0), generation_config.json, .gitattributes (markiert die Gewichtsdateien als Git LFS).

Eine Konsequenz dieses Layouts ist für das unten beschriebene Fake-Repo-Problem von Bedeutung. Eine echte Kopie dieses Repos ist umfangreich und vollständig. Ein Platzhalter-Repo mit dem Namen „Qwen3.8" und nichts weiter als einer README ist kein fehlgeschlagener Download — es ist ein anderes, leeres Repository.
So laden Sie es herunter – drei Möglichkeiten
Methode eins, huggingface-cli, ist der sauberste Weg. Das Modell ist öffentlich, daher ist keine Anmeldung erforderlich; dies lädt alle 18 Shards plus die Metadaten in einen Ordner:
huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
Für eine 55,6-GB-Übertragung ist das hf_transfer-Backend eine Installation wert — es parallelisiert den Download und verkürzt die Zeit in der Regel erheblich:
pip install hf_transfer
HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
Methode zwei, git clone, liefert dir das Repository als Arbeitskopie mit Verlauf. Erfordert Git LFS:
git lfs install
git clone https://huggingface.co/Qwen/Qwen3.8-27B
Methode drei, der Browser — öffne den Datei-Tab und lade die Shards einzeln herunter. Nur sinnvoll, wenn du eine Datei brauchst (z. B. nur config.json, um die Architektur zu prüfen). Für das vollständige Repo sind es 18 manuelle Downloads plus eine Prüfsummenprüfung; nutze eine CLI.

Welche Dateien Sie tatsächlich herunterladen sollten
Das offizielle Repository enthält BF16-Safetensors — volle Präzision, 55,6 GB — das richtige Artefakt, wenn du eine GPU der 80-GB-Klasse hast oder später selbst quantisieren möchtest. Es gibt kein offizielles GGUF. Die GGUF-Builds, die auf Consumer-Karten tatsächlich genutzt werden, sind Community-Releases: Hugging Face listet 303 quantisierte Modelle, die aus dieser Basis erstellt wurden (geprüft am 15. August 2026), und die, auf die Runbooks verweisen, sind die unsloth- und lmstudio-community-Builds. Die grobe Leiter:
• BF16 safetensors — 55,6 GB, benötigt eine GPU der 80-GB-Klasse bei nativer Präzision.
• GGUF Q8_0 — etwa 29 GB, passt auf eine 48-GB-Karte.
• GGUF Q4_K_M — etwa 17 GB, die Standardwahl für 24-GB-Karten.
• GGUF 2-bit — etwa 9 GB, passt gerade noch auf 12-GB-Karten, mit sichtbarem Qualitätsverlust.
Wenn du mit einem GGUF-Build Vision nutzen möchtest, benötigst du auch die separate mmproj-Datei für den Vision-Encoder, die auf jeder Community-Karte dokumentiert ist. Für die vollständige Aufschlüsselung von Quantisierung und Laufzeit — einschließlich des llama.cpp-Chat-Template-Vorbehalts — enthält unser Runbook zum lokalen Ausführen von Qwen3.8 27B die Details.
Wie man das echte Repo von den Fakes unterscheidet
Bevor die Gewichte veröffentlicht wurden, war die Hugging-Face-Suche voller „Qwen3.8“-Repos ohne Gewichtsdateien – Platzhalter-Karten und Forks, die dort abgestellt wurden, um frühe Sucher abzufangen. Einige sind immer noch online. Die Verifikations-Checkliste:
• Prüfen Sie den Herausgeber, nicht den Namen. Das echte Repository befindet sich unter der Qwen-Organisation: Qwen/Qwen3.8-27B. Ein Repository namens Qwen3.8 27B unter einem anderen Konto ist keine offizielle Veröffentlichung, egal wie professionell es aussieht.
• Nutze die offizielle Sammlung. Qwen verwaltet huggingface.co/collections/Qwen/qwen38; jedes Repo darin gehört ihnen.
• Prüfen Sie das Lizenzfeld. Auf der echten Karte steht Apache 2.0.
• Prüfe die Größe und Form. Das echte Repo enthält 18 Safetensors-Shards mit insgesamt etwa 55,6 GB, eine crc32.txt-Prüfsummendatei und eine 65-kB-README. Keine Gewichtsdateien bedeuten ein leeres Repository, keinen fehlerhaften Download.
• Betrachte die Download-Zahl als Signal, nicht als Beweis. Das echte Repository überschritt innerhalb eines Tages 91.000 Downloads, was dir zeigt, wohin alle anderen zeigen. Aber auch eine Fälschung kann heruntergeladen werden; der Herausgeber ist die Garantie.
Nach dem Download die Integrität verifizieren: Prüfen Sie die CRC32 jedes Shards gegen crc32.txt, oder laden Sie das Modell mit Transformers und bestätigen Sie, dass der State-Dict ohne Warnungen geladen wird. Das erkennt sowohl eine fehlerhafte Übertragung als auch ein neu verpacktes falsches Modell.
Wenn das Herunterladen der falsche Schritt ist
Das Herunterladen von 55,6 GB ist nicht für jeden die richtige Wahl, und die ehrliche Version dieses Artikels sagt das unverblümt.
Sie möchten nur das Modell bewerten. Der API-Weg ist schneller — ein strukturierter Test kostet nur ein paar Cent und dauert Minuten, statt einen Download und einen Nachmittag für die Einrichtung zu benötigen.
Du hast keine GPU mit etwa 80 GB. Der BF16-Download ist das falsche Artefakt für dich. Wähle ein GGUF-Quant oder die API.
Sie benötigen verifizierte Benchmarks. Jede Schlagzeilenzahl für Qwen3.8 27B wurde von Alibaba am 15. August 2026 gemeldet. Wenn Ihre Entscheidung von Zahlen abhängt, die ein unabhängiges Labor reproduziert hat, warten Sie darauf — die Gewichte werden immer noch hier sein.
Sie bauen auf einem nur wenige Tage alten Modell auf. Die Gewichte wurden am 14. August ausgeliefert. Die heutige Modellseite von OrcaRouter zeigt für die letzten sieben Tage eine Fehlerrate von 33,3 % und eine p50-Latenz für den ersten Token von 225 ms — ein brandneues Modell unter früher Last, behandeln Sie frühe Telemetriedaten also als vorläufig. Self-Hoster sollten den heruntergeladenen Commit festpinnen und einen Fallback bereithalten; API-Nutzer sollten eine Failover-Regel als gleiche Absicherung beibehalten.

Sie möchten einen Supportvertrag. Apache 2.0 ist permissiv, aber eine Lizenz ist kein SLA. Wenn Ihre Workload Anbieter-Support benötigt, ist die gehostete API-Route der sicherere Platz.
Das Fazit
Das echte Qwen3.8 27B ist auf Hugging Face unter Qwen/Qwen3.8-27B, Apache 2.0, veröffentlicht am 14. August 2026, mit 55,6 GB an BF16-Safetensors in 18 Shards. Lade es mit huggingface-cli oder git clone herunter, verifiziere, dass der Herausgeber die Qwen-Organisation ist, und du hast ein hochmodernes 27B-Modell mit offenen Gewichten, das dir niemand wegnehmen oder in Rechnung stellen kann. Falls das mehr Aufwand ist, als dein Anwendungsfall erfordert, ist dasselbe Modell über die API nur ein paar Cent entfernt. Worauf es jedoch ankommt, sind die Gewichte — und die sind kostenlos.
