Eine Titelkarte mit der Aufschrift „Qwen3.8-27B", dem Untertitel „Offene Gewichte kommen diese Woche", Eyebrow-Text „Alibaba Qwen – Was wir bisher wissen" und einer Datumszeile „Woche vom 10. August 2026" neben einem Open-Box-Icon und einem Kalender-Icon.
Guides & Insights

Qwen3.8-27B Offene Gewichte: Max wurde ausgeliefert, die 27B nicht — Was wir jetzt wissen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 13. August 2026 teilte sich die von Alibaba für seine Qwe​n3.8-Generation versprochene Open-Weights-Woche in zwei Teile. Die Gewichte des Max-Klasse-Flaggschiffs — Qwen3.8-2.4T-A95B, ein sparsames Mixture-of-Experts-Modell mit 2,4 Billionen Parametern und die erste jemals zum Download bereitgestellte Max-Level-Q​wen-Veröffentlichung — erschienen tatsächlich auf Hugging Face und ModelScope, nachdem sie spät in der vorherigen Nacht über die ModelScope-Community angekündigt worden waren. Das kleinere Modell, um das es auf dieser Seite geht, Qwen3.8-27B, tat es nicht: Obwohl es für dieselbe Woche des 10. August angekündigt war, hat es immer noch kein offizielles Repository, keine Model Card, keine Lizenzdatei und keinen eigenen Benchmark, und Drittanbieter-Tracker beschreiben die Veröffentlichung inzwischen als verzögert, ohne ein neues Datum zu nennen. Die Frage, die diese Was-wir-bisher-wissen-Seite beantworten sollte — „Wann erscheint die 27B tatsächlich?“ — ist zu zwei Fragen geworden: Warum wurden zuerst die Gewichte des Max veröffentlicht, und was ist mit der 27B passiert?

Dies bleibt ein Artikel über den aktuellen Wissensstand, keine Rezension. Qwen3.8-Max, das API-Flaggschiff, ist seit dem 3. August zu $2/$6 pro Million Tokens verfügbar; die zugrunde liegende Open-Weights-Basis, Qwen3.8-2.4T-A95B, wurde am 13. August zum Download freigegeben; und die Qwen3.8-27B-Gewichte sind weiterhin unveröffentlicht. Jede Behauptung unten ist entsprechend als bestätigt, vom Anbieter gemeldet oder von der Community geschätzt gekennzeichnet.

Das Signal und was die Woche tatsächlich geliefert hat

Das erste Signal war ein Beitrag auf X von @kimmonismus, der die „nächste Woche“ als die Woche hervorhob, die man im Auge behalten sollte: „Q​wen-3.8 27b - Grok 4.6“, wobei Astra auffällig auf der Liste fehlte. Die Grok-Hälfte dieser Woche wurde am 12. August ausgeliefert. Die Q​wen-Hälfte teilte sich in zwei Teile. Was der Beitrag widerspiegelte, war die Stimmung unter den Menschen, die Modellveröffentlichungen beruflich verfolgen – das Qwe​n3.8-Open-Weights-Release war das Ereignis im Kalender, und die Woche begann, ohne dass die Einzelheiten feststanden. Eine Woche später haben sich die Einzelheiten teilweise geklärt: Eines der beiden versprochenen Open-Weights-Releases ist erschienen, und es war nicht das, was der Beitrag nannte.

Was ist bestätigt?

• Die Familie ist real und offiziell angekündigt. Alibaba stellte die Qwen3.8-Basismodellfamilie am 3. August 2026 vor, nach einer Vorschauversion Mitte Juli.

• Qwen3.8-Max wurde am selben Tag veröffentlicht. Das API-Flaggschiff – ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, rund 95B aktiven Parametern, einem Kontextfenster von 1M Token sowie Text-, Bild- und Videoeingabe – ging auf der Q​wen API zu $2/$6 pro Million Token live. Es ist auch über OrcaRouter zum gleichen Listenpreis erhältlich, ohne Aufschlag weitergegeben.

• Die Open-Weights von Max wurden am 13. August veröffentlicht. Qwen3.8-2.4T-A95B — das Basismodell, auf dem die Qwen3.8-Max-API basiert — wurde auf Hugging Face und ModelScope zum Download freigegeben, zusammen mit einer FP8-quantisierten Version. Dies ist die erste Open-Weights-Veröffentlichung von Q​wen auf Max-Ebene überhaupt. Das herunterladbare Modell ist rein textbasiert, hat einen fest aktivierten Denkmodus, einen nativen 256K-Token-Kontext, der auf etwa 1M erweiterbar ist, und lässt sich mit SGLang, vLLM und TokenSpeed einsetzen.

• Qwen3.8-27B ist das kleinere Open-Weight-Modell der Familie — noch nicht veröffentlicht. Alibaba positionierte es als den realistischen Weg für lokale und On-Premise-Bereitstellung und verpflichtete sich, seine Gewichte zusammen mit denen des Max auf Hugging Face und ModelScope bereitzustellen. Stand 13. August gibt es immer noch kein offizielles Qwen3.8-27B-Repository. Die Zusage war echt; die Lieferung ist noch nicht erfolgt.

• Der erste unabhängige Score für die Generation liegt vor.Artificial Analysis bewertet Qwen3.8-Max mit einem Intelligenzindex von 56 bei etwa 1,14 $ pro Aufgabe — wirklich gut, mit den Einschränkungen, die jedes erst wenige Tage alte Flaggschiff mit sich bringt.

Was wir tatsächlich über die 27B wissen

Die ehrliche Zusammenfassung lautet, dass „Qwen3.8-27B" nach wie vor hauptsächlich ein Name und eine Parameterzahl ist. Die bestätigten Fakten sind, dass es sich um ein Modell mit etwa 27 Milliarden Parametern handelt, dass es das Mitglied mit offenen Gewichten der Qwe​n3.8-Generation ist und dass es für Einzel-GPU- und On-Premise-Arbeit ausgelegt ist und nicht für einen Cluster mit mehreren hundert GPUs. Daniel Han von Unsloth berichtet, dass es bei der Veröffentlichung in etwa 17 GB VRAM passen sollte – eine einzelne Prosumer-Karte.

Alles andere ist unbestätigt. Alibaba hat weder veröffentlicht, ob es sich bei dem 27B um ein dichtes Modell oder ein Mixture-of-Experts-Modell handelt, noch dessen Kontextfenster, welche Modalitäten es akzeptiert, oder eigene Benchmark-Ergebnisse. Was sich diese Woche geändert hat, ist das Timing: Das Max und das 27B wurden für dieselbe Woche versprochen, und nur das Max ist erschienen. Drittanbieter-Tracker melden nun, dass sich das 27B ohne neues Datum verzögert – eine Interpretation der Community, keine offizielle Aussage von Alibaba, und es ist möglich, dass das Repository noch vor Ablauf der versprochenen Woche erscheint. Aber zum Zeitpunkt dieses Schreibens listet die offizielle Q​wen-Organisation auf Hugging Face kein Qwen3.8-27B, und die Handvoll „Qwen3.8-27B-FP8“-, „-GGUF“- und „-MLX“-Repositories, die in der Suche auftauchen, sind Community-Platzhalterkarten mit Download-Zahlen im einstelligen Bereich, nicht die offizielle Veröffentlichung.

Der nützliche Referenzpunkt ist immer noch die 27B der vorherigen Generation: Qwen3.5-27B, ein Open-Weight-Dense-Modell mit einem 32K-Kontextfenster. Es ist eine vernünftige Untergrenze dafür, was die Qwen3.8-27B übertreffen muss, und eine Erinnerung daran, dass Modelle der 27B-Klasse von Q​wen historisch darauf ausgelegt waren, auf Hardware zu laufen, die ein Entwickler tatsächlich besitzt.

Der Max ist der Referenzpunkt dafür, was die 27B erben könnte.

A comparison scoreboard for Qwen3.8-Max and Qwen3.8-27B, contrasting the Max's 2.4T MoE total parameters, ~95B active params, 1M-token context, / pricing and AA Index 56 with the 27B's ~27B params, TBD context, TBD architecture, self-host and no independent score yet.

Das 27B wird nicht an die rohe Obergrenze des Max heranreichen, aber die Zahlen des Max – jetzt in einer echten Modellkarte veröffentlicht – setzen die Erwartungen dafür, wie die Verbesserungen dieser Generation aussehen. In Alibabas eigenen Bewertungen des Open-Weights-Modells erreicht Qwen3.8-2.4T-A95B 93,0 bei PaperBench, 86,1 bei OSworld-Verified, 91,5 beim parametrischen CAD, 67,7 bei SWE-bench Pro und 86,6 bei Terminal-Bench 2.1, wobei der Anbieter Parität mit Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol und Gemini 3.1 Pro beansprucht. Dies sind vom Anbieter gemeldete Zahlen, die im Release-Material veröffentlicht und noch nicht von einem unabhängigen Labor reproduziert wurden. Der agentische Zugewinn, den der API-Start behauptete – FrontierSWE steigt in einer einzigen Generation von 40,7 auf 73,5 – findet sich im selben Release-Material wieder. Wenn auch nur ein Teil dieser Verbesserung auf eine 27B übertragen wird, würde das neu definieren, was „gutes lokales Codierungsmodell“ in ihrer Klasse bedeutet.

Eine wichtige Nuance, die man im Hinterkopf behalten sollte: Das herunterladbare Max ist nicht identisch mit dem API Max. Qwen3.8-2.4T-A95B ist rein textbasiert mit erzwungenermaßen aktiviertem Denkmodus, während die Qwen3.8-Max-API Vision-Eingabe, einen Nicht-Denkmodus und einen Standard-Kontext von 1 Million Token hinzufügt. Genau diese Art von Lücke wird ein 27B-Modell wahrscheinlich erben – und das sollte man bedenken, wenn man Schlagzeilen über Benchmarks von „Qwe​n3.8“ liest, ohne zu prüfen, welche Variante sie beschreiben.

Der Preis ist der Punkt, an dem das Max am besten vertretbar ist: 2/6 US-Dollar pro Million Token über den gesamten 1M-Token-Kontext in der API, ohne Aufschlag für lange Prompts. Das ist aggressiv für eine Frontier-API, und es ist wichtig für die Routing-Berechnung – bei diesen Zahlen wird die 3.8-Generation eine Option für Workloads, die früher standardmäßig auf teurere Flaggschiffe zurückgriffen.

Was kann es tatsächlich ausführen?

A hardware reality-check card for Qwen3.8-27B showing community-projected VRAM requirements: Q4_K_M ~16GB, Q3_K_M ~13GB, Q6_K ~21GB, FP8 ~27GB, full precision H100 80GB, with a footer noting these are community projections based on Qwen 3.6-27B quant sizes.

Für die 27B hat Alibaba noch immer keine Hardware-Anforderungen veröffentlicht, daher bleiben die im Umlauf befindlichen Zahlen Gemeinschaftsprojektionen, die auf der Qwen 3.6-27B-Quant-Tabelle basieren — Schätzungen, keine Spezifikationen. Die Arbeitsbereiche, um die die meisten Menschen ihre Planung herum aufbauen, sind unverändert:

• Q4_K_M quant, ~16GB VRAM — eine RTX 4090 oder ein gleichwertiges Modell, der Sweet Spot, auf den die meisten lokalen Entwickler abzielen werden.

• Q3_K_M quant, ~13GB VRAM — passt auf eine 12GB-Karte wie die RTX 3060 bei reduzierter Qualität.

• Q6_K quant, ~21GB VRAM — nahezu verlustfrei auf 24GB-Karten.

• FP8-Serving, ~27 GB VRAM — eine einzelne L40S, wie zuvor prognostiziert, für produktionsreife Inferenz.

• Volle Präzision, H100 80GB — der Weg zu Benchmark-Qualität, und nichts, was die meisten Teams ausführen werden.

Die neue Wendung ist, dass „man die Qwe​n3.8-Generation jetzt selbst hosten kann“ zwar stimmt, aber nicht für das Modell, mit dem die Leute geplant hatten. Die offenen Gewichte des Max gehören in eine völlig andere Hardware-Klasse: Das BF16-Modell in voller Präzision umfasst grob 4,9 TB, und Unsloths 1-Bit-Schicht-für-Schicht-selektive Quantisierung bringt es auf etwa 397 GB – lauffähig, aber nur mit 410 GB oder mehr an kombinierter RAM- und VRAM-Kapazität. Das ist ernsthafte Infrastruktur, keine Prosumer-Karte. Genau diese Lücke soll die 27B schließen, was das anhaltende Fehlen der 27B zum Grund dafür macht, dass es für diese Generation noch keinen lokalen Pfad mit einer einzelnen GPU gibt.

Die Lizenzfrage: Der Max hat gerade den Präzedenzfall gesetzt.

Die Lizenzfrage für die 27B ist weiterhin unbeantwortet, aber „wie würde es aussehen“ ist keine Vermutung mehr. Die offenen Gewichte des Max wurden unter einer benutzerdefinierten Lizenz mit der Bezeichnung „qwen3.8-max“ veröffentlicht – nicht unter Apache 2.0. Wie aus der Modellkarte hervorgeht, ist sie grundsätzlich für kommerzielle Nutzung und Hosting kostenlos, löst aber in großem Maßstab zusätzliche Anforderungen aus: Produkte mit mehr als 100 Millionen monatlich aktiven Nutzern oder mehr als 20 Millionen US-Dollar monatlichem Umsatz müssen den Modellnamen anzeigen, und Unternehmen mit mehr als 50 Millionen US-Dollar Jahresumsatz, die Model-as-a-Service- oder KI-Arbeitsassistent-Dienste anbieten, benötigen eine separate Lizenzierung. Eine kursierende Behauptung, die Lizenz verbiete die Nutzung in den USA, der EU, dem Vereinigten Königreich und Korea, ist falsch – die Lizenz enthält keine territorialen Beschränkungen.

Speziell für die 27B wurde keine Lizenz genannt. Aber das Max wurde unter einer benutzerdefinierten Q​wen-Lizenz ausgeliefert und nicht unter Apache 2.0, was Apache 2.0 auch für das Schwestermodell zu einer schwachen Annahme macht. Die alte Tongyi-Qianwen-Lizenz – mit ihrer 100-Millionen-MAU-Klausel – ist nicht das, was das Max bekommen hat; das Max hat eine neue, nach Maßstäben gestufte Lizenz. Lies die LICENSE-Datei im tatsächlichen Repository, bevor du deine Pläne darauf aufbaust, und erwarte, dass die Lizenz der 27B erst festgelegt wird, wenn ihr Repository veröffentlicht wird.

Toolchain-Timing: Day-one-Support wurde gerade unter Beweis gestellt.

Die Serving-Engines waren so schnell wie erwartet — für das Modell, das ausgeliefert wurde. Qwen3.8-2.4T-A95B startete mit funktionierendem Support in SGLang, vLLM und TokenSpeed, und genau das bedeutet „per API fast sofort verfügbar“ bei einer großen Open-Weights-Veröffentlichung. Für die 27B sind dieselben Engines die wahrscheinlichsten First Mover, sobald ihr Repository erscheint, und die Day-one-Abdeckung der Max macht es zur vernünftigen Erwartung, dass die 27B diesen Support erbt. Community-GGUF- und AWQ-Quantisierungen hinken typischerweise immer noch ein bis zwei Wochen hinterher, daher wird das Ollama-artige „Pull and Run“-Erlebnis am Veröffentlichungstag der 27B wahrscheinlich weiterhin nicht existieren — eine manuelle vLLM- oder llama.cpp-Einrichtung ist zunächst der wahrscheinlichste lokale Weg.

Was ist noch unbekannt?

Ein ehrlicher Leak-Artikel bleibt bei dem stehen, was tatsächlich öffentlich ist, und die Grenze ist in der einen Richtung weiter als vor einer Woche und in einer anderen enger: Die Fragen von Max wurden beantwortet, die der 27B nicht.

• Der neue Veröffentlichungstermin. „Die Woche vom 10. August“ war die Zusage; die Woche ist fast vorbei und das Repo ist nicht erschienen. Drittanbieter-Tracker melden eine Verzögerung ohne neues Datum, aber Alibaba hat keine offizielle Stellungnahme abgegeben.

• Architektur. Dense oder MoE für die 27B, und falls MoE, die Anzahl der aktiven Parameter.

• Das Datenblatt.Kontextfenster, Modalitäten, Ausgabelimits, Reasoning-Modus.

• Benchmarks. Die 27B hat keine offiziellen Ergebnisse und keine unabhängige Bewertung.

• Die Lizenz. Noch unentschieden, bis das Repository der 27B veröffentlicht wird; die eigene Lizenz von Max ist der Präzedenzfall, vor dem man auf der Hut sein sollte.

• Spiegelrisiko.Das Platzhalterproblem ist jetzt in freier Wildbahn sichtbar — Community-Karten für „Qwen3.8-27B-FP8", „-GGUF" und „-MLX" existieren ohne offizielle Dateien. Bis die offizielle Q​wen-Organisation das Repository veröffentlicht, lade nur von der offiziellen Organisationsseite herunter.

Was es für Entwickler bedeutet

Die praktische Aufteilung für die Qwe​n3.8-Generation ist jetzt dreigeteilt statt zweiteilig. Wenn du heute die Frontier-API möchtest, ist Qwen3.8-Max über OrcaRouter live, zum Listenpreis des Anbieters von 2 $/6 $, ohne Aufschlag durchgereicht – der Preis, den du siehst, ist der Preis, den Alibaba festgelegt hat. Wenn du das Modell der Max-Klasse selbst hosten möchtest, sind die offenen Gewichte jetzt herunterladbar, aber du brauchst die Hardware für ein Modell in voller Präzision von etwa 4,9 TB oder ein quantisiertes Modell von etwa 397 GB. Und wenn du die Einzel-GPU-Bereitstellung vor Ort erwartest, die diese Generation bieten sollte, wartest du immer noch auf Qwen3.8-27B, das noch nicht veröffentlicht wurde. Ein OpenAI-kompatibler Schlüssel deckt heute die API-Seite ab, und sobald das Hosting der 27B geklärt ist, kann derselbe Schlüssel dorthin geroutet werden.

Screenshot of the OrcaRouter model page for Qwen3.8-Max, showing model id qwen/qwen3.8-max, .00/1M input token pricing, a 1M-token context window, and an OpenAI-compatible Python code sample.

Dieser letzte Punkt ist der allgemeinere, und genau dafür ist eine unbewiesene, verspätete Open-Weight-Veröffentlichung der Testfall. Ein Modell, das noch nicht einmal ausgeliefert wurde, hat keine Erfolgsbilanz, keine unabhängige Benchmark-Suite und keine Vorfallhistorie – und wenn es schließlich erscheint, wird es brandneu sein. Routing ist die Möglichkeit, es auszuprobieren, ohne einen kundenorientierten Pfad darauf zu verwetten: Man schickt ihm den Datenverkehr, der Überraschungen verkraften kann, wechselt bei Fehlverhalten automatisch auf ein bewährtes Modell und stellt die gesamte Arbeitslast um, sobald es sich Vertrauen verdient hat. Die Routing-Ebene ist auch das, was die Preisrechnung ehrlich macht – wenn Alibaba den Preis eines Modells senkt, das man über einen Endpunkt aufruft, ist die Änderung noch am selben Tag wirksam, weil der Listenpreis direkt durchgereicht wird.

Was zu sehen

• Ob das Repo der 27B überhaupt erscheint. Eine Auflistung unter der offiziellen Q​wen-Organisation auf Hugging Face oder ModelScope ist das Ereignis, das die Verzögerung beendet — und die Woche des 10. August ist fast vorbei, ohne dass eine erschienen ist.

• Die Lizenzdatei der 27B.Das Max wurde mit einer benutzerdefinierten, skalierungsgestuften Lizenz ausgeliefert, nicht mit Apache 2.0. Ob die 27B diesem Präzedenzfall folgt, ist die folgenreichste Aussage ihrer letztendlichen Ankündigung.

• Architektur und Kontextlänge. Dense-vs-MoE und das Kontextfenster entscheiden, wofür die 27B gedacht ist.

• Der erste unabhängige Benchmark. Die 56 Punkte des Max auf dem Artificial Analysis Intelligence Index setzten die Messlatte; die erste externe Bewertung des 27B wird zeigen, wie viel von den Leistungssteigerungen der Generation bei Consumer-Größe erhalten bleibt.

• Toolchain-Abdeckung. Ob die 27B die SGLang/vLLM/TokenSpeed-Unterstützung des Max ab dem ersten Tag erbt und wie schnell Community-Quantisierungen folgen.

FAQ

Wurde Qwen3.8-27B bereits veröffentlicht?

Nein. Alibaba hat es am 3. August 2026 angekündigt und zugesagt, die Gewichte in der Woche vom 10. August auf Hugging Face und ModelScope zu veröffentlichen. Doch Stand 13. August gibt es kein offizielles Qwen3.8-27B-Repository, keine Modellkarte und keine Lizenz. Die Open-Weights der Max-Klasse — Qwen3.8-2.4T-A95B — wurden am 13. August veröffentlicht; die 27B-Variante nicht, und Drittanbieter-Tracker melden, dass sie sich ohne neues Datum verzögert hat.

Welche Hardware benötige ich, um Qwen3.8-27B auszuführen?

Unbestätigt, aber die Community-Projektionen auf Basis der Qwen-3.6-27B-Quantisierungstabelle gehen davon aus, dass ein Q4_K_M-Quant etwa 16 GB VRAM benötigt (eine RTX 4090), ein Q3_K_M-Quant etwa 13 GB (12-GB-Karten), ein Q6_K-Quant etwa 21 GB (24-GB-Karten) und FP8-Serving etwa 27 GB (eine einzelne L40S). Daniel Han von Unsloth berichtet von etwa 17 GB bei Release. Behandelt diese Angaben als Schätzungen, bis die offizielle Modellkarte Hardware-Empfehlungen veröffentlicht.

Ist Qwen3.8-27B über OrcaRouter verfügbar?

Noch nicht. Qwen3.8-27B ist ein Open-Weight-Modell zum Selbsthosten und steht heute noch nicht auf der Plattform. Das Flaggschiff derselben Familie – Qwen3.8-Max – ist jetzt über OrcaRouter zum Listenpreis des Anbieters von 2 $/6 $ pro Million Tokens mit 0 % Aufschlag verfügbar, und sobald sich das Hosting der 27B stabilisiert hat, kann es zu demselben OpenAI-kompatiblen Schlüssel hinzugefügt werden.

Sollte ich auf Qwen3.8-27B warten oder heute Qwen3.8-Max verwenden?

Es hängt davon ab, wo die Workload läuft. Wenn Sie jetzt eine Frontier-API benötigen, ist Qwen3.8-Max verfügbar und mit $2/$6 pro Million Tokens aggressiv bepreist. Wenn Sie die Max-Klasse heute selbst hosten möchten, ist Qwen3.8-2.4T-A95B jetzt herunterladbar, benötigt aber ernsthafte Hardware – etwa ein 4,9-TB-Modell in voller Präzision oder rund 397 GB quantisiert, mit über 410 GB kombiniertem RAM und VRAM. Wenn Sie ein lokales oder On-Premise-Modell auf einer einzelnen Consumer-Grafikkarte benötigen, ist Qwen3.8-27B weiterhin das Modell, auf das man warten sollte – es ist der realistische Self-Hosting-Weg in dieser Generation, und seine Veröffentlichung ist nun die offene Frage statt eines festen Datums.

Die versprochene Woche ist fast vorüber, und die Hälfte davon ist nicht eingetroffen. Qwen3.8-2.4T-A95B ist herunterladbar, lizenziert und nutzbar; Qwen3.8-27B ist bestätigt vorhanden, weiterhin den offenen Gewichten verpflichtet und weiterhin ohne Repository, Lizenz, Benchmark oder neues Datum. Beobachte, ob das Repo der 27B vor dem vollständigen Ablauf der versprochenen Woche erscheint, was ihre Lizenzdatei neben der des Max sagt und wie die ersten unabhängigen Bewertungen sie einstufen. Diese drei Signale zeigen dir, ob dies eine routinemäßige zweistufige Open-Weight-Veröffentlichung ist, bei der das kleinere Modell noch kommt, oder eine Verzögerung, mit der man rechnen muss.