
Qwen3.8-Flash-Next: Alibaba zeigt eine Vorschau auf die Qwen4-Architektur, noch bevor Qwen4 existiert
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Alibaba wird die Qwen4-Architektur veröffentlichen, bevor es ein Qwen4-Modell herausbringt. Qwen3.8-Flash-Next – ein Open-Weight-Modell mit multimodaler Expertenmischung (Mixture-of-Experts), basierend auf der Architektur der nächsten Generation, die die Qwen4-Familie antreiben wird – soll am 26. August 2026 um 23:00 Uhr Pekinger Zeit auf ModelScope veröffentlicht werden. Alibaba präsentiert die Veröffentlichung als Technologievorschau: Entwickler erhalten die Architektur frühzeitig, die vollständige Qwen4-Familie folgt später. Zum Zeitpunkt dieses Artikels sind Parameteranzahl, Lizenz und Preis noch nicht bestätigt, daher handelt es sich hier um einen Beitrag nach dem Prinzip „Was wir bisher wissen“ – jedes unten genannte konkrete Detail ist mit einer Einschätzung versehen, wie belastbar es ist.
Wenn Sie Alibabas Takt in diesem Monat nicht verfolgt haben, ist der Anker Qwen3.8-Max — das Flaggschiff mit 2,4 Billionen Parametern, das am 3. August veröffentlicht und weniger als zwei Wochen später als Qwen3.8-2.4T-A95B als Open Source bereitgestellt wurde. Qwen3.8-Flash-Next erscheint weniger als einen Monat danach. Dasselbe Labor, das ein Open-Weight-Modell mit 2,4 Billionen Parametern herausgebracht hat, gibt nun die Architektur für die nächste Generation heraus, bevor das Flaggschiff dieser Generation überhaupt benannt ist.
Was wurde angekündigt?
Das Signal erreichte die Arena über die üblichen Kanäle. Eine ModelScope-Teaser-Seite für Qwen3.8-Flash-Next ging am 25. August online und trug ein Abzeichen mit der Aufschrift „Upcoming Open-Release“, die Tagline „Onward to the Next-Gen — Lightning-Fast“ sowie einen Countdown, der auf 2026-08-26 23:00 (UTC+08:00) eingestellt war. Das Qwen-Team von Alibaba postete am selben Tag auf X: „The next Qwen wave is coming.“ Der Beitrag, der uns diesen Artikel zuspielte, stammte von @kimmonismus auf X und beschrieb dasselbe in etwas anderen Worten: ein multimodales Open-Weight-MoE auf der Architektur der nächsten Generation, mit Early Access, damit die Community sich auf die Qwen4-Familie vorbereiten kann.

Der Teil, der es wert ist, noch einmal gelesen zu werden, ist Alibabas eigene Darstellung. Das Modell wird als auf der Architektur der nächsten Generation basierend beschrieben, „die die kommende Qwen4-Familie antreiben wird“ — und ausdrücklich nicht als Qwen4 selbst. Alibabas angegebener Grund ist, dass die architektonischen Änderungen in den Händen der Community liegen sollten, bevor die Familie eintrifft, damit Laufzeiten, Quantisierungen und Anwendungen bereit sind, wenn das eigentliche Produkt erscheint. Das ist eine Marketingposition, aber auch eine technische Verpflichtung: zuerst den schwierigen Teil in der Vorschau zeigen, die Community mitnehmen.
Was ist heute bestätigt, und was nicht:
• Bestätigt, laut Teaser und der Aussage von Qwen: Qwen3.8-Flash-Next ist ein Open-Weight-, multimodales und MoE-Modell auf der Qwen4-Architektur.
• Bestätigt, so die Qwen-Erklärung: Es führt zwei wichtige architektonische Änderungen ein — die GDN-Hybridarchitektur und Qwen Sparse Attention (QSA).
• Bestätigt, laut Teaser: die Veröffentlichungszeit, 2026-08-26 23:00 (UTC+08:00), auf ModelScope.
• Nicht bestätigt: Gesamtzahl oder aktive Parameter, Lizenzbedingungen, Kontextlänge, API-Verfügbarkeit oder Preise und alle Benchmark-Ergebnisse. Es gibt noch keine unabhängige Bewertung, da die Gewichte noch nicht veröffentlicht sind.

Was die Qwen4-Architektur tatsächlich ist
Zwei Mechanismen tragen die Geschichte. Der erste, GDN — Gated Delta Network — ist Alibabas Linear-Attention-Schicht. Während ein Standard-Transformer einen Key-Value-Cache behält, der mit der Sequenzlänge wächst, pflegt eine GDN-Schicht einen rekurrenten Zustand fester Größe und aktualisiert ihn mit einer gelernten Gating-Regel; die Entwicklungslinie führt über DeltaNet und Mamba-2. Der Nutzen ist derselbe, der seit Qwen3-Next still die Qwen-Linie antreibt: Lange Kontexte bleiben günstig, weil der Zustand nicht wächst, während eine Minderheit von Full-Attention-Schichten in der Mischung bleibt, um das präzise Abrufen zu übernehmen, das lineare Aufmerksamkeit nicht gut beherrscht. In der aktuellen Generation liegt das Verhältnis bei ungefähr drei GDN-Schichten pro Full-Attention-Schicht — die Community-Analyse des Qwen3.8-2.4T-A95B-Checkpoints zählt 69 GDN-Schichten gegenüber 23 Attention-Schichten. Qwen3.8-Flash-Next wird genau auf dieser Linie als „GDN-Hybridarchitektur“ beschrieben.
Das zweite, QSA — Qwen Sparse Attention — ist das wirklich neue Element, und es gibt noch keine öffentliche technische Beschreibung davon: nur den Namen und seine Ankündigung als eine der beiden wichtigsten Änderungen der Vorschauversion. Dieses Fehlen von Details ist selbst Teil des Musters. Die Vorschau von Qwen3-Next Ende 2025 führte Gated DeltaNet mit derselben Dokumentationsknappheit ein, und die Architektur wurde erst vollständig spezifiziert, als die Qwen3.5-Serie sie übernahm. Für einen Leser ist die praktische Erkenntnis beide Male dieselbe: Der Architektur-Kanarienvogel erscheint zuerst, die Dokumentation und die Produktionsmodelle folgen danach.
Das Playbook, das bereits einmal funktioniert hat
Alibaba hat dieses exakte Spiel schon einmal gespielt, und es funktionierte. Ende 2025 zeigte Qwen3-Next Gated DeltaNet und eine Hybridform aus linearer und vollständiger Aufmerksamkeit. Als die Qwen3.5-Serie erschien, übernahm sie diesen Bauplan im großen Maßstab – und die Hybridform hat seitdem die Qwen3.8-Generation durchzogen, einschließlich des 2.4T-Flaggschiffs. Der Grund, warum der Präzedenzfall hier wichtig ist, ist die zeitliche Implikation. Die vollständige Qwen4-Familie sollte jenseits dieser Vorschau erwartet werden, nicht darin; wenn die Qwen3-Next-Lücke ein Anhaltspunkt ist, wird die Distanz zwischen „hier ist die Architektur“ und „hier ist die Familie“ in Monaten gemessen. Nichts in dem Teaser bestätigt das – es ist eine Schlussfolgerung aus einem Muster, das Alibaba nun zweimal durchgespielt hat.
Was wir noch nicht wissen
Die Unbekannten sind der Sinn einer Vorschau, und sie sind real:
• Parameter. Der Teaser verrät keine. Community-Spekulationen auf X und Reddit — ohne offizielle Bestätigung — deuten auf eine Konfiguration mit etwa 125B gesamt / 6B aktiv und einer großen n-gram-Embedding-Lookup-Tabelle hin. Behandle es als Gerücht.
• Die „Flash“-Stufe. In der Qwen3.5-Generation war das ausschließlich in der Cloud verfügbare Qwen3.5-Flash eine erweiterte Variante des Open-Weight-Modells Qwen3.5-35B-A3B. Ob Qwen3.8-Flash-Next das Open-Weight-Pendant zu einem ähnlich großen Qwen3.8-Modell ist, ist unbekannt; es könnte sich stattdessen um das Modell der 125B-A6B-Klasse handeln. Beide Lesarten sind Spekulationen.
• Lizenz. Alibabas aktuelle Qwen-Releases reichen von Apache-2.0 (Qwen3.8-27B) bis zur umsatzabhängigen Qwen3.8-Max-Lizenz. Wo Flash-Next landet, bestimmt, ob es kommerziell genutzt werden kann und in welchem Umfang.
• Benchmarks. Die Qwen-Erklärung hebt agentisches Codieren, langfristige Aufgaben und multimodale Intelligenz hervor, aber es sind keine Zahlen beigefügt und es gibt keine unabhängige Bewertung, bis die Gewichte veröffentlicht werden.
Eine Familie, die im Zweiwochenrhythmus iteriert
Der umgebende Takt ist eine eigene Geschichte. Qwen3.8-Max, das Flaggschiff mit 2,4 Billionen Parametern, erschien am 3. August; das Open-Weight-Modell Qwen3.8-2.4T-A95B folgte am 12.–13. August; das kostenlose Apache-2.0-Modell Qwen3.8-27B kam wenige Tage später; und nun, noch vor Monatsende, wird eine Vorschau auf die Architektur der nächsten Generation gezeigt. Kein anderes Labor arbeitet derzeit in diesem Takt. Für Leser, die Modelle auswählen, hat das praktisch zur Folge, dass „das beste Qwen" ein bewegliches Ziel ist — und der Generationsunterschied kommt schneller, als sich das umliegende Ökosystem normalerweise anpasst. Zunehmend ist der vertretbare Schritt, eine Entscheidung zu kaufen statt ein Modell.
Was ein Entwickler jetzt tun sollte
Planen Sie die Architektur, nicht nur das Modell. Qwen3.8-Flash-Next wird am ersten Tag eine unbewährte Vorschauversion sein: keine unabhängigen Benchmarks, ein Runtime-Ökosystem, das noch hinterherhinkt, und nur Herstellerangaben zu den agentischen und langfristigen Stärken, die für die Workloads relevant sind, die es nutzen würden. Der sichere Weg, es zu evaluieren, besteht nicht darin, es in einen Produktionspfad einzubinden – sondern darin, eine risikoarme Kopie eines Workloads an es zu leiten, die Ausgabe mit dem bisherigen Modell zu vergleichen und das automatische Failover die Momente abfangen zu lassen, in denen sich der Anbieter eines brandneuen Open-Weight-Modells fehlverhält. Bei OrcaRouter sind das derselbe Endpoint und derselbe Schlüssel, den Sie bereits verwenden: Qwen3.8-Flash-Next und Ihr aktuelles Modell sitzen hinter einer gemeinsamen API, und die Routing-DSL kann die Vorschauversion mit demselben Prompt im A/B-Test gegen das bisherige Modell antreten lassen, bevor etwas endgültig festgelegt wird.
Preise, sofern es sie gibt, sollten auf dieselbe Weise gelesen werden. Alibaba hat keinen API-Preis für Flash-Next angekündigt, und unveröffentlichte Gewichte sind nirgendwo routingfähig. Wenn ein Anbieter den Preis offenlegt, gibt OrcaRouter den Listenpreis des Anbieters unverändert mit 0 % Aufschlag weiter – egal welche Zahl Alibaba letztlich nennt, sie erscheint unverändert am selben Tag. Die nächstgelegene Basislinie, die Sie heute tatsächlich aufrufen können, ist Qwen3.8-Max (qwen/qwen3.8-max), das Flaggschiff, unter dem diese Architektur letztlich stehen wird: ein Kontextfenster von 1.000.000 Token zu 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token, zum Listenpreis durchgereicht. Behalten Sie diese Zahl im Kopf, wenn Flash-Nexts Preis fällt; sie ist der Kostenpunkt, den die nächste Generation unterbieten muss.

Was man beim Drop ansehen sollte
Vier Dinge sind in dem Moment wichtig, in dem der Release-Timer abläuft:
• Die Parameteranzahl und die Stufe der aktiven Parameter – ob dies das 125B-A6B-Klassenmodell ist, das die Gerüchte beschreiben, oder ein kleineres Einstiegsmodell.
Die Lizenz — permissiv wie Qwen3.8-27B oder eingeschränkt wie die Max-Lizenz.
• Ob die ersten unabhängigen Evaluierungen die Agentic-Coding- und Langzeithorizont-Behauptungen des Anbieters reproduzieren — den Zahlen vertrauen, nicht der Marketing-Linie.
Wie lange Alibaba wartet, bevor die vollständige Qwen4-Familie der Vorschau folgt.
Von hier aus lässt sich nichts davon wissen. Was man heute wissen kann, ist die Form der Entscheidung, die Alibaba getroffen hat: Sie setzt darauf, dass die nächste Generation ihrer Architektur es wert ist, vor dem Flaggschiff preisgegeben zu werden. Diese Wette ist die Geschichte – und die Gewichte werden morgen veröffentlicht.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
