Qwen3.8-Flash-Next Release — Einblicke in Alibabas Qwen4-Architekturvorschau. Neu generierte Abbildung.
Guides & Insights

Qwen3.8-Flash-Next Veröffentlichung: Einblick in Alibabas Qwen4-Architektur-Vorschau

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das nützlichste Dokument, das Ali­baba am 26. August 2026 veröffentlichte, war nicht die Pressemappe — es war ein technischer Bericht. Qwen3.8-Flash-Next, das an diesem Tag veröffentlichte Open-Weight-Multimodal-Mixture-of-Experts-Modell, erschien zusammen mit einem Paper mit dem Titel „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability“, und der Bericht ist die eigentliche Geschichte. Er tut das, was Produktveröffentlichungen fast nie tun: Er veröffentlicht die Ablationen, die negativen Ergebnisse und die Experimente zur Trainingsrezeptur und zieht dann von jedem Befund eine Linie zur Architektur der Qwen4-Familie, die dieses Modell vorwegnehmen soll.

Was tatsächlich am 26. August ausgeliefert wurde

Das Modell selbst ist nach Qwens Standards von 2026 bescheiden, und das ist beabsichtigt. Qwen3.8-Flash-Next speichert 125B Hauptmodell-Parameter plus eine separate 51B-n-Gramm-Einbettungstabelle — also rund 176B vor einem 4B-Multi-Token-Vorhersagemodul —, aktiviert aber nur 6B pro Token. Es ist ein Mixture-of-Experts-Modell mit 512 Experten, Top-10-Routing und 48 Schichten, nativ mit 262.144 Token Kontext und per YaRN auf 1M erweiterbar. Es nimmt Text-, Bild- und Videoeingaben entgegen und gibt Text aus. Die Gewichte sind auf Hugging Face und ModelScope unter der qwen-community-1.0-Lizenz verfügbar, und Alibabas eigener Blog nennt es „eine experimentelle Vorschau auf die Architektur, die Qwen4 zugrunde liegen wird“ — dieselbe Rolle, die Qwen3-Next für die Qwen3.5-Linie spielte: ein Kanarienvogel, der dem Flaggschiff vorausfliegt.

Am selben Tag schaltete Ali​baba das kommerzielle Gegenstück frei: eine gehostete Version namens Qwen3.8-Flash auf der QwenCloud-API für 0,16 $ pro Million Eingabe-Tokens und 0,47 $ pro Million Ausgabe. Die beiden sind leicht zu verwechseln, und es lohnt sich, sie auseinanderzuhalten. Qwen3.8-Flash-Next ist die Open-Weights-Vorschau, die der technische Bericht analysiert; Qwen3.8-Flash ist der kostenpflichtige Produktions-API-Build mit einem Standard-1M-Token-Kontext und Open​AI- und Anthropic-kompatiblen Anfrageformaten. Der Preis, die Benchmarks und die Architektur-Argumente gehen alle auf dasselbe Engineering zurück.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Die vier Architektur-Wetten im Tech-Bericht

Das Rückgrat des Papers bilden vier Wetten darauf, wie ein kostengünstiges Frontier-Modell mit langem Kontext aussehen sollte, jede mit experimenteller Untermauerung.

• Attention — GDN + QSA-Hybrid. Drei von vier Schichten verwenden Gated DeltaNet, eine Linear-Attention-Schicht, die die Historie in einen rekurrenten Zustand fester Größe komprimiert, anstatt in einen KV-Cache, der mit der Sequenzlänge wächst. Die verbleibende Schicht ist Qw​en Sparse Attention, die die Sequenz in Mikroblöcke aggregiert, sie kostengünstig bewertet und nur auf den relevanten Regionen vollständige Attention ausführt. Ali​baba berichtet von bis zu 7,6-fachen Prefill- und 4,9-fachen Decode-Beschleunigungen bei 1M Kontext; SGLangs eigener Day-0-Benchmark maß noch höhere Werte, nämlich 10,2-fach und 6,6-fach. Bei einer Präfix-Cache-Trefferquote von 90 % erreicht der Prefill-Durchsatz das 8,6-Fache von Qwen3.7-Plus. Dies sind von Anbietern und Partnern gemeldete Zahlen, keine unabhängig geprüften.

• Residual-Stream — Gated Residual. Der einzelne Residualpfad wird auf vier parallele Zweige mit elementweiser dynamischer Gating-Steuerung erweitert — ein Multi-Branch-Design im Hyper-Connection-Stil mit GatedNorm-artiger Steuerung. Das Gate reguliert Lese- und Schreibzugriffe pro Zweig, was laut dem Paper Aktivierungsausreißer unterdrückt und es in der Praxis ermöglicht, die Residualzustände in FP8 zu speichern.

• Einbettung — die 51B-n-gram-Tabelle. Statt einer Einbettung pro Token verwendet das Modell den aktuellen Token sowie die vorhergehenden als Schlüssel für eine Nachschlagetabelle und speichert so ganze Phrasen und lokale Muster. Das kostet pro Token nahezu nichts, und da die Nachschlageadressen im Voraus bekannt sind, kann die Tabelle im Host-Speicher liegen und asynchron vorabgeladen werden – vollständig außerhalb des GPU-Speichers. Dies ist der Trick, der es ermöglicht, einen gespeicherten 176B-Checkpoint auf Maschinen der 75-GB-Klasse auszuführen. Er geht auf die Einbettungen pro Schicht von Gemma 3n und das Engram von Deep​Seek zurück.

• Optimierung — Muon, abgestimmt. Das Training verwendet den Muon-Optimierer, eine auf Orthogonalisierung basierende Impulsmethode, angewendet auf zweidimensionale lineare Abbildungen (Aufmerksamkeit, GDN und MoE-Expertengewichte), während AdamW für Embeddings, den Router und Low-Rank-Parameter beibehalten wird. Das Papier berichtet auch über ein negatives Ergebnis, das zu lesen lohnt: Das Batch-Größen-Warmup wurde verworfen, nachdem sich herausstellte, dass es 18,8 % mehr Optimierungsschritte kostete, ohne etwas zu verbessern.

Die Benchmark-Tabelle sorgfältig lesen.

Jede Schlagzeilenzahl hier stammt von Qwen selbst, veröffentlicht auf der Modellkarte und im Bericht, und nichts davon wurde unabhängig reproduziert – das Modell ist einen Tag alt und noch hat kein Dritter es geprüft. Liest man es so, ist es immer noch beeindruckend, denn Qwen3.8-Flash-Next liefert sich ein Kopf-an-Kopf-Rennen mit DeepSeek-V4-Flash-0731, einem viel größeren und etablierten Modell, bei 6B aktiven Parametern.

• DeepSWE 1.1 — 58,7 vs. 54,4 (vom Anbieter gemeldet).

• SWE-bench Pro — 62.5 vs. 56.0 (Anbieterangabe).

• Toolathlon Verifiziert — 73,5 vs. 70,3 (vom Anbieter angegeben).

• LiveCodeBench v6 — 91,9 vs. 90,6 (vom Anbieter gemeldet).

• GPQA Diamond — 91,7 vs. 90,8 (vom Anbieter gemeldet).

• IFBench — 81,3 vs. 79,2 (vom Anbieter angegeben).

Dann weist der Bericht den Rückstand offen aus: NL2Repo-Bench 48,1 gegenüber 54,2 von DeepSeek-V4-Flash-0731 – ein echtes Defizit bei der Codegenerierung auf Repository-Ebene, genau die eine Dimension des agentischen Codierens, bei der das kleinere Modell nicht mithält. Agents' Last Exam ist mit 24,3 zu 25,2 ein Patt. Bei der Büroautomation meldet Qw​en CoWorkBench 73,9 – aber das ist ein hauseigener Benchmark, und Ali​baba führt ihn nicht in der Hauptübersicht.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Beim Thema Sehen zeigt die selbstberichtete Tabelle AndroidWorld 84,5 gegenüber 62,0 für Claude Opus 4.6 Max und RealWorldQA 88,5 gegenüber 73,9. Humanity's Last Exam ist die eine Schlagzeile, bei der Qw​en gegen Claude Opus 4.6 Max klar verliert — und die Bewertung dieser Punktzahl wurde selbst von GPT-4o durchgeführt, sodass selbst dieser Vergleich nicht sauber ist.

Der Preis: ein Zwölftel des Flaggschiffs.

Dann die Zahl, die für Budgets zählt. Der angebotene Qwen3.8-Flash-Build kostet $0.16 pro Million Eingabe-Token und $0.47 pro Million Ausgabe-Token auf QwenCloud. Das ist ungefähr ein Zwölftel des Preises von Ali​babas eigenem Flaggschiff Qwen3.8-Max für $2.00 pro Million Eingabe und $6.00 pro Million Ausgabe — bei einem Modell, das laut Bericht mit etwa einem Neuntel der Rechenleistung von Qwen3.7-Plus trainiert wurde. Chinesische Modellanbieter haben den Sommer damit verbracht, die Preise der Flash-Klasse zu senken, und diese Veröffentlichung ist die Qw​en-Seite dieser Kampagne, die mit einer Architekturbegründung statt nur mit einem Rabatt daherkommt.

Für alle, die innerhalb der Kategorie vergleichen, ist die Rechnung einfacher, wenn jeder Anbieter dieselbe Zahl zeigt. OrcaRouter routet den Rest der Qw​en-Familie – Qwen3.8-Max, Qwen3.8-27B und Qwen3.8 – zum Listenpreis des Anbieters mit 0% Aufschlag, sodass eine Preissenkung des Anbieters bei uns am Tag der Ankündigung live ist. Qwen3.8-Flash-Next ist noch nicht in unserem Katalog; sobald es eine Laufzeit erreicht, die wir routen, fügt es sich in dasselbe Ein-Klick-Listenpreis-Setup ein, ohne einen zweiten Vertrag.

Was du heute damit machen kannst

Schon am Erscheinungstag ist die Serving-Unterstützung ungewöhnlich breit. SGLang bringt eine Cookbook-Seite und ein dediziertes Image (lmsysorg/sglang:qwen38flashnext) mit; vLLM hat vllm/vllm-openai:qwen38-flash-next; NVIDIA validiert beide sowie TensorRT LLM auf einem GB300-NVL72-Rack mit mehr als 16.000 Tokens pro Sekunde je GPU in FP8, und NeMo deckt Feintuning ab. Unterhalb der Data-Center-Skala läuft das Modell auf DGX-Spark-Clustern und Workstations mit 4× RTX PRO 6000, und die noch am selben Tag einsetzende Welle an Community-Quantisierungen – Unsloths GGUFs und ein 1-Bit-Build, der in 75 GB RAM passt und ungefähr 80 % der vollen Genauigkeit erreicht – bedeutet, dass der gespeicherte 176B-Checkpoint tatsächlich auf Hardware läuft, die ein kleines Team besitzt. Teams, die das Modell lieber per API aufrufen, als es selbst zu betreiben, erreichen die Qwen3.8-Flash-API über Alibabas eigene QwenCloud und mehrere Drittanbieter-Plattformen, auch wenn die meisten Early Adopters zuerst zu den offenen Gewichten greifen werden.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Die VRAM-Rechnung hinter dieser Liste ist die n-gram-Tabelle, und auf sie konvergieren die Serving-Stacks als Nächstes. Das Embedding pro Schicht, das der Tech-Report aus dem GPU-Speicher auslagert, ist eine reine Nachschlagestruktur – pro generiertem Token zieht das Modell nur etwa 16 seiner 320 Millionen Zeilen –, was das Auslagern günstig macht. vLLM bedient Qwen3.8-Flash-Next aus einem dedizierten Dev-Image, während der Pull-Request für die Architekturunterstützung noch offen ist, und der neueste Teil dieser Arbeit – ein PR-Entwurf vom selben vLLM-Autor (vllm-project/vllm#54371, nicht gemergt) – fügt einen PLE-Offload-Serving-Pfad hinzu, der die Tabelle im Host-Speicher hält und sie über CUDA Unified Virtual Addressing liest, anstatt VRAM zu reservieren. Bei FP8 umfasst die Tabelle etwa 48 GB des ~173-GB-Checkpoints, sodass das Auslagern den Unterschied zwischen einer Data-Center-GPU und einer einzelnen 96-GB-Karte ausmacht – einer RTX PRO 6000 oder dem Unified-Memory-Pool eines einzelnen DGX Spark. Es ist früh, also behandle es als Richtungsangabe und nicht als heute unterstützte Option; aber es ist die Laufzeit, die das einholt, was der Tech-Report bereits behauptet hat, und das, worauf man achten sollte, wenn die VRAM-Zahl das ist, was dich zurückgehalten hat.

Eine einen Tag alte Vorschau mit nicht reproduzierten Zahlen ist der Lehrbuchfall, um keine Produktionsstrecke darauf zu setzen – genau dafür ist Failover da. Wenn eine Runtime Qwen3.8-Flash-Next enthält und Sie einen Endpunkt mit automatischem Failover auf ein Ihnen bereits vertrautes Modell darauf ausrichten, erhalten Sie den Vorteil der neuen Architektur bei unkritischem Traffic und einen sauberen Fallback, wenn sie ins Straucheln gerät – kein Umbau, denn das ist eine Routing-Regel und keine Codeänderung.

Was diese Vorschau über Qwen4 sagt

Alibaba hat diesen Schachzug schon einmal gemacht. Qwen3-Next hat Gated DeltaNet Ende 2025 mit dürftiger Dokumentation vorgestellt, und die Architektur wurde erst vollständig spezifiziert, als die Qwen3.5-Serie sie in großem Maßstab übernahm. Das Muster wiederholt sich: Qwen3.8-Flash-Next ist der Kanarienvogel, und der Bericht ist die Spezifikation durch Experimente. Die konkreten Dinge, auf die man achten sollte, sind, ob das Qwen4-Flaggschiff die Drei-zu-eins-Aufteilung von GDN zu QSA übernimmt, ob die N-Gramm-Einbettung den Kontakt mit dem Produktionsbetrieb im Maßstab des Flaggschiffs übersteht, und vor allem, ob unabhängige Bewertungen den Vorteil der 6B-aktiven Modelle gegenüber größeren Modellen bestätigen. Wenn die Effizienzthese Bestand hat, könnte das Qwen4-Flaggschiff mit deutlich geringeren Bereitstellungskosten ausgeliefert werden als die Generation davor.

FAQ

Qwen3.8-Flash-Next und Qwen3.8-Flash — dasselbe Modell?

Nein, und der Unterschied ist wichtig. Qwen3.8-Flash-Next ist die Open-Weights-Architekturvorschau, die der technische Bericht analysiert; Qwen3.8-Flash ist der Produktions-API-Build, den Ali​baba auf QwenCloud zu 0,16 $/0,47 $ pro Million Token mit einem Standard-Kontext von 1M bereitstellt. Gleiche technische Herkunft, andere Artefakte – das eine ist zum Selbst-Hosten und Inspizieren gedacht, das andere ein kostenpflichtiger verwalteter Dienst.

Sollten Produktions-Workloads heute dorthin umziehen?

Nicht ohne eine zweite Meinung. Jeder Benchmark wird vom Anbieter gemeldet und ist nicht reproduziert, die Architektur ist neu genug, dass sich die Serving-Stacks noch angleichen — vLLMs eigener Support wird noch über offene Pull-Requests ausgerollt — und die eine Lücke beim agentischen Coding (NL2Repo) betrifft genau die Art von Aufgabe, auf die Produktionsentwickler stoßen. Die offenen Gewichte machen es günstig, selbst zu evaluieren, und der Day-0-Support von SGLang und vLLM macht eine Pilotierung noch diese Woche möglich — aber ein Pilot hinter Failover ist der ehrliche Weg, um zu starten, nicht ein Cutover.

Wann wird das eigentliche Qwen4 ausgeliefert?

Alibaba hat sich nicht geäußert. Das einzige zeitliche Signal in dieser Veröffentlichung ist historischer Natur: Der letzte Canary, Qwen3-Next, flog etwa eine Saison, bevor die Qwen3.5-Serie seine Architektur übernahm. In diesem Rhythmus sind die Flaggschiffe von Qwen4 näher, als es den Anschein hat — aber der Bericht befasst sich ausdrücklich mit Architektur, nicht mit einer Roadmap.

Das Fazit

Qwen3.8-Flash-Next ist die seltene Veröffentlichung, bei der das Paper das Produkt ist. Was das Modell selbst betrifft, liest sich die ehrliche Bilanz wie folgt: 6B aktive Parameter, die bei den meisten gemeinsamen Benchmarks mit weitaus größeren Modellen gleichziehen, eine ausgewiesene Lücke bei Repository-Level-Code, ein angebotener Preis von einem Zwölftel des Flaggschiffs sowie eine Architektur, die Qwens Antwort darauf ist, wie ein Frontier-Modell preiswert wird. Der Tech-Report sagt, wofür Qwen3.8-Flash-Next gedacht ist – und das ist nicht das Modell. Er ist der Beleg für die Architektur, die Qwen4 sein wird, und es lohnt sich, ihn zu lesen, bevor Qwen4 erscheint, denn die Entscheidung, die er verändert, ist genau die, die du treffen wirst, wenn Qwen4 da ist.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube