Lernen Sie Qwen3.8-Flash kennen — ein Open-Weight-Modell mit multimodaler MoE-Architektur, das eine Vorschau auf die Qwen4-Architektur bietet. Regenerierte Illustration.
Guides & Insights

Lernen Sie Qwen3.8-Flash kennen: ein multimodales MoE-Modell mit offenen Gewichten, das einen Vorgeschmack auf die Qwen4-Architektur gibt — 0,15 $/0,47 $ pro 1 Million Tokens auf QwenCloud.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 26. August 2026 hat das Qw​en-Team die Gewichte hinter Qwen3.8-Flash als Open Source veröffentlicht — auf Hugging Face und ModelScope unter dem Namen Qwen3.8-Flash-Next — und das Produktionsmodell gestartet, das den Namen Qwen3.8-Flash auf der QwenCloud-API trägt, und bestätigte am nächsten Tag dessen offizielle Preise. Die wichtigste Kennzahl — offiziell bestätigt in Alibabas eigener Ankündigung am 28. August — ist ein multimodales Mixture-of-Experts-Modell mit 125 Milliarden Parametern, das pro Token nur etwa 6 Milliarden Parameter aktiviert, eine Sparsity von ungefähr 95 %, aufgebaut auf einer Architektur, die Alibaba ausdrücklich als frühe Vorschau der Qwen4-Generation beschreibt. Die Produktions-API ist live in der QwenCloud zu 0,15 US-Dollar pro Million Input-Tokens, 0,47 US-Dollar pro Million Output-Tokens und 0,016 US-Dollar pro Million bei Cache-Treffern — der günstigste Weg, etwas zu betreiben, das strukturell von Alibabas nächstem Flaggschiff abstammt, und das erste Mal, dass das Labor eine Architektur-Vorschau als öffentliche offene Gewichte veröffentlicht hat, bevor die vollständige Modellfamilie existiert.

Eine Zahl wiegt schwerer als der Rest des Datenblatts: 6B. Qwen3.8-Flash bezieht seine Leistungsfähigkeit nicht aus schierer Größe — sondern daraus, wohin es die Rechenleistung steckt. Ein 125B-MoE-Grundgerüst, eine 51B-N-Gramm-Embedding-Tabelle und ein kleines Multi-Token-Prädiktionsmodul speichern fast 180B Parameter auf der Platte, doch jeder Token durchläuft nur 6B davon. Das ist die Wette, auf der dieses gesamte Release steht, und es ist der Grund, warum die Trainingskosten so stark gesunken sind.

Was tatsächlich ausgeliefert wurde

Qwen3.8-Flash, ohne das Suffix, ist das produktionsreife Modell, das jetzt live auf der QwenCloud-API und in Alibabas Qw​en Office-Produkt verfügbar ist; es wird mit einem Standardkontext von 1M Token und integrierten Tools ausgeliefert, zu $0,15/$0,47 pro Million Token und Cache-Treffern bei $0,016. Am 28. August wurde die Verfügbarkeitsliste erweitert: Laut Alibabas Ankündigung ist Qwen3.8-Flash nun auch über OpenCode Go erreichbar, das Flatrate-Abonnement des Open-Source-Terminal-Coding-Agenten – OpenCodes eigene Modellliste führt es als qwen3.8-flash zu denselben Preisen von $0,15/$0,47 pro Million.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

Die offizielle Ankündigung von Qwen Studio stellt die Veröffentlichung der offenen Gewichte als Einladung an das Ökosystem dar: die strukturellen Änderungen frühzeitig auszuliefern, damit sich die Community und die Inferenz-Stacks anpassen können, bevor die vollständige Qwen4-Modellreihe aufgebaut ist. Das erste Zeichen, dass das funktioniert hat, ist SGLang – die von LMSYS unterstützte Inferenz-Engine – die noch am selben Tag Day-0-Unterstützung für Qwen3.8-Flash-Next veröffentlichte, wobei das Modell auch für Transformers, vLLM und TokenSpeed konfiguriert ist.

Die Architektur ist die Geschichte.

Dies ist kein herunterskaliertes Modell der Qwen-3.8-Generation. Qwen3.8-Flash führt vier Änderungen ein, die laut Team die Qwen4-Familie übernehmen wird, und jede zielt auf einen anderen Engpass ab.

• Attention — Gated DeltaNet plus Qw​en Sparse Attention. Gated DeltaNet (GDN) komprimiert die Historie in drei von vier Schichten in Zustände fester Größe, sodass das Modell nicht bei jedem Schritt alles erneut liest; QSA behandelt langen Kontext dann als Suchproblem – ein leichtgewichtiger Indexer fasst die Sequenz zu Mikroblöcken zusammen, bewertet die Wichtigkeit auf Blockebene und lenkt die Aufmerksamkeit auf die relevantesten Bereiche. Nach Messungen von Alibaba erreicht der QSA-Attentionskern bei einem 1M-Token-Kontext bis zu 7,6× schnelleres Prefill und 4,9× schnelleres Decode (vom Anbieter gemeldet).

• Residual – Gated Residual. Der einzelne Residualstrom wird zu vier parallelen Zweigen mit elementweisem Gating, wodurch das Netzwerk pro Token entscheiden kann, wie viel es auf jedem Zweig liest und schreibt; ein Zweig etabliert sich als Fernkanal, der frühe Aufmerksamkeitschichten mit tiefen Schichten verbindet. Residualzustände werden in FP8 gespeichert, um die Speicherbandbreite zu reduzieren.

• Einbettung — N-Gramm-Einbettungen. Eine Nachschlagetabelle mit 51B Parametern, die auf dem aktuellen Token sowie mehreren vorherigen basiert. Sie erhöht die Kapazität, ohne den Rechenaufwand pro Token zu erhöhen, und da die Tabelle im Host-Speicher liegen und asynchron vorab geladen werden kann, belegt sie den GPU-Speicher nicht dauerhaft.

Optimierer — Muon. Große 2D-lineare Parameter (Attention, GDN, MoE-Experten) werden mit Muon trainiert, während Embeddings, der Router und die Gated-Residual-Low-Rank-Teile AdamW beibehalten; das Team hat das Skalierungsgesetz für die neue Architektur neu an den Mix angepasst.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Für Entwickler sind zwei davon sofort relevant: der Attention-Stack ist der Grund, warum ein 1M-Token-Kontext der Standard statt eines ehrgeizigen Ziels sein kann, und die N-Gramm-Tabelle ist der Grund, warum ein 125B-Modell weiterhin schlank ausgeliefert werden kann. Der Rest ist Vorschau-Material für Qwen4 — und genau so positioniert Alibaba es.

Das Benchmark-Blatt, ehrlich beschriftet.

Jede Zahl in diesem Abschnitt ist eine eigene Bewertung von Alibaba, einen Tag alt und zum Zeitpunkt der Erstellung von keinem unabhängigen Labor reproduziert. Betrachten Sie sie als Richtungsangaben, nicht als endgültige Ergebnisse. In Alibabas Suite erreicht Qwen3.8-Flash-Next (6B aktiv) SWE-bench Pro 62,5, DeepSWE 1.1 58,7, CoWorkBench 73,9, AndroidWorld 84,5 und MathVision 95,7, mit einem JobBench-Wert von 55,7 — und die Basisvariante Qwen3.8-Flash-Next-Base wird als das beste offene Modell bei 8 von 14 Benchmarks in einem direkten Vergleich gemeldet, darunter MMLU-Pro, SuperGPQA, BBH und MMMU.

Alibabas Angaben zur familiären Platzierung sollten als das bezeichnet werden, was sie sind – Angaben. Das Unternehmen sagt, Qwen3.8-Flash schlage Claude Opus 4.6 um 9,1 Punkte bei SWE-bench Pro und etwa 20 Punkte bei JobBench und nähere sich Claude Opus 4.8 bis auf einen Sprung. Alles vom Anbieter gemeldet, alles unabhängig nicht reproduziert. Was heute unabhängig überprüfbar ist, ist enger: Die Gewichte sind veröffentlicht, der Inferenz-Stack führt sie bereits aus, und SGLang hat noch am selben Tag Unterstützung bereitgestellt. Die unabhängige Reproduktion des Benchmark-Blattes ist nur Tage entfernt, nicht Wochen.

Was es kostet

Die Preisgestaltung ist der am einfachsten zu verifizierende Teil, denn es handelt sich um einen veröffentlichten Preis und nicht um einen Benchmark – und am 27. August hat Alibaba den offiziellen Produktionspreis für QwenCloud bestätigt: 0,15 $ pro Million Input-Tokens, 0,47 $ pro Million Output-Tokens und 0,016 $ pro Million bei Cache-Treffern, mit den Inlands-China-Preisen bei 0,8 ¥/2,7 ¥/0,1 ¥. Die Cache-Treffer-Zahl ist diejenige, die für agentische Workloads entscheidend ist: Ein Long-Context-Agent, der bei jedem Schritt einen großen Verlauf erneut liest, zahlt bei wiederholten Lesevorgängen nur Centbeträge – genau der Workload, auf den der Qwen4-preview-Aufmerksamkeits-Stack abzielt. Die chinesische Presse verglich den Schlagzeilenpreis sofort mit denen von Mitbewerbern – etwa ein Drittel dessen, was DeepSeek-V4-Flash verlangt, und ein vernachlässigbarer Rundungsfehler im Vergleich zu proprietären Frontier-Modellen. Nach Alibabas eigener Rechnung kostete der Trainingslauf etwa ein Neuntel von Qwen3.7-Plus, und genau diese strukturelle Hebelwirkung ermöglicht es dem API-Preis, dort zu liegen, wo er liegt.

Verglichen mit dem Rest der Qw​en-3.8-Familie ist der Abstand eklatant: Das Flaggschiff Qwen3.8-Max liegt bei 2,00 $ und 6,00 $ pro Million Tokens und ist bei OrcaRouter bereits zum Listenpreis des Anbieters ohne Aufschlag live. Jetzt, da die Produktions-API von Qwen3.8-Flash offen ist, gilt derselbe Pass-through für den offiziellen Satz von 0,15 $/0,47 $ und die Cache-Hit-Rate von 0,016 $ – eine Routing-Schicht ist der Unterschied zwischen einer Preissenkung, von der man liest, und einer, die in der Konfiguration steht. Beide Modelle hinter einem Schlüssel, Failover zwischen ihnen, kein zweiter Vertrag.

Was „Vorschau von Qwen4" bedeutet

Liest man die Ankündigung wörtlich, sind die Einsätze klar: Dies ist keine neue Stufe von Qw​en 3.8 — es ist die Architektur von Qwen4, die früh ausgeliefert wurde, unter der schützenden Marke eines kleineren, günstigeren Modells. Die Gründe dafür sind stichhaltig: Frameworks, Quantisierung und Bereitstellungsmuster brauchen Zeit, um auszureifen, und ein 6B-aktives Modell ist ein kostengünstiger Weg für die Community, GDN + QSA in großem Maßstab zu testen, bevor Alibaba das teure Modell darauf aufbaut. Die Kehrseite ist, dass das Produktionsmodell Qwen3.8-Flash eine API ist, die auf einer Architektur basiert, die das breitere Ökosystem noch prüft. Erstanwender sind konstruktionsbedingt der Testsatz.

Der schnelle Weg, es auszuprobieren.

Heute haben Sie vier realistische Optionen. Hosten Sie die offenen Gewichte selbst über vLLM, SGLang, Transformers oder TokenSpeed – der FP8-Build ist die sinnvolle erste Anlaufstelle für alles, was unterhalb eines vollständigen Nodes liegt. Rufen Sie die QwenCloud-API auf, jetzt live zum offiziellen Satz von 0,15 $/0,47 $, mit Cache-Treffern für 0,016 $. Nutzen Sie sie in OpenCode Go, dem Flatrate-Abonnement des Open-Source-Terminal-Coding-Agenten, das diese Woche Qwen3.8-Flash hinzugefügt hat (von Alibaba am 28. August angekündigt, auf OpenCodes eigener Modellliste bestätigt). Oder rufen Sie das Produktions-Flash über einen Router auf, so wie Sie bereits Qwen3.8-Max aufrufen, wobei der offizielle Satz ohne Aufschlag durchgereicht wird – keine maßgeschneiderte Integration, die Sie warten müssen.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

Die offene Frage ist die ehrliche: Kann ein Modell, das 6 Milliarden seiner Parameter aktiviert, in der Produktion über eine breite Palette von Arbeitslasten standhalten, oder wird das Benchmark-Blatt, das heute einen Tag alt aussieht, in einem Monat immer noch so aussehen? Das ist kein Grund zu warten – es ist ein Grund, es hinter Failover zu stellen und nicht vor deinen gesamten Stack. Die Gewichte sind draußen, der Preis ist festgelegt, und die Architektur ist Alibabas erklärte Richtung. Die nächsten Wochen entscheiden, ob 6B genug war.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube