
Lernen Sie Qwen3.8-Flash kennen: ein multimodales MoE-Modell mit offenen Gewichten, das einen Vorgeschmack auf die Qwen4-Architektur gibt — 0,15 $/0,47 $ pro 1 Million Tokens auf QwenCloud.
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Am 26. August 2026 hat das Qwen-Team die Gewichte hinter Qwen3.8-Flash als Open Source veröffentlicht — auf Hugging Face und ModelScope unter dem Namen Qwen3.8-Flash-Next — und das Produktionsmodell gestartet, das den Namen Qwen3.8-Flash auf der QwenCloud-API trägt, und bestätigte am nächsten Tag dessen offizielle Preise. Die wichtigste Kennzahl — offiziell bestätigt in Alibabas eigener Ankündigung am 28. August — ist ein multimodales Mixture-of-Experts-Modell mit 125 Milliarden Parametern, das pro Token nur etwa 6 Milliarden Parameter aktiviert, eine Sparsity von ungefähr 95 %, aufgebaut auf einer Architektur, die Alibaba ausdrücklich als frühe Vorschau der Qwen4-Generation beschreibt. Die Produktions-API ist live in der QwenCloud zu 0,15 US-Dollar pro Million Input-Tokens, 0,47 US-Dollar pro Million Output-Tokens und 0,016 US-Dollar pro Million bei Cache-Treffern — der günstigste Weg, etwas zu betreiben, das strukturell von Alibabas nächstem Flaggschiff abstammt, und das erste Mal, dass das Labor eine Architektur-Vorschau als öffentliche offene Gewichte veröffentlicht hat, bevor die vollständige Modellfamilie existiert.
Eine Zahl wiegt schwerer als der Rest des Datenblatts: 6B. Qwen3.8-Flash bezieht seine Leistungsfähigkeit nicht aus schierer Größe — sondern daraus, wohin es die Rechenleistung steckt. Ein 125B-MoE-Grundgerüst, eine 51B-N-Gramm-Embedding-Tabelle und ein kleines Multi-Token-Prädiktionsmodul speichern fast 180B Parameter auf der Platte, doch jeder Token durchläuft nur 6B davon. Das ist die Wette, auf der dieses gesamte Release steht, und es ist der Grund, warum die Trainingskosten so stark gesunken sind.
Was tatsächlich ausgeliefert wurde
Qwen3.8-Flash, ohne das Suffix, ist das produktionsreife Modell, das jetzt live auf der QwenCloud-API und in Alibabas Qwen Office-Produkt verfügbar ist; es wird mit einem Standardkontext von 1M Token und integrierten Tools ausgeliefert, zu $0,15/$0,47 pro Million Token und Cache-Treffern bei $0,016. Am 28. August wurde die Verfügbarkeitsliste erweitert: Laut Alibabas Ankündigung ist Qwen3.8-Flash nun auch über OpenCode Go erreichbar, das Flatrate-Abonnement des Open-Source-Terminal-Coding-Agenten – OpenCodes eigene Modellliste führt es als qwen3.8-flash zu denselben Preisen von $0,15/$0,47 pro Million.

Die offizielle Ankündigung von Qwen Studio stellt die Veröffentlichung der offenen Gewichte als Einladung an das Ökosystem dar: die strukturellen Änderungen frühzeitig auszuliefern, damit sich die Community und die Inferenz-Stacks anpassen können, bevor die vollständige Qwen4-Modellreihe aufgebaut ist. Das erste Zeichen, dass das funktioniert hat, ist SGLang – die von LMSYS unterstützte Inferenz-Engine – die noch am selben Tag Day-0-Unterstützung für Qwen3.8-Flash-Next veröffentlichte, wobei das Modell auch für Transformers, vLLM und TokenSpeed konfiguriert ist.
Die Architektur ist die Geschichte.
Dies ist kein herunterskaliertes Modell der Qwen-3.8-Generation. Qwen3.8-Flash führt vier Änderungen ein, die laut Team die Qwen4-Familie übernehmen wird, und jede zielt auf einen anderen Engpass ab.
• Attention — Gated DeltaNet plus Qwen Sparse Attention. Gated DeltaNet (GDN) komprimiert die Historie in drei von vier Schichten in Zustände fester Größe, sodass das Modell nicht bei jedem Schritt alles erneut liest; QSA behandelt langen Kontext dann als Suchproblem – ein leichtgewichtiger Indexer fasst die Sequenz zu Mikroblöcken zusammen, bewertet die Wichtigkeit auf Blockebene und lenkt die Aufmerksamkeit auf die relevantesten Bereiche. Nach Messungen von Alibaba erreicht der QSA-Attentionskern bei einem 1M-Token-Kontext bis zu 7,6× schnelleres Prefill und 4,9× schnelleres Decode (vom Anbieter gemeldet).
• Residual – Gated Residual. Der einzelne Residualstrom wird zu vier parallelen Zweigen mit elementweisem Gating, wodurch das Netzwerk pro Token entscheiden kann, wie viel es auf jedem Zweig liest und schreibt; ein Zweig etabliert sich als Fernkanal, der frühe Aufmerksamkeitschichten mit tiefen Schichten verbindet. Residualzustände werden in FP8 gespeichert, um die Speicherbandbreite zu reduzieren.
• Einbettung — N-Gramm-Einbettungen. Eine Nachschlagetabelle mit 51B Parametern, die auf dem aktuellen Token sowie mehreren vorherigen basiert. Sie erhöht die Kapazität, ohne den Rechenaufwand pro Token zu erhöhen, und da die Tabelle im Host-Speicher liegen und asynchron vorab geladen werden kann, belegt sie den GPU-Speicher nicht dauerhaft.
Optimierer — Muon. Große 2D-lineare Parameter (Attention, GDN, MoE-Experten) werden mit Muon trainiert, während Embeddings, der Router und die Gated-Residual-Low-Rank-Teile AdamW beibehalten; das Team hat das Skalierungsgesetz für die neue Architektur neu an den Mix angepasst.

Für Entwickler sind zwei davon sofort relevant: der Attention-Stack ist der Grund, warum ein 1M-Token-Kontext der Standard statt eines ehrgeizigen Ziels sein kann, und die N-Gramm-Tabelle ist der Grund, warum ein 125B-Modell weiterhin schlank ausgeliefert werden kann. Der Rest ist Vorschau-Material für Qwen4 — und genau so positioniert Alibaba es.
Das Benchmark-Blatt, ehrlich beschriftet.
Jede Zahl in diesem Abschnitt ist eine eigene Bewertung von Alibaba, einen Tag alt und zum Zeitpunkt der Erstellung von keinem unabhängigen Labor reproduziert. Betrachten Sie sie als Richtungsangaben, nicht als endgültige Ergebnisse. In Alibabas Suite erreicht Qwen3.8-Flash-Next (6B aktiv) SWE-bench Pro 62,5, DeepSWE 1.1 58,7, CoWorkBench 73,9, AndroidWorld 84,5 und MathVision 95,7, mit einem JobBench-Wert von 55,7 — und die Basisvariante Qwen3.8-Flash-Next-Base wird als das beste offene Modell bei 8 von 14 Benchmarks in einem direkten Vergleich gemeldet, darunter MMLU-Pro, SuperGPQA, BBH und MMMU.
Alibabas Angaben zur familiären Platzierung sollten als das bezeichnet werden, was sie sind – Angaben. Das Unternehmen sagt, Qwen3.8-Flash schlage Claude Opus 4.6 um 9,1 Punkte bei SWE-bench Pro und etwa 20 Punkte bei JobBench und nähere sich Claude Opus 4.8 bis auf einen Sprung. Alles vom Anbieter gemeldet, alles unabhängig nicht reproduziert. Was heute unabhängig überprüfbar ist, ist enger: Die Gewichte sind veröffentlicht, der Inferenz-Stack führt sie bereits aus, und SGLang hat noch am selben Tag Unterstützung bereitgestellt. Die unabhängige Reproduktion des Benchmark-Blattes ist nur Tage entfernt, nicht Wochen.
Was es kostet
Die Preisgestaltung ist der am einfachsten zu verifizierende Teil, denn es handelt sich um einen veröffentlichten Preis und nicht um einen Benchmark – und am 27. August hat Alibaba den offiziellen Produktionspreis für QwenCloud bestätigt: 0,15 $ pro Million Input-Tokens, 0,47 $ pro Million Output-Tokens und 0,016 $ pro Million bei Cache-Treffern, mit den Inlands-China-Preisen bei 0,8 ¥/2,7 ¥/0,1 ¥. Die Cache-Treffer-Zahl ist diejenige, die für agentische Workloads entscheidend ist: Ein Long-Context-Agent, der bei jedem Schritt einen großen Verlauf erneut liest, zahlt bei wiederholten Lesevorgängen nur Centbeträge – genau der Workload, auf den der Qwen4-preview-Aufmerksamkeits-Stack abzielt. Die chinesische Presse verglich den Schlagzeilenpreis sofort mit denen von Mitbewerbern – etwa ein Drittel dessen, was DeepSeek-V4-Flash verlangt, und ein vernachlässigbarer Rundungsfehler im Vergleich zu proprietären Frontier-Modellen. Nach Alibabas eigener Rechnung kostete der Trainingslauf etwa ein Neuntel von Qwen3.7-Plus, und genau diese strukturelle Hebelwirkung ermöglicht es dem API-Preis, dort zu liegen, wo er liegt.
Verglichen mit dem Rest der Qwen-3.8-Familie ist der Abstand eklatant: Das Flaggschiff Qwen3.8-Max liegt bei 2,00 $ und 6,00 $ pro Million Tokens und ist bei OrcaRouter bereits zum Listenpreis des Anbieters ohne Aufschlag live. Jetzt, da die Produktions-API von Qwen3.8-Flash offen ist, gilt derselbe Pass-through für den offiziellen Satz von 0,15 $/0,47 $ und die Cache-Hit-Rate von 0,016 $ – eine Routing-Schicht ist der Unterschied zwischen einer Preissenkung, von der man liest, und einer, die in der Konfiguration steht. Beide Modelle hinter einem Schlüssel, Failover zwischen ihnen, kein zweiter Vertrag.
Was „Vorschau von Qwen4" bedeutet
Liest man die Ankündigung wörtlich, sind die Einsätze klar: Dies ist keine neue Stufe von Qwen 3.8 — es ist die Architektur von Qwen4, die früh ausgeliefert wurde, unter der schützenden Marke eines kleineren, günstigeren Modells. Die Gründe dafür sind stichhaltig: Frameworks, Quantisierung und Bereitstellungsmuster brauchen Zeit, um auszureifen, und ein 6B-aktives Modell ist ein kostengünstiger Weg für die Community, GDN + QSA in großem Maßstab zu testen, bevor Alibaba das teure Modell darauf aufbaut. Die Kehrseite ist, dass das Produktionsmodell Qwen3.8-Flash eine API ist, die auf einer Architektur basiert, die das breitere Ökosystem noch prüft. Erstanwender sind konstruktionsbedingt der Testsatz.
Der schnelle Weg, es auszuprobieren.
Heute haben Sie vier realistische Optionen. Hosten Sie die offenen Gewichte selbst über vLLM, SGLang, Transformers oder TokenSpeed – der FP8-Build ist die sinnvolle erste Anlaufstelle für alles, was unterhalb eines vollständigen Nodes liegt. Rufen Sie die QwenCloud-API auf, jetzt live zum offiziellen Satz von 0,15 $/0,47 $, mit Cache-Treffern für 0,016 $. Nutzen Sie sie in OpenCode Go, dem Flatrate-Abonnement des Open-Source-Terminal-Coding-Agenten, das diese Woche Qwen3.8-Flash hinzugefügt hat (von Alibaba am 28. August angekündigt, auf OpenCodes eigener Modellliste bestätigt). Oder rufen Sie das Produktions-Flash über einen Router auf, so wie Sie bereits Qwen3.8-Max aufrufen, wobei der offizielle Satz ohne Aufschlag durchgereicht wird – keine maßgeschneiderte Integration, die Sie warten müssen.

Die offene Frage ist die ehrliche: Kann ein Modell, das 6 Milliarden seiner Parameter aktiviert, in der Produktion über eine breite Palette von Arbeitslasten standhalten, oder wird das Benchmark-Blatt, das heute einen Tag alt aussieht, in einem Monat immer noch so aussehen? Das ist kein Grund zu warten – es ist ein Grund, es hinter Failover zu stellen und nicht vor deinen gesamten Stack. Die Gewichte sind draußen, der Preis ist festgelegt, und die Architektur ist Alibabas erklärte Richtung. Die nächsten Wochen entscheiden, ob 6B genug war.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
