
Qwen3.8-Flash-Next ist erschienen: Alibaba liefert die Qwen4-Architektur aus, bevor Qwen4 existiert
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 84 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Qwen3.8-Flash-Next hat endlich Zahlen, die Alibaba nicht erzeugt hat – und sie sagen nicht, was die lauteste Version der Erzählung sagt. Auf dem Artificial Analysis Intelligence Index, der am 7. September auf v4.3 neu berechnet wurde, erzielt Alibabas Open-Weight-Vorschau 40 Punkte und belegt den fünften Platz unter den 113 Modellen ihrer Vergleichsklasse. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) – das Modell, gegen das es immer wieder gemessen wird – erzielt 35 Punkte und belegt den neunten Platz. Das ist kein Gleichstand; es ist ein Vorsprung von fünf Punkten für das kleinere Modell. Es ist außerdem die erste breite, unabhängige Rangliste, die ein Modell erfasst, dessen einzige veröffentlichte Zahlen bis zu diesem Monat die des Anbieters selbst waren. Das Modell selbst ist nicht neu: Die Gewichte gingen am 24. August auf Hugging Face live, und die offizielle ModelScope-Veröffentlichung erfolgte am 26. August. Was sich diesen Monat geändert hat, ist, dass ein Leser die Behauptungen jetzt überprüfen kann, statt sie einfach zu glauben.
Der Anstoß, diesen Beitrag erneut aufzugreifen, kam von @teortaxesTex auf X, der fragte, ob die Vorschau stillschweigend zu wenig gehypt wird: angeblich auf derselben Stufe bei Artificial Analysis wie DeepSeek V4 Flash 0731, „fast 4x kleiner“, mit „fast 3x weniger aktiven Parametern“. Zwei dieser drei Behauptungen überstehen den Kontakt mit den veröffentlichten Daten nicht — und die Korrektur fällt zugunsten des Modells aus, denn bei den Zahlen, auf die es ankommt, liegt die Vorschau vor ihrem Vergleichsmodell, nicht gleichauf damit.
Beginnen wir mit der Größe, wo die Zahlen eindeutig sind. Qwen3.8-Flash-Next speichert rund 180B Parameter — einen 125B großen Mixture-of-Experts-Körper, eine separate 51B große n-Gramm-Embedding-Tabelle und etwa 4B an Multi-Token-Prediction-Schichten — und aktiviert pro Token 6B davon. DeepSeek V4 Flash 0731 speichert 284B und aktiviert 13B. Das sind die Zahlen auf Qwens Modellkarte und in der Dokumentation von DeepSeek, und es sind die Zahlen, die Artificial Analysis auf beiden Modellseiten führt. Die daraus resultierenden Verhältnisse sind 1,6-fach bei den gespeicherten Parametern und 2,2-fach bei den aktiven Parametern. Das ist eine echte Effizienzgeschichte, und sie ist der Grund, warum diese Architektur von Bedeutung ist — aber es sind nicht 4-fach und nicht 3-fach. Wir konnten nirgendwo eine veröffentlichte Zahl finden, die die größeren Multiplikatoren stützt. Wenn die Absicht der Speicherbedarf im Betrieb und nicht die Parameteranzahl war, ist diese Zahl ebenfalls nicht veröffentlicht.
Was wurde angekündigt?
Alibaba veröffentlichte die Qwen4-Architektur, bevor es ein Qwen4-Modell veröffentlichte. Qwen3.8-Flash-Next – ein multimodales Mixture-of-Experts-Modell mit offenen Gewichten, das auf der Architektur der nächsten Generation basiert, die die Qwen4-Familie antreiben wird – erschien in zwei Schritten: Das offizielle Repository Qwen/Qwen3.8-Flash-Next ging am 24. August auf Hugging Face online, zwei Tage vor der ModelScope-Veröffentlichung, auf die der Teaser-Timer hingedeutet hatte. Der formelle ModelScope-Release erfolgte am 26. August um 23:00 UTC+08:00, wobei die bereitgestellte Qwen3.8-Flash-Variante zeitgleich bepreist wurde. Die zentrale Behauptung auf der Modellkarte, die seither die Runde macht, ist, dass ein Modell, das pro Token 6B Parameter aktiviert, Claude Opus 4.6 Max in 8 von 9 vergleichbaren Benchmarks auf Alibabas eigener Tabelle übertrifft. Die vollständige Qwen4-Familie, so sagt Alibaba immer wieder, kommt später.
Wenn Sie in diesem Monat den Rhythmus von Alibaba nicht verfolgt haben, dann ist Qwen3.8-Max der Bezugspunkt — das Flaggschiff mit 2,4 Billionen Parametern, das am 3. August veröffentlicht und weniger als zwei Wochen später unter dem Namen Qwen3.8-2.4T-A95B als Open Source freigegeben wurde. Die Gewichte von Qwen3.8-Flash-Next sind weniger als einen Monat später verfügbar. Dasselbe Labor, das ein Open-Weight-Modell mit 2,4 Billionen Parametern herausgebracht hat, gibt jetzt die Architektur für die darauffolgende Generation heraus, noch bevor das Flaggschiff dieser Generation überhaupt einen Namen bekommen hat.

Der Teil, der es wert ist, noch einmal gelesen zu werden, ist die eigene Darstellung von Alibaba. Das Modell wird als auf der Next-Generation-Architektur aufbauend beschrieben, „die die kommende Qwen4-Familie antreiben wird“ – und ausdrücklich nicht als Qwen4 selbst. Der von Alibaba angegebene Grund ist, dass die architektonischen Änderungen in den Händen der Community liegen sollten, bevor die Familie erscheint, damit Laufzeitumgebungen, Quantisierungen und Anwendungen bereit sind, wenn das echte Produkt ausgeliefert wird. Das ist eine Marketingposition, aber es ist auch eine technische Verpflichtung: zuerst den schwierigen Teil als Vorschau zeigen, die Community mitnehmen.
Was die Modellkarte klärt – und was nicht:
Bestätigt, laut der offiziellen Modellkarte: Qwen3.8-Flash-Next ist ein Open-Weight-Modell, multimodal und ein Mixture-of-Experts-Modell auf der Qwen4-Architektur — die Karte bezeichnet es als „an experimental preview of the architecture that will underpin Qwen4.“
• Bestätigt, laut Modellkarte und Konfiguration: zwei zentrale architektonische Änderungen — Gated Delta Network (GDN) und Qwen Sparse Attention (QSA) — innerhalb eines 48-Schichten-Hybrids, der 36 lineare Attention-Schichten gegenüber 12 vollständigen Attention-Schichten umfasst.
• Bestätigt aus dem Repository: 125 Mrd. Gesamtparameter, wobei 6 Mrd. pro Token aktiviert werden (512 Experten, 10 geroutet plus ein geteilter) — Artificial Analysis listet 180 Mrd., sobald die separate 51 Mrd. N-Gramm-Einbettungstabelle und die MTP-Schichten mitgezählt werden — mit einem nativen Kontext von 262.144 Token, erweiterbar auf 1.000.000 unter der Qwen Community License 1.0.
• Nicht länger unbestätigt: Das Modell ist inzwischen unabhängig bewertet worden – gleich zweimal. Alibabas Tabelle ist nach wie vor die des Anbieters selbst und nach wie vor nicht reproduziert, aber sie ist nicht mehr der einzige Beleg im Raum.
Die ersten unabhängigen Bewertungen sind da — und sie sagen "vorne", nicht "gleichauf"
Artificial Analysis hat am 7. September Intelligence Index v4.3 veröffentlicht, und die Neubewertung ist der Grund, warum all dies überhaupt vergleichbar ist. Das Update auf v4.3 ersetzte Terminal-Bench v2.1 durch das deutlich schwierigere Terminal-Bench v4.0 und tauschte τ³-Banking gegen AutomationBench-AA, einen agentischen Workflow-Benchmark, der mit Zapier auf einem privaten Hold-out-Testsatz mit 657 Aufgaben erstellt wurde. Die Gewichtung privater Hold-out-Daten stieg auf 45 %. Der angegebene Zweck war, die Frontier daran zu hindern, den Index auszutricksen, und die Wirkung auf die Punktzahlen war groß: GPT-6 Astra und Claude Fable 5.1, die beiden Spitzenreiter, landeten beide bei 53, nachdem sie auf der alten Skala in den Sechzigern bewertet worden waren.
Das ist wichtig, wenn man die Zahlen aus der Community liest. Die Werte „56 versus 52“, die Anfang September für Qwen3.8-Flash-Next und DeepSeek V4 Flash 0731 kursierten, wurden auf dem Index vor v4.3 berechnet; unter v4.3 liegt das Paar bei 40 und 35. Wenn man einen der beiden Werte gegen den anderen stellt, vergleicht man zwei verschiedene Prüfungen.
Im aktuellen Index vergleichen sich die beiden Modelle in den eigenen Evaluierungen von Artificial Analysis tatsächlich so:
• Intelligenzindex — Qwen3.8-Flash-Next 40 (5. von 113 in der Klasse) vs. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 35 (9. von 113).
• Agentische Wissensarbeit — AA-Briefcase 1587 vs. 1259; GDPval-AA v2 1647 vs. 1468; AutomationBench-AA 56 % vs. 54 %.
• Terminal und Programmierung — Terminal-Bench v4.0 25 % vs. 12 %; SciCode 51 % vs. 50 %.
• Allgemeines und wissenschaftliches Schlussfolgern — Humanity's Last Exam 38 % vs. 39 %; CritPt 11 % vs. 17 %; GDP.pdf 16 % vs. 11 %; AA-LCR v1.1 80 % vs. 80 %.
• Faktenabruf versus Konfabulation — AA-Omniscience −10 vs. −14, vier Punkte Vorsprung für die Qwen-Vorschau.
• Preis — 0,15 $ pro Million Eingabe / 0,47 $ pro Million Ausgabe vs. 0,44 $ / 1,32 $; gemischt 0,0882 $ pro Million Tokens vs. 0,2298 $. Kosten pro Aufgabe des Intelligence Index: 0,37 $ vs. 0,22 $.
• Geschwindigkeit und Latenz — 53 Ausgabe-Token pro Sekunde vs. 210; Zeit bis zum ersten Token 2,80 s vs. 0,98 s; End-to-End-Antwort 49,76 s vs. 12,88 s; Zeit pro Aufgabe 1.572,60 s vs. 221,65 s.
• Token-Nutzung — 108k Ausgabe-Tokens pro Aufgabe vs. 62k, davon 72k Reasoning-Tokens vs. 45k. Artificial Analysis bezeichnet die Vorschau als „sehr wortreich“ und „langsamer als der Durchschnitt“.
• Kontext und Größe — 256k Token vs. 1.000k; 180B gesamt / 6B aktiv vs. 284B / 13B.
Zusammengenommen ist das eine präzisere Antwort als „gleiche Stufe“. Qwen3.8-Flash-Next gewinnt den Genauigkeits-und-Effizienz-Vergleich auf fast jeder Achse, die Artificial Analysis misst — es ist das höher bewertete Modell, es ist kleiner und kostet pro Token etwa ein Drittel davon. DeepSeek V4 Flash 0731 gewinnt den Produktions-Vergleich eindeutig: vierfacher Durchsatz, ein Viertel der End-to-End-Latenz, siebenmal weniger Wanduhrzeit pro abgeschlossener Aufgabe und ein viermal so großes Kontextfenster. Und bei den Kosten pro abgeschlossener Aufgabe — die Zahl, die Token-Weitschweifigkeit übersteht — ist DeepSeek mit 0,22 $ gegenüber 0,37 $ das günstigere Modell, trotz des höheren Listenpreises. Wenn „underhyped“ bedeutet „besser als sein Ruf bei der Qualität pro Parameter“, ist die Bezeichnung fair. Wenn damit „Sie sollten stattdessen dies einsetzen“ gemeint ist, sprechen die Geschwindigkeits- und Latenzspalten dagegen.

Es gibt auch außerhalb von Artificial Analysis unabhängige Belege. Ein Drittanbieter-Harness, smf-bench, veröffentlichte am 5. September einen „Official A“-Lauf: Qwen3.8-Flash-Next erzielte in NVIDIAs NVFP4-Quantisierung auf einem einzelnen DGX Spark, Thinking aus, 137 von 157 (87,3 %) mit sauberen 30 von 30 in seinem Coding-Abschnitt, gegenüber 117 von 157 für einen Two-Spark-Lauf von DeepSeek V4 Flash Vision-Exp auf demselben 157-Test-Harness. Das ist ein Harness auf einer Maschinenklasse und kein Ersatz für eine umfassende Evaluation – aber es ist ein zweiter Datenpunkt, der in dieselbe Richtung weist, und er stammt von jemandem, der an keinem der beiden Anbieter ein Eigeninteresse hat.
Was die Qwen4-Architektur tatsächlich ist
Zwei Mechanismen tragen die Geschichte. Der erste, GDN — Gated Delta Network — ist Alibabas Linear-Attention-Schicht. Während ein Standard-Transformer einen Key-Value-Cache vorhält, der mit der Sequenzlänge wächst, unterhält eine GDN-Schicht einen rekurrenten Zustand fester Größe und aktualisiert ihn mit einer erlernten Gating-Regel; die Entwicklungslinie verläuft über DeltaNet und Mamba-2. Der Gewinn ist derjenige, der die Qwen-Linie seit Qwen3-Next im Stillen antreibt: Lange Kontexte bleiben günstig, weil der Zustand nicht wächst, während eine Minderheit von Full-Attention-Schichten im Mix bleibt, um das präzise Retrieval zu leisten, in dem lineare Attention schlecht ist. In der aktuellen Generation beträgt dieses Verhältnis ungefähr drei GDN-Schichten pro Full-Attention-Schicht — eine Community-Analyse des Checkpoints Qwen3.8-2.4T-A95B zählt 69 GDN-Schichten gegenüber 23 Attention-Schichten. Qwen3.8-Flash-Next zeigt dieselbe Drei-zu-eins-Aufteilung: 36 Linear-Attention-Schichten gegenüber 12 Full-Attention-Schichten.
Der zweite, QSA — Qwen Sparse Attention —, ist der wirklich neue Teil, und die öffentliche Beschreibung davon ist noch dünn: Die Modellkarte fügt hinzu, dass es auf Mikroblock-Ebene mit einem Budget von 512 Blöcken / 2048 Token arbeitet, aber eine vollständige technische Ausarbeitung existiert noch nicht. Diese Knappheit an Details ist selbst Teil des Musters. Die Vorschau von Qwen3-Next Ende 2025 führte Gated DeltaNet mit derselben dünnen Dokumentation ein, und die Architektur wurde erst vollständig spezifiziert, als die Qwen3.5-Serie sie übernahm. Für einen Leser ist die praktische Erkenntnis beide Male dieselbe: Der Architektur-Canary taucht zuerst auf, die Dokumentation und die Produktionsmodelle folgen danach.
Das Playbook, das bereits einmal funktioniert hat
Alibaba hat genau dieses Spiel schon einmal gespielt, und es hat funktioniert. Ende 2025 stellte Qwen3-Next Gated DeltaNet und einen Hybrid aus linearer und voller Attention vor. Als die Qwen3.5-Serie erschien, übernahm sie diesen Bauplan im großen Maßstab – und der Hybrid hat sich seitdem durch die Qwen3.8-Generation gezogen, einschließlich des 2,4T-Flaggschiffs. Warum der Präzedenzfall hier zählt, ist das Timing, das er impliziert. Die vollständige Qwen4-Familie dürfte jenseits dieser Vorschau zu erwarten sein, nicht in ihr; wenn der Qwen3-Next-Abstand ein Anhaltspunkt ist, wird die Distanz zwischen „hier ist die Architektur“ und „hier ist die Familie“ in Monaten gemessen. Nichts in der Modellkarte bestätigt das – es ist eine Schlussfolgerung aus einem Muster, das Alibaba nun zweimal durchlaufen hat.
Was wir noch nicht wissen
Die Unbekannten sind weniger geworden, aber sie sind nicht verschwunden:
• Die Benchmark-Tabelle des Anbieters ist weiterhin die des Anbieters. Artificial Analysis hat das Modell inzwischen unabhängig bewertet, was die größte Lücke in der Launch-Berichterstattung schließt — doch Alibabas eigene vielbeachtete Behauptung, dass das Modell Claude Opus 4.6 Max bei 8 von 9 vergleichbaren Benchmarks übertrifft, stützt sich auf Alibabas eigene interne Evaluierungen (CoWorkBench, JobBench, AndroidWorld) neben öffentlichen Benchmarks, und keine davon wurde von einem Dritten reproduziert.
• Ob die Vorschau dasselbe Modell ist wie das bereitgestellte. Die Karte positioniert Qwen3.8-Flash-Next als die experimentelle Vorschau mit offenen Gewichten, während die in der Produktion bereitgestellte Variante – Qwen Cloud's Qwen3.8-Flash – standardmäßig einen Kontext von 1.000.000 Token und integrierte Tools hinzufügt. Ob dieses bereitgestellte Modell dieselbe Architektur unter einem größeren Kontextfenster ist, wird weiterhin nicht angegeben, und die unabhängigen Bewertungen oben gelten für die Vorschau mit offenen Gewichten, nicht für das bereitgestellte API-Modell.
• Die Lizenz ist bekannt und eine echte Lizenz: Die Qwen Community License 1.0 erlaubt kommerzielle Nutzung, einschließlich des Verkaufs abgeleiteter Werke, verlangt jedoch eine separate kommerzielle Vereinbarung mit Alibaba, wenn Sie ein Model-as-a-Service- oder KI-Arbeitsassistenten-Geschäft betreiben und dabei einen definierten Umsatz- und Monatlich-aktive-Nutzer-Schwellenwert überschreiten. Sie ist nicht mit der umsatzabhängigen Qwen3.8-Max-Lizenz identisch, aber es lohnt sich, sie zu lesen, bevor Sie auf den Gewichten aufbauen.
• Ein erwähnenswerter Feldbericht: Ein Bericht vom 6. September über einen Community-NVFP4-Build protokolliert einen Fehler bei grammatikbeschränkten Tool-Aufrufen, wenn Thinking und Multi-Token-Vorhersage beide aktiviert sind, zurückgeführt auf den xgrammar-Pfad zur beschränkten Dekodierung. Das ist ein Laufzeitfehler in einem quantisierten Community-Build und keine Eigenschaft des Modells – aber wenn Ihre Evaluierungs-Harness auf grammatikbeschränkte Tool-Aufrufe setzt, ist es das Erste, was getestet werden sollte.
Eine Familie, die im Zweiwochenrhythmus iteriert
Der umgebende Takt erzählt seine eigene Geschichte. Qwen3.8-Max, das Flaggschiff mit 2,4 Billionen Parametern, wurde am 3. August veröffentlicht; das Open-Weight-Modell Qwen3.8-2.4T-A95B folgte am 12.–13. August; das kostenlose Apache-2.0 Qwen3.8-27B erschien wenige Tage später; und jetzt, noch bevor der Monat zu Ende ist, wird ein Ausblick auf die Architektur der nächsten Generation gegeben – und eine Woche später unabhängig gebenchmarkt. Kein anderes Labor iteriert derzeit in diesem Takt. Für Leser, die Modelle auswählen, ist die praktische Konsequenz, dass „das beste Qwen“ ein bewegliches Ziel ist – und das Delta zwischen den Generationen schneller eintrifft, als sich das umgebende Ökosystem üblicherweise anpasst. Eine Entscheidung statt eines Modells zu kaufen, ist zunehmend die verteidigungsfähige Vorgehensweise.
Was ein Entwickler jetzt tun sollte
Die Effizienzwerte verändern die Kalkulation für lokales Serving stärker, als es der Launch selbst getan hat. Ein Modell mit 6B aktiven Parametern, das im aktuellen Index 40 Punkte erreicht, ist komprimierbar: NVIDIAs offizielle NVFP4-Quantisierung ist diejenige, die der smf-bench-Lauf vom 5. September verwendet hat, und darüber hinaus sind Community-Builds mit NVFP4 und FP8 bereits im Umlauf, was ein Deployment eines mit 180B gespeicherten Modells in der Single-GPU-Klasse überhaupt erst plausibel macht. Der Vorbehalt ist unverändert — dies ist eine unerprobte Preview, die Herstellertabelle ist nicht reproduziert, und die Form der unabhängigen Ergebnisse (stark bei Wissensarbeit und Terminal-Aufgaben, schwächer bei langfristiger Repo-Generierung und One-Shot-Pass-Raten von Agenten) bedeutet, dass die Schwächen des Modells genau dort auftreten, wo Änderungen an Produktionscode stattfinden. Lassen Sie eine Kopie einer echten Workload mit geringem Risiko darauf laufen, bevor sie irgendetwas berührt, das wichtig ist, und lassen Sie automatisches Failover die Momente abfangen, in denen sich eine Preview danebenbenimmt.
Beim Preis ist das Bild, das zum Start unklar war, jetzt konkret. Artificial Analysis listet die bereitgestellte Rate der Vorschau mit 0,15 $ pro Million Input-Tokens und 0,47 $ pro Million Output-Tokens, gegenüber 0,44 $ und 1,32 $ für DeepSeek V4 Flash 0731 – dieselbe Größenordnung wie die bereitgestellte Variante Qwen3.8-Flash, die Qwen Cloud mit ¥1 und ¥3 listet (ungefähr 0,16 $ und 0,47 $). Die Produktionsvariante ist diejenige, die man heute tatsächlich aufrufen kann: Sie wird hier als qwen/qwen3.8-flash geroutet, und OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, wenn Alibaba diese Zahl ändert, ändert sich der Endpunkt noch am selben Tag mit. Dasselbe gilt für das Vergleichsmodell in diesem Artikel – DeepSeek V4 Flash 0731 wird als deepseek/deepseek-v4-flash-0731 zum Listenpreis des Anbieters geroutet, was die Kosten-pro-Token-Hälfte des obigen Vergleichs gegen Ihren eigenen Traffic testbar macht statt gegen die Token-Zahlen eines Benchmarks. Was hier nicht geroutet wird, ist die Open-Weight-Vorschau Flash-Next selbst: Um sie heute zu nutzen, lädt man die Gewichte herunter und betreibt sie selbst, weshalb die Quantisierungsgeschichte oben mehr zählt als der Listenpreis. Die Obergrenze, die diese Generation überschreiten muss, ist auf demselben Endpunkt noch sichtbar: Qwen3.8-Max (qwen/qwen3.8-max) liegt bei 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens, ebenfalls zum Listenpreis des Anbieters weitergegeben.

Die praktische Abfolge hat sich nicht wesentlich geändert, doch das Vertrauen dahinter ist gewachsen. Wenn Sie die bereitgestellte Produktionsvariante möchten, ohne 100GB an Gewichten herunterzuladen, ist Qwen3.8-Flash bereits zum Listenpreis aufrufbar. Wenn Sie die Architektur wollen – GDN, QSA, die n-Gramm-Tabelle, die Offload-Tricks –, sind die Gewichte herunterladbar und die Runtimes bereit: vLLM bedient es ab Tag eins mit einem Offload-Pfad, der die 51B-Parameter-n-Gramm-Embedding-Tabelle im Host-Speicher statt dauerhaft im VRAM hält, SGLang und TensorRT-LLM stehen auf NVIDIAs Day-0-Liste, und Ollamas Bibliothek führt einen MLX-Build, den Sie auf Apple Silicon pullen können. Das Einzige, womit Sie aufhören sollten, ist, das Modell in puncto Qualität als unbekannte Größe zu behandeln. Es ist inzwischen vermessen worden, und es hat gut abgeschnitten.
Was als Nächstes ansehen
• Ob die unabhängigen Zahlen Bestand haben, während der Index reift. Die 40 von Qwen3.8-Flash-Next geht mit einer ungewöhnlich hohen Token-Rechnung einher – beim Index-Lauf verbrauchte es 245 Mio. Token gegenüber einem Median von 140 Mio. – und Artificial Analysis' eigene Anmerkung bezeichnet es als „sehr wortreich“. Ein Score, der durch längeres Reasoning entsteht, ist immer noch ein Score, aber er ist die Art von Wert, die sich ändert, wenn sich die Evaluation ändert. Die nächste Index-Revision ist der eigentliche Test dafür, ob die 40 ein Niveau oder ein lokales Maximum war.
• Ob das bereitgestellte Qwen3.8-Flash separat bewertet wird. Jede unabhängige Zahl in diesem Beitrag bezieht sich auf die Open-Weight-Vorschau. Die Produktionsvariante mit dem 1M-Kontext und integrierten Tools hat keine eigene unabhängige Bewertung, und wenn es sich um dieselbe Architektur unter einem längeren Kontext handelt, ist das eine kostengünstige Evaluierung, die jemand veröffentlichen sollte.
• Wie sich die Day-0-Serving-Unterstützung in der Praxis bewährt — die vom Anbieter genannten GB300-Durchsatzwerte sind nach wie vor nur Herstellerangaben, und die TP4-Expert-Parallel- und KV-Offload-Konfigurationen sind noch neu genug, um fragil zu sein.
• Wie lange Alibaba wartet, bevor die vollständige Qwen4-Familie der Vorschau folgt.
Der Teil dieser Geschichte, den wir bisher kennen, ist nun weitgehend abgeschlossen. Das Datenblatt ist öffentlich, die Gewichte stehen zum Herunterladen bereit, die Architektur ist bestätigt, die bereitgestellte Qwen3.8-Flash-Variante ist zu Listenpreis auf gehosteten APIs live, und das Modell wurde von zwei separaten Parteien unabhängig bewertet – wobei das kleinere Modell das Qualitätsargument gewinnt und das größere das Durchsatzargument. Offen bleibt, ob eine Preview mit 6B aktiven Parametern über die Benchmarks hinaus generalisiert, auf die sie abgestimmt wurde, und wie lange Alibaba wartet, bevor die vollständige Qwen4-Familie folgt. Diese letzte Frage ist nach wie vor die, die das Release unbeantwortet lässt, und sie ist nach wie vor die, die am meisten zählen wird.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
