
Qwen3.8-Flash-Next vs Qwen3.8-27B: das Qwen4-preview-MoE gegen das Open-Weights-Arbeitstier
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 578 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Das Überraschende an Qwen3.8-Flash-Next ist nicht, dass Alibaba behauptet, ein Modell, das pro Token nur 6 Milliarden Parameter aktiviert, schlage den Großteil des offenen Feldes — sondern dass sein Betrieb mehr Speicher benötigt als der des dichten 27-Milliarden-Parameter-Modells, mit dem es verglichen wird. Qwen3.8-Flash-Next, das am 26. August 2026 als Open-Source-Vorschau der Qwen4-Architektur veröffentlicht wurde, hält eine N-Gramm-Nachschlagetabelle mit 51 Milliarden Parametern im System-RAM statt im VRAM vor; Qwen3.8-27B, das unter Apache-2.0 veröffentlichte multimodale dichte Modell, das Mitte August erschien und das Open-Weights-Arbeitspferd der aktuellen Qwen-3.8-Generation ist, passt bei 4-Bit auf eine einzelne 24-GB-Grafikkarte. In Alibabas eigener Benchmark-Tabelle schlägt das neue MoE das 27B-Modell bei 21 von 22 verglichenen Benchmarks. Bei unabhängigen Belegen — Arena-Platzierungen, eine Studie zu Legal-Agents, Durchsatzmessungen durch Dritte — ist das 27B-Modell das einzige der beiden, das überhaupt welche vorweisen kann. Diese Kombination ist die gesamte Entscheidung.
Das Duell in einem Satz: zwei Open-Weight-Modelle mit Text-und-Vision-Fähigkeiten derselben Generation, derselbe native Kontext von 262K, beide dafür entwickelt, außerhalb eines Rechenzentrums zu laufen – und getrennt durch Architektur, Lizenz, Preis und dadurch, wie viel ihrer Geschichte verifiziert ist. Qwen3.8-Flash-Next ist das Sparse-MoE, das alles vorwegnimmt, was Qwen4 voraussichtlich erben wird. Qwen3.8-27B ist das dichte Modell, das das, was Alibaba beim Bau des 2.4T-Flaggschiffs gelernt hat, in etwas komprimiert, das eine einzelne GPU ausführen kann. Die Wahl zwischen ihnen ist weniger eine Frage der Leistungsfähigkeit – Alibaba sagt, die Vorschau sei voraus – sondern eher, ob man einem erst einen Tag alten Datenblatt des Herstellers mehr vertraut als einem Modell, das bereits von der Community auseinandergenommen wurde.
Die Anzeigetafel
Quellen zuerst: Alle unten aufgeführten Zahlen zu Qwen3.8-Flash-Next stammen von Alibaba selbst, sind einen Tag alt und nicht reproduziert. Die Benchmark-Hauptaussagen des Qwen3.8-27B stammen ebenfalls von Alibaba, aber die 27B weist unabhängige Ergebnisse auf – Platzierungen in Human-Preference-Arenas, eine Studie aus dem Rechtsbereich und AMD-Durchsatzmessungen –, die die Vorschau nicht erreichen kann.
• Gesamtparameter — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B gespeichert), 6B aktiv. Qwen3.8-27B: ~27B dense (28B mit Vision-Encoder), alle aktiv.
• Architektur — Qwen3.8-Flash-Next: Qwen4-Vorschau — Qwen Sparse Attention im Wechsel mit Gated DeltaNet, gated residual, N-Gramm-Einbettungen, mit Muon trainiert. Qwen3.8-27B: 48 GDN-Linear-Attention-Schichten plus 16 Full-Attention-Schichten (3:1), dicht.
Kontext — sowohl 262.144 Token nativ als auch auf 1M via YaRN erweiterbar.
• Modalität — beide akzeptieren Text-, Bild- und Videoeingaben und geben Text zurück.
• Lizenz — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Preis — Qwen3.8-Flash-Next: 0,16 $ / 0,47 $ pro 1M (angekündigt; Produktions-API noch nicht verfügbar). Qwen3.8-27B: 0,33 $ / 2,40 $ pro 1M, heute live.
• Speicherbedarf — Qwen3.8-Flash-Next: 51B-Tabelle im Host-RAM, ~96 GB Systemspeicher plus GPU; FP8 ~186 GB, Q4 GGUF ~82 GB. Qwen3.8-27B: BF16 ~55,6 GB, 4-Bit passt auf eine 24-GB-Karte.
• Unabhängige Belege — Qwen3.8-Flash-Next: noch keine. Qwen3.8-27B: #1 offenes Modell auf Arena.ai Image-to-WebDev, #9 insgesamt auf Code Arena WebDev, #1 Open-Weight bei Harvey's Legal Agent Benchmark, AMD-gemessener Durchsatz.

Nach Alibabas eigenen Zahlen gewinnt die Vorschau fast alles.
In Alibabas veröffentlichtem Vergleich erzielt Qwen3.8-Flash-Next bei 21 von 22 Sprach- und Bild-Benchmarks gleichwertige oder bessere Werte als Qwen3.8-27B – und die Siege sind keine reine Kosmetik. SWE-bench Pro 62,5 gegenüber 61,7 ist ein marginaler Vorsprung, aber DeepSWE 58,7 gegenüber 42,2, JobBench 55,7 gegenüber 33,4 und CoWorkBench 73,9 gegenüber 70,7 sind echte Abstände genau bei den agentischen und Office-Workloads, auf die die Flash-Stufe abzielt. Die Headline-Zahlen der Vorschau – LiveCodeBench v6 91,9, GPQA Diamond 91,7, MathVision 95,7 – übertreffen in Alibabas Tabelle ebenfalls die entsprechenden Zeilen der 27B-Variante. Das ist die These des Releases, in Daten ausgedrückt: der Großteil der Denk- und Codierfähigkeiten der größeren Qwen-3.8-Linie zu einem Bruchteil der aktiven Rechenleistung.
Behalte das Label an diesem Satz. Dies sind Alibabas eigene Bewertungen, aus Alibabas eigener Testumgebung, im Fall der Vorschau einen Tag alt und für beide nicht repliziert. Der KGP-Talkie-Architektur-Teardown, der für dieses Aufeinandertreffen rankt, kommt zu derselben Art von Schlussfolgerung, stützt sich aber auf dieselbe Herstellerunterlage. Eine Herstellertabelle ist ein Versprechen; nichts in diesem Absatz wurde unabhängig bestätigt.
Was das 27B hat, was Flash-Next nicht hat: Beweise
An diesem Punkt ist der Vergleich nicht mehr einseitig. Qwen3.8-27B ist seit zwei Wochen öffentlich verfügbar, und die Community hat drei unabhängige Datenpunkte geliefert. Auf dem Image-to-WebDev-Ranking von Arena.ai — bei dem blinde Menschen darüber abstimmen, welche von zwei anonymisierten Ausgaben ein Betrachter eher veröffentlichen würde — belegt die 27B den 1. Platz unter den offenen Modellen und insgesamt Platz 7 mit einem gemeldeten Score von 1.574. Auf dem Schwester-Board Code Arena WebDev liegt sie mit 1.595 insgesamt auf Platz 9, das einzige Modell ihrer Größenklasse in den Top Ten. Harvey, das Legal-AI-Unternehmen, und Engram führten eine Studie über synthetische Anwaltskanzleien durch, die eine angepasste 27B an die Spitze ihrer Legal-Agent-Benchmark brachte — mit der Einschränkung, dass das Modell den Testkorpus zuvor studiert hatte, was es eher zu einer Demonstration des Fine-Tuning-Spielraums macht als zu einem Wert für die Standardgewichte. AMD veröffentlichte Day-0-Durchsatzmessungen: 24,5 Token/s auf einem Ryzen AI Max+ 395 und 51,8 Token/s auf einer Radeon AI PRO R9700. Keiner dieser Werte ist ein allgemeiner Qualitätswert — es gibt weiterhin keinen Artificial-Analysis-Index für die 27B — aber jeder stammt von einem Dritten, der das Modell tatsächlich ausgeführt hat.
Qwen3.8-Flash-Next hat nichts davon. Sein gesamtes Benchmark-Blatt stammt von Alibaba, ist zum Zeitpunkt des Schreibens erst Stunden alt, und kein unabhängiges Labor hat auch nur eine einzige Zeile reproduziert. Das ist keine Anschuldigung, sondern die Definition einer einen Tag alten Veröffentlichung. Aber genau diese Asymmetrie sollte die Wahl bestimmen: Die Vorschau liegt bei den einzigen vorhandenen Zahlen vorn, und jede dieser Zahlen stammt von dem Anbieter, der möchte, dass du ihm glaubst.
Der Deployment-Fork
Der praktische Unterschied zwischen diesen beiden Modellen liegt darin, wo die Parameter liegen, und das bestimmt, welche Hardware man benötigt. Qwen3.8-Flash-Next lagert seine 51B-N-Gramm-Embedding-Tabelle bewusst in den Host-Speicher aus, wo sie asynchron vorab geladen werden kann — genau deshalb fügt sie 51B Parameter an Kapazität hinzu, ohne den Rechenaufwand pro Token zu erhöhen. Die Folge ist, dass das Modell nicht auf eine 24-GB-Consumer-Grafikkarte passt, so wie ein lokales Qwen es bisher getan hat. Community-Schätzungen beziffern ein Q4-GGUF auf insgesamt etwa 82 GB (etwa 58 GB Hauptgewichte plus die 24-GB-Lookup-Tabelle), den FP8-Build auf etwa 186 GB, BF16 auf etwa 360 GB; das funktionierende Rezept ist ein Rechner mit rund 96 GB Arbeitsspeicher plus einer beliebigen GPU, die die aktiven 6B ausführt. Der Lohn ist, dass der Rechenaufwand pro Token gering ist — das ganze Kalkül der Architektur — und lange Kontexte mit 1 M Token erschwinglich bleiben, weil die GDN-Schichten die Historie komprimieren, anstatt den KV-Cache wachsen zu lassen.
Qwen3.8-27B ist das Modell genau umgekehrt: dicht, sodass jedes Token alle 27B Parameter durchläuft, aber klein genug, dass das Ganze auf Hardware passt, die du bereits besitzt. Die BF16-Gewichte umfassen etwa 55,6 GB; bei 4-Bit läuft es auf einer 24-GB-Karte wie einer RTX 3090 oder 4090, und AMDs Messungen zeigen 24,5 bis 51,8 Token/s auf AI-Max- und Radeon-PRO-Hardware. Wenn die Einschränkung eine einzelne Workstation ist, ist die 27B diejenige, die tatsächlich passt; wenn die Einschränkung die Kosten pro Token bei Skalierung ist, gewinnt Flash-Next auf dem Papier.
Die Preisspanne
Die API-Preise erzählen dieselbe Geschichte von der anderen Seite. Qwen3.8-27B ist heute auf OrcaRouter live zu $0,33 pro Million Eingabe-Token und $2,40 pro Million Ausgabe-Token, wobei der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird – die Selbsthosting-Option ist verfügbar, ohne eine GPU kaufen zu müssen. Qwen3.8-Flash-Next wird noch nirgendwo geroutet: Die offenen Gewichte sind der einzige Weg, bis das Produktionsmodell Qwen3.8-Flash auf der QwenCloud-API zu den angekündigten $0,16/$0,47 verfügbar ist. Wenn diese API verfügbar ist, sorgt dieselbe Weitergabe am selben Tag für den $0,16/$0,47-Preis auf unserer Seite, unter demselben Schlüssel wie beim 27B, mit automatischem Failover zwischen beiden – der Weg, eine einen Tag alte Architektur einzuführen, besteht also nicht darin, die Produktion auf sie zu setzen, sondern einen Teil des Datenverkehrs darauf zu lenken, mit dem bewährten Modell als Fallback. Eine Routing-Ebene kann auch ein Modell vorschalten, das Sie selbst betreiben, was der praktische Weg ist, die offenen Gewichte von Flash-Next heute zu evaluieren, ohne eine zweite Integration.

Welches soll ausgeführt werden?
Wählen Sie Qwen3.8-Flash-Next, wenn Sie jetzt in die Qwen4-Richtung gehen möchten, wenn Ihre Arbeitslast hoch genug ist, dass $0.16/$0.47 gegenüber $0.33/$2.40 eine echte Zahl ist, oder wenn Sie den Arbeitsspeicher haben, es selbst zu hosten, und sich auf einem Anbieterblatt wohlfühlen. Wählen Sie Qwen3.8-27B, wenn Sie Apache-2.0-Bedingungen, eine einzelne 24-GB-Karte, ein Modell, das Sie heute aufrufen können, oder ein gewisses Maß an unabhängigen Beweisen benötigen – es ist das einzige der beiden, das von jemandem außerhalb von Alibaba ausgeführt wurde.

Die beiden obigen Screenshots sind die öffentlichen Oberflächen der beiden Hälften: der OrcaRouter-Eintrag, in dem Qwen3.8-27B heute für $0.33/$2.40 aufrufbar ist, und die Qwen/Qwen3.8-Flash-Next-Modellkarte auf Hugging Face.
Und der ehrliche Schluss ist eine Frage, weil die Evidenzbasis einen Tag alt ist: {{1}}kann ein Modell, das 6 Milliarden seiner Parameter aktiviert, einen 21-von-22-Sweep bei unabhängiger Replikation aufrechterhalten{{/1}}, oder ist die N-Gramm-Tabelle, die für schlankes Serving sorgt, auch das, was bei realen Workloads versagt? Die 27B hat bereits zwei Wochen Prüfung durch die Community überstanden. Flash-Next steht da, wo die 27B vor zwei Wochen stand — {{2}}was das beste Argument dafür ist, sie nebeneinander laufen zu lassen, statt sich zu entscheiden{{/2}}.
