Qwen3.8-Flash-Next vs Qwen3.8-27B — das Qwen4-preview-MoE gegen das Open-Weights-Arbeitstier. Regenerierte Illustration.
Guides & Insights

Qwen3.8-Flash-Next vs Qwen3.8-27B: das Qwen4-preview-MoE gegen das Open-Weights-Arbeitstier

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Überraschende an Qwen3.8-Flash-Next ist nicht, dass Alibaba behauptet, ein Modell, das pro Token nur 6 Milliarden Parameter aktiviert, schlage den Großteil des offenen Feldes — sondern dass sein Betrieb mehr Speicher benötigt als der des dichten 27-Milliarden-Parameter-Modells, mit dem es verglichen wird. Qwen3.8-Flash-Next, das am 26. August 2026 als Open-Source-Vorschau der Qwen4-Architektur veröffentlicht wurde, hält eine N-Gramm-Nachschlagetabelle mit 51 Milliarden Parametern im System-RAM statt im VRAM vor; Qw​en3.8-27B, das unter Apache-2.0 veröffentlichte multimodale dichte Modell, das Mitte August erschien und das Open-Weights-Arbeitspferd der aktuellen Qw​en-3.8-Generation ist, passt bei 4-Bit auf eine einzelne 24-GB-Grafikkarte. In Alibabas eigener Benchmark-Tabelle schlägt das neue MoE das 27B-Modell bei 21 von 22 verglichenen Benchmarks. Bei unabhängigen Belegen — Arena-Platzierungen, eine Studie zu Legal-Agents, Durchsatzmessungen durch Dritte — ist das 27B-Modell das einzige der beiden, das überhaupt welche vorweisen kann. Diese Kombination ist die gesamte Entscheidung.

Das Duell in einem Satz: zwei Open-Weight-Modelle mit Text-und-Vision-Fähigkeiten derselben Generation, derselbe native Kontext von 262K, beide dafür entwickelt, außerhalb eines Rechenzentrums zu laufen – und getrennt durch Architektur, Lizenz, Preis und dadurch, wie viel ihrer Geschichte verifiziert ist. Qwen3.8-Flash-Next ist das Sparse-MoE, das alles vorwegnimmt, was Qwen4 voraussichtlich erben wird. Qw​en3.8-27B ist das dichte Modell, das das, was Alibaba beim Bau des 2.4T-Flaggschiffs gelernt hat, in etwas komprimiert, das eine einzelne GPU ausführen kann. Die Wahl zwischen ihnen ist weniger eine Frage der Leistungsfähigkeit – Alibaba sagt, die Vorschau sei voraus – sondern eher, ob man einem erst einen Tag alten Datenblatt des Herstellers mehr vertraut als einem Modell, das bereits von der Community auseinandergenommen wurde.

Die Anzeigetafel

Quellen zuerst: Alle unten aufgeführten Zahlen zu Qwen3.8-Flash-Next stammen von Alibaba selbst, sind einen Tag alt und nicht reproduziert. Die Benchmark-Hauptaussagen des Qw​en3.8-27B stammen ebenfalls von Alibaba, aber die 27B weist unabhängige Ergebnisse auf – Platzierungen in Human-Preference-Arenas, eine Studie aus dem Rechtsbereich und AMD-Durchsatzmessungen –, die die Vorschau nicht erreichen kann.

• Gesamtparameter — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B gespeichert), 6B aktiv. Qw​en3.8-27B: ~27B dense (28B mit Vision-Encoder), alle aktiv.

• Architektur — Qwen3.8-Flash-Next: Qwen4-Vorschau — Qw​en Sparse Attention im Wechsel mit Gated DeltaNet, gated residual, N-Gramm-Einbettungen, mit Muon trainiert. Qw​en3.8-27B: 48 GDN-Linear-Attention-Schichten plus 16 Full-Attention-Schichten (3:1), dicht.

Kontext — sowohl 262.144 Token nativ als auch auf 1M via YaRN erweiterbar.

• Modalität — beide akzeptieren Text-, Bild- und Videoeingaben und geben Text zurück.

• Lizenz — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.

• Preis — Qwen3.8-Flash-Next: 0,16 $ / 0,47 $ pro 1M (angekündigt; Produktions-API noch nicht verfügbar). Qw​en3.8-27B: 0,33 $ / 2,40 $ pro 1M, heute live.

• Speicherbedarf — Qwen3.8-Flash-Next: 51B-Tabelle im Host-RAM, ~96 GB Systemspeicher plus GPU; FP8 ~186 GB, Q4 GGUF ~82 GB. Qwen3.8-27B: BF16 ~55,6 GB, 4-Bit passt auf eine 24-GB-Karte.

• Unabhängige Belege — Qwen3.8-Flash-Next: noch keine. Qw​en3.8-27B: #1 offenes Modell auf Arena.ai Image-to-WebDev, #9 insgesamt auf Code Arena WebDev, #1 Open-Weight bei Harvey's Legal Agent Benchmark, AMD-gemessener Durchsatz.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

Nach Alibabas eigenen Zahlen gewinnt die Vorschau fast alles.

In Alibabas veröffentlichtem Vergleich erzielt Qwen3.8-Flash-Next bei 21 von 22 Sprach- und Bild-Benchmarks gleichwertige oder bessere Werte als Qw​en3.8-27B – und die Siege sind keine reine Kosmetik. SWE-bench Pro 62,5 gegenüber 61,7 ist ein marginaler Vorsprung, aber DeepSWE 58,7 gegenüber 42,2, JobBench 55,7 gegenüber 33,4 und CoWorkBench 73,9 gegenüber 70,7 sind echte Abstände genau bei den agentischen und Office-Workloads, auf die die Flash-Stufe abzielt. Die Headline-Zahlen der Vorschau – LiveCodeBench v6 91,9, GPQA Diamond 91,7, MathVision 95,7 – übertreffen in Alibabas Tabelle ebenfalls die entsprechenden Zeilen der 27B-Variante. Das ist die These des Releases, in Daten ausgedrückt: der Großteil der Denk- und Codierfähigkeiten der größeren Qw​en-3.8-Linie zu einem Bruchteil der aktiven Rechenleistung.

Behalte das Label an diesem Satz. Dies sind Alibabas eigene Bewertungen, aus Alibabas eigener Testumgebung, im Fall der Vorschau einen Tag alt und für beide nicht repliziert. Der KGP-Talkie-Architektur-Teardown, der für dieses Aufeinandertreffen rankt, kommt zu derselben Art von Schlussfolgerung, stützt sich aber auf dieselbe Herstellerunterlage. Eine Herstellertabelle ist ein Versprechen; nichts in diesem Absatz wurde unabhängig bestätigt.

Was das 27B hat, was Flash-Next nicht hat: Beweise

An diesem Punkt ist der Vergleich nicht mehr einseitig. Qw​en3.8-27B ist seit zwei Wochen öffentlich verfügbar, und die Community hat drei unabhängige Datenpunkte geliefert. Auf dem Image-to-WebDev-Ranking von Arena.ai — bei dem blinde Menschen darüber abstimmen, welche von zwei anonymisierten Ausgaben ein Betrachter eher veröffentlichen würde — belegt die 27B den 1. Platz unter den offenen Modellen und insgesamt Platz 7 mit einem gemeldeten Score von 1.574. Auf dem Schwester-Board Code Arena WebDev liegt sie mit 1.595 insgesamt auf Platz 9, das einzige Modell ihrer Größenklasse in den Top Ten. Harvey, das Legal-AI-Unternehmen, und Engram führten eine Studie über synthetische Anwaltskanzleien durch, die eine angepasste 27B an die Spitze ihrer Legal-Agent-Benchmark brachte — mit der Einschränkung, dass das Modell den Testkorpus zuvor studiert hatte, was es eher zu einer Demonstration des Fine-Tuning-Spielraums macht als zu einem Wert für die Standardgewichte. AMD veröffentlichte Day-0-Durchsatzmessungen: 24,5 Token/s auf einem Ryzen AI Max+ 395 und 51,8 Token/s auf einer Radeon AI PRO R9700. Keiner dieser Werte ist ein allgemeiner Qualitätswert — es gibt weiterhin keinen Artificial-Analysis-Index für die 27B — aber jeder stammt von einem Dritten, der das Modell tatsächlich ausgeführt hat.

Qwen3.8-Flash-Next hat nichts davon. Sein gesamtes Benchmark-Blatt stammt von Alibaba, ist zum Zeitpunkt des Schreibens erst Stunden alt, und kein unabhängiges Labor hat auch nur eine einzige Zeile reproduziert. Das ist keine Anschuldigung, sondern die Definition einer einen Tag alten Veröffentlichung. Aber genau diese Asymmetrie sollte die Wahl bestimmen: Die Vorschau liegt bei den einzigen vorhandenen Zahlen vorn, und jede dieser Zahlen stammt von dem Anbieter, der möchte, dass du ihm glaubst.

Der Deployment-Fork

Der praktische Unterschied zwischen diesen beiden Modellen liegt darin, wo die Parameter liegen, und das bestimmt, welche Hardware man benötigt. Qwen3.8-Flash-Next lagert seine 51B-N-Gramm-Embedding-Tabelle bewusst in den Host-Speicher aus, wo sie asynchron vorab geladen werden kann — genau deshalb fügt sie 51B Parameter an Kapazität hinzu, ohne den Rechenaufwand pro Token zu erhöhen. Die Folge ist, dass das Modell nicht auf eine 24-GB-Consumer-Grafikkarte passt, so wie ein lokales Qw​en es bisher getan hat. Community-Schätzungen beziffern ein Q4-GGUF auf insgesamt etwa 82 GB (etwa 58 GB Hauptgewichte plus die 24-GB-Lookup-Tabelle), den FP8-Build auf etwa 186 GB, BF16 auf etwa 360 GB; das funktionierende Rezept ist ein Rechner mit rund 96 GB Arbeitsspeicher plus einer beliebigen GPU, die die aktiven 6B ausführt. Der Lohn ist, dass der Rechenaufwand pro Token gering ist — das ganze Kalkül der Architektur — und lange Kontexte mit 1 M Token erschwinglich bleiben, weil die GDN-Schichten die Historie komprimieren, anstatt den KV-Cache wachsen zu lassen.

Qwen3.8-27B ist das Modell genau umgekehrt: dicht, sodass jedes Token alle 27B Parameter durchläuft, aber klein genug, dass das Ganze auf Hardware passt, die du bereits besitzt. Die BF16-Gewichte umfassen etwa 55,6 GB; bei 4-Bit läuft es auf einer 24-GB-Karte wie einer RTX 3090 oder 4090, und AMDs Messungen zeigen 24,5 bis 51,8 Token/s auf AI-Max- und Radeon-PRO-Hardware. Wenn die Einschränkung eine einzelne Workstation ist, ist die 27B diejenige, die tatsächlich passt; wenn die Einschränkung die Kosten pro Token bei Skalierung ist, gewinnt Flash-Next auf dem Papier.

Die Preisspanne

Die API-Preise erzählen dieselbe Geschichte von der anderen Seite. Qw​en3.8-27B ist heute auf OrcaRouter live zu $0,33 pro Million Eingabe-Token und $2,40 pro Million Ausgabe-Token, wobei der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird – die Selbsthosting-Option ist verfügbar, ohne eine GPU kaufen zu müssen. Qwen3.8-Flash-Next wird noch nirgendwo geroutet: Die offenen Gewichte sind der einzige Weg, bis das Produktionsmodell Qwen3.8-Flash auf der QwenCloud-API zu den angekündigten $0,16/$0,47 verfügbar ist. Wenn diese API verfügbar ist, sorgt dieselbe Weitergabe am selben Tag für den $0,16/$0,47-Preis auf unserer Seite, unter demselben Schlüssel wie beim 27B, mit automatischem Failover zwischen beiden – der Weg, eine einen Tag alte Architektur einzuführen, besteht also nicht darin, die Produktion auf sie zu setzen, sondern einen Teil des Datenverkehrs darauf zu lenken, mit dem bewährten Modell als Fallback. Eine Routing-Ebene kann auch ein Modell vorschalten, das Sie selbst betreiben, was der praktische Weg ist, die offenen Gewichte von Flash-Next heute zu evaluieren, ohne eine zweite Integration.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Welches soll ausgeführt werden?

Wählen Sie Qwen3.8-Flash-Next, wenn Sie jetzt in die Qwen4-Richtung gehen möchten, wenn Ihre Arbeitslast hoch genug ist, dass $0.16/$0.47 gegenüber $0.33/$2.40 eine echte Zahl ist, oder wenn Sie den Arbeitsspeicher haben, es selbst zu hosten, und sich auf einem Anbieterblatt wohlfühlen. Wählen Sie Qw​en3.8-27B, wenn Sie Apache-2.0-Bedingungen, eine einzelne 24-GB-Karte, ein Modell, das Sie heute aufrufen können, oder ein gewisses Maß an unabhängigen Beweisen benötigen – es ist das einzige der beiden, das von jemandem außerhalb von Alibaba ausgeführt wurde.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

Die beiden obigen Screenshots sind die öffentlichen Oberflächen der beiden Hälften: der OrcaRouter-Eintrag, in dem Qw​en3.8-27B heute für $0.33/$2.40 aufrufbar ist, und die Qwen/Qwen3.8-Flash-Next-Modellkarte auf Hugging Face.

Und der ehrliche Schluss ist eine Frage, weil die Evidenzbasis einen Tag alt ist: {{1}}kann ein Modell, das 6 Milliarden seiner Parameter aktiviert, einen 21-von-22-Sweep bei unabhängiger Replikation aufrechterhalten{{/1}}, oder ist die N-Gramm-Tabelle, die für schlankes Serving sorgt, auch das, was bei realen Workloads versagt? Die 27B hat bereits zwei Wochen Prüfung durch die Community überstanden. Flash-Next steht da, wo die 27B vor zwei Wochen stand — {{2}}was das beste Argument dafür ist, sie nebeneinander laufen zu lassen, statt sich zu entscheiden{{/2}}.