
Qwen3.8-Omni-Flash vs. Qwen 3.8: Ein Spezialist Bill gegen ein Flaggschiff
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 196 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Wenn Sie die Kurzfassung wollen: Qwen3.8-Omni-Flash ist ungefähr dreizehnmal günstiger pro Token als Qwen 3.8 und ist der einzige der beiden, der dafür gebaut ist, eine Stunde Audio-Video zu verkraften, ohne ins Schwimmen zu geraten — während Qwen 3.8, der offene Kern mit 2,4 Billionen Parametern an der Spitze der Qwen3.8-Reihe, derjenige ist, den Sie nehmen, wenn die Antwort richtig statt billig sein muss, und der einzige der beiden, dessen Gewichte Sie herunterladen können. Sie teilen sich eine Kontextlänge, einen Familiennamen und ein Startfenster von August bis September. Sie sind kein Ersatz füreinander, und der ganze Wert dieses Vergleichs liegt darin zu wissen, welche Frage Sie eigentlich stellen.
Um bei den Namen genau zu sein, denn die Familie ist groß. Qwen 3.8bedeutet hier den 2.4T-A95B-Mixture-of-Experts-Open-Core – das Modell hinter dem Qwen3.8-Max-Endpunkt, das Alibaba am 3. August 2026 vorgestellt und für das es am 12. August die Gewichte veröffentlicht hat, und das Artificial Analysis mit 40 auf seinem Intelligence Index führt. Qwen3.8-Omni-Flashist das native omnimodale Modell, das Alibaba am 18. September 2026 in den API-Dienst genommen hat, aufgebaut auf der Qwen3.8-Flash-Architekturlinie, das Text, Bild, Audio und Video entgegennimmt und Text zurückgibt. Alles über das Flaggschiff stammt vom Hersteller oder aus unabhängiger Indexierung, wie angemerkt; alles über das Omni-Modell stammt allein vom Hersteller, weil es erst wenige Stunden alt ist und niemand außerhalb Alibabas es gemessen hat.
Zwei Modelle, eine Familie, gegensätzliche Designvorgaben
Die Versuchung ist, dies als ein großes Modell und ein kleines Modell derselben Generation zu lesen, so wie man Qwen3.8-Max gegen Qwen3.8-Flash lesen würde. Diese Lesart ist auf eine Weise falsch, die Geld kostet. Der Qwen 3.8 Kern ist eine Reasoning-Engine, die zufällig Bilder und Videos akzeptiert; ihr Durchsatz wird in Tokens pro Sekunde bei schwierigen Problemen gemessen, ihr Preis ist so gesetzt, dass er den Rechenaufwand widerspiegelt, den ein Forward-Pass mit 95 Milliarden aktiven Parametern kostet, und ihr Bewertungsblatt ist eine Liste von Reasoning- und Coding-Boards. Qwen3.8-Omni-Flash ist eine Wahrnehmungs- und Aktions-Engine, die zufällig logisch schlussfolgert; ihr Preis ist gegen die Kosten der Aufnahme von Stunden an Medieninhalten gesetzt, und ihr Bewertungsblatt ist eine Liste von Audio-, Video- und Tool-Calling-Boards. Das eine ist für Tiefe pro Token optimiert. Das andere ist für Tokens pro Stunde Inhalt optimiert.
Dieser Unterschied zeigt sich am deutlichsten an einer Stelle, die das Marketing nicht erwähnt. Beide Modelle akzeptieren rund eine Million Token, und beide akzeptieren Video. Doch Qwen3.8-Omni-Flash wurde explizit auf das Dauerproblem hin konstruiert – bis zu eine Stunde durchgehendes Audio-Video in einem einzigen Aufruf, mit einem Agentic-Understanding-Modus, in dem das Modell auswählt, was es abtastet, statt jedes Einzelbild zu verarbeiten, wodurch die Token pro Anfrage von 145.736 auf 79.117 sinken, während die Genauigkeit auf OmniVideoBench von 63,4 auf 67,8 steigt. Qwen 3.8 hat keinen vergleichbaren veröffentlichten Mechanismus. Ihm zwei Stunden Video zuzuführen ist auf dem Papier möglich; es zu einem Preis zu tun, der den Kontakt mit einem Finanzteam übersteht, ist eine andere Frage – und genau diese Frage wurde das Omni-Modell gebaut, um sie zu beantworten.
Die Dimensionen, die tatsächlich den Ausschlag geben
• Preis — Qwen3.8-Omni-Flash: 0,15 $ pro Million Eingabe-Tokens und 0,47 $ pro Million Ausgabe-Tokens, gegenüber Qwen 3.8 mit 2,00 $ und 6,00 $. Cache-Lesezugriff: 0,016 $ gegenüber 0,25 $.
• Offene Gewichte — Qwen 3.8 veröffentlichte am 12. August 2026 die Gewichte unter einer eigenen Lizenz; Qwen3.8-Omni-Flash ist nur per API verfügbar, und Alibaba hat nicht angekündigt, dass es veröffentlicht wird.
• Kontext — eine Million Tokens auf beiden Seiten; 991K maximaler Input beim Omni-Modell, bei 131K maximaler Ausgabe und einem Reasoning-Budget von 262K.
• Mediendauer – bis zu einer Stunde kontinuierliches Audio-Video in einem einzigen Omni-Call; das Flaggschiff ist für Videoeingabe dokumentiert, ohne dass eine Angabe zu stündlichen Kosten damit verbunden ist.
• Ausgabemodalität — Text auf beiden Seiten. Keine von beiden erzeugt Sprache, trotz der Herkunft des Omni-Modells.
• Unabhängiger Score — Qwen 3.8 liegt bei 40 im Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash hat bisher keinerlei unabhängigen Score.

Warum die Benchmark-Tabellen dies nicht klären können
Es gibt kein direktes Head-to-Head-Board, und es wird so bald auch keines geben. Alibabas Startunterlagen für Qwen3.8-Omni-Flash vergleichen es ausschließlich mit Qwen3.5-Omni-Plus, seinem direkten Vorgänger, und mit Gemini 3.8 Flash; die Zahlen des Flaggschiffs stammen aus einem völlig anderen Satz von Reasoning- und Coding-Evaluierungen. Die beiden Tabellenblätter haben nicht eine einzige Zeile gemeinsam. Wer eine Tabelle veröffentlicht, die sie auf einer Achse nebeneinanderstellt, hat diese Achse selbst gebaut.
Was sich ehrlich sagen lässt, ist richtungsweisend. Nach den eigenen Zahlen des Anbieters ist das Omni-Modell ein großer Schritt gegenüber der Omni-Reihe, die es ersetzt – ein durchschnittlicher Zuwachs von über 26 % über rund dreißig Evaluierungen hinweg, mit WildClawBench-MM bei 71,0, UniClawBench bei 69,6 und LongAudioSpan bei 82,7 – und ein echter, aber nur teilweiser Fortschritt gegenüber Gemini 3.8 Flash, wo es bei audiozentrierten Benchmarks wie SpotSoundBench (67,2 gegenüber 39,7) und MMAU (81,8 gegenüber 76,9) führt und beim reinen Videoreasoning-Benchmark AgenticVBench (36,8 gegenüber 45,0) zurückliegt. Beim Flaggschiff ist Qwen 3.8s Index-Wert von 40 eine unabhängige Messung und mehr wert als alles oben Genannte. Dabei handelt es sich um unterschiedliche Arten von Evidenz, die nicht miteinander gemittelt werden sollten.

Ein durchgerechneter Kostenvergleich mit angegebener Annahme
Nehmen Sie einen Analysejob für lange Dokumente und Videos: 300.000 Eingabe-Tokens und 20.000 Ausgabe-Tokens, eine plausible Größenordnung für ein neunzigminütiges aufgezeichnetes Meeting mit Folien. Bei Qwen3.8-Omni-Flash sind das 300.000 × 0,15 $ pro Million = 0,045 $ an Eingabe und 20.000 × 0,47 $ pro Million = 0,0094 $ an Ausgabe, also etwa 5,4 Cent. Bei Qwen 3.8 kostet derselbe Aufruf 300.000 × 2,00 $ pro Million = 0,60 $ und 20.000 × 6,00 $ pro Million = 0,12 $, also etwa 72 Cent. Etwas mehr als das Dreizehnfache der Kosten bei derselben Token-Anzahl.
Die Zahl, die die Entscheidung verändert, ist nicht das Verhältnis, sondern das Volumen. Bei hundert solchen Aufträgen pro Tag sind das ungefähr 5 $ pro Tag gegenüber ungefähr 72 $ pro Tag – der Unterschied zwischen einem Feature, das Sie ausliefern, und einem Feature, dessen Umfang Sie reduzieren. Doch wenn die Aufgabe eine einzelne schwierige Extraktion aus einem 300K-Token-Vertrag ist, bei der eine falsche Antwort eine Stunde menschlicher Prüfung kostet, ist der 13-fache Preisaufschlag irrelevant, und das stärkere Reasoning-Modell gewinnt dadurch, dass es den ersten Fehler nicht macht. Legen Sie die Annahme fest, bevor Sie auf die Preiszeile schauen, nicht danach.
Wo jedes einzelne tatsächlich gewinnt
Qwen3.8-Omni-Flash gewinnt bei allem, was in Stunden gemessen wird. Besprechungstranskription mit Diarisierung und Extraktion von Folgeaufgaben, Zusammenfassung langer Videos, audiovisuelle Rechercheberichte, Untertitelungs-Pipelines und jeder Agent, der selbst entscheiden muss, welche Minute einer Aufnahme relevant ist. Die vom Anbieter gemeldete Verbesserung der Diarisierung – die Sprecherfehlerrate bei AliMeeting sinkt von 88,11 auf 3,35 – ist die Art von Delta, die eine manuell geprüfte Pipeline in eine automatisierte verwandelt, obwohl eine chinesische technische Analyse des Launches argumentiert, dass ein Großteil dieses Gewinns aus Front-End- und Diarisierungs-Engineering rund um das Modell stammt und nicht vom Modell selbst, also benchmarken Sie es mit Ihrem eigenen Audio, bevor Sie den Schritt der menschlichen Überprüfung aufgeben. Das Omni-Modell gewinnt außerdem unkompliziert beim Preis für jede Text-Workload mit hohem Volumen, bei der seine Textqualität ausreichend ist, was laut Alibaba mit reinen Textmodellen derselben Größe vergleichbar sein soll – eine nicht reproduzierte Behauptung, die es wert ist, getestet statt angenommen zu werden.
Qwen 3.8 gewinnt überall dort, wo die Ausgabe bewertet statt gezählt wird: anspruchsvolles Reasoning, agentische Arbeit über lange Horizonte, Code-Arbeit im großen Maßstab, Analyse von Dokumenten mit einer Million Token, bei der die Synthese das Produkt ist. Außerdem gewinnt es in einer Dimension, die nichts mit Benchmarks zu tun hat – es ist Open-Weight. Wenn Ihre Einschränkung Datenresidenz, On-Premise-Bereitstellung, Fine-Tuning oder einfach der Wunsch ist, keinen Anbieter im Inferenzpfad zu haben, ist das Omni-Modell überhaupt kein Kandidat, und kein Preisvorteil schließt diese Lücke. Diese eine Einschränkung entscheidet über mehr reale Bereitstellungen als jede der oben genannten Zahlen.
Sie ohne zwei Verträge auszuführen
Die praktische Hürde bei einem solchen Vergleich ist selten die Wahl des Modells; sie besteht darin, dass man am Ende zwei Anbieter, zwei Abrechnungsbeziehungen und zwei Sätze Client-Code integriert, nur um herauszufinden, welches man eigentlich wollte. Qwen3.8-Max – der Endpunkt, der den offenen Kern mit 2,4 Billionen Parametern trägt – ist live auf OrcaRouter unter der Modell-ID qwen/qwen3.8-max, zu 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens, mit einem Kontext von einer Million Tokens sowie Text-, Bild- und Videoeingabe, zusammen mit mehr als 200 weiteren Modellen auf einem Schlüssel zum Listenpreis des Anbieters ohne Aufschlag und mit automatischem Failover zwischen Anbietern, falls ein Endpunkt beeinträchtigt ist. Qwen3.8-Omni-Flash ist nicht in diesem Katalog enthalten – es läuft auf Alibabas eigenen Plattformen –, die ehrliche Konfiguration ist heute also das Flaggschiff auf unserer Route und das Omni-Modell direkt aufgerufen, wobei die Routing-Schicht Ihnen einen Platz bietet, um den Verlierer des Tests abzulegen, sobald Sie ihn durchgeführt haben.

Das Urteil
Wählen Sie Qwen3.8-Omni-Flash, wenn die Eingabe lang, die Ausgabe kurz ist und das Volumen den Stückpreis zur bindenden Einschränkung macht. Wählen Sie Qwen 3.8, wenn die Eingabe dicht ist, die Ausgabe das Produkt ist und entweder Korrektheit oder Deployment-Kontrolle nicht verhandelbar ist. Die Überschneidungszone – Videoverständnis – ist der einzige Ort, an dem ein echter direkter Vergleich existiert, und in dieser Zone hat das Omni-Modell das Kosten- und Dauerargument auf seiner Seite, während das Flaggschiff das Reasoning- und Open-Weights-Argument auf seiner Seite hat. Führen Sie beide mit Ihren eigenen Daten aus, bevor Sie sich festlegen; das Omni-Modell hat noch keine unabhängige Evaluierung, und ein Preisvorteil am Markteinführungstag ist genau die Art von Sache, die man anhand einer Rechnung statt einer Ankündigung bestätigen sollte.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
