Eine Hero-Titelkarte für Qwen3.8-Omni-Flash mit der Dachzeile 'Alibaba – Qwen – 18. September 2026', dem Untertitel 'Qwens natives omni-modales Modell – Text, Bild, Audio und Video als Eingabe, eine Million Tokens Kontext, bis zu eine Stunde durchgehendes Audio-Video pro Aufruf' und drei Kennzahlen-Chips mit 'Preis pro Mio. Tokens: 0,15 $ Eingabe / 0,47 $ Ausgabe', 'Audiokosten im Vergleich zur vorherigen Generation: 98 % niedriger' und 'Ausgabemodalität: nur Text'.
Guides & Insights

Qwen3.8-Omni-Flash ist da: 1M-Token-Kontext, 98 % günstigeres Audio, nur Textausgabe

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Launch öffnete Qwen3.8-Omni-Flash heute, am 18. September 2026, für API-Kunden, und die Zahl, mit der er aufwartete, ist eher eine Rechnung als ein Benchmark-Ergebnis. Pro Stunde Audio-Eingabe kostet das neue Modell laut Qwen 98 % weniger als sein Vorgänger Qwen3.5-Omni-Plus; pro Stunde kombiniertem Audio und Video 93 % weniger. Alles Weitere in der Ankündigung ergibt sich aus dieser Rahmung. Qwen3.8-Omni-Flash ist ein natives omni-modales Modell – Text, Bild, Audio und Video hinein, eine Million Token Kontext, bis zu eine volle Stunde durchgängiges Audio-Video in einem einzigen Aufruf – und Alibaba verkauft es nicht als besseren Beschreiber von Medien, sondern als das erste Qwen-Modell, das darauf ausgelegt ist, zu handeln. Der Slogan lautet „Omni Senses. Agentic Delivery." Der Haken, offen in denselben Unterlagen benannt, ist, dass das Modell nur in Textform antwortet: Es hört und sieht, spricht aber nicht.

Nichts des Folgenden wurde unabhängig reproduziert. Das Modell ist erst wenige Stunden alt, es gibt noch keine Bewertung durch Dritte, und jede Benchmark- und Preisangabe in den Startmaterialien stammt von Alibaba selbst. Wo eine Zahl vom Anbieter gemeldet wird, sagt dieser Text das in dem Satz, der sie enthält; wo eine Einschätzung von einem Kritiker statt vom Anbieter stammt, wird sie entsprechend gekennzeichnet. Das Einzige, das sich heute unabhängig überprüfen lässt — dass das Modell auf Alibabas Plattformen live ist und nicht in irgendeinem anderen Katalog —, ist das, worüber bei der Markteinführung am wenigsten gesprochen wird.

Was tatsächlich ausgeliefert wurde

Das Datenblatt ist für eine Omni-Modal-Einführung ungewöhnlich sauber, was selbst die Geschichte ist: Die vorherige Generation der Omni-Modelle in dieser Familie wurde aus separaten Wahrnehmungs-Encodern zusammengesetzt, die an ein Text-LLM geschraubt wurden, und dieses hier ist direkt auf der Qwen3.8-Flash-Architekturlinie aufgebaut, wobei Modalitäten nativ verarbeitet werden, statt aufgepfropft zu werden.

• Eingabe — Text, Bild, Audio und Video, wobei Stereo- und vierkanaliges räumliches Audio akzeptiert wird; die Ausgabe ist nur Text.

• Kontext — eine Million Tokens, mit maximalem Input bei ungefähr 991K (etwa 983K im Denkmodus), maximalem Output bei 131K und einem Reasoning-Budget, das 262K erreicht.

• Dauer — bis zu eine Stunde kontinuierliches Audio oder Audio-Video pro Anruf – der Wert, der die Anwendungsfälle Meetings und lange Videos ohne Segmentierung möglich macht.

• Sprachabdeckung – Erkennung in 74 Sprachen und Sprachgenerierung in 29 im umgebenden Tooling; ein chinesischsprachiger Bericht über die Veröffentlichung nennt 113 Sprachen und Dialekte für Audioeingabe.

• Verfügbarkeit – die Qianwen-KI-Plattform und Alibaba Cloud Model Studio (Bailian), unter der API-ID qwen3-8-omni-flash. Die Gewichte werden nicht veröffentlicht. Eine Realtime-Variante wird als das erste omni-modale Modell mit Schallquellenlokalisierung beschrieben.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

Die 98 % sind eine Kostenbehauptung, und die Berechnung dahinter ist einen Blick wert.

Eine Reduzierung der Kosten einer Stunde Audio um 98 % ist eine viel größere Zahl als eine Reduzierung des Preises eines Tokens um 98 %, und die Kluft zwischen diesen beiden Dingen ist der Punkt, an dem die Ankündigung ihre Wirkung entfaltet. Die Angabe pro Stunde ergibt sich, indem man eine Zwei-Minuten-Stichprobe bepreist und mit dreißig multipliziert, wobei das Video mit 720p und einem Bild pro Sekunde abgetastet wird. Das ist eine legitime Art, eine Produktionslast anzugeben, und es beschreibt zugleich, womit sich das Modell befassen soll: Ein Bild pro Sekunde reicht aus, um zu wissen, was gesagt wurde und ungefähr, was auf dem Bildschirm geschah, und ist bei Weitem nicht genug, um Vorgänge auf Frame-Ebene zu untersuchen, die Qualität eines Schnitts zu beurteilen oder ein einzelnes Frame-Artefakt zu erkennen. Zwei Veränderungen werden miteinander multipliziert – eine echte Senkung des Stückpreises und eine deutlich aggressivere Sampling-Strategie –, und nur die erste ist eine Verbesserung des Modells.

Die Stückpreise selbst sind konkret. Die internationalen Preise werden angegeben mit $0.15 pro Million Eingabe-Token, $0.016 pro Million zwischengespeicherte Eingabe-Token und $0.47 pro Million Ausgabe-Token. Für inländische Bailian-Preise werden ¥0.8 pro Million für multimodale Eingaben angegeben, gegenüber etwa ¥18 zuvor. Beachten Sie, dass die internationalen und die Festland-Abrechnungssysteme getrennt sind und die Zahlen nicht austauschbar sind; wer sie direkt vergleicht, erhält ein falsches Ergebnis.

Dies ist der Teil der Ankündigung, bei dem Routing mehr als sonst zählt. OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, sodass eine Preissenkung des Anbieters wie diese unsere Kunden an dem Tag erreicht, an dem sie kommt, und nicht erst bei der nächsten Vertragsverlängerung. Ein wirklich überprüfbarer Vergleich liegt bereits in unserem eigenen Katalog vor: Qwen3.8-Flash, das multimodale Modell, neben dem dieses hier entwickelt wird, ist heute routbar zu 0,15 $ pro Million Input-Tokens und 0,47 $ pro Million Output-Tokens — demselben Listenpreis, den Alibaba für das neue Omni-Modell nennt — und es hat in den sieben Tagen vor Verfassung dieses Textes 2,47 Milliarden Tokens Traffic über unsere API abgewickelt, was ein fairer Maßstab dafür ist, wie groß der Appetit dieser Stufe bereits ist. Das Omni-Modell selbst ist noch nicht in unserem Katalog verfügbar, und bis dahin läuft es ausschließlich auf Alibabas eigenen Plattformen und nirgendwo sonst. Wir werden nicht so tun, als wäre es anders.

Jeder Benchmark im Launch vergleicht eine einzige Sache

Die Schlagzeile ist eine durchschnittliche Verbesserung von mehr als 26 % über rund 30 Evaluierungen – und jede dieser Evaluierungen erfolgt gegen Qwen3.5-Omni-Plus. Das ist die richtige Baseline für einen Launch – und eine eng gefasste: Sie sagt Ihnen, dass sich die Familie bewegt hat, nicht, wo sie im Verhältnis zu etwas landet, wofür Sie bereits bezahlen könnten.

Die einzelnen Werte, alle vom Anbieter angegeben: WildClawBench-MM 71.0, ein Plus von 36.5 Punkten und die größte Einzelbewegung im Set; UniClawBench 69.6; AgenticVBench um 22.3 Punkte auf 36.8; LongAudioSpan 82.7, ein Plus von 8.3; OmniVideoBench 63.4, ein Plus von 9.6; OmniCap-IF 28.2. Das auffälligste Paar ist die Sprecherdiarisierung bei AliMeeting, wo die Fehlerrate von 88.11 auf 3.35 und der cpWER von 89.61 auf 17.18 fällt — ein Sprung, der groß genug ist, dass er eher kritische Prüfung als Applaus verdient. Eine chinesische technische Analyse der Markteinführung argumentiert genau das: Sie schreibt die Verbesserung substanziell dem Frontend- und Diarisierungs-Engineering zu, das um das Modell herum gebaut wurde, statt dem Reasoning des Modells selbst, und warnt, dass das System wie aufs Hören spezialisiert wirkt, bei vergleichsweise schwächerem tiefen Videoverständnis. Das ist die Lesart eines Kritikers, keine gemessene Reproduktion, aber die Größe des Unterschieds ist der Grund, sie im Hinterkopf zu behalten.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Die andere Zahl, die man sich merken sollte, ist überhaupt keine Punktzahl. In dem von Alibaba so genannten Agentic Understanding-Modus entscheidet das Modell selbst, was es betrachten und worauf es hören soll, statt jedes Einzelbild zu verarbeiten, und sammelt Belege in Grob-zu-Fein-Runden. Bei OmniVideoBench steigert dieser Modus die Genauigkeit von 63,4 auf 67,8, während er Tokens pro Abfrage von 145.736 auf 79.117 senkt – ein Rückgang um 45,7 %. Dass die Genauigkeit steigt und die Kosten gleichzeitig sinken, ist die stärkste Behauptung in der Veröffentlichung, und sie ist diejenige, die das agentische Versprechen am direktesten stützt.

Der Gemini-Vergleich ist enger gefasst, als die Berichterstattung nahelegt.

Alibabas Positionierung ist, dass die Audio-Video-Fähigkeit „an Gemini 3.8 Flash heranreicht“, während die Gesamt-Audioleistung sie übertrifft. Ohne diese Rahmung sehen die vom Anbieter gemeldeten Vergleiche so aus. WildClawBench-MM: 71.0 gegenüber 58.9. SpotSoundBench: 67.2 gegenüber 39.7. MMAU: 81.8 gegenüber 76.9. DailyOmni: 85.1 gegenüber 84.0. Das sind echte Abstände bei Audio und bei audiozentrierter Tool-Nutzung. Sie sind aber auch selektiv. Bei AgenticVBench, dem reinen Board für Video-Reasoning, kehrt sich die Reihenfolge um – Gemini mit 45.0 gegenüber Qwens 36.8 –, und Alibabas eigene Darstellung räumt ein, dass Gemini weiterhin bei mehreren Video-Verständnis-Tests führt. Eine vernünftige Zusammenfassung ist, dass Qwen die Audio-Hälfte von Omni übernommen hat und bei der Video-Hälfte noch zurückliegt – was eine andere Behauptung ist als die, mit der die Schlagzeilen liefen.

„Qwens erstes omnimodales Modell“ braucht eine nähere Bestimmung.

Die Darstellung, dass Qwen3.8-Omni-Flash Qwens erstes omnimodales Modell sei, wurde heute weithin verbreitet, und es lohnt sich, hier präzise zu sein, denn die Familie hat einen früheren Eintrag, der diesen Titel mit gutem Recht für sich beanspruchen kann. Qwen2.5-Omni, ein 7B-Modell mit offenen Gewichten, das im März 2025 in einer Thinker-Talker-Architektur veröffentlicht wurde, nahm ebenfalls Text, Bild, Audio und Video als Eingabe entgegen – und erzeugte ebenso Sprache wie Text. Was hier wirklich das Erste ist, ist native Omnimodalität: ein einziges Modell, das auf dem Qwen3.8-Flash Fundament aufbaut statt auf einem Text-LLM mit angehängten Wahrnehmungs-Encodern, dazu ein Design-Briefing, das Agenten in den Mittelpunkt stellt. Beide Aussagen sind wahr; nur eine von ihnen ist die, die wiederholt wurde. Wenn Sie das Modell unter der Annahme bewerten, dass es vor dieser Woche kein Qwen-Omni-Modell gab, werden Sie den Upgrade-Pfad von Qwen2.5-Omni falsch einschätzen – ein Vergleich, den wir separat ausgearbeitet haben.

Das Tooling ist der Ort, an dem der agentische Anspruch tatsächlich lebt.

Zwei Dinge wurden zusammen mit dem Modell ausgeliefert, und sie sind wichtiger, als die Modellkarte vermuten lässt, denn sie sind das, was Wahrnehmung in Auslieferung verwandelt. Qwen-MM-Plugins ist eine multimodale Plugin-Suite für Agenten-Harnesse, die einem externen Agenten Bild-, Audio-, Video- und Dokumentenverständnis sowie Langvideo-Gedächtnis und Videobearbeitung bietet; sie wirbt mit Unterstützung für Codex, Claude Code, Qwen Code, Gemini CLI und mehrere andere und liefert benannte Tools, darunter Video2Note, das stundenlange Videos in illustrierte PDF-Notizen verwandelt. Qwen-Live Harness ist eine quelloffene Laufzeitumgebung für kontinuierliche Echtzeit-omnimodale Interaktion, die als Planungsschicht fungiert, in der ein Benutzer live kommuniziert und schwerere Arbeit an Hintergrundagenten delegiert. Eine Einschränkung aus der Berichterstattung zum Starttag: Die GitHub-Seite von Qwen-Live Harness gab einen 404 zurück, als Gigazine sie überprüfte, daher sollte man das Tooling als angekündigt statt als verifiziert betrachten, bis die Repositories erreichbar sind.

Der Satz, den der Launch begräbt: er spricht nicht

Für ein Modell, dessen Vorgänger Sprache erzeugte, die Tatsache, dass Qwen3.8-Omni-Flash multimodal-in und text-out ist, ist die folgenreichste Zeile in der Spezifikation, und sie erscheint in den Materialien weitgehend als Fußnote. Das bedeutet, dass das Modell nicht für sich allein in ein Sprach-zu-Sprach-Produkt integriert werden kann. Jede Synchronisation, jeder Sprachagent oder jede Echtzeitkonversation, die darauf aufbauen, benötigt eine externe Text-zu-Sprache-Stufe und für Video einen externen Renderer – genau deshalb gibt es die Plugin-Suite und den Live-Harness. Die praktische Konsequenz ist eine Pipeline mit mehr beweglichen Teilen als bei „einem Omni-Modell“ und einer Latenz, die über all diese Teile hinweg eingeplant werden muss.

In der Veröffentlichung verbirgt sich eine schöne Demonstration der Kluft – und dessen, wofür das Modell gut ist. In einem Experiment, bei dem „ein Modell ein Modell optimiert“, verbesserte Qwen3.8-Omni-Flash autonom die Sichuan-Dialekterkennung von Qwen2.5-Omni-3B, wodurch die Zeichenfehlerrate von 25,79 % auf 15,30 % innerhalb von zwölf Stunden gesenkt und in vier Runden 3.413 Trainingsbeispiele erstellt wurden. Ein Modell, das die Dialektverarbeitung eines kleineren Geschwistermodells diagnostizieren und reparieren kann, leistet etwas, das eine Transkriptions-API nicht kann. Das ist, mehr noch als die Benchmark-Tabelle, das klarste Argument dafür, was „agentisch“ hier eigentlich bedeuten soll.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

Was würde unsere Einschätzung ändern?

Der ehrliche Stand der Dinge ist, dass es sich um einen gut spezifizierten Launch mit einer überzeugenden Preis-Story, ohne unabhängige Evaluierung und mit mindestens einer strukturellen Einschränkung handelt, die die Ankündigung herunterspielt. Drei Dinge würden die Sache klären. Ein Eintrag bei Artificial Analysis oder LMArena würde Anbieterzahlen in vergleichbare Zahlen verwandeln, und einen solchen gibt es noch nicht. Ein Test der 45,7 % Token-Reduktion durch Dritte – die Behauptung, dass die Genauigkeit steigt, während die Kosten sinken – würde das nützlichste und am wenigsten glamouröse Ergebnis der Veröffentlichung bestätigen. Und eine unabhängige Messung der AliMeeting-Diarisierung würde zeigen, ob der Rückgang um 88 Punkte dem Modell oder der Pipeline um es herum zuzuordnen ist.

Bis dahin ist die vernünftige Haltung die, die für jedes Modell an seinem ersten Tag gilt: Es lohnt sich, es zu testen, aber es lohnt sich nicht, einen Produktionspfad darauf zu verwetten. Wenn Sie bereits über OrcaRouter routen, besteht der praktische Schritt darin, die Workload auf den Modellen zu belassen, die Sie gemessen haben, und Qwen3.8-Omni-Flash als Kandidaten zu behandeln, der gegen sie an Ihren eigenen Audio- und Videoinhalten getestet werden sollte statt an der Benchmark-Tabelle eines der beiden Anbieter. Wenn Ihr Anwendungsfall die Analyse von langen Meetings oder Medieninhalten auf Chinesisch und Englisch ist, ist die Token-Ökonomie hier stark genug, um den Test jetzt zu rechtfertigen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert