
Qwen3.8-Omni-Flash, fünf Tage nach dem Start: Eine Tür, keine Gewichte und die ersten Bewertungen, die nicht von Alibaba stammen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fünf Tage, nachdem der Anbieter Qwen3.8-Omni-Flash für API-Kunden geöffnet hat, hat das Modell immer noch genau ein Zuhause. Es läuft auf der eigenen Qianwen-Plattform des Anbieters und auf seinem Bailian-Cloud-Dienst; die seit dem Start aufgetauchten Einträge bei Drittanbietern sind Proxys vor genau denselben Endpunkten, nicht ein zweiter Ort, an dem das Modell lebt. Es wurden keine Gewichte veröffentlicht. Die Zahlen vom Starttag – eine Senkung der Kosten für eine Stunde Audio um 98 %, ein durchschnittlicher Zugewinn von 26 % gegenüber Qwen3.5-Omni-Plus, eine Million Tokens Kontext, reine Textausgabe – bleiben die des Anbieters und wurden nicht reproduziert. Was sich in fünf Tagen tatsächlich geändert hat, ist nicht das Modell, sondern das Umfeld darum: eine dünne Schicht von Bewertungen Dritter ist aufgetaucht, Framework-Unterstützung kam bereits am Tag null, und der Vergleich, nach dem alle greifen, erfolgt mit Gemini 3.8 Flash statt mit dem Qwen3.8-Flash, an dessen Seite dieses Modell entwickelt wurde. Jeder dieser Punkte verdient einen genaueren Blick, als die Berichterstattung zum Start ihm gewidmet hat.
Die Tür ist eine gute Tür, und sie ist die einzige.
Verfügbarkeit wurde ausgeweitet, ohne plural zu werden. Das Modell beantwortet eine Anfrage im OpenAI-Format unverändert, was bedeutet, dass vorhandener Client-Code größtenteils funktioniert; was kaputtgeht, ist der Endpunkt, weil die internationalen und die Mainland-Hosts getrennte Dienste mit getrennter Abrechnung sind. Code, der auf den Standard zeigt, schlägt entweder fehl oder wird in der falschen Währung abgerechnet, und die Sache mit dem Stundenpreis gilt nur auf der internationalen Seite. Open-Source-Client-Bibliotheken lieferten Day-Zero-Unterstützung für das Modell, was wirklich nützlich ist und zugleich kein zweiter Anbieter: Eine Bibliothek, die mit Bailian spricht, ist ein Komfort-Wrapper um dieselbe einzige Bezugsquelle.
Das ist das strukturelle Risiko, das es wert ist, benannt zu werden. Ein Single-Source-Modell hat keinen Failover-Pfad. Wenn der Endpunkt rate-limitet, an Leistung verliert oder eine Region ausfällt, gibt es keinen Ausweichweg, und noch so viel Unterstützung durch Client-Bibliotheken ändert daran nichts. Es ist auch der Grund, warum wir unsere eigene Position klar benennen, statt etwas anderes anzudeuten: Qwen3.8-Omni-Flash ist nicht in unserem Katalog. Wir hosten es nicht, und ein Leser, der sich anmeldet in der Erwartung, es routen zu können, würde in die Irre geführt. Routbar ist der Rest der Familie — Qwen3.8-Flash und Qwen3.8-Max sind beide live auf unserer API — und OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, sodass, wenn sich Alibabas Omni-Preise ändern oder an dem Tag, an dem das Omni-Modell zum Routen verfügbar wird, die Änderung die Kunden noch am selben Tag erreicht statt erst bei der nächsten Vertragsverlängerung.

Die ersten Ergebnisse, die nicht von Alibaba stammen, sind dürftig, und sie sind wenig schmeichelhaft.
Auf Artificial Analysis existiert nichts für dieses Modell, und dieses Fehlen ist fünf Tage nach dem Start die ehrliche Schlagzeile: Die Bestenlisten, die alle für benachbarte Modelle zitieren, haben noch keine Zeile für das Omni-Modell. Die Lücke wurde von etwas anderem gefüllt. Eine Drittanbieter-Evaluierungsplattform hat begonnen, Testläufe gegen das Modell zu veröffentlichen, und ihre Zusammenfassung ist gerade deshalb lesenswert, weil sie so wenig aussagt. Sie meldet E-Mail-Klassifikation mit 99,0 % Genauigkeit (86. Perzentil), Ethik mit 95,0 % (23. Perzentil) und Reasoning mit 56,0 %, was sie dem 28. Perzentil zuordnet und als bemerkenswerte Schwäche bezeichnet; die Geschwindigkeit landet im 21. Perzentil, die Kosten im 58., bei einer Gesamterfolgsquote von 89 %.
Behandle sie mit echter Vorsicht, und nicht nur, weil die Stichprobe klein ist. Dieselbe Seite datiert die Veröffentlichung des Modells auf den 20. September, zwei Tage, nachdem Alibaba es ausgeliefert hat, gibt für keines der Ergebnisse Durchführungsdaten an und rendert unter einer Zusammenfassung, die Zahlen beschreibt, die die Tabelle nicht enthält, eine leere Benchmark-Tabelle. Das ist das Profil eines frühen, nur wenig überwachten Test-Harness statt einer gemessenen Evaluierung, und die ehrliche Lesart ist, dass dies die ersten nicht vom Anbieter stammenden Datenpunkte sind statt der ersten verlässlichen. Sie sind ein Grund, das Modell selbst zu testen, kein Grund, irgendwelche Schlüsse zu ziehen. Die Richtung jedoch deckt sich mit dem, was die eigenen Unterlagen des Anbieters durch Auslassung nahelegen: Dies ist ein Wahrnehmungs- und Long-Media-Modell, und die reasoning-lastigen Boards sind nicht das, worauf es abzielte.
Es gibt außerdem eine Falle in den Suchergebnissen, die in den nächsten Wochen Menschen erwischen wird. Qwen 3.8, das Textmodell, hat einen Artificial Analysis Intelligence Index im vierziger Bereich, und diese Zahl wurde in mehr als einer Zusammenfassung so zitiert, als würde sie das Omni-Modell beschreiben. Das tut sie nicht. Es sind unterschiedliche Modelle mit unterschiedlichen Aufgaben, und das Omni-Modell hat noch gar keinen Index.

Die Benchmark-Tabelle ist weiterhin nur ein Anbieter, der sich mit sich selbst vergleicht.
Die Startzahl — eine durchschnittliche Verbesserung von mehr als 26 % über rund dreißig Evaluierungen — wird ausschließlich an Qwen3.5-Omni-Plus gemessen. Das sagt Ihnen, dass sich die Familie weiterentwickelt hat. Es sagt Ihnen nicht, wo das Modell im Vergleich zu irgendetwas steht, für das Sie bereits bezahlen, und die selektiven Vergleiche, die daneben kursierten, schließen die Lücke ebenfalls nicht. Das vom Anbieter berichtete Bild gegen Gemini 3.8 Flash ist ein echter Sieg auf den Audio-Boards und eine Niederlage auf denen, die agentische Videoarbeit messen: WildClawBench-MM 71,0 gegen 58,9 und SpotSoundBench 67,2 gegen 39,7 auf der einen Seite, AgenticVBench 36,8 gegen 45,0 und OmniGAIA 74,0 gegen 78,6 auf der anderen. Alibabas eigene zusammenfassende Formulierung — Audio-Video-Leistung, die Gemini „annähernd“ erreicht, während die Gesamt-Audioleistung Gemini übertrifft — ist vorsichtiger als die Schlagzeilen, die sie produzierte, und die vorsichtige Version ist die zutreffende.
• Kontext — 1 Mio. Tokens, mit ungefähr 991K maximaler Eingabe (etwa 983K im Denkmodus) und 131K maximaler Ausgabe.
• Modalität — Text, Bild, Audio und Video als Eingabe; nur Text als Ausgabe. Keine Sprachgenerierung im Basismodell.
• Dauer – bis zu eine Stunde kontinuierliches Audio oder Audio-Video pro Anruf, was Meeting- und Langmedienarbeit ohne Aufteilung ermöglicht.
• Sprachenabdeckung — Erkennung über 74 Sprachen hinweg plus 39 chinesische Dialekte in den Launch-Materialien, wobei an anderer Stelle für Audioeingabe umfassendere Zahlen (113 Sprachen und Dialekte) genannt werden.
• Eingabedetail — Stereo- und Vierkanal-Raumklang werden akzeptiert, wobei die Realtime-Variante als das erste omni-modale Modell beschrieben wird, das ein Ziel anhand seines Klangs orten kann.
• Preis — $0,15 pro Million Input-Tokens, $0,016 für gecachte Tokens, $0,47 für Output auf der internationalen Seite, und eine separate Preisliste für das Festland, die sich nicht vergleichen lässt.
Die 98 % sind real, und es ist nicht Ihre Rechnung.
Nach Alibabas eigener Methodik – eine zweiminütige Stichprobe multipliziert mit dreißig, Video mit 720p und einem Frame pro Sekunde abgetastet – sinkt eine Stunde Audioeingabe von 0,28 $ auf unter 0,01 $, und eine Stunde aus kombiniertem Audio und Video von 3,27 $ auf 0,20 $. Das sind große, konkrete, vom Anbieter gemeldete Reduzierungen, und sie betreffen einen einzigen Einzelposten. Die entscheidende Rechnung ist, welchen Anteil Ihrer Workload dieser Einzelposten ausmacht. Eine Pipeline, die den Großteil ihrer Tokens für Output, für gecachten Kontext oder für Video-Frames ausgibt, die dichter als einmal pro Sekunde abgetastet werden, wird auf der Rechnung eine viel kleinere prozentuale Veränderung sehen, als die Schlagzeile verspricht – und die Schlagzeile bezieht sich auf Audioeingabe, nicht auf die Gesamtsumme. Fügt man die reine Textausgabe hinzu, wird die Lücke wieder größer: Alles, was mit Sprache antworten muss, braucht ein zweites Modell, und dieses Modell wird separat abgerechnet.
Das ist der Teil des Bildes, in dem sich Routing bezahlt macht. Der Wert eines Pass-through-Routers besteht nicht in einem Rabatt – er besteht darin, dass die eigene Preisliste des Anbieters das ist, was man zahlt, und dass eine Workload über mehrere Modelle verteilt werden kann, sodass ein Single-Source-Modell eine Komponente und keine Abhängigkeit darstellt. Ein Omni-Modell, das das Einzige ist, was man aufrufen kann, ist ein Single Point of Failure – sowohl auf der Ebene der Verfügbarkeit als auch auf der Ebene der Preisgestaltung.

Was fünf Tage Produktion dir tatsächlich verraten würden
Drei Dinge würden die offenen Fragen klären. Eine unabhängige Messung des AliMeeting-Diarisierungsergebnisses – eine Fehlerrate, die von 88,11 auf 3,35 fällt, und cpWER von 89,61 auf 17,18 – würde zeigen, ob dies zum Modell gehört oder zur Diarisierung und zum Frontend-Engineering, das darum herumgebaut wurde, worauf mindestens eine chinesische technische Analyse den Großteil des Zugewinns zurückführt. Ein reproduzierter Test der Token-Reduktion des agentischen Modus, bei dem die Genauigkeit auf OmniVideoBench von 63,4 auf 67,8 stieg, während die Tokens pro Anfrage von 145.736 auf 79.117 fielen, würde die nützlichste einzelne Aussage der Veröffentlichung bestätigen: dass das Modell gleichzeitig besser und günstiger werden kann. Und eine Zeile bei Artificial Analysis oder in einer Arena würde jede der obigen Herstellerzahlen in etwas Vergleichbares verwandeln, was die Voraussetzung dafür ist, dass das Modell gewählt statt nur ausprobiert wird.
Bis dahin ist die sinnvolle Haltung diejenige, die für jedes fünf Tage alte Modell mit einem Host und ohne unabhängige Evaluierung gilt: Es lohnt sich, es mit eigenem Audio- und Videomaterial zu messen, aber es lohnt sich nicht, daraus den einzigen Weg durch Ihre Pipeline zu machen. Wenn Ihre Workload aus der Analyse von langen Meetings oder Medien auf Chinesisch oder Englisch besteht und Ihre Kosten eher von Eingabestunden als von Ausgabe-Tokens dominiert werden, ist die Wirtschaftlichkeit hier stark genug, um diese Woche einen Test zu rechtfertigen. Wenn Ihre Workload Sprachausgabe zurückliefern muss oder einen Fallback benötigt, wenn ein Anbieter schlechter wird, kann das Modell in seinem heutigen Zustand nicht die ganze Antwort sein — und keine noch so umfangreiche Day-zero-Framework-Unterstützung ändert etwas daran.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
