
Qwen3.8-Omni-Flash vs. Qwen2.5-Omni: 18 Monate später hat das Upgrade seine Stimme verloren
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hier ist die Tatsache, die diesen Vergleich interessanter macht als ein Generations-Refresh. Das ältere Modell kann sprechen, und das neuere kann es nicht. Qwen2.5-Omni, veröffentlicht im März 2025, nahm Text, Bilder, Audio und Video als Eingabe entgegen und antwortete in Text oder in streamender natürlicher Sprache, in einem einzigen Ende-zu-Ende-Modell, das man herunterladen konnte. Qwen3.8-Omni-Flash, veröffentlicht am 18. September 2026, verarbeitet dieselben vier Modalitäten über ein dreißigmal größeres Kontextfenster hinweg, nimmt eine Stunde durchgehendes Audio-Video auf, während sein Vorfahre Sekunden verarbeitete, und gibt nur Text zurück. Achtzehn Monate Arbeit erkauften eine enorm viel breitere Eingabe und gaben den Ausgabekanal auf. Ob das Fortschritt oder ein Tauschgeschäft ist, hängt ganz davon ab, wofür man das alte Modell verwendete — und die Antwort zerfällt sauber in zwei Teile.
Die Zahlen für Qwen2.5-Omni sind die des Anbieters, aus seinen Veröffentlichungsunterlagen vom März 2025, und achtzehn Monate des breiten Einsatzes haben sie teilweise bestätigt. Die Zahlen für Qwen3.8-Omni-Flash stammen ebenfalls von Alibaba, aus Markteinführungsunterlagen, die Stunden vor der Niederschrift dieses Textes veröffentlicht wurden, und nichts darin wurde unabhängig reproduziert. Wo eine Behauptung von einem Kritiker statt vom Anbieter stammt, wird sie als solche gekennzeichnet. Die eine strukturelle Tatsache, die keiner Überprüfung bedarf, ist zugleich die folgenreichste: Qwen2.5-Omni hat offene Gewichte und ist herunterladbar, und Qwen3.8-Omni-Flash ist es nicht.
Was Qwen2.5-Omni war und warum es wichtig war
Als es am 26. März 2025 auf den Markt kam, Qwen2.5-Omni war das erste durchgängige omni-modale Modell der Familie – die Veröffentlichung positionierte es als Antwort auf das Problem des „Zoos der Spezialisten“, bei dem Transkription, Vision und Stimme jeweils ein separates Modell und eine separate Klebeschicht benötigten. Das 7B-Modell verarbeitete alle vier Eingabemodalitäten sowie Text- und Sprachausgabe, beanspruchte moderne Spitzenergebnisse auf dem OmniBench-Fusions-Benchmark vor Gemini-1.5-Pro und meldete einen Qualitätswert für die Sprachgenerierung von 4,51, den Alibaba als menschengleich beschrieb. Eine 3B-Variante folgte derselben Architektur.
Die Technik, die es zum Laufen brachte, verdient es, benannt zu werden, denn das neue Modell nutzt sie nicht.Thinker-Talker teilte die Aufgabe in zwei Teile: Ein Thinker-Transformer fusionierte die Audio- und Bild-Encoder und erzeugte Semantik und Text, während ein Talker Sprach-Tokens aus den Hidden States des Thinker streamte und dabei die vollständige Gesprächshistorie teilte. Time-aligned multimodal RoPE (TMRoPE) verschränkte die Video- und Audio-Positionen, sodass die beiden Streams synchron blieben. Blockweises Streaming ermöglichte es den Encodern, die Wahrnehmung zu übernehmen, während das Sprachmodell lange Sequenzen verarbeitete, was gesprochene Antworten mit niedriger Latenz erst möglich machte. Zwei feste Stimmen wurden damit ausgeliefert: Chelsie und Ethan.
Die Einschränkungen waren genauso real. Der Kontext umfasste 32.768 Token. Der Speicher war der begrenzende Faktor, weit mehr noch als die Rechenleistung: Alibabas eigene Tabellen veranschlagen BF16-Inferenz mit FlashAttention-2 auf ungefähr 31 GB GPU-Speicher für ein 15-sekündiges Video, 42 GB für 30 Sekunden und 60 GB für eine volle Minute. Eine Minute Video, auf einem 7B-Modell, auf einer der größten Einzel-GPUs, die man mieten konnte. Diese Zahl ist diejenige, die man im Auge behalten muss, denn sie ist die Zahl, die das 2026er Modell zerstören sollte.
Was Qwen3.8-Omni-Flash ist
Das neue Modell ist von Natur aus omni-modal und nicht zusammengesetzt — es baut direkt auf der Qwen3.8-FlashArchitekturlinie auf und nicht als Text-LLM, an das Wahrnehmungs-Encoder angeschraubt wurden, was ein struktureller Unterschied und nicht nur ein Generationslabel ist. Es akzeptiert Text, Bild, Audio und Video, einschließlich Stereo- und Vierkanal-Raumklang, und gibt Text über einen Kontext von einer Million Token mit etwa 991K maximaler Eingabe, 131K maximaler Ausgabe und einem Reasoning-Budget von 262K zurück. Es verarbeitet bis zu eine Stunde durchgehendes Audio-Video pro Aufruf. Die Spracherkennung deckt 74 Sprachen ab, wobei die Sprachgenerierung für 29 Sprachen im umgebenden Tooling und nicht vom Modell übernommen wird. Es ist auf der Qianwen AI platform und in Alibaba Cloud Model Studio unter der ID qwen3-8-omni-flash verfügbar, für 0,15 US-Dollar pro Million Eingabe-Tokens und 0,47 US-Dollar pro Million Ausgabe-Tokens, wobei zwischengespeicherte Eingaben 0,016 US-Dollar kosten.

Achtzehn Monate, Dimension für Dimension
• Kontext — Qwen2.5-Omni 32.768 Token gegenüber Qwen3.8-Omni-Flash mit einer Million, etwa eine dreißigfache Steigerung.
• Mediendauer — Sekunden Video, begrenzt durch GPU-Speicher, gegenüber einer Stunde kontinuierlichem Audio-Video in einem einzelnen gehosteten Call.
• Ausgabe — Text plus Streaming natürlicher Sprache beim alten Modell; nur Text beim neuen.
• Bereitstellung — Qwen2.5-Omni ist Open-Weight unter Apache-2.0, herunterladbar von Hugging Face und ModelScope; Qwen3.8-Omni-Flash ist nur per API verfügbar, eine Veröffentlichung der Gewichte wurde nicht angekündigt.
• Hardware — 7B Parameter, die bis zu ~60 GB GPU-Speicher für eine Minute Video benötigen, gegenüber einem gehosteten Endpunkt, den Sie überhaupt nicht bereitstellen.
• Preis — das alte Modell kostet dich eine GPU; das neue kostet 0,15 US-Dollar pro Million Input-Tokens, und Alibaba behauptet, dass Audio-Input pro Stunde 98 % günstiger ist als die Qwen3.5-Omni-Plus-Generation, die es ersetzt.
• Sprachgenerierung — zwei feste Stimmen im Jahr 2025, gegenüber 29 Sprachen der Sprachgenerierung im Tooling von 2026, nichts davon vom Modell selbst erzeugt.
Das Gewerbe, für das niemand warb
Liest man die beiden Datenblätter zusammen, wird die Gestalt der letzten achtzehn Monate klar. Alibaba verbrachte die Zeitspanne mit der Lösung des Aufnahme-Problems — wie viel Medienmaterial ein Modell aufnehmen kann, wie kostengünstig, und wie viel der Entscheidungsfindung es selbst übernehmen kann. Qwen3.8-Omni-Flash ist ein Triumph auf dieser Achse. Der Agentic-Understanding-Modus, in dem das Modell auswählt, was es abtastet, statt jeden Frame zu verarbeiten, senkt die Tokens pro Abfrage von 145.736 auf 79.117 und steigert gleichzeitig die Genauigkeit bei OmniVideoBench von 63,4 auf 67,8, und der Anbieter berichtet, dass der Sprecher-Diarisierungsfehler bei AliMeeting von 88,11 auf 3,35 zusammenbricht.
Was in der Zwischenzeit nicht priorisiert wurde, ist Output. Der entscheidende Trick des 2025er-Modells – ein einziges Modell, das dich hört und dir laut antwortet, Ende-zu-Ende, ohne separaten Sprachsynthesizer – hat hier keinen Nachfolger. Wenn du einen Voice-Agent, eine Dubbing-Pipeline oder ein Barrierefreiheits-Tool auf Qwen2.5-Omni's Talker aufgebaut hast, ist das 2026er-Modell kein Upgrade dafür; es ist eine Komponente, an die du eine neue Text-to-Speech-Stufe anflanschen müsstest, wodurch Latenz und ein Anbieter zu einer Pipeline hinzukommen, die zuvor weder das eine noch das andere hatte. Die Launch-Materialien sind diesbezüglich ehrlich, wenn man die Modalitätszeile genau liest, aber es ist nicht die Schlagzeile, und wer in der Annahme migriert, dass „omni“ in beiden Releases dasselbe bedeutet, wird den Unterschied im Produktivbetrieb entdecken.

Warum das 2025er Modell noch einen Job hat
Drei Gründe, und keiner davon ist Nostalgie. Der erste ist die Stimme, wie oben. Der zweite Grund sind offene Gewichte: 32K Kontext und ein 7B-Footprint laufen auf Hardware, die Sie kontrollieren, offline, ohne dass Daten das Gebäude verlassen und ohne Abrechnung pro Token — die einzige Option, wenn für Ihr Audio eine Residenzpflicht gilt oder Ihr Latenzbudget einen Roundtrip verbietet. Der dritte sind die Kosten bei sehr geringem Volumen. Eine GPU, die Sie bereits besitzen, ist marginal kostenlos; die 0,15 US-Dollar pro Million Token des gehosteten Modells sind günstig, aber nicht null, und die Fixkosten für die Bereitstellung dagegen sind real für eine Arbeitslast, die zweimal pro Woche läuft.
Das Gegenargument lautet, dass die Einschränkungen des alten Modells mit jedem Jahr stärker zu spüren sind. Eine Minute Video, 32K Kontext und kein Tool-Calling oder strukturierte Ausgabe in einer Welt, in der Agents die Standard-Deployment-Form sind, ist ein enger Rahmen. Für eine Pipeline, die aufgezeichnete Meetings einlesen muss, Qwen3.8-Omni-Flash ist nicht nur besser — es ist der Unterschied zwischen möglich und nicht möglich, weil das 2025er-Modell den Input physisch nicht fassen kann.
Es lohnt sich, konkret zu sein, wie viel Leben noch in den alten Gewichten steckt, denn „legacy“ verkauft sie unter Wert. Das Qwen2.5-Omni-7B-Repository verzeichnete 343.676 Downloads im letzten Monat, als wir es am 18. September 2026 überprüften, mit rund hundert Community-Spaces und Dutzenden von darauf aufbauenden Fine-Tunes, Adaptern und Quantisierungen. Was auch immer das Flaggschiff macht, eine große Zahl von Menschen setzt noch auf das 2025er-Modell — und bemerkenswerterweise führte Hugging Face keinen Inferenzanbieter auf, der es einsetzt, was bedeutet, dass fast die gesamte Nutzung selbst gehostet ist.
Das neue Modell verbessert das alte.
Das seltsamste und überzeugendste Detail der Markteinführung verbirgt sich gegen Ende der Unterlagen. In einem Experiment, das Alibaba als ein Modell beschreibt, das ein Modell optimiert, Qwen3.8-Omni-Flash verbesserte autonom die Spracherkennung für den Sichuan-Dialekt von Qwen2.5-Omni-3B – dem kleinen Geschwistermodell des Modells, das es nominell ersetzt – und senkte die Zeichenfehlerrate von 25,79 % auf 15,30 % binnen zwölf Stunden und erstellte in vier Runden 3.413 Trainingsbeispiele.
Das ist ein besseres Argument für das neuere Modell als jeder Benchmark in der Veröffentlichung, und es ordnet die Beziehung zwischen den beiden neu ein. Das Modell von 2026 ist nicht nur ein Ersatz für das von 2025; es ist ein Werkzeug, das die Gewichte von 2025 besser macht. Wenn Sie Qwen2.5-Omni in der Produktion für eine Sprache oder einen Dialekt einsetzen, den es schlecht beherrscht, könnte der praktische Weg darin bestehen, das Deployment beizubehalten und das neue Modell zu nutzen, um die Trainingsdaten zu erstellen, statt die Workload zu migrieren. Beachten Sie jedoch, dass dies eine vom Anbieter gemeldete Demonstration ohne veröffentlichte Methodik ist und als ermutigende Anekdote und nicht als reproduzierbares Rezept behandelt werden sollte.

Wenn Sie migrieren
Die Entscheidung läuft selten auf ein einziges Modell hinaus. Ein Team, das ein selbst gehostetes Omni-Modell verlässt, wählt zwischen drei Varianten: bei offenen Gewichten bleiben und weiterhin provisionieren, zu einer Anbieter-API wechseln und die Kontrolle abgeben oder die Workload so aufteilen, dass nur der Teil, der eine Million Token aufnehmen muss, an das gehostete Modell geht. Die dritte Option ist meistens richtig und zugleich die, die man überspringt, weil sie nach mehr Arbeit klingt, als sie tatsächlich ist – das Dialekt-Fine-Tuning, an dem Sie einen Monat gearbeitet haben, muss nicht weggeworfen werden, nur weil die Phase der Meeting-Zusammenfassung verlagert wurde.
Wo Routing hilft, sind die Nahtstellen. OrcaRouter gibt dir einen Schlüssel für mehr als 200 Modelle mit 0 % Aufschlag auf den Listenpreis des Anbieters und automatischem Failover, falls ein Endpunkt degradiert, was bedeutet, dass die gehostete Hälfte einer geteilten Pipeline weder einen eigenen Vertrag noch eigenen Client-Code noch eigenes Monitoring braucht, bevor du weißt, ob die Workload irgendetwas davon rechtfertigt. Um klarzustellen, was wir nicht tun: Keines der Omni-Modelle steht in unserem Katalog – beide laufen auf Alibabas Plattformen oder auf deiner eigenen Hardware –, es ist also eine Routing-Entscheidung, die du rund um die Modelle triffst, nicht über uns.
Wer sollte umziehen, und wer nicht?
Wechseln Sie, wenn Ihre Arbeitslast aus Langform-Audio oder -Video besteht, wenn 32K Kontext das ist, was eine Pipeline daran hindert, zu existieren, wenn Sie agentisches Verhalten über Medien hinweg benötigen oder wenn Sprecher-Diarisierung im großen Maßstab Ihr Problem ist. Bleiben Sie, wenn das Modell sprechen können muss, wenn Ihr Audio Ihre Infrastruktur nicht verlassen darf, wenn Sie auf die spezifischen Qwen2.5-Omni-Gewichte angewiesen sind, die Sie bereits feinabgestimmt haben, oder wenn Ihr Aufrufvolumen niedrig genug ist, dass eine eigene GPU einen Zähler schlägt.
Die unbequeme Zusammenfassung lautet, dass dies weniger ein Ersatz als vielmehr eine Abzweigung in der Produktlinie ist. Alibaba hat achtzehn Monate damit verbracht, das bestmögliche Intake-Modell zu entwickeln, und keinen Nachfolger für die Ausgabehälfte gebaut. Wenn Ihre Arbeit auf der Intake-Seite angesiedelt ist, ist das Upgrade nahezu verpflichtend. Wenn sie auf der Output-Seite angesiedelt ist, ist das Modell von 2025 immer noch das Neueste, das tut, was Sie brauchen — und das sollten Sie wissen, bevor Sie eine Migration planen, die still und leise eine Funktion entfernen würde, auf die Sie angewiesen sind.
