
Qwen3.8-Omni-Flash vs. Gemini Omni 1.1 Flash: Der eine sieht sich das Video an, der andere erstellt es
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Kurze Antwort: Diese beiden sind kein Ersatz füreinander, und der Vergleich ergibt erst dann Sinn, wenn man aufhört, „Omni" als Kategorie zu behandeln. Qwen3.8-Omni-Flash, das der Anbieter am 18. September 2026 für API-Kunden geöffnet hat, nimmt Text, Bild, Audio und Video entgegen und gibt Text zurück – es ist ein Modell, um eine Stunde Meeting oder Videomaterial zu lesen und Ihnen zu sagen, was passiert ist. Gemini Omni 1.1 Flash, das der Anbieter am 27. August 2026 ausgeliefert hat, nimmt einen Text- oder Bild-Prompt entgegen und gibt Video mit synchronisiertem Audio zurück – es ist ein Modell, um das Videomaterial zu erzeugen. Das eine konsumiert Medien, das andere produziert sie. Wenn Ihre Pipeline beides braucht, brauchen Sie beides, und die ehrliche Frage ist nicht, welches gewinnt, sondern an welchem von beiden es Ihnen tatsächlich fehlt.
Keines der beiden Modelle ist Open-Weight, keines lässt sich über OrcaRouter routen, und beide werden auf Achsen bepreist, die sich nicht ineinander umrechnen lassen – auf der einen Seite Tokens, auf der anderen Sekunden generierten Videos. Der Bereich, in dem sie sich tatsächlich überschneiden, ist enger, als es die Rahmung „omni vs. omni“ nahelegt, und es lohnt sich, diese Überschneidung vor der Preisarithmetik festzunageln, denn die Preisarithmetik ist der Punkt, an dem die beiden am häufigsten falsch verglichen werden.
Der Kategorienfehler, der zuerst ausgeräumt werden sollte
Alibabas Markteinführungsmaterialien vergleichen Qwen3.8-Omni-Flash mit Gemini 3.8 Flash, und ein großer Teil der darauf folgenden Berichterstattung verkürzte das zu „schlägt Gemini“. Das ist ein anderes Google-Modell als Gemini Omni 1.1 Flash, und die beiden sind keine austauschbaren Bezugspunkte: Gemini 3.8 Flash ist das universelle multimodale Modell, und Gemini Omni 1.1 Flash ist das Videogenerierungsmodell mit eigener Preisliste und eigener API-Oberfläche. Jede Qwen-gegen-Gemini-Zahl, die seit der Markteinführung kursiert — WildClawBench-MM 71,0 gegen 58,9, SpotSoundBench 67,2 gegen 39,7, AgenticVBench 36,8 gegen 45,0 — bezieht sich auf Gemini 3.8 Flash, nicht auf das Omni-Videomodell, und keine davon ist ohnehin unabhängig. Wenn Sie mit einem Punktestand hierhergekommen sind, der die beiden Modelle in diesem Artikel auf dieselbe Achse setzt, ist es mit ziemlicher Sicherheit das falsche Google-Modell in der rechten Spalte.
Was jedes Einzelne tatsächlich bewirkt
• Was es entgegennimmt — Qwen3.8-Omni-Flash akzeptiert Text, Bild, Audio und Video, einschließlich Stereo- und Vierkanal-Raumklang; Gemini Omni 1.1 Flash akzeptiert Text- und Bild-Prompts sowie bis zu drei Sekunden Referenzvideo.
• Was es zurückgibt – Qwen3.8-Omni-Flash liefert nur Text; Gemini Omni 1.1 Flash liefert Video mit nativ synchronisiertem Audio, in Szenen, die sich in Zehn-Sekunden-Schritten auf 40 Sekunden erweitern lassen.
• Steuerungsoberfläche — Qwen3.8-Omni-Flash bietet Kontext, Sampling und einen agentischen Modus, der selbst entscheidet, was er sich ansieht; Gemini Omni 1.1 Flash bietet Steuerung des ersten und letzten Frames, einen Zehn-Sekunden-Rückblick für die Kontinuität und eine 360p-Entwurfsstufe, die Google als ungefähr ein Drittel so teuer und etwa 60 % schneller beschreibt.
• Auflösung und Ausgabe — Qwen3.8-Omni-Flash hat keine Ausgabeauflösung, da es keine Medien erzeugt; Gemini Omni 1.1 Flash gibt mit 720p, 1080p und 4K aus.
• Kontext und Dauer — Qwen3.8-Omni-Flash verarbeitet eine Million Tokens und bis zu eine Stunde kontinuierliches Audio-Video in einem einzigen Aufruf; Gemini Omni 1.1 Flash ist durch den Clip begrenzt, den es erzeugt, nicht durch ein Eingabefenster.
• Wie Sie bezahlen — Qwen3.8-Omni-Flash wird pro Token abgerechnet: 0,15 $ pro Million Eingabe, 0,016 $ für zwischengespeicherte Eingabe, 0,47 $ Ausgabe auf der internationalen Liste; Gemini Omni 1.1 Flash wird pro Sekunde des generierten Videos abgerechnet, wobei Googles veröffentlichter Preis bei 0,10 $ pro Sekunde für 720p liegt.
• Offenheit — auf beiden Seiten geschlossen. Für keines der beiden Modelle gibt es Gewichte, und keines von beiden ist heute verfügbar, um über unsere API geroutet zu werden.

Die Überschneidung ist Videoverständnis, und sie ist asymmetrisch.
Der einzige Ort, an dem ein Käufer diese vernünftigerweise nebeneinanderstellen könnte, ist eine Pipeline, die sowohl Material verstehen als auch produzieren muss – sagen wir, ein Schnittassistent, der eine lange Aufnahme liest, die lohnenswerten Momente findet und einen Schnitt erzeugt. Auf der Verständnisseite ist Qwen3.8-Omni-Flash genau dafür gebaut: eine Stunde kontinuierliches Audio und Video pro Aufruf, Sprechertrennung und ein agentischer Modus, der die Genauigkeit auf dem OmniVideoBench des Anbieters von 63,4 auf 67,8 steigert, während er die Tokens pro Abfrage von 145.736 auf 79.117 reduziert. Auf der Produktionsseite ist Gemini Omni 1.1 Flash dasjenige, das den resultierenden Clip mit synchronisiertem Audio generieren kann, und Qwens Modell kann nicht einmal ein Einzelbild Video erzeugen.
Die Asymmetrie verläuft auch in die andere Richtung, und sie ist leichter zu übersehen. Das Verständnis eines Videogenerierungsmodells ist instrumentell — es braucht genug von einer Szene, um eine Einstellung über eine zehnsekündige Verlängerung hinweg konsistent zu halten, was eine andere Anforderung ist, als eine Frage dazu zu beantworten, was in der dritten Stunde eines Meetings gesagt wurde. Googles Modell hat die längere Erfolgsbilanz bei der Generierungsqualität und die kürzere bei der Langformanalyse; bei Alibabas Modell ist es umgekehrt. Wenn Ihre Aufgabe darin besteht, „die drei Minuten zu finden, auf die es in dieser Aufnahme ankommt“, dann ist das Generierungsmodell nicht das Werkzeug der Wahl. Wenn Ihre Aufgabe darin besteht, „einen dreißigsekündigen Clip zu produzieren, der diesem Briefing entspricht“, dann ist das Verstehensmodell ebenso wenig das Werkzeug der Wahl.
Warum der Preisvergleich immer wieder schiefgeht
Ein Pro-Sekunde-Tarif und ein Pro-Token-Tarif lassen sich nicht ineinander umrechnen, und der Versuch, sie umzurechnen, erzeugt die beiden Fehler, die diesen Vergleich dominieren. Der erste besteht darin, einen ganzen generierten Clip mit einem Pro-Token-Eingabetarif zu vergleichen und daraus zu schließen, dass das Videomodell hundertfach teurer ist – was zutrifft und doch nichts aussagt, weil sie nicht dasselbe verkaufen. Der zweite besteht darin, nur die Eingabepreise zu vergleichen und zu übersehen, dass Alibabas 98-%-Audio-Preissenkung für Eingabe-Audiostunden gilt, während Googles Tarif für Ausgabe-Videosekunden gilt, sodass die beiden „Preissenkungen“ nicht einmal auf derselben Seite des Zählers liegen.
Was man ehrlich sagen kann, ist Folgendes. Nach Alibabas eigener Methodik – eine Zwei-Minuten-Stichprobe multipliziert mit dreißig, Video bei 720p und ein Bild pro Sekunde – wird eine Stunde kombinierten Audio- und Video-Inputs für Qwen3.8-Omni-Flash mit etwa 0,20 US-Dollar angegeben, ein Rückgang von 3,27 US-Dollar gegenüber der vorherigen Generation. Die Generierung von vierzig Sekunden 720p-Video mit Gemini Omni 1.1 Flash kostet zu Googles veröffentlichten 0,10 US-Dollar pro Sekunde 4,00 US-Dollar, und das Erstellen derselben vierzig Sekunden bei 360p liegt nach Googles Kalkulation mit einem Drittel der Kosten bei etwa 1,20 US-Dollar. Beide Zahlenreihen stammen von den Anbietern, und keine von beiden wurde unabhängig reproduziert. Die nützliche Schlussfolgerung ist nicht, welche Zahl kleiner ist, sondern dass die Analyse einer Stunde Filmmaterial und die Generierung von vierzig Sekunden daraus in derselben Größenordnung liegen – was der eigentliche Grund dafür ist, dass eine Produktionspipeline, die beides tut, ein Kostenmodell braucht, nicht einen Gewinner.
Das ist auch das Argument dafür, die beiden unter einem Schlüssel statt über zwei Verträge zu führen. Keines der Omni-Modelle lässt sich heute über OrcaRouter routen: Qwen3.8-Omni-Flash läuft nur auf Alibabas eigenen Plattformen, und Google hat die Omni-Video-API nicht für Drittanbieter-Routing geöffnet, deshalb hosten wir keines von beiden und werden nicht vorgeben, es zu tun. Was in unserem Katalog live ist, ist das jeweilige Geschwistermodell jeder Familie – Qwen3.8-Flash und Gemini 3.8 Flash –, beide heute über einen Endpunkt zum Listenpreis des Anbieters mit 0 % Aufschlag aufrufbar, was einen A/B-Vergleich gegen die eigenen Zahlen des jeweiligen Anbieters zu einer Frage der Konfigurationsänderung statt einer zweiten Integration macht.

Wo jedes einzelne gewinnt, klar gesagt
Qwen3.8-Omni-Flash gewinnt bei allem, was in Eingabestunden gemessen wird: Transkription und Diarisierung von Meetings, Zusammenfassung langer Aufnahmen, audiostarke agentische Tool-Nutzung und Kosten pro Stunde verarbeiteter Medien. Die vom Anbieter gemeldeten Audioergebnisse sind stark, und seine Schwäche liegt dort, wo das Modell nie ausgerichtet war – die reasoning-lastigen Benchmarks, wo die ersten Drittanbieter-Läufe es beim Reasoning auf das 28. Perzentil setzten, mit einem Geschwindigkeitswert im 21. Perzentil, bei einer Stichprobe, die klein genug ist, dass die Zahlen eher als Aufforderung zum Testen denn als Urteil behandelt werden sollten.
Gemini Omni 1.1 Flash gewinnt bei der Ausgabe: Shot-Generierung mit synchronisiertem Audio, Kontinuität über längere Szenen hinweg, Kontrolle auf Frame-Ebene und das 4K-Finish, das eine Delivery-Pipeline schlicht erfordern kann. Sein Vorteil ist kein Benchmark-Ergebnis – sondern dass das andere Modell die Aufgabe gar nicht erledigen kann. Schwächer ist es bei allem, was das Halten einer Stunde Kontext erfordert, weil es dafür nicht ausgelegt ist.
Die Entscheidung – und worauf man achten sollte
Wenn Sie zwischen ihnen wählen, stellt sich die Frage, welche Hälfte der Pipeline nicht abgedeckt ist. Ein Team, das bereits Videos generiert und lange Aufzeichnungen verstehen muss, sollte Qwen3.8-Omni-Flash diese Woche mit seinem eigenen Audio testen; ein Team, das Medien analysiert und sie produzieren muss, sollte testen: Gemini Omni 1.1 Flash. Ein Team, das beides braucht, hat es mit zwei Anbietern, zwei Abrechnungsmodellen und zwei Integrationen zu tun, also mit der Situation, in der eine einzelne Routing-Ebene aufhört, eine Annehmlichkeit zu sein, und beginnt, das zu sein, was das Kostenmodell nachvollziehbar hält.
Zwei Dinge würden diese Einschätzung ändern. Eine unabhängige Bewertung von Qwen3.8-Omni-Flashwürde jede oben genannte Herstellerangabe durch eine vergleichbare ersetzen – eine solche gibt es noch nicht, und ihr Fehlen ist die größte einzelne Lücke in diesem Vergleich. Und ein veröffentlichter Preis für die 1080p- und 4K-Ausgabe von Google würde die Rechnung im oberen Bereich überprüfbar machen; heute kursieren diese Zahlen nur als Schätzungen aus dem Marktplatzumfeld und nicht als Googles eigene Liste.

Eine abschließende Anmerkung zur Einordnung. „Omni“ bedeutet inzwischen nichts Präzises mehr – es umfasst heute ein Modell, das eine Stunde Besprechungsaudio liest, und eines, das einen 40-Sekunden-Clip mit Ton rendert, und wenn man das Wort als Kategorie behandelt, führt genau das dazu, dass Käufer eine Rate pro Token mit einer Rate pro Sekunde vergleichen und daraus eine Schlussfolgerung ziehen. Die Modelle sind Komplemente mit einer schmalen Überschneidung, und die richtige Haltung beiden gegenüber, fünf Tage und vier Wochen nach ihren jeweiligen Veröffentlichungen, ist dieselbe: Messen Sie sie an Ihrem eigenen Material, und halten Sie einen zweiten Weg offen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
