
Qwen-Image-2.1 vs. Gemini Omni 1.1 Flash: Einer liefert ein PNG, der andere nicht
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Das Nützlichste, was man über Qwen-Image-2.1 und Gemini Omni 1.1 Flash wissen sollte, ist, dass sie nicht konkurrieren. Bittet man Gemini Omni 1.1 Flash um ein Standbild, erhält man einen Fehler: In der eigenen Dokumentation des Anbieters werden Bildgenerierung, Bildbearbeitung und verschachtelte Bild- und Textausgabe als nicht unterstützte Fähigkeiten des Modells aufgeführt. Bittet man Qwen-Image-2.1 um ein Video, erhält man ein Standbild in 2048×2048 mit einem Alphakanal. Jede Vergleichstabelle, die sie in zwei Spalten stellt, vergleicht eine Kamera mit einem Projektor. Die eigentliche Frage – die, die tatsächlich Geld kostet – ist, was passiert, wenn man sie verkettet, und ob die Kette den Kontakt mit der Preisliste übersteht. Qwen-Image-2.1 wurde am 20. September 2026 öffentlich zugänglich; Gemini Omni 1.1 Flash ist seit dem 27. August 2026 allgemein verfügbar.
Was jedes Modell physisch zurückgibt
Dies ist der ganze Vergleich, und alles andere folgt daraus.
• Ausgabeformat — Qwen-Image-2.1 liefert ein Standbild, nativ bis zu 2048×2048 bei 40 Inferenzschritten, optional mit einem echten Alphakanal; Gemini Omni 1.1 Flash liefert Video, bis zu 40 Sekunden, zusammengesetzt aus 10-Sekunden-Generierungs- und Erweiterungsaufrufen, ganz ohne Standbildmodus.
• Transparenz — Qwen-Image-2.1 entrauscht in einem 64-Kanal-RGBA-Latentraum, daher kommt das Alpha direkt aus dem Sampler; Gemini Omni 1.1 Flash hat keine Ausgabe mit transparentem Hintergrund, und eine entsprechende Anforderung schlägt fehl.
• Referenzeingabe — Qwen-Image-2.1 akzeptiert bis zu 10 Referenzbilder für die Komposition mehrerer Subjekte; Gemini Omni 1.1 Flash akzeptiert bis zu 10 Bilder pro Prompt als *Eingabe* und bis zu drei 3-sekündige Referenzvideoclips.
• Auflösungsobergrenze — Qwen-Image-2.1 ist nativ 2K; Gemini Omni 1.1 Flash bietet 360p, 720p, 1080p und 4K, aber 1080p und 4K sind Hochskalierungen eines nativen 720p-Renders statt nativer Generierungen.
• Was es kostet — Qwen-Image-2.1 hat keinen gehosteten Preis, weil es keinen gehosteten Endpunkt gibt, die Kosten sind also die eigene GPU-Zeit; Gemini Omni 1.1 Flash berechnet 0,10 $ pro Sekunde bei 720p, mit einer 360p-Draft-Stufe für etwa 0,03 $ pro Sekunde.
• Lizenz — Qwen-Image-2.1 wird unter der Qwen Research License Agreement vom 20. September 2026 veröffentlicht, nur für nichtkommerzielle Nutzung; Gemini Omni 1.1 Flash ist eine kommerzielle API, deren Ausgabe standardmäßig SynthID- und C2PA-Provenienz trägt.
Die letzte Zeile ist die, die alle überfliegen. Auf der einen Seite steht ein Modell, das man herunterladen, aber nicht verkaufen kann. Auf der anderen Seite ein Modell, das man nicht herunterladen, aber frei verkaufen kann – mit einem unsichtbaren Wasserzeichen in jedem Frame.
Warum die „versus“-Rahmung trotzdem immer wieder auftaucht
Suche nach den beiden Namen zusammen, und du findest Seiten, die sie direkt gegeneinander antreten lassen. Der Grund dafür ist, dass die zugrunde liegende Frage real ist, auch wenn die Rahmung falsch ist: Beide Modelle sitzen in derselben kreativen Pipeline, und beide sind das Neueste darin. Was die Menschen tatsächlich zu entscheiden versuchen, ist, wo das Standbild endet und die Bewegung beginnt.
Gemini Omni 1.1 Flash hat sich seinen Platz bei dieser Frage mit unabhängigen Zahlen statt mit Herstellerzahlen verdient. Bei Artificial Analysis hielt es den Spitzenplatz in beiden Arenen Text-zu-Video und Bild-zu-Video in der Kategorie ohne Audio mit Stand vom 2. September 2026, bei Elo 1324 und 1364. Mit aktiviertem Audio fällt es auf Elo 1237 und 1180 zurück – den zweiten und vierten Platz. Diese Audio-Lücke ist die Art von Detail, die ein Datenblatt verbirgt und eine Rangliste offenlegt.
Die Belege für Qwen-Image-2.1 sind dünner und von anderer Art. Der eigene Qwen-Image-Bench des Anbieters setzt es auf 60,28 und damit vor Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65 sowie an die Spitze der offenen Modelle – doch das ist ein vom Anbieter durchgeführter Benchmark mit Abständen unter einem Punkt, und es ist keine Reproduktion durch Dritte. Unabhängige Tests bestehen bisher aus einem menschlich bewerteten Durchlauf bei GenAI Showdown mit 7/15, gegenüber 4/15 für das ursprüngliche Qwen-Image und hinter Ideogram 4 mit 8/15. Das Modell hatte zum Zeitpunkt des Schreibens keinen Eintrag in den Bild-Ranglisten von Artificial Analysis. Kein niedriger Wert – gar kein Wert.


Die Übergabe und was sie tatsächlich kostet
Wenn du etwas baust, das sowohl ein Standbild als auch einen Clip benötigt, verläuft die Pipeline nur in eine Richtung: Qwen-Image-2.1 erzeugt das Einzelbild, Gemini Omni 1.1 Flash animiert es. Den umgekehrten Weg gibt es nicht.
Die Rechnung ist gnadenlos, sobald man sie aufmacht. Ein 10-Sekunden-720p-Clip auf Gemini Omni 1.1 Flash wird mit etwa 1,00 $ berechnet. In der 360p-Entwurfsstufe kosten dieselben 10 Sekunden rund 0,30 $, und eine vollständige 40-Sekunden-Szene in 720p – eine Generierung plus drei Verlängerungsaufrufe – landet bei etwa 4,00 $. Das Standbild, das das Ganze anstößt, kostet unterdessen nichts außer dem Strom auf der eigenen Karte. Was bedeutet, dass die interessante Kostenentscheidung nicht „welches Modell“ lautet, sondern „wie viele Takes“. Ein Standbild kann man kostenlos durchiterieren; ein Video nicht. Teams, die Videogenerierung pro Asset statt pro Versuch budgetieren, sind diejenigen, die überrascht werden, denn das erste Frame ist kostenlos und die Wiederholungen nicht.
Auch bei der Übergabe lauert eine Qualitätsfalle. Gemini Omni 1.1 Flash rendert nativ mit 720p und skaliert auf 1080p und 4K hoch. Wenn Ihr Standbild ein 2048×2048-Frame von Qwen-Image-2.1 mit einem sauberen Alphakanal ist, geht beim Einspeisen in einen Videopfad, der mit 720p rendert und hochskaliert, das meiste verloren, was das Bildmodell Ihnen gegeben hat – und der Alphakanal wird vollständig verworfen, weil es keine transparente Videoausgabe gibt. Transparenz überlebt im Compositor, nicht in der Modellkette. Planen Sie das Compositing, nachdem der Clip zurückkommt, nicht davor.
Wo die Routing-Schicht hingehört
Der heikle Punkt an dieser Kombination ist, dass keines der beiden Modelle auf die Art erreichbar ist, wie es beim Rest Ihres Stacks vermutlich der Fall ist. Gemini Omni 1.1 Flash ist eine Vendor-API mit eigenem Schlüssel und eigener Abrechnung im Sekundentakt. Qwen-Image-2.1 ist ein rund 33 GB großer Download – ein 7B-Diffusionstransformer plus ein Qwen3-VL 8B Textencoder –, den Sie selbst hosten, unter einer Lizenz, die ausschließlich nichtkommerzielle Nutzung erlaubt. Zwei Abrechnungsmodelle, zwei Zugriffswege, ein Projekt.
OrcaRouter existiert genau für die umgebende Oberfläche: ein OpenAI-kompatibler Endpunkt über 200+ Modelle hinweg, Anbieter-Listenpreis ohne Aufschlag durchgereicht, automatisches Failover zwischen Anbietern, eine Routing-DSL zum Zusammensetzen von Fallbacks und Modell-Fusion für Aufrufe im Panel-Stil. Hier präzise zu sein, was das abdeckt, ist wichtig. Wir routen kein Qwen-Image-Modell irgendeiner Version, daher ist Qwen-Image-2.1 keine Route, die du auf unserer Seite aufrufen kannst — es läuft auf deiner Hardware oder gar nicht. Wir routen auch Gemini Omni 1.1 Flash nicht. Was wir auf der Bewegtbild-Seite führen, ist die Videolinie von Kling, einschließlich kling-v3, kling-v3-omni und kling-video-o1, plus MiniMax H3 — sodass die Animationshälfte dieser Pipeline eine gehostete Route hat, die keinen zweiten Anbietervertrag erfordert, und auf der Bildseite führen wir die OpenAI GPT-Image-Familie, Googles Imagen-4-Stufen und Gemini-Bildvorschauen sowie xAIs Grok-Imagine-Bild-Endpunkt. Da der Listenpreis durchgereicht und nicht mit einem Aufschlag versehen wird, ist eine Anbieter-Preissenkung bei einem von ihnen hier noch am selben Tag live.
Welches du tatsächlich brauchst
• Du brauchst Assets, kein Footage — Qwen-Image-2.1, und der Alpha-Kanal ist der Grund. Transparente Produkt-Freisteller, Icons, Sprites und mehrschichtige Composites sind der Bereich, in dem ein Sampler, der RGBA ausgibt, eine komplette Freistellungs-Pipeline spart.
• Du brauchst Bewegung, und du brauchst sie messbar — Gemini Omni 1.1 Flash. Es ist das einzige der beiden mit unabhängigen Arena-Ergebnissen an der Spitze eines Rankings und das einzige mit einem veröffentlichten Preis pro Sekunde, den du in eine Prognose aufnehmen kannst.
• Du brauchst beides — Kalkuliere die Video-Hälfte pro Versuch, nicht pro Asset, und gehe nicht davon aus, dass der Alpha-Kanal durchkommt.
• Du musst das Ergebnis verkaufen können — Gemini Omni 1.1 Flash, und nur Gemini Omni 1.1 Flash, bis Qwen kommerzielle Bedingungen für Qwen-Image-2.1 veröffentlicht. Für diese Lizenz gibt es heute weder einen veröffentlichten Preis noch ein Bedingungsdokument.
Die ehrliche Zusammenfassung ist, dass der Vergleich, der sie einordnet, das falsche Artefakt ist. Was als Nächstes zu beobachten lohnt, ist, ob Qwen kommerzielle Bedingungen an Qwen-Image-2.1 knüpft und ob Google die Audio-Lücke in den Omni-Leaderboards schließt – diese beiden Fakten, nicht ein weiteres Scoreboard, entscheiden darüber, welche Hälfte dieser Pipeline das Budget bekommt.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
