
Qwen-Image-2.1 vs Gemini Omni 1.1 Flash : l’un renvoie un PNG, l’autre non
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La chose la plus utile à savoir à propos de Qwen-Image-2.1 et Gemini Omni 1.1 Flash, c'est qu'ils ne sont pas en concurrence. Demandez une image fixe à Gemini Omni 1.1 Flash et vous obtenez une erreur : la documentation du fournisseur lui-même répertorie la génération d'images, l'édition d'images et la sortie entrelacée image-texte parmi les capacités non prises en charge du modèle. Demandez une vidéo à Qwen-Image-2.1 et vous obtenez une image fixe de 2048×2048 avec un canal alpha. Tout tableau comparatif qui les place dans deux colonnes revient à comparer un appareil photo à un projecteur. La vraie question — celle qui coûte réellement de l'argent — est de savoir ce qui se passe lorsqu'on les enchaîne, et si la chaîne survit au contact de la grille tarifaire. Qwen-Image-2.1 est devenu public le 20 septembre 2026 ; Gemini Omni 1.1 Flash est disponible en général depuis le 27 août 2026.
Ce que chaque modèle renvoie physiquement
Voilà toute la comparaison, et tout le reste en découle.
• Format de sortie — Qwen-Image-2.1 renvoie une image fixe, jusqu’à 2048×2048 nativement en 40 étapes d’inférence, éventuellement avec un véritable canal alpha ; Gemini Omni 1.1 Flash renvoie de la vidéo, jusqu’à 40 secondes assemblées à partir d’appels de génération et d’extension de 10 secondes, sans aucun mode image fixe.
• Transparence — Qwen-Image-2.1 débruit dans un espace latent RGBA à 64 canaux, donc l’alpha provient de l’échantillonneur ; Gemini Omni 1.1 Flash n’a pas de sortie à fond transparent, et en demander une échoue.
• Entrée de référence — Qwen-Image-2.1 accepte jusqu’à 10 images de référence pour une composition multi-sujets ; Gemini Omni 1.1 Flash accepte jusqu’à 10 images par prompt comme *entrée* et jusqu’à trois clips vidéo de référence de 3 secondes.
• Plafond de résolution — Qwen-Image-2.1 est natif en 2K ; Gemini Omni 1.1 Flash propose 360p, 720p, 1080p et 4K, mais 1080p et 4K sont des agrandissements d’un rendu natif en 720p plutôt que des générations natives.
• Ce que cela coûte — Qwen-Image-2.1 n’a pas de tarif hébergé parce qu’il n’existe aucun point de terminaison hébergé, donc le coût correspond à votre propre temps GPU ; Gemini Omni 1.1 Flash facture 0,10 $ par seconde en 720p, avec un palier brouillon 360p à environ 0,03 $ par seconde.
• Licence — Qwen-Image-2.1 est distribué sous le Qwen Research License Agreement daté du 20 septembre 2026, à usage non commercial uniquement ; Gemini Omni 1.1 Flash est une API commerciale dont la sortie porte SynthID et la provenance C2PA par défaut.
La dernière ligne est celle que les gens sautent. D’un côté, vous avez un modèle que vous pouvez télécharger et que vous ne pouvez pas vendre. De l’autre, un modèle que vous ne pouvez pas télécharger et que vous pouvez vendre librement — avec un filigrane invisible dans chaque image.
Pourquoi le cadrage « versus » ne cesse d'apparaître malgré tout
Cherchez les deux noms ensemble et vous trouverez des pages qui les classent face à face. La raison en est que la question sous-jacente est bien réelle, même lorsque le cadrage est erroné : les deux modèles occupent la même chaîne de création, et tous deux en sont l'élément le plus récent. Ce que les gens cherchent en réalité à trancher, c'est où s'arrête l'image fixe et où commence le mouvement.
Gemini Omni 1.1 Flash a mérité sa place sur cette question grâce à des chiffres indépendants plutôt qu’à ceux du fournisseur. Sur Artificial Analysis, il occupait la première place à la fois dans les arènes texte-vers-vidéo et image-vers-vidéo de la catégorie sans audio au 2 septembre 2026, avec des Elo de 1324 et 1364. Avec l’audio activé, il descend à des Elo de 1237 et 1180 — deuxième et quatrième. Cet écart audio est le genre de détail qu’une fiche technique cache et qu’un classement révèle.
Les preuves de Qwen-Image-2.1 sont plus minces et d'une autre nature. Le propre Qwen-Image-Bench du fournisseur le place à 60,28, devant Nano Banana 2.0 à 59,82 et GPT Image 1.5 à 59,65, et premier parmi les modèles ouverts — mais il s'agit d'un benchmark réalisé par le fournisseur avec des marges inférieures à un point, et ce n'est pas une reproduction par un tiers. Les tests indépendants effectués jusqu'à présent consistent en une évaluation GenAI Showdown notée par des humains à 7/15, en hausse par rapport à 4/15 pour le Qwen-Image original et derrière le 8/15 d'Ideogram 4. Le modèle n'avait aucune entrée dans les classements d'images d'Artificial Analysis au moment de la rédaction. Pas un score faible — aucun score.


La passation, et ce qu’elle coûte réellement
Si vous construisez quelque chose qui a besoin à la fois d'une image fixe et d'un clip, le pipeline est à sens unique : Qwen-Image-2.1 crée l'image, Gemini Omni 1.1 Flash l'anime. L'inverse n'existe pas.
L’arithmétique ne pardonne pas une fois qu’on passe aux chiffres. Un clip de 10 secondes en 720p sur Gemini Omni 1.1 Flash coûte environ 1,00 $. Au palier brouillon 360p, les mêmes 10 secondes reviennent à environ 0,30 $, et une scène complète de 40 secondes en 720p — une génération plus trois appels d’extension — approche les 4,00 $. Pendant ce temps, l’image fixe qui amorce tout le processus ne coûte rien d’autre que l’électricité sur votre propre carte graphique. Ce qui signifie que la décision de coût intéressante n’est pas « quel modèle », mais « combien de prises ». Une image fixe, vous pouvez l’itérer gratuitement ; une vidéo, non. Les équipes qui budgétisent la génération vidéo par élément plutôt que par tentative sont celles qui se font surprendre, car la première image est gratuite et les reprises ne le sont pas.
Il y a aussi un piège de qualité dans le transfert. Gemini Omni 1.1 Flash effectue nativement un rendu en 720p et monte en résolution vers 1080p et 4K. Si votre image fixe est une image Qwen-Image-2.1 en 2048×2048 avec un canal alpha propre, l’injecter dans un pipeline vidéo qui effectue un rendu en 720p puis monte en résolution revient à gaspiller la majeure partie de ce que le modèle d’image vous a donné — et le canal alpha est entièrement perdu, car il n’existe aucune sortie vidéo transparente. La transparence survit dans le compositeur, pas dans la chaîne de modèles. Planifiez la composition après le retour du clip, pas avant.
Où s'insère la couche de routage
Le côté délicat de cet appariement, c’est qu’aucun des deux modèles n’est accessible de la manière dont le reste de votre stack l’est probablement. Gemini Omni 1.1 Flash est une API de fournisseur avec sa propre clé et son propre compteur à la seconde. Qwen-Image-2.1 est un téléchargement d’environ 33 Go — un transformateur de diffusion 7B plus un encodeur de texte Qwen3-VL 8B — que vous servez vous-même, sous une licence qui n’autorise que l’usage non commercial. Deux modèles de facturation, deux voies d’accès, un seul projet.
OrcaRouter existe précisément pour la surface environnante : un point de terminaison compatible OpenAI sur plus de 200 modèles, le prix catalogue des fournisseurs répercuté sans marge, le basculement automatique entre fournisseurs, un DSL de routage pour composer des solutions de repli, et la fusion de modèles pour les appels de type panel. Être précis sur ce que cela couvre ici est important. Nous ne routons aucun modèle Qwen-Image, quelle qu'en soit la version, donc Qwen-Image-2.1 n'est pas une route que vous pouvez appeler de notre côté — il s'exécute sur votre matériel ou pas du tout. Nous ne routons pas non plus Gemini Omni 1.1 Flash. Ce que nous proposons du côté du mouvement, c'est la gamme vidéo de Kling, notamment kling-v3, kling-v3-omni et kling-video-o1, ainsi que MiniMax H3 — la moitié animation de ce pipeline dispose donc d'une route hébergée qui ne nécessite pas un second contrat fournisseur, et du côté image, nous proposons la famille OpenAI GPT-Image, les différents paliers d'Imagen 4 de Google et les aperçus d'image Gemini, ainsi que le point de terminaison image Grok Imagine de xAI. Comme le prix catalogue est répercuté plutôt que majoré, une baisse de prix d'un fournisseur sur l'un d'entre eux est effective ici le jour même.
Lequel vous faut-il réellement ?
• Il vous faut des ressources, pas des séquences — Qwen-Image-2.1, et le canal alpha en est la raison. Les détourages de produits transparents, les icônes, les sprites et les compositions en couches sont les cas où un échantillonneur qui produit du RGBA économise tout un pipeline de matting.
• Il vous faut du mouvement, et il vous faut qu'il soit mesuré — Gemini Omni 1.1 Flash. C'est le seul des deux à afficher des résultats d'arène indépendants en tête d'un classement, et le seul à proposer un prix à la seconde publié que vous pouvez intégrer à une prévision.
• Il vous faut les deux — budgétisez la partie vidéo par tentative, pas par ressource, et ne partez pas du principe que le canal alpha est conservé.
• Il vous faut vendre le résultat — Gemini Omni 1.1 Flash, et uniquement Gemini Omni 1.1 Flash, jusqu'à ce que Qwen publie des conditions commerciales pour Qwen-Image-2.1. Il n'existe aujourd'hui aucun prix publié ni document de conditions pour cette licence.
Le résumé honnête, c'est que la comparaison qui les classe est le mauvais artefact. Ce qu'il vaut la peine de surveiller ensuite, c'est si Qwen assortit Qwen-Image-2.1 de conditions commerciales, et si Google comble l'écart audio dans les classements Omni — ces deux faits, et non un autre tableau de scores, déterminent quelle moitié de ce pipeline obtient le budget.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
