
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash : L'un regarde la vidéo, l'autre la crée.
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Réponse courte : ces deux modèles ne sont pas interchangeables, et la comparaison n'a de sens qu'à partir du moment où l'on cesse de traiter « omni » comme une catégorie. Qwen3.8-Omni-Flash, que l'éditeur a ouvert à ses clients API le 18 septembre 2026, accepte du texte, des images, de l'audio et de la vidéo en entrée et renvoie du texte — c'est un modèle conçu pour lire une heure de réunion ou de séquences filmées et vous dire ce qui s'y est passé. Gemini Omni 1.1 Flash, que l'éditeur a livré le 27 août 2026, accepte un prompt textuel ou une image et renvoie de la vidéo avec un son synchronisé — c'est un modèle conçu pour produire les séquences. L'un consomme des médias, l'autre les produit. Si votre pipeline a besoin des deux, il vous faut les deux, et la vraie question n'est pas de savoir lequel l'emporte, mais duquel vous manquez réellement.
Aucun des deux modèles n’est à poids ouverts, aucun n’est routable via OrcaRouter, et tous deux sont tarifés selon des axes qui ne peuvent pas être convertis l’un en l’autre — des tokens d’un côté, des secondes de vidéo générée de l’autre. Le terrain sur lequel ils se recoupent réellement est plus étroit que ne le suggère le cadrage « omni vs omni », et ce recoupement mérite d’être cerné avant l’arithmétique des prix, car c’est dans l’arithmétique des prix que les deux sont le plus souvent comparés à tort.
L'erreur de catégorie qu'il vaut la peine de dissiper en premier
Les documents de lancement d'Alibaba évaluent Qwen3.8-Omni-Flash par rapport à Gemini 3.8 Flash, et une grande partie de la couverture qui a suivi a résumé cela en « bat Gemini ». Il s'agit d'un modèle Google différent de Gemini Omni 1.1 Flash, et les deux ne sont pas des points de référence interchangeables : Gemini 3.8 Flash est le modèle multimodal polyvalent, et Gemini Omni 1.1 Flash est le modèle de génération vidéo avec une grille tarifaire distincte et une surface d'API distincte. Tous les chiffres Qwen contre Gemini qui circulent depuis le lancement — WildClawBench-MM 71,0 contre 58,9, SpotSoundBench 67,2 contre 39,7, AgenticVBench 36,8 contre 45,0 — concernent Gemini 3.8 Flash, et non le modèle vidéo Omni, et rien de tout cela n'est indépendant en tout cas. Si vous êtes arrivé ici avec un tableau de scores qui place les deux modèles de cet article sur le même axe, c'est presque certainement le mauvais modèle Google dans la colonne de droite.
Ce que chacun fait réellement
• Ce qu'il accepte en entrée — Qwen3.8-Omni-Flash accepte le texte, l'image, l'audio et la vidéo, y compris l'audio stéréo et spatial à quatre canaux ; Gemini Omni 1.1 Flash accepte des invites textuelles et imagées, ainsi que jusqu'à trois secondes de vidéo de référence.
• Ce qu'il renvoie — Qwen3.8-Omni-Flash ne renvoie que du texte ; Gemini Omni 1.1 Flash renvoie de la vidéo avec un audio synchronisé nativement, en scènes extensibles jusqu'à 40 secondes par tranches de dix secondes.
• Surface de contrôle — Qwen3.8-Omni-Flash expose le contexte, l’échantillonnage et un mode agentique qui décide lui-même ce qu’il doit examiner ; Gemini Omni 1.1 Flash expose un contrôle de la première et de la dernière image, un retour en arrière de dix secondes pour la continuité, et un palier de brouillon en 360p que Google décrit comme environ un tiers du coût et environ 60 % plus rapide.
• Résolution et finition — Qwen3.8-Omni-Flash n’a pas de résolution de sortie, car il ne produit aucun média ; Gemini Omni 1.1 Flash produit en 720p, 1080p et 4K.
• Contexte et durée — Qwen3.8-Omni-Flash prend en charge un million de jetons et jusqu'à une heure d'audio-vidéo continu en un seul appel ; Gemini Omni 1.1 Flash est limité par le clip qu'il génère, et non par une fenêtre d'entrée.
• Comment vous payez — Qwen3.8-Omni-Flash est facturé par token : 0,15 $ par million en entrée, 0,016 $ en cache, 0,47 $ en sortie sur la grille tarifaire internationale ; Gemini Omni 1.1 Flash est facturé à la seconde de vidéo générée, avec le tarif publié par Google à 0,10 $ par seconde pour la 720p.
• Ouverture — fermée des deux côtés. Aucun poids pour l’un ou l’autre modèle, et aucun des deux n’est disponible pour être routé via notre API aujourd’hui.

Le chevauchement est la compréhension vidéo, et il est asymétrique
Le seul endroit où un acheteur pourrait raisonnablement les mettre côte à côte est un pipeline qui doit à la fois comprendre les séquences et les produire — par exemple, un assistant de montage qui lit un long enregistrement, repère les moments qui valent la peine d’être conservés et génère un montage. Pour la partie compréhension, Qwen3.8-Omni-Flash est conçu exactement pour cela : une heure d’audio et de vidéo en continu par appel, la séparation des locuteurs et un mode agentique qui fait passer la précision sur l’OmniVideoBench du fournisseur de 63,4 à 67,8 tout en réduisant les tokens par requête de 145 736 à 79 117. Pour la partie production, Gemini Omni 1.1 Flash est celui qui peut générer le clip résultant avec un audio synchronisé, alors que le modèle de Qwen ne peut pas produire une seule image de vidéo.
L’asymétrie joue aussi dans l’autre sens, et elle est plus facile à négliger. Chez un modèle de génération vidéo, la compréhension est instrumentale — il a besoin de suffisamment d’éléments d’une scène pour qu’un plan reste cohérent sur une extension de dix secondes, ce qui est une exigence différente de celle consistant à répondre à une question sur ce qui a été dit pendant la troisième heure d’une réunion. Le modèle de Google a l’historique le plus long en matière de qualité de génération et le plus court en analyse de contenu long ; celui d’Alibaba a l’inverse. Si votre tâche est de « trouver les trois minutes qui comptent dans cet enregistrement », le modèle de génération n’est pas l’outil. Si votre tâche est de « produire un clip de trente secondes correspondant à ce brief », le modèle de compréhension n’est pas l’outil non plus.
Pourquoi la comparaison des prix continue de mal tourner
Un tarif à la seconde et un tarif par token ne se convertissent pas, et la tentative de les convertir produit les deux erreurs qui dominent cette confrontation. La première consiste à comparer un clip généré entier à un tarif d'entrée par token et à conclure que le modèle vidéo est des centaines de fois plus cher — ce qui est vrai et dénué de sens, car ils ne vendent pas la même chose. La seconde consiste à ne comparer que les prix d'entrée et à manquer que la réduction de 98 % d'Alibaba sur l'audio s'applique aux heures d'audio en entrée, tandis que le tarif de Google s'applique aux secondes de vidéo en sortie, de sorte que les deux « réductions » ne se situent même pas du même côté du compteur.
Ce qui peut être dit honnêtement, c'est ceci. Selon la méthodologie propre à Alibaba — un échantillon de deux minutes multiplié par trente, vidéo en 720p et une image par seconde — une heure d'entrée audio et vidéo combinée destinée à Qwen3.8-Omni-Flashest annoncée à environ 0,20 $, contre 3,27 $ pour la génération précédente. Générer quarante secondes de vidéo 720p avec Gemini Omni 1.1 Flashau tarif publié de 0,10 $ par seconde de Google coûte 4,00 $, et générer ces mêmes quarante secondes en 360p revient à près de 1,20 $ selon le cadre de Google fondé sur le tiers du coût. Les deux séries de chiffres sont déclarées par les fournisseurs et aucune n'a été reproduite indépendamment. La conclusion utile n'est pas de savoir quel nombre est le plus petit, mais que l'analyse d'une heure de séquence et la génération de quarante secondes de celle-ci se situent dans le même ordre de grandeur — ce qui est la véritable raison pour laquelle un pipeline de production qui fait les deux a besoin d'un modèle de coûts, et non d'un gagnant.
C'est aussi l'argument pour garder les deux sur une seule clé plutôt que deux contrats. Aucun des deux modèles omni n'est routable via OrcaRouter aujourd'hui : Qwen3.8-Omni-Flash ne tourne que sur les plateformes propres d'Alibaba, et Google n'a pas ouvert l'API vidéo Omni au routage tiers, donc nous n'hébergeons ni l'un ni l'autre et ne prétendrons pas le contraire. Ce qui est bien vivant dans notre catalogue, ce sont les frères et sœurs de chaque famille — Qwen3.8-Flash et Gemini 3.8 Flash — tous deux appelables dès aujourd'hui via un seul point de terminaison au prix catalogue du fournisseur, avec 0 % de marge, ce qui fait qu'un A/B face aux chiffres de l'un ou l'autre fournisseur relève d'un simple changement de configuration plutôt que d'une seconde intégration.

Là où chacun l’emporte, dit sans détour
Qwen3.8-Omni-Flash l'emporte sur tout ce qui se mesure en heures d'entrée : transcription et diarisation de réunions, synthèse de longs enregistrements, utilisation agentique d'outils à forte composante audio, et coût par heure de média traité. Ses résultats audio rapportés par le fournisseur sont solides, et sa faiblesse se situe là où le modèle n'a jamais été conçu — les classements à forte dominante de raisonnement, où les premiers tests tiers le placent au 28e percentile en raisonnement, avec un chiffre de vitesse au 21e, sur un échantillon assez petit pour que ces chiffres soient à considérer comme une invitation à tester plutôt qu'un verdict.
Gemini Omni 1.1 Flash l'emporte sur la sortie : génération de plans avec audio synchronisé, continuité sur des scènes étendues, contrôle image par image, et la finition 4K qu'un pipeline de livraison peut simplement exiger. Son avantage n'est pas un score de benchmark — c'est que l'autre modèle ne peut pas faire le travail du tout. Là où il est plus faible, c'est pour tout ce qui exige de conserver une heure de contexte, car il n'est pas conçu pour cela.
La décision, et ce qu’il faut surveiller
Si vous devez choisir entre les deux, la question est de savoir quelle moitié du pipeline n’est pas desservie. Une équipe qui génère déjà de la vidéo et doit comprendre de longs enregistrements devrait tester Qwen3.8-Omni-Flash sur son propre audio cette semaine ; une équipe qui analyse des médias et doit en produire devrait tester Gemini Omni 1.1 Flash. Une équipe qui a besoin des deux se retrouve face à deux fournisseurs, deux modèles de facturation et deux intégrations, situation dans laquelle une couche de routage unique cesse d’être une simple facilité et devient l’élément qui garde le modèle de coûts lisible.
Deux choses changeraient cette lecture. Une évaluation indépendante de Qwen3.8-Omni-Flash remplacerait chaque chiffre de fournisseur ci-dessus par un chiffre comparable — aucun n'existe encore, et son absence est la plus grande lacune de cette comparaison. Et un tarif publié pour les sorties 1080p et 4K de Google rendrait l'arithmétique haut de gamme vérifiable ; aujourd'hui, ces chiffres ne circulent que comme des estimations de place de marché plutôt que comme la liste officielle de Google.

Une dernière remarque sur le cadrage. « Omni » ne signifie plus rien de précis — il désigne désormais aussi bien un modèle qui lit une heure d’audio de réunion qu’un modèle qui génère un clip de quarante secondes avec son, et c’est en traitant ce mot comme une catégorie que les acheteurs finissent par comparer un tarif par token à un tarif à la seconde et en tirer une conclusion. Les modèles sont complémentaires, avec un chevauchement limité, et la bonne posture à l’égard des deux, cinq jours et quatre semaines après leurs sorties respectives, est la même : mesurez-les sur vos propres contenus, et gardez une seconde voie ouverte.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
