Une carte hero générée intitulée « Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash », sous le surtitre « Face-à-face – deux tâches différentes », avec le sous-titre « L’un lit une heure de séquences. L’autre en génère quarante secondes. » et quatre pastilles : « Chevauchement : compréhension vidéo », « Entrée : audio + vidéo vs invite », « Sortie : texte vs vidéo », « Routable ici : aucun des deux ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash : L'un regarde la vidéo, l'autre la crée.

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Réponse courte : ces deux modèles ne sont pas interchangeables, et la comparaison n'a de sens qu'à partir du moment où l'on cesse de traiter « omni » comme une catégorie. Qwen3.8-Omni-Flash, que l'éditeur a ouvert à ses clients API le 18 septembre 2026, accepte du texte, des images, de l'audio et de la vidéo en entrée et renvoie du texte — c'est un modèle conçu pour lire une heure de réunion ou de séquences filmées et vous dire ce qui s'y est passé. Gemini Omni 1.1 Flash, que l'éditeur a livré le 27 août 2026, accepte un prompt textuel ou une image et renvoie de la vidéo avec un son synchronisé — c'est un modèle conçu pour produire les séquences. L'un consomme des médias, l'autre les produit. Si votre pipeline a besoin des deux, il vous faut les deux, et la vraie question n'est pas de savoir lequel l'emporte, mais duquel vous manquez réellement.

Aucun des deux modèles n’est à poids ouverts, aucun n’est routable via OrcaRouter, et tous deux sont tarifés selon des axes qui ne peuvent pas être convertis l’un en l’autre — des tokens d’un côté, des secondes de vidéo générée de l’autre. Le terrain sur lequel ils se recoupent réellement est plus étroit que ne le suggère le cadrage « omni vs omni », et ce recoupement mérite d’être cerné avant l’arithmétique des prix, car c’est dans l’arithmétique des prix que les deux sont le plus souvent comparés à tort.

L'erreur de catégorie qu'il vaut la peine de dissiper en premier

Les documents de lancement d'Alibaba évaluent Qwen3.8-Omni-Flash par rapport à Gemini 3.8 Flash, et une grande partie de la couverture qui a suivi a résumé cela en « bat Gemini ». Il s'agit d'un modèle Google différent de Gemini Omni 1.1 Flash, et les deux ne sont pas des points de référence interchangeables : Gemini 3.8 Flash est le modèle multimodal polyvalent, et Gemini Omni 1.1 Flash est le modèle de génération vidéo avec une grille tarifaire distincte et une surface d'API distincte. Tous les chiffres Qwen contre Gemini qui circulent depuis le lancement — WildClawBench-MM 71,0 contre 58,9, SpotSoundBench 67,2 contre 39,7, AgenticVBench 36,8 contre 45,0 — concernent Gemini 3.8 Flash, et non le modèle vidéo Omni, et rien de tout cela n'est indépendant en tout cas. Si vous êtes arrivé ici avec un tableau de scores qui place les deux modèles de cet article sur le même axe, c'est presque certainement le mauvais modèle Google dans la colonne de droite.

Ce que chacun fait réellement

• Ce qu'il accepte en entrée — Qwen3.8-Omni-Flash accepte le texte, l'image, l'audio et la vidéo, y compris l'audio stéréo et spatial à quatre canaux ; Gemini Omni 1.1 Flash accepte des invites textuelles et imagées, ainsi que jusqu'à trois secondes de vidéo de référence.

• Ce qu'il renvoie — Qwen3.8-Omni-Flash ne renvoie que du texte ; Gemini Omni 1.1 Flash renvoie de la vidéo avec un audio synchronisé nativement, en scènes extensibles jusqu'à 40 secondes par tranches de dix secondes.

• Surface de contrôle — Qwen3.8-Omni-Flash expose le contexte, l’échantillonnage et un mode agentique qui décide lui-même ce qu’il doit examiner ; Gemini Omni 1.1 Flash expose un contrôle de la première et de la dernière image, un retour en arrière de dix secondes pour la continuité, et un palier de brouillon en 360p que Google décrit comme environ un tiers du coût et environ 60 % plus rapide.

• Résolution et finition — Qwen3.8-Omni-Flash n’a pas de résolution de sortie, car il ne produit aucun média ; Gemini Omni 1.1 Flash produit en 720p, 1080p et 4K.

• Contexte et durée — Qwen3.8-Omni-Flash prend en charge un million de jetons et jusqu'à une heure d'audio-vidéo continu en un seul appel ; Gemini Omni 1.1 Flash est limité par le clip qu'il génère, et non par une fenêtre d'entrée.

• Comment vous payez — Qwen3.8-Omni-Flash est facturé par token : 0,15 $ par million en entrée, 0,016 $ en cache, 0,47 $ en sortie sur la grille tarifaire internationale ; Gemini Omni 1.1 Flash est facturé à la seconde de vidéo générée, avec le tarif publié par Google à 0,10 $ par seconde pour la 720p.

• Ouverture — fermée des deux côtés. Aucun poids pour l’un ou l’autre modèle, et aucun des deux n’est disponible pour être routé via notre API aujourd’hui.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

Le chevauchement est la compréhension vidéo, et il est asymétrique

Le seul endroit où un acheteur pourrait raisonnablement les mettre côte à côte est un pipeline qui doit à la fois comprendre les séquences et les produire — par exemple, un assistant de montage qui lit un long enregistrement, repère les moments qui valent la peine d’être conservés et génère un montage. Pour la partie compréhension, Qwen3.8-Omni-Flash est conçu exactement pour cela : une heure d’audio et de vidéo en continu par appel, la séparation des locuteurs et un mode agentique qui fait passer la précision sur l’OmniVideoBench du fournisseur de 63,4 à 67,8 tout en réduisant les tokens par requête de 145 736 à 79 117. Pour la partie production, Gemini Omni 1.1 Flash est celui qui peut générer le clip résultant avec un audio synchronisé, alors que le modèle de Qwen ne peut pas produire une seule image de vidéo.

L’asymétrie joue aussi dans l’autre sens, et elle est plus facile à négliger. Chez un modèle de génération vidéo, la compréhension est instrumentale — il a besoin de suffisamment d’éléments d’une scène pour qu’un plan reste cohérent sur une extension de dix secondes, ce qui est une exigence différente de celle consistant à répondre à une question sur ce qui a été dit pendant la troisième heure d’une réunion. Le modèle de Google a l’historique le plus long en matière de qualité de génération et le plus court en analyse de contenu long ; celui d’Alibaba a l’inverse. Si votre tâche est de « trouver les trois minutes qui comptent dans cet enregistrement », le modèle de génération n’est pas l’outil. Si votre tâche est de « produire un clip de trente secondes correspondant à ce brief », le modèle de compréhension n’est pas l’outil non plus.

Pourquoi la comparaison des prix continue de mal tourner

Un tarif à la seconde et un tarif par token ne se convertissent pas, et la tentative de les convertir produit les deux erreurs qui dominent cette confrontation. La première consiste à comparer un clip généré entier à un tarif d'entrée par token et à conclure que le modèle vidéo est des centaines de fois plus cher — ce qui est vrai et dénué de sens, car ils ne vendent pas la même chose. La seconde consiste à ne comparer que les prix d'entrée et à manquer que la réduction de 98 % d'Alibaba sur l'audio s'applique aux heures d'audio en entrée, tandis que le tarif de Google s'applique aux secondes de vidéo en sortie, de sorte que les deux « réductions » ne se situent même pas du même côté du compteur.

Ce qui peut être dit honnêtement, c'est ceci. Selon la méthodologie propre à Alibaba — un échantillon de deux minutes multiplié par trente, vidéo en 720p et une image par seconde — une heure d'entrée audio et vidéo combinée destinée à Qwen3.8-Omni-Flashest annoncée à environ 0,20 $, contre 3,27 $ pour la génération précédente. Générer quarante secondes de vidéo 720p avec Gemini Omni 1.1 Flashau tarif publié de 0,10 $ par seconde de Google coûte 4,00 $, et générer ces mêmes quarante secondes en 360p revient à près de 1,20 $ selon le cadre de Google fondé sur le tiers du coût. Les deux séries de chiffres sont déclarées par les fournisseurs et aucune n'a été reproduite indépendamment. La conclusion utile n'est pas de savoir quel nombre est le plus petit, mais que l'analyse d'une heure de séquence et la génération de quarante secondes de celle-ci se situent dans le même ordre de grandeur — ce qui est la véritable raison pour laquelle un pipeline de production qui fait les deux a besoin d'un modèle de coûts, et non d'un gagnant.

C'est aussi l'argument pour garder les deux sur une seule clé plutôt que deux contrats. Aucun des deux modèles omni n'est routable via OrcaRouter aujourd'hui : Qwen3.8-Omni-Flash ne tourne que sur les plateformes propres d'Alibaba, et Google n'a pas ouvert l'API vidéo Omni au routage tiers, donc nous n'hébergeons ni l'un ni l'autre et ne prétendrons pas le contraire. Ce qui est bien vivant dans notre catalogue, ce sont les frères et sœurs de chaque famille — Qwen3.8-Flash et Gemini 3.8 Flash — tous deux appelables dès aujourd'hui via un seul point de terminaison au prix catalogue du fournisseur, avec 0 % de marge, ce qui fait qu'un A/B face aux chiffres de l'un ou l'autre fournisseur relève d'un simple changement de configuration plutôt que d'une seconde intégration.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

Là où chacun l’emporte, dit sans détour

Qwen3.8-Omni-Flash l'emporte sur tout ce qui se mesure en heures d'entrée : transcription et diarisation de réunions, synthèse de longs enregistrements, utilisation agentique d'outils à forte composante audio, et coût par heure de média traité. Ses résultats audio rapportés par le fournisseur sont solides, et sa faiblesse se situe là où le modèle n'a jamais été conçu — les classements à forte dominante de raisonnement, où les premiers tests tiers le placent au 28e percentile en raisonnement, avec un chiffre de vitesse au 21e, sur un échantillon assez petit pour que ces chiffres soient à considérer comme une invitation à tester plutôt qu'un verdict.

Gemini Omni 1.1 Flash l'emporte sur la sortie : génération de plans avec audio synchronisé, continuité sur des scènes étendues, contrôle image par image, et la finition 4K qu'un pipeline de livraison peut simplement exiger. Son avantage n'est pas un score de benchmark — c'est que l'autre modèle ne peut pas faire le travail du tout. Là où il est plus faible, c'est pour tout ce qui exige de conserver une heure de contexte, car il n'est pas conçu pour cela.

La décision, et ce qu’il faut surveiller

Si vous devez choisir entre les deux, la question est de savoir quelle moitié du pipeline n’est pas desservie. Une équipe qui génère déjà de la vidéo et doit comprendre de longs enregistrements devrait tester Qwen3.8-Omni-Flash sur son propre audio cette semaine ; une équipe qui analyse des médias et doit en produire devrait tester Gemini Omni 1.1 Flash. Une équipe qui a besoin des deux se retrouve face à deux fournisseurs, deux modèles de facturation et deux intégrations, situation dans laquelle une couche de routage unique cesse d’être une simple facilité et devient l’élément qui garde le modèle de coûts lisible.

Deux choses changeraient cette lecture. Une évaluation indépendante de Qwen3.8-Omni-Flash remplacerait chaque chiffre de fournisseur ci-dessus par un chiffre comparable — aucun n'existe encore, et son absence est la plus grande lacune de cette comparaison. Et un tarif publié pour les sorties 1080p et 4K de Google rendrait l'arithmétique haut de gamme vérifiable ; aujourd'hui, ces chiffres ne circulent que comme des estimations de place de marché plutôt que comme la liste officielle de Google.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

Une dernière remarque sur le cadrage. « Omni » ne signifie plus rien de précis — il désigne désormais aussi bien un modèle qui lit une heure d’audio de réunion qu’un modèle qui génère un clip de quarante secondes avec son, et c’est en traitant ce mot comme une catégorie que les acheteurs finissent par comparer un tarif par token à un tarif à la seconde et en tirer une conclusion. Les modèles sont complémentaires, avec un chevauchement limité, et la bonne posture à l’égard des deux, cinq jours et quatre semaines après leurs sorties respectives, est la même : mesurez-les sur vos propres contenus, et gardez une seconde voie ouverte.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement