Carte de titre principale pour l'article de lancement de Gemini Omni 1.1 Flash. Le gros titre indique « Gemini Omni 1.1 Flash — plus de contrôle sur votre vidéo ». Quatre puces de fonctionnalités indiquent « Extension de scène jusqu'à 40 s », « Contrôle de la première/dernière image », « Brouillon 360p à ~1/3 du coût », « Sortie 1080p et 4K ». Un pied de page indique « Publié le 27 août 2026 via l'API Gemini ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Gemini Omni 1.1 Flash passe en production : scènes de 40 secondes, contrôle des images et finition 4K

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Donnez à un modèle vidéo la dernière seconde d’un clip et demandez-lui de continuer le plan, et vous jouez sa mémoire. C’est exactement ce que Gemini Omni 1.1 Flash — la mise à jour de production que Go​gle a publiée le 27 août 2026 — a été conçu pour éliminer : au lieu de regarder en arrière une seconde de métrage lors de l’extension d’une scène, il lit désormais jusqu’à dix secondes. Au passage, Go​gle a sorti les contrôles les plus demandés du modèle de la colonne expérimentale : conditionnement sur la première et la dernière image, un palier de brouillon en 360p qui coûte environ un tiers du prix de la sortie standard en 720p, et des rendus finaux jusqu’en 4K. Le prix du palier de travail n’a pas bougé — un clip 720p coûte toujours 0,10 $ par seconde — donc l’histoire de cette version, c’est le contrôle et le coût, pas un choc sur l’étiquette.

Gemini Omni 1.1 Flash est le successeur de l’aperçu Gemini Omni Flash qui a été mis à disposition des développeurs le 30 juin 2026, et il hérite de tout ce qui rendait l’original inhabituel : une saisie multimodale qui accepte texte, images, audio et vidéo en un seul appel, un son natif synchronisé sur chaque clip, et une édition conversationnelle multi-tours où vous affinez une scène en parlant au modèle au lieu de relancer une requête à zéro. Ce que 1.1 ajoute, c’est l’outillage manquant — la durée, le cadrage, la résolution et le coût d’itération sont désormais des paramètres qu’un développeur peut réellement définir.

Le problème du lookback, résolu

Le changement le plus conséquent est le contexte. Les versions précédentes du modèle ne référençaient que la dernière seconde d'un clip pour le prolonger, ce qui explique pourquoi les extensions dérivaient en termes de personnage, d'éclairage et de mouvement de caméra. Gemini Omni 1.1 Flash analyse jusqu'à 10 secondes de vidéo antérieure, et les extensions s'exécutent par incréments de 10 secondes jusqu'à un total cumulé de 40 secondes. La différence pratique se situe entre « un ensemble de clips adjacents » et « une séquence qui se lit comme une seule scène ». Pour une publicité de 30 secondes ou un actif de marque en boucle, c'est la différence entre l'assemblage et la direction.

• Extension de scène. Prolongez un clip existant par tranches de 10 secondes jusqu'à un plafond de 40 secondes, avec jusqu'à 10 secondes de contexte antérieur pour préserver la cohérence de la suite.

• Contrôle de la première/dernière image. Spécifiez l'image de début et de fin d'un plan et le modèle génère une vidéo continue entre les deux images clés — la primitive derrière les orbites de caméra, les transitions de zoom et les boucles sans couture.

• Références vidéo. Jusqu'à trois secondes de séquences de référence peuvent être incluses dans l'entrée multimodale afin de préserver le personnage, le costume et le style de mouvement d'un plan à l'autre.

• Audio natif. Les clips générés conservent un dialogue synchronisé, des effets sonores et un son ambiant, si bien que le résultat est un court-métrage finalisé plutôt qu'un élément silencieux en attente d'une passe audio.

Les commandes de Veo, le pipeline d'Omni

L'annonce s'appuie sur l'expression « vos contrôles créatifs préférés de Veo », et c'est une description exacte de l'origine de ces fonctionnalités. Veo 3.1, le générateur vidéo haute fidélité distinct de Go​gle, disposait déjà d'un conditionnement par image clé et d'une mise à l'échelle dans sa boîte à outils ; Gemini Omni 1.1 Flash apporte ce vocabulaire de contrôle dans le pipeline Omni multimodal — où l'entrée peut être des images, de l'audio et une vidéo de référence, et où l'édition est conversationnelle plutôt qu'une nouvelle génération à chaque fois. Les deux modèles ne sont pas rivaux au sein de la gamme de Go​gle ; la documentation de l'API Gemini positionne Gemini Omni Flash comme le choix par défaut recommandé pour la génération vidéo, avec Veo comme spécialiste haute fidélité.

Cela a son importance pour une raison pratique : les contrôles se trouvent désormais dans le modèle que vous êtes le plus susceptible d'utiliser pour vos travaux vidéo quotidiens, et non dans un niveau premium séparé qui exige d'apprendre une deuxième API. Le contrôle des images, l'ébauche et la mise à l'échelle partagent un seul point de terminaison et un seul modèle de tarification.

Un workflow du brouillon au final.

Le palier de brouillon 360p est la fonctionnalité la plus discrète de l'annonce et peut-être la plus précieuse. Les aperçus en 360p sont rendus jusqu'à 60 % plus rapidement que le 720p standard et coûtent environ un tiers du prix, ce qui bouleverse totalement l'économie de l'itération. Sur les tarifs à la seconde que les gens citent, un brouillon 360p de 10 secondes revient à environ 0,30 $ contre 1,00 $ en 720p — trois tours d'exploration pour le prix d'un rendu définitif.

Le flux prévu est évident : storyboarder et itérer en 360p, puis rendre la seule prise qui fonctionne en 720p, 1080p ou 4K. Pour une équipe qui produit des coupes sociales ou des variantes publicitaires, le palier brouillon convertit un flux de travail contraint par les coûts en un flux contraint par l’exploration. Les chiffres de vitesse et de coût ici proviennent des fournisseurs — les propres affirmations de Go​gle, non reproduites jusqu’à présent — mais l’arithmétique qui les sous-tend est simple.

A generated scoreboard titled 'Gemini Omni 1.1 Flash — the scoreboard'. Six rows read 'Max scene length: 40s (10s increments)', 'Lookback context: 10s (was 1s)', 'Resolution: 720p, 1080p, 4K', 'Frame control: first/last frame', 'Draft tier: 360p, ~1/3 cost, ~60% faster', 'Independent benchmark: none yet'. A footer reads 'Vendor-reported; no independent scores yet. 720p $0.10/s per Google.' The OrcaRouter logo is composited in the bottom-right corner.

Le tableau des prix

Le chiffre de 0,10 $ par seconde qui est constamment cité est le niveau standard 720p publié par Go​gle, inchangé depuis l'aperçu. L'entrée est facturée 1,50 $ par million de jetons, que ceux-ci soient du texte, des images, de l'audio ou de la vidéo, et la sortie textuelle est facturée 9,00 $ par million de jetons — la même structure que l'original. Le niveau 360p représente environ 0,03 $ par seconde, ce qui correspond à la formulation « environ un tiers du coût » de Go​gle et à ce que montrent désormais les listes de revendeurs.

Ce que Go​gle n'a pas publié, c'est un tarif par seconde pour les nouveaux paliers 1080p et 4K. Les annonces de revendeurs indiquent 0,15 $ par seconde pour la 1080p et 0,30 $ par seconde pour la 4K, mais ce sont des estimations du marché, pas les chiffres de Go​gle — considérez tout budget de production en haute résolution comme provisoire jusqu'à ce que le tarif officiel apparaisse sur la page de tarification de l'API Gemini. Pour donner une idée de l'échelle, une scène complètement étendue de 40 secondes en 720p peut atteindre 4,00 $, une finition 4K de 10 secondes revient à environ 3,00 $ au tarif indiqué par les revendeurs, et les mêmes 10 secondes ébauchées en 360p coûtent environ 0,30 $.

La facturation à la seconde est l'argument phare, mais le montant que vous payez réellement est fixé par la plateforme par laquelle vous achetez — Go​gle vend au prix catalogue, et les revendeurs et passerelles API ajoutent leurs propres marges par-dessus. C'est exactement pour cela que la politique de marge de 0 % compte du côté de l'infrastructure : OrcaRouter transmet le prix catalogue du fournisseur tel quel, donc lorsque le tarif d'un modèle change, notre prix change le jour même, sans couche de marge entre vous et le prix publié par le fournisseur. Nous ne routons pas encore Gemini Omni 1.1 Flash — Go​gle n'a pas ouvert l'API vidéo Omni au routage tiers, et nous ne prétendons pas héberger un modèle que nous n'hébergeons pas — mais la discipline tarifaire est le point essentiel, et lorsque ce niveau d'API sera ouvert, le modèle apparaîtra au prix catalogue.

A screenshot of the Gemini API Pricing page (ai.google.dev, captured August 28, 2026) showing the developer-docs navigation (Models, Gemini Omni Flash, Veo, Nano Banana, Imagen), the 'Gemini Developer API pricing' heading, and the Free tier card for developers getting started with the Gemini API — Google's own page for the model family's pricing and availability tiers.

Où vous pouvez l'appeler

Gemini Omni 1.1 Flash est désormais disponible sous l'identifiant de modèle gemini-omni-1.1-flash via l'API Gemini dans Go​gle AI Studio, présenté comme prêt pour la production plutôt que comme un aperçu. Il est également disponible via la plateforme d'agents d'entreprise Gemini pour les charges de travail de production — la même interface à laquelle s'intègrent déjà Adobe, Figma, GMI Cloud et Runway, selon l'annonce. Côté consommateur, Go​gle Flow offre l'ensemble complet des fonctionnalités pour tous les abonnés AI Plus, Pro et Ultra dans le monde, et l'extension de scène est disponible dans l'application Gemini. Ce n'est pas un lancement symbolique : l'API, la plateforme d'agents et les surfaces grand public ont toutes été lancées le même jour.

Si vous avez essayé l'aperçu de juin et buté contre son plafond strict de 10 secondes ou son incapacité à maintenir la cohérence d'une scène, cette version répond exactement à ces critiques — une extension à 40 secondes, des références vidéo fonctionnelles et une véritable échelle de résolution. La forme de l'API mérite aussi d'être connue : la génération et l'édition passent par l'API Interactions, ce qui rend possible le modèle d'édition conversationnel à plusieurs tours, et un réglage response_format peut fixer la résolution de sortie — 360p pour les brouillons, pleine résolution pour les versions finales.

A screenshot of the Gemini API developer documentation Models page (ai.google.dev, captured August 28, 2026) showing the docs navigation under 'Gemini API' — Models, Gemini Omni Flash, Nano Banana, Veo, Imagen — and the list of Gemini's generation models. It is the vendor's official developer page for the model family.

Ce qui n'est toujours pas prouvé

Pour tout le nouveau contrôle, les compromis qui définissaient l'original subsistent. La sortie reste une vidéo courte avec audio synchronisé, pas un remplaçant de Veo 3.1 — les deux modèles ciblent des tâches différentes. La cohérence des personnages à travers les changements de scène est améliorée par le regard en arrière de 10 secondes et l'entrée vidéo de référence, mais cela reste une faiblesse générative qu'il vaut la peine de tester sur vos propres images plutôt que de supposer. Chaque clip généré porte un filigrane SynthID, ce qui est important pour les outils qui nécessitent des garanties de provenance.

Et l'avertissement honnête : il n'existe aucun benchmark indépendant pour Gemini Omni 1.1 Flash sur aucun classement vidéo public au moment où j'écris ces lignes. L'accélération de 60 % pour les brouillons en 360p, la qualité en 1080p et 4K, la fiabilité du conditionnement sur la première/dernière image — tout cela est rapporté par le fournisseur, rien n'a été reproduit par un tiers. Quiconque vous cite un score de qualité pour ce modèle aujourd'hui fait référence à un nombre que personne en dehors des laboratoires de Go​gle n'a produit.

Qui devrait bouger maintenant

Trois groupes tirent immédiatement profit de cette version. Les équipes qui développent déjà sur l'API Omni doivent basculer les identifiants de modèle et retester leurs chemins d'extension et de contrôle de trame — la mise à niveau est un changement de champ de requête, pas une réarchitecture. Toute personne ayant besoin de vidéo courte en volume — variantes publicitaires, déclinaisons pour les réseaux sociaux, actifs de marque en boucle — devrait chiffrer le flux de travail brouillon-vers-final en 360p, car c'est là que le calcul des coûts est réellement nouveau. Et les équipes qui attendaient l'aperçu devraient essayer le modèle maintenant, car les deux blocages qui rendaient l'aperçu inutilisable en production — clips de dix secondes et absence de continuité de scène — sont précisément ce que cette mise à jour élimine.

Le groupe qui devrait attendre est tout aussi bien défini : si vous avez besoin d'un benchmark tiers ou d'un tarif officiel de 4K par seconde avant d'engager un budget, personne ne les a encore, et cela mérite d'être dit clairement plutôt que de passer sous silence. La sortie est réelle, les commandes sont réelles, et l'écart de prix est le seul élément encore en mouvement. Consultez la page de tarification de l'API Gemini pour les taux 1080p et 4K, et surveillez les premières évaluations indépendantes — dès que quelqu'un d'autre exécute ce modèle, l'avertissement du fournisseur sur chaque affirmation de qualité de cet article reçoit une coche ou un drapeau rouge.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube