Une carte-titre principale pour la comparaison « InternLumina-U2 vs Gemini Omni 1.1 Flash » avec le sous-titre « Le modèle que vous ne pouvez pas encore exécuter contre celui que vous payez à la seconde » et trois pastilles de statistiques — « InternLumina-U2 : code uniquement, poids bientôt disponibles », « Gemini Omni 1.1 Flash : GA le 27 août 2026 », « 0,03 $–0,30 $ par seconde de vidéo » — avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash : le modèle que vous ne pouvez pas encore exécuter contre celui que vous payez à la seconde

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si votre échéance est cette semaine, cette comparaison tient en une phrase. Gemini Omni 1.1 Flash est le modèle de génération vidéo généralement disponible de Google — vous l'appelez via une API, il renvoie un clip avec un son synchronisé, et vous payez par seconde de sortie. InternLumina-U2 est le modèle de recherche Apache-2.0 publié en toute discrétion par le Shanghai AI Laboratory — vous pouvez télécharger son code d'inférence, mais pas ses poids, que le laboratoire marque toujours « à venir ». L'un est un produit que vous pouvez acheter dès maintenant ; l'autre est un pari sous forme d'article que vous ne pouvez pas du tout exécuter. La question intéressante est de savoir pourquoi quelqu'un les mettrait dans la même phrase en premier lieu, et ce que chacun vous apprend sur la direction du travail multimodal ouvert fin 2026.

Tout ce qui suit est étiqueté par source. Les détails d'InternLumina-U2 proviennent du dépôt GitHub et de la page de projet que le laboratoire a publiés le 1er septembre 2026 — le même jour où le stub vide de Hugging Face est apparu — et chacun de ses chiffres de référence est déclaré par le fournisseur, préliminaire et non reproduit. Les détails de Gemini Omni 1.1 Flash proviennent des documents de lancement de Google et de sa page de tarification pour le modèle, qui est devenu généralement disponible le 27 août 2026.

Deux réponses à la même question « multimodale »

Les deux modèles se présentent sous la bannière floue d'« un modèle, de multiples modalités », et c'est uniquement cette étiquette commune qui les fait comparer. Pour le reste, ils n'ont presque rien en commun. Gemini Omni 1.1 Flash est un service fermé et hébergé, conçu avant tout pour la génération vidéo : fournissez-lui du texte, une image, un court clip de référence ou de l'audio, et il produit jusqu'à dix secondes de vidéo 720p avec parole, musique et effets sonores intégrés, extensibles par paliers de dix secondes jusqu'à une scène de quarante secondes. Il raisonne sur le clip dont vous disposez déjà — le passage d'extension examine désormais jusqu'à dix secondes de contexte préalable, contre une seule auparavant — et il prend en charge le contrôle de la première et de la dernière image, afin que vous puissiez fixer le début et la fin d'un plan et laisser le modèle combler l'entre-deux. C'est un outil de création d'images animées, vendu à la seconde.

InternLumina-U2 est un pari dans la direction opposée : un modèle unique à mélange d'experts sparse, 16B de paramètres au total dont 1B actifs, qui prétend comprendre les images, les vidéos et les actifs 3D, et générer et éditer des images via une interface unique à jetons discrets. Son côté visuel est entièrement discret — huit codebooks complémentaires issus d'un tokeniseur que le laboratoire appelle AToken, de sorte que chaque position visuelle est décrite par huit codes plutôt qu'un seul — et son côté langage repose sur un backbone de diffusion que le laboratoire étend à partir de LLaDA-2.0. La thèse est que la compréhension et la génération devraient se renforcer mutuellement dans un ensemble de poids unique, au lieu d'être assemblées à partir de modèles spécialisés. Savoir si cela fonctionne est actuellement sans réponse : le modèle n'est exécutable nulle part, car les poids n'existent pas publiquement.

Le tableau d'affichage, tel qu'il est.

Le tableau de bord honnête pour cette paire doit porter la provenance sur chaque ligne, car une colonne est un produit commercialisé avec des prix publiés, et l'autre est une affirmation de recherche non divulguée sans aucun prix.

- **Ce que c'est** — Gemini Omni 1.1 Flash : un modèle hébergé de génération et d'édition vidéo (ID du modèle gemini-omni-1.1-flash), disponibilité générale le 27 août 2026. InternLumina-U2 : un LLM de diffusion open-science pour la compréhension omni-visuelle, la génération et l'édition d'images, code publié le 1er septembre 2026.

• Poids — Gemini Omni 1.1 Flash : aucun, fermé et exclusivement hébergé. InternLumina-U2 : aucun non plus pour l'instant, mais sous licence Apache-2.0 et explicitement marqué « coming soon ».

• Ce que vous obtenez — Gemini Omni 1.1 Flash : clips 720p de 10 secondes avec audio, extensibles à 40 secondes ; mises à l’échelle 1080p et 4K ; texte d’accompagnement. InternLumina-U2 : rien pour l’instant — code d’inférence et feuille de route.

• Ce qu'il prend en entrée — Gemini Omni 1.1 Flash : texte, image, vidéo (jusqu'à ~131 K jetons d'entrée ; trois extraits de 10 secondes par prompt), audio. InternLumina-U2 : revendique la prise en charge du texte, des images naturelles, des graphiques denses, de la vidéo (sur 64 frames échantillonnées) et des actifs 3D GLB/GLTF rendus en 64 vues couleur et profondeur.

• Comment l'exécuter — Gemini Omni 1.1 Flash : l'API Gemini de Google via l'API Interactions avec état ; accès consommateur via Google Flow pour les abonnés AI Plus, Pro et Ultra. InternLumina-U2 : auto-hébergement uniquement, et seulement après la publication des poids ; le code s'attend à un répertoire de points de contrôle fractionnés, aux poids du tokenizer AToken, à FlashAttention et à Blender 4.5 pour le chemin 3D.

• Ce que ça coûte — Gemini Omni 1.1 Flash : 0,03 $/s en brouillon 360p, 0,10 $/s en 720p, 0,15 $/s en 1080p, 0,30 $/s en 4K, avec une grille tarifaire de 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie. InternLumina-U2 : ce que coûtent vos propres GPU, une fois qu'elle existera.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

Les deux colonnes ne mesurent pas le même axe. Le côté Gemini est tarifé, servi et immédiatement utile ; le côté InternLumina est une spécification d'un modèle qui n'est pas encore un modèle.

La partie réellement actuelle : la GA de Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash compte à part entière cette semaine, car c'est le moment où la gamme vidéo omni de Google a cessé d'être une preview. L'endpoint d'aperçu Gemini Omni Flash précédent doit être désactivé le 30 septembre 2026, et ce modèle GA est le remplacement vers lequel les développeurs sont basculés. La liste des améliorations est concrète : une extension de scène de quarante secondes construite par incréments de dix secondes, un contrôle des images clés qui permet de spécifier une première et une dernière image et de laisser le modèle générer les images de liaison, des clips de référence jusqu'à trois secondes pour maintenir la cohérence d'un personnage ou d'un décor, et un palier de brouillon 360p facturé au tiers du prix de la 720p, jusqu'à 60 % plus rapide pour itérer sur les prompts avant le rendu final coûteux. Si vous construisez des pipelines vidéo, le tableau des prix — 0,10 $ pour une seconde de 720p, 1,01 $ pour un clip de dix secondes, environ 4 $ pour une scène 720p de quarante secondes construite à partir de quatre appels d'extension — est le chiffre qui change votre modèle de coûts.

Rien de tout cela n'en fait un concurrent d'InternLumina-U2 sur le plan opérationnel. Gemini Omni 1.1 Flash génère du mouvement ; InternLumina-U2, si ses affirmations survivent au contact des poids, comprendra le mouvement et générera des images fixes. Une équipe qui a besoin de vidéos produit ce trimestre ne choisit pas entre les deux — le modèle Gemini est le seul des deux qui puisse être appelé, et il est disponible via l'API propre de Google et plusieurs plateformes tierces.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

La documentation « Models » de l'API Gemini sur le site de développement IA de Google, capturée le 2 septembre 2026 — la page répertoriant la famille Gemini actuelle, avec la gamme Gemini Omni dans la navigation latérale.

La partie qui n'est pas du tout à jour : InternLumina-U2

La sortie d'InternLumina-U2 du 1er septembre fut des plus discrètes : trois commits sur un dépôt GitHub, une page de projet, un stub Hugging Face de 28 octets dont tout le contenu est un en-tête de licence Apache-2.0, et aucune annonce. Ce qui est réellement public, c'est le harnais d'inférence et l'architecture, et ils méritent une lecture attentive précisément parce que personne n'a pu tester le modèle lui-même. Le dépôt présente un pilote avec un point d'entrée par tâche — texte, génération texte-image jusqu'à 1024×1024, compréhension d'images naturelles et de graphiques denses, édition d'images par instructions avec un mode double-CFG optionnel, compréhension vidéo sur 64 images échantillonnées, et compréhension 3D sur des vues GLB/GLTF rendues par Blender. Le pari de conception est qu'un vocabulaire visuel discret multi-codebook permet à un seul backbone de tout faire sans gonfler la longueur des séquences — le même instinct selon lequel « les tokens visuels devraient porter plus d'information » qui anime les modèles vidéo natifs codec, appliqué à une interface unifiée de compréhension et de génération.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

Le dépôt GitHub InternLM/InternLumina-U2, capturé le 2 septembre 2026 — la page d'accueil du dépôt sous licence Apache-2.0 avec la description « Multi-Codebook Diffusion Large Language Model », trois commits, et les scripts d'inférence par tâche qui constituent l'intégralité de la version publique à ce jour.

Le tableau de référence sur la page du projet est qualifié de « résultats préliminaires et partiels » par le laboratoire lui-même, et les chiffres qui y figurent vont dans les deux sens : des scores solides sur les graphiques et les documents (ChartQA 86,52, CharXiv-DQ 83,65, communiqués par le fournisseur) côtoient un GenEval de 0,81, inférieur au 0,89 d'au moins un modèle que le laboratoire prétend surpasser. Il n'existe aucune évaluation indépendante, car il n'y a aucun modèle à évaluer. Tout ce qui concerne la qualité réelle reste une simple affirmation tant que les fichiers safetensors n'apparaissent pas dans cette page Hugging Face vide.

Ce que fait une couche de routage lorsqu'un seul côté existe

C’est une de ces comparaisons où l’angle du routage relève vraiment du temps, pas du choix. Nous n’allons pas prétendre qu’OrcaRouter sert InternLumina-U2 — personne ne le peut, les poids ne sont pas publiés — et Gemini Omni 1.1 Flash n’est pas non plus dans notre catalogue ; on y accède via l’API propre de Google. Ce à quoi sert réellement une couche de routage dans cet entre-deux, c’est à garder vos options ouvertes sans reconstruire votre pipeline deux fois. Le modèle de répercussion directe est le mécanisme : lorsqu’un modèle hébergé par un fournisseur arrive effectivement dans un catalogue, le prix catalogue du fournisseur est répercuté avec une marge de 0 %, donc le tarif à la seconde que le fournisseur publie est le tarif à la seconde que vous payez via une seule clé plutôt qu’un contrat par fournisseur. Et quand une sortie de poids sous licence Apache-2.0 comme InternLumina-U2 arrive enfin, la décision rationnelle n’est pas de démonter votre pipeline vidéo qui fonctionne — c’est de mettre le nouveau modèle sur un chemin de test derrière un basculement automatique, de sorte que la première fois que ce modèle de diffusion non éprouvé se comporte mal, l’appel retombe sur le modèle auquel vous faites déjà confiance sans modification de code. Essayez la nouveauté là où elle ne peut pas vous nuire ; acheminez ce qui paie les factures.

Le verdict

Si vous avez besoin de vidéo ce mois-ci, la décision est prise pour vous : Gemini Omni 1.1 Flash est réel, tarifé et généralement disponible, et personne ne peut appeler InternLumina-U2. Si vous observez où se dirige la recherche multimodale ouverte, InternLumina-U2 est l'artefact le plus intéressant — un rare pari entièrement discret à codebooks multiples, lancé par un grand laboratoire, sous licence Apache-2.0, avec une architecture déjà publique et des poids probablement pas loin derrière. Considérez le dépôt comme un aperçu d'une direction de recherche, considérez le modèle vidéo GA comme un outil sur lequel vous pouvez bâtir dès aujourd'hui, et ne laissez pas l'étiquette « multimodale » qu'ils partagent vous faire croire qu'ils sont en concurrence pour la même tâche.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube