
InternLumina-U2 contre Qwen2.5 Omni : le modèle Omni livré par Alibaba face à celui que Shanghai AI Lab promet encore
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
InternLumina-U2 et Qwen2.5 Omni sont deux réponses à la même ambition — un modèle unique qui gère toutes les modalités au lieu d’un zoo de spécialistes — mais à deux générations d’écart. Qwen2.5 Omni est la réponse qui a réellement été livrée : un modèle open-weight de 7 milliards de paramètres publié en mars 2025, dix-sept mois au moment de la rédaction, qui prend en entrée du texte, des images, de l’audio et de la vidéo et répond en texte ou en parole naturelle en streaming. InternLumina-U2 est la réponse du Shanghai AI Laboratory, publiée sous forme de code d’inférence le 1er septembre 2026 : un modèle de diffusion sparse de 16 milliards de paramètres qui prétend percevoir les images, les vidéos et la 3D, et générer et éditer des images via une interface commune de jetons discrets. Une génération de l’idée omni est en production depuis un an et demi ; l’autre est vieille d’un jour et ne peut être exécutée par personne, car ses poids n’existent pas encore. L’écart entre les deux est la différence entre une promesse tenue et une promesse faite.
L'omni qui est sorti : Qwen2.5 Omni
Il faut prendre Qwen2.5 Omni au sérieux comme référence, car c’est l’un des rares modèles ouverts à avoir réellement tenu la promesse « percevoir tout, répondre sous n’importe quelle forme ». Son architecture Thinker-Talker associe un penseur textuel à un parleur qui génère la parole, à l’aide d’un encodage positionnel multimodal aligné dans le temps pour que l’audio et la vidéo restent synchronisés ; l’entrée couvre le texte, les images, l’audio et la vidéo, et la sortie peut être du texte plus une voix dans le même tour, avec quatre voix intégrées. Les limites sont aussi bien documentées que les capacités : le contexte est de 32K jetons, il n’y a pas d’appel de fonction ni de sortie structurée, et il s’agit d’un conversationnel omni plutôt que d’un agent. Ce qu’il ne fait pas mérite d’être souligné pour cette comparaison : il perçoit les images, l’audio et la vidéo, mais il ne les génère pas. Le « omni » de Qwen2.5 Omni désigne une perception omni avec synthèse vocale côté sortie ; les pixels entrent, et les mots sortent.
Le bilan est réel. Le modèle a été téléchargé des centaines de milliers de fois, dispose d'une API hébergée via la plateforme du développeur lui-même et plusieurs plateformes tierces, et a passé dix-sept mois à accumuler des quantifications, des outils communautaires et un prix connu — les listes d'agrégateurs situent le texte autour de 0,09 $ par million de jetons d'entrée et de 0,34 $ par million de jetons de sortie, l'audio étant facturé séparément. Dix-sept mois, c'est assez long pour que ses forces et ses limites soient toutes deux bien cartographiées. C'est ce que procure la maturité : non pas la perfection, mais la prévisibilité.
L'omni promis : InternLumina-U2
InternLumina-U2 tente d'aller un cran plus loin que Qwen2.5 Omni, et c'est précisément là que se situe la difficulté. Son postulat de conception est que la perception et la génération devraient partager une interface unique à jetons discrets : plutôt qu'un modèle de langage qui perçoit la vidéo et un modèle de diffusion séparé qui dessine, un unique backbone de diffusion MoE épars — 16B au total, 1B actif — devrait à la fois lire une image, un graphique, une vidéo ou un asset 3D et écrire une nouvelle image ou une édition, en s'appuyant sur un vocabulaire visuel entièrement discret à huit codebooks, afin que chaque position visuelle porte suffisamment d'informations pour prendre en charge les deux directions. C'est une affirmation considérablement plus forte que celle de Qwen2.5 Omni. Une chose est de router chaque modalité d'entrée vers le texte et la parole ; une autre est de faire qu'un même ensemble de poids génère des pixels aussi couramment qu'il raisonne à leur sujet.
C'est aussi, à l'heure actuelle, une affirmation invérifiable. Le laboratoire a publié le code d'inférence, une page de projet avec un tableau de référence « préliminaire, partiel », et un stub Hugging Face vide ; les poids, le code d'entraînement, le rapport technique et la pile Ascend-NPU sont tous marqués « à venir ». Aucune évaluation indépendante n'existe car il n'y a rien à évaluer. L'architecture de Qwen2.5 Omni était vérifiable la semaine de sa sortie parce que les poids étaient fournis avec ; l'architecture d'InternLumina-U2 est lisible aujourd'hui, mais sa qualité reste une promesse du fournisseur.
Le tableau d'affichage
Parce que l'un de ces modèles possède dix-sept mois d'historique et l'autre une journée de code, les lignes portent la provenance plutôt que de prétendre que les colonnes sont symétriques.
• Âge — Qwen2.5 Omni : sorti en mars 2025, dix-sept mois en conditions réelles, des centaines de milliers de téléchargements. InternLumina-U2 : code d’inférence publié le 1er septembre 2026, zéro téléchargement, zéro exécution indépendante.
• Shape — Qwen2.5 Omni : ~7B de bout en bout, Thinker-Talker avec encodage positionnel multimodal aligné dans le temps. InternLumina-U2 : 16B au total / 1B actif, LLM de diffusion MoE éparse avec un tokeniseur visuel discret à huit codebooks.
• Entrée — les deux acceptent le texte et les images ; Qwen2.5 Omni prend également en charge l’audio et la vidéo pour le chat omni ; InternLumina-U2 revendique en outre une compréhension vidéo sur 64 images échantillonnées et une compréhension 3D à partir de vues GLB/GLTF rendues par Blender.
• Sortie — Qwen2.5 Omni : texte et parole en streaming, quatre voix. InternLumina-U2 : revendique le texte, la génération d'images jusqu'à 1024×1024, et l'édition d'images basée sur des instructions.
• Frontière de la génération — Qwen2.5 Omni : génère des mots et de la voix, pas des pixels. InternLumina-U2 : tente la génération et l’édition de pixels dans le même modèle à jetons discrets qui lit.
• Poids et licence — tous deux des poids ouverts sous Apache-2.0 en principe ; ceux de Qwen2.5 Omni sont téléchargeables dès aujourd'hui, ceux d'InternLumina-U2 ne sont pas encore publics.
• Service — Qwen2.5 Omni : API hébergée plus auto-hébergement (un déploiement lourd en pleine précision) ; contexte connu de 32K, pas d’appel de fonctions. InternLumina-U2 : ne peut pas être servi — le pilote publié attend des checkpoints qui n’existent pas.
• Chiffres clés — Qwen2.5 Omni : établi de longue date sur le classement OmniBench (un score d’environ 0,561 sur les classements actuels) ; InternLumina-U2 : ChartQA 86,52, MathVision 33,22, GenEval 0,81 — le tout rapporté par le fournisseur, préliminaire et partiel.

Pourquoi le fossé des générations est la véritable histoire
Mettons de côté les âges et la différence substantielle réside dans la frontière où chaque modèle s'arrête. Qwen2.5 Omni a choisi une version gérable de l'omni : percevoir largement, répondre en langage ou en voix, et laisser la synthèse d'images et de vidéos à des modèles de génération dédiés ailleurs dans la pile. Cette division du travail est la façon dont pratiquement tout système multimodal de production en 2026 est construit, et c'est pourquoi Qwen2.5 Omni a pu être lancé en 2025 et rester utile en 2026 — il fait bien sa partie et s'assemble avec le reste. InternLumina-U2 est un pari que la division du travail est le problème : qu'un modèle forcé de tout représenter — perception et génération — dans un même vocabulaire discret partagé apprendra une compréhension plus profonde de la vision qu'un modèle qui ne fait que la décrire. Ce pari, s'il porte ses fruits, est le résultat le plus important. S'il échoue, InternLumina-U2 finit comme un Qwen2.5 Omni plus lent et plus gourmand, avec un générateur d'images vissé maladroitement dans les mêmes poids. Tout le match — et c'est un match entre une conception commercialisée et une hypothèse, pas entre deux modèles exécutables — est de savoir si l'architecture plus exigeante se justifie.

La fiche Hugging Face de Qwen/Qwen2.5-Omni-7B, capturée le 27 août 2026 — la vue d’ensemble Thinker-Talker, la licence Apache-2.0 et les balises de modalité texte, image, audio et vidéo du modèle.
Ce qu'un an et demi de téléchargements achète réellement
La maturité n'est pas une vibe ; c'est une liste de choses que l'on sait. Avec Qwen2.5 Omni, vous savez que le contexte de 32K est une contrainte stricte et vous pouvez concevoir en conséquence. Vous savez qu'il n'existe pas de chemin d'appel de fonction et vous ne prétendrez pas qu'il y en a un. Vous savez approximativement ce que coûte un déploiement, que ce soit via une API hébergée ou sur vos propres GPU, parce que le modèle a été tarifé et exécuté par suffisamment de personnes pour que les chiffres se soient stabilisés. Vous savez que la position sur OmniBench est réelle parce que des classements indépendants la suivent depuis plus d'un an. Avec InternLumina-U2, aucun de ces verbes ne s'applique — vous ne savez pas, vous ne pouvez pas savoir, car il n'y a pas d'artefact. Quand un modèle n'a qu'un jour et ne pèse rien, chaque affirmation à son sujet est une déclaration d'intention. Cette asymétrie n'est pas une critique de la science ; c'est la posture épistémique correcte pour quiconque choisit sur quoi bâtir.

Le dépôt GitHub InternLM/InternLumina-U2, capturé le 2 septembre 2026 — la page d'accueil du dépôt qui rend l'architecture publique — description, licence et scripts d'inférence — tandis que les poids eux-mêmes sont absents de l'arborescence.
La décision de routage, présentée honnêtement
Soyons clairs sur la disponibilité : OrcaRouter n'héberge pas InternLumina-U2, car il n'existe pas de poids à héberger pour qui que ce soit, et nous ne proposons pas non plus Qwen2.5 Omni actuellement — il tourne via l'API du développeur lui-même et des plateformes tierces. La leçon de routage ici porte donc sur la posture, pas sur l'appel de ces deux modèles via une seule clé aujourd'hui. Le schéma durable est celui que toute décision entre modèle mature et nouveau venu finit par rencontrer : garder le modèle éprouvé sur le chemin principal, où une API couvrant plus de 200 modèles et une majoration de 0 % en transparence signifient que vous payez le tarif catalogue du fournisseur, rien de plus ; orienter le nouveau venu non éprouvé vers un chemin de test avec basculement automatique, afin qu'à la première panne, dérive ou réponse aberrante, l'appel retombe sur le modèle au bilan éprouvé de dix-sept mois. C'est ainsi que vous pouvez évaluer une architecture ambitieuse comme InternLumina-U2 le jour où ses poids sont publiés — sans mettre en jeu le chemin de production dont vous dépendez déjà.
Le verdict
Qwen2.5 Omni est le modèle omni sur lequel vous pouvez construire dès aujourd'hui : livré, téléchargeable, documenté, avec des limites connues et un prix fixé. InternLumina-U2 est le modèle omni à surveiller : une véritable avancée architecturale au-delà de la perception vers la création, sous licence Apache-2.0, avec son code public et ses poids en attente. Si le pari du laboratoire sur les multi-codebooks se confirme lors de tests indépendants, InternLumina-U2 ne sera pas tant un rival de Qwen2.5 Omni que la prochaine génération de la même idée. Si ce n'est pas le cas, le généraliste vieux de dix-sept mois qui a réellement été lancé sera toujours là, faisant le travail qu'il a fait tout du long. Surveillez la page Hugging Face ; le verdict dépend des fichiers safetensors, pas de cet article.
