
InternLumina-U2 Aperçu : un modèle de diffusion 16B pour l'image, la vidéo et la 3D — poids encore à venir
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
À 04:03 UTC le 1er septembre 2026, le laboratoire d’IA de Shanghai a créé le dépôt GitHub InternLumina-U2. Treize minutes plus tard, la même organisation a enregistré un dépôt portant le même nom sur Hugging Face. Il n’y a eu ni article de lancement, ni fiche de modèle, ni annonce d’aucune sorte — seulement le code d’inférence pour InternLumina-U2, un modèle à mélange d’experts de 16 milliards de paramètres (1 milliard actifs) que le laboratoire présente comme un modèle unique couvrant la compréhension d’images, la génération texte-image, l’édition d’images, la compréhension vidéo et la compréhension 3D via une interface unique à jetons discrets. Le code est réel et public ; le modèle lui-même ne l’est pas — pas encore. Les poids sont marqués « bientôt disponibles », le dépôt Hugging Face n’est qu’un espace réservé vide, et le rapport technique promis n’est jamais apparu. Ce qui est sorti discrètement le 1er septembre n’en reste pas moins l’image publique la plus complète de ce modèle qui existe à ce jour.
Si c'est la première fois que vous entendez parler d'InternLumina-U2, c'est précisément le but. Rien n'a été annoncé concernant cette sortie, et aucune couverture indépendante ne semble encore exister — les analyses précoces sont exactement l'endroit où un modèle comme celui-ci fait surface en premier, avant le post de lancement et parfois avant les poids. Tout ce qui suit provient du dépôt GitHub, de la page du projet et du stub Hugging Face que le laboratoire lui-même a publié le 1er septembre, et toute information allant au-delà de ces sources est explicitement marquée comme une inférence.
Ce qui a réellement été lancé le 1er septembre
Le dépôt GitHub InternLM/InternLumina-U2 a été créé le 1er septembre 2026 et a connu trois commits ce jour-là — l'init, un passage marquant le lien du modèle comme « bientôt disponible » et les résultats de benchmark comme « préliminaires », et une correction de navigation. Il est sous licence Apache-2.0 et contient un README intitulé « Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing » (en versions anglaise et chinoise), un harnais d'inférence complet et une feuille de route. Une particularité à noter : l'entrée d'actualité du dépôt lui-même est datée « [2026-08] », alors que le commit init et les deux horodatages du dépôt sont datés du 1er septembre 2026 — considérez le début septembre comme la date de sortie réelle, et non août. Le dépôt ci-dessous représente la totalité de la sortie publique : chaque fichier visible dans l'arborescence fait partie de ce qui a été publié, et rien d'autre n'existe ailleurs pour l'instant.

• GitHub — InternLM/InternLumina-U2, créé le 2026-09-01 sous licence Apache-2.0, avec du code d’inférence pour le texte, la génération texte-vers-image, la compréhension d’images, l’édition d’images, la compréhension vidéo et la compréhension 3D.
• Hugging Faceinternlm/InternLumina-U2, créé le 2026-09-01, ne contient actuellement qu'un fichier .gitattributes et un README de 28 octets dont tout le contenu est l'en-tête de licence Apache-2.0. Aucun poids, aucune configuration, aucun fichier tokenizer.
• Page du projet — internlm.github.io/InternLumina-U2, avec des figures d’architecture, un tableau de benchmark préliminaire et des démos provisoires ; le rapport technique porte la mention « à venir ».
Le code d’inférence est organisé en un script pilote avec une section par tâche : génération de texte brut, texte-vers-image jusqu’à 1024×1024 avec CFG et nombre de pas configurables, compréhension d’images sur des images naturelles et des graphiques denses, édition d’images basée sur des instructions avec un mode double-CFG optionnel, compréhension vidéo sur 64 images échantillonnées, et compréhension 3D sur des assets GLB/GLTF rendus en 64 vues couleur et profondeur via un pipeline Blender intégré avant la tokenisation. Cette étendue de tâches constitue toute la thèse de conception du modèle, et il vaut la peine de s’y arrêter avant de plonger dans l’architecture.
Un modèle, six emplois, un vocabulaire de tokens.
InternLumina-U2 s'inscrit dans une ligne de recherche en évolution rapide qui parie que le langage et la vision devraient partager une interface unique à jetons discrets plutôt que de résider dans des stacks séparés de compréhension et de génération. Les travaux antérieurs du laboratoire dans cette direction — Lumina-DiMOO, le modèle unifié de diffusion discrète présenté au WAIC 2025 — sont cités aux côtés de LLaDA2.0-Uni, Show-o2 et MMaDA comme les systèmes pionniers sur lesquels InternLumina-U2 s'appuie et qu'il prétend surpasser. Le pari spécifique d'InternLumina-U2 est que le goulot d'étranglement de ces modèles unifiés n'est pas l'architecture mais le vocabulaire visuel : un codebook unique plafonne la quantité d'informations qu'un jeton visuel peut transporter, tandis que les hybrides discret–continu, qui répartissent la compréhension et la génération entre différentes représentations, forcent de toute façon le modèle à maintenir deux stacks.
La réponse d'InternLumina-U2 est une modélisation entièrement discrète à codebooks multiples. Le côté visuel utilise le tokenizer AToken d'Apple, qui décrit chaque position visuelle au moyen de huit codebooks complémentaires — une tentative de préserver la texture locale, le texte incrusté, la géométrie et les détails haute fréquence sans augmenter la longueur de séquence. Côté entrée, chacun des huit codebooks possède son propre embedding, et les huit embeddings de chaque position sont concaténés puis projetés en un seul token du backbone. Côté sortie, la prédiction est spatialement parallèle mais autorégressive selon la profondeur des codebooks : le backbone de diffusion débruite en parallèle de nombreuses positions spatiales masquées, et une tête autorégressive à codebooks multiples prédit ensuite les huit codes de chaque position dans l'ordre.
• Scale — 16B de paramètres au total, 1B actifs (16B-A1B), un MoE sparse.
• Tronc linguistique — LLaDA-2.0 MoE, modèle de langage à diffusion, dont l’objectif de diffusion par blocs est étendu aux tâches visuelles grâce à un entraînement conjoint multitâche (description du fournisseur).
• Représentation visuelle — jetons entièrement discrets à 8 codebooks du tokenizer AToken d'Apple.
• Matériel — compatible avec les GPU NVIDIA et les NPU Huawei Ascend pour l'entraînement, l'évaluation et l'inférence, avec un alignement numérique au niveau des opérateurs entre les backends.

Ce que cela apporte en pratique, si ces affirmations se vérifient, c’est le plus vieux rêve du domaine multimodal : un ensemble unique de poids capable de lire une image, de la modifier, d’en dessiner une nouvelle à partir d’un texte, de répondre à des questions sur une vidéo et de décrire un actif 3D — avec une compréhension et une génération qui se renforcent mutuellement à travers la même interface, plutôt que d’être assemblées à partir de modèles spécialisés. C’est aussi l’affirmation qui mérite le plus un regard sceptique, car c’est la plus difficile à rendre vraie.
Les nombres, tels qu'ils sont.
Tous les benchmarks d'InternLumina-U2 sont déclarés par le fournisseur, préliminaires et partiels. Le README et la page du projet le disent eux-mêmes : « Résultats préliminaires et partiels. Les tableaux de comparaison complets paraîtront dans le prochain rapport technique. » Aucune évaluation indépendante n'existe, car les poids ne sont pas publics. Considérez les chiffres ci-dessous comme les propres affirmations du laboratoire, et non comme des scores vérifiés.
• Compréhension de graphiques / documents — ChartQA 86.52, CharXiv-DQ 83.65 (chiffres déclarés par le fournisseur).
• Raisonnement mathématique visuel — MathVision 33,22, DynaMath 56,37 ; le laboratoire affirme que cela surpasse l'InternVL3-8B, limité à la compréhension, sur les deux.
• Robustesse aux hallucinations — HallusionBench 62,15.
• Compréhension vidéo — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (page du projet).
• Compréhension 3D — 3D MM-Vet 41.8.
• Texte-vers-image — DPG-Bench 87,10, TIIF-Bench court/long 84,60/85,95, GenEval 0,81 (page du projet).
• Édition d'images — ImgEdit 3.83.
C’est dans la partie consacrée aux comparaisons qu’un lecteur honnête devrait ralentir. Le README affirme qu’InternLumina-U2 surpasse des modèles unifiés tels qu’InternVL-U, LLaDA2.0-Uni, Show-o2 et Lumina-DiMOO sur les benchmarks de compréhension et de génération à grain fin — mais le tableau de la page du projet montre lui-même InternLumina-U2 à 0,81 sur GenEval contre 0,89 pour LLaDA2.0-Uni : le modèle est donc distancé par au moins un concurrent sur au moins une métrique de génération phare. Choisir quelques chiffres favorables dans un tableau partiel est exactement ce que la réserve « les tableaux de comparaison complets figurent dans le rapport technique » vise à atténuer. Ces chiffres ne constituent qu’un signal directionnel en provenance du laboratoire, rien de plus.
Ce qui est réel par rapport à ce qui est promis
Le périmètre de cette version est exceptionnellement explicite, et c'est un critère déterminant pour quiconque cherche à savoir s'il peut l'essayer dès aujourd'hui. Ce qui est livré : le code d'inférence. Ce qui n'est pas livré : les poids, le code d'entraînement (promis dans un dépôt séparé), la pile d'entraînement et d'inférence Ascend, ainsi que le rapport technique. Le dépôt Hugging Face qui accueillera à terme le modèle n'est qu'une coquille vide — la capture d'écran ci-dessous montre l'intégralité du contenu actuel de la page sur laquelle arrive le lecteur qui clique sur le lien « Model (coming soon) » dans le README.

Même le code publié ne peut pas encore produire de sortie. Le pilote d'inférence attend un répertoire de checkpoints Hugging Face fractionné et les poids du tokenizer AToken à un chemin spécifique — alors qu'aucun des deux ne se trouve dans le dépôt — donc ce qui est téléchargeable aujourd'hui est une spécification de la manière dont le modèle fonctionnera, pas un modèle en cours d'exécution. Et lorsque les poids seront enfin disponibles, l'auto-hébergement ne se résumera pas à un simple `pip install` de routine. Le modèle utilise une API de génération block-diffusion plutôt que l'interface de génération standard de Transformers, le tokenizer AToken nécessite FlashAttention, le code exige un GPU visible au moment de l'import, le pilote racine est monoprocessus, et le pipeline 3D requiert Blender 4.5 pour l'encodage des assets. C'est un véritable projet de déploiement, pas une expérience de week-end — ce qui est exactement le genre de friction qu'une couche de routage existe pour absorber pour la plupart des équipes.
Quand les poids arrivent, traitez-le comme le modèle non éprouvé qu'il est.
Personne ne peut exécuter InternLumina-U2 aujourd'hui, et aucun fournisseur ne peut le servir, car les poids n'existent pas publiquement. Cela changera à un moment donné — la licence Apache-2.0 et la cadence d'open-sourcing agressif du laboratoire en 2026 (la campagne « open everything » d'ArchSpace, InternVL3.5, les modèles scientifiques Intern-S2) rendent une publication des poids probable, et non plus seulement hypothétique. Quand cela se produira, la première étape rationnelle sera non pas de miser votre chaîne de production sur un modèle de diffusion tout juste sorti, aux exigences de déploiement inhabituelles et sans aucune évaluation indépendante, mais de l'exécuter côte à côte avec le modèle auquel vous faites déjà confiance, sur un chemin de test, avec une bascule automatique vers le modèle éprouvé dès que le nouveau se comporte mal. C'est précisément le cas d'usage pour lequel une couche de routage est conçue : une seule API pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés à 0 % de marge, et une bascule qui transforme « tester le nouveau » en règle de routage plutôt qu'en migration. OrcaRouter est conçu exactement ainsi — et soyons clairs : nous ne routons pas InternLumina-U2 et ne pouvons pas le faire, car les poids ne sont pas publiés. Cette section porte sur le processus à suivre lorsqu'ils le seront ; elle ne prétend pas que le modèle est disponible quelque part aujourd'hui.
Que regarder ensuite
Quatre événements feraient passer InternLumina-U2 de l'aperçu à la réalité, par ordre approximatif de probabilité. D'abord, le remplissage du dépôt Hugging Face : des fichiers safetensors, une config et les poids du tokenizer AToken apparaissant dans cette coquille vide — c'est le moment où le modèle existe réellement. Ensuite, le rapport technique, censé contenir les tableaux de comparaison complets, qui transformerait les chiffres partiels du fournisseur ci-dessus en quelque chose de vérifiable. Troisièmement, le dépôt du code d'entraînement et la pile Ascend, qui comptent pour quiconque souhaite affiner ce modèle ou l'exécuter sur du matériel non-NVIDIA. Quatrièmement, une première évaluation indépendante — un Elo d'arène, une exécution reproduite de ChartQA ou de GenEval — qui mettrait à l'épreuve la promesse « un modèle, six tâches » sans le biais de sélection du laboratoire. Le code étant public le 1er septembre, l'architecture est déjà connaissable ; l'absence des poids signifie que tout ce qui concerne la qualité réelle n'est encore qu'une affirmation. Surveillez le dépôt du modèle plutôt que le fil des annonces : les parties intéressantes sont déjà publiques, et le modèle lui-même ne devrait probablement pas tarder.
