Une carte de titre opposant Ling-3.0-flash-VL, un modèle vision-langage de 124 milliards de paramètres dont 5,5 milliards actifs, sous licence MIT, doté d’un indice d’intelligence indépendant de 25 et d’une voie de service NVIDIA CUDA, à InternLumina U2, un modèle de diffusion multi-codebook de 16 milliards de paramètres dont 1 milliard actif, sous Apache-2.0, dont le seul checkpoint publié est entraîné sur Ascend, couvrant la compréhension ainsi que la génération, l’édition et la 3D.
Guides & Insights

Ling-3.0-flash-VL vs InternLumina U2 : tous deux livrés, silicium différent

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ces deux modèles sont désormais réels, exécutables et téléchargeables, ce qui n'était pas le cas il y a quinze jours — et la différence entre eux n'a presque rien à voir avec les benchmarks. Ling-3.0-flash-VL, du laboratoire inclusionAI d'Ant Group, a mis en ligne des poids BF16 et FP8 sur Hugging Face entre le 4 et le 8 septembre 2026, publié en parallèle des recettes de service SGLang et vLLM, et obtenu un score indépendant de 25 à l'Artificial Analysis Intelligence Index v4.3. InternLumina U2, de l'équipe InternLM de Shanghai AI Laboratory, a d'abord livré le code d'inférence, puis publié ses poids de modèle entraînés sur Ascend sur Hugging Face le 10 septembre — sept fragments safetensors dans un sous-dossier ascend/, ce qui porte le dépôt à seize fichiers.

Le hic, c’est la cible pour laquelle ces deux sorties de poids ont été conçues. Le chemin publié de Ling-3.0-flash-VL est celui sur CUDA que tout le monde a déjà : un nœud à huit accélérateurs exécute la version FP8, et les stacks de serving sont celles que vous exécutez déjà. Le checkpoint publié d’InternLumina U2 est celui pour Ascend, et le README précise explicitement que vous téléchargez le checkpoint qui correspond à la façon dont vous prévoyez d’exécuter l’inférence — le checkpoint entraîné par NVIDIA étant toujours annoncé comme prochainement disponible. Deux modèles sortis la même semaine, et un seul d’entre eux tourne sur le matériel devant lequel se tiennent la plupart des équipes.

Cela recadre utilement la comparaison. Il ne s’agit plus d’un article opposant un produit sorti à du vaporware, et quiconque décrit encore InternLumina U2 comme étant en attente des poids se fonde sur un README vieux d’une semaine. C’est un article sur deux conceptions visuelles unifiées très différentes, arrivées sur deux écosystèmes silicium différents, et sur les parties de chaque version qui sont réellement finalisées.

Ce que chaque version contient désormais

Ling-3.0-flash-VL est un mélange d'experts creux de 124 milliards de paramètres, activant environ 5,5 milliards de paramètres par token, sur un tronc hybride de 42 couches alternant Kimi Delta Attention et des blocs MLA à porte dans un rapport de 5:1. Un encodeur de vision à résolution arbitraire et un projecteur MLP à deux couches alimentent ce tronc, VideoRoPE se chargeant de la position spatiale et temporelle. Il prend en entrée du texte, des images et de la vidéo et renvoie du texte. Les versions BF16 (64 fragments) et FP8 (environ 126 Go, la tour de vision étant délibérément maintenue à une précision supérieure à celle des poids des experts) sont toutes deux publiques sous licence MIT, et la publication est suffisamment complète pour que la communauté indépendante de l'évaluation l'ait notée — 25 sur l'Intelligence Index v4.3, classée n° 2 sur 64 dans sa catégorie de taille, pour une médiane de catégorie de 8. Ce qu'elle ne publie pas, c'est un prix par token pour le modèle de vision, et ses exemples d'API portent un -rc1 identifiant qui laisse en suspens la question de savoir si le point de contrôle servi correspond aux poids ouverts.

InternLumina U2 est un mélange d'experts clairsemé (sparse mixture-of-experts) de 16 B de paramètres, avec environ 1 B de paramètres actifs, construit sur un socle de modèle de langage de diffusion MoE LLaDA-2.0, couvrant six familles de tâches dans un seul modèle : questions-réponses textuelles, génération texte-image, compréhension d'images, édition d'images, compréhension vidéo et compréhension 3D. Le code d'inférence pour toutes ces tâches est public sur main. Le checkpoint entraîné sur Ascend est désormais public sur Hugging Face. Toujours en suspens, selon la feuille de route du dépôt : le checkpoint entraîné sur NVIDIA, le code d'entraînement (un dépôt séparé) et le rapport technique. La feuille de route coche quatre cases et en laisse deux ouvertes — code d'inférence, poids Ascend et stack d'entraînement et d'inférence Ascend terminés ; code d'entraînement et rapport technique non.

Un détail pratique se situe entre ces deux paragraphes. L’exécution des chemins de vision de U2 nécessite les poids du tokeniseur AToken dans atoken_inference/checkpoints/atoken-sod.pt, et le pilote publié attend un répertoire de checkpoints scindé où les ressources du modèle sont regroupées. Le code est réel et s’installe avec Python 3.11, PyTorch 2.6.0 et, sur le chemin CUDA, flash-attn 2.7.2. La prise en charge d’Ascend se trouve sur une branche distincte nommée ascend-npu-support et nécessite CANN ainsi qu’une compilation correspondante de torch_npu à la place de la chaîne d’outils CUDA. Rien de tout cela n’est caché ; tout cela est documenté. C’est simplement un chemin plus long qu’un pip install et une chaîne de modèle.

Deux réponses à la question « qu'est-ce qu'un jeton visuel »

Les architectures divergent quelque part plus profondément que le nombre de paramètres, et cette divergence est ce qu’il y a de plus intéressant lorsqu’on met ces deux-là côte à côte.

Ling-3.0-flash-VL conserve le contrat standard. Une image devient une séquence de tokens via l’encodeur visuel et le projecteur, ces tokens entrent dans un tronc transformer, et tout s’exécute de manière autorégressive. La nouveauté ne tient pas à la façon dont la vision est représentée, mais au faible coût d’exécution du tronc — 5,5 B de paramètres actifs par token sur 124 B au total, ce qui explique entièrement pourquoi le modèle apparaît sur la frontière intelligence-paramètres actifs. VideoRoPE donne à la position spatiale et temporelle un encodage cohérent, si bien que la vidéo n’a besoin d’aucun mécanisme séparé.

InternLumina U2 modifie la représentation elle-même. Il utilise le tokenizer AToken d'Apple, dans lequel chaque position visuelle est décrite par huit codebooks complémentaires — texture locale, texte intégré, géométrie et détails haute fréquence en tant que flux distincts plutôt qu'un seul vecteur fusionné. Chaque codebook conserve son propre embedding à l'entrée, et les huit embeddings par position sont concaténés puis projetés vers un unique token de backbone. En sortie, la prédiction est ce que l'équipe appelle autorégressive spatialement parallèle, en profondeur de codebooks : le backbone de diffusion débruit plusieurs positions spatiales masquées à la fois, puis une tête autorégressive multi-codebooks prédit les huit codes pour chaque position dans l'ordre. La compréhension et la génération passent par le même mécanisme — c'est là la véritable affirmation. L'argument de l'équipe est qu'un seul codebook plafonne la quantité d'informations qu'un token visuel peut porter, tandis que les hybrides discret-continu répartissent la compréhension et la génération sur différentes représentations et chemins de décodage, et que passer entièrement au discret avec plusieurs codebooks est la façon d'obtenir un modèle véritablement unifié plutôt que deux piles boulonnées ensemble.

Ces deux positions sont cohérentes, et elles s'accompagnent de coûts opposés. Les représentations multi-codebooks peuvent contenir des détails visuels plus fins ; elles multiplient aussi le budget de tokens par image par le nombre de codebooks et rendent le décodage considérablement plus complexe, ce qui explique probablement en partie pourquoi 16B-A1B a été l'échelle retenue. La parcimonie de Ling permet une inférence par token à faible coût ; elle implique également une capacité active plus faible par passe avant, ce qui est le compromis que la médiane de classe de 8 sur l'indice d'intelligence illustre discrètement — Ling-3.0-flash-VL la dépasse confortablement à 25, mais il ne rivalise pas avec les modèles frontières denses en raisonnement brut.

Les surfaces de tâches ne se chevauchent que partiellement.

Les ranger tous les deux sous « modèle multimodal » exagère le recoupement. Savoir où il s'arrête évite bien des comparaisons mal avisées.

• Entrées — Ling-3.0-flash-VL prend en entrée du texte, des images et de la vidéo, jusqu’à 40 images par requête, et renvoie du texte ; InternLumina U2 prend en entrée du texte, des images, de la vidéo et des ressources 3D, et renvoie du texte, des images générées ou des images modifiéesbr /> • Génération d’images — Ling-3.0-flash-VL ne peut pas du tout générer ou modifier des images ; l’affirmation centrale d’InternLumina U2 est qu’il fait les deux, jusqu’à 1024×1024, à partir des mêmes poids que ceux qui lisent les imagesbr /> • 3D — Ling-3.0-flash-VL n’a aucun chemin 3D ; InternLumina U2 livre un pipeline basé sur Blender qui restitue les ressources GLB et GLTF en 64 vues appariées couleur et profondeur pour que le modèle puisse raisonner dessusbr /> • Vidéo — Ling-3.0-flash-VL traite la vidéo via l’encodage temporel VideoRoPE ; InternLumina U2 échantillonne 64 imagesbr /> • Contexte et sortie — Ling-3.0-flash-VL mesure une fenêtre de contexte de 262K tokens, contre les 256K indiqués sur sa fiche modèle, et une sortie maximale comparativement courte ; InternLumina U2 n’a publié aucun de ces deux chiffresbr /> • Paramètres actifs — Ling-3.0-flash-VL active environ 5,5 B par token ; InternLumina U2 active environ 1 B, soit un cinquième de ce montant

Lisez cette liste : la conclusion est que ces deux-là sont des substituts pour exactement une tâche — lire une image et répondre à des questions à son sujet — et des compléments presque partout ailleurs. Si vous avez besoin d’un modèle qui génère ou modifie une image, Ling-3.0-flash-VL n’est pas un candidat et aucun benchmark n’y changera rien. Si vous avez besoin d’un seul modèle qui lit un graphique, génère une variante et raisonne sur un actif 3D, InternLumina U2 vise cela et Ling-3.0-flash-VL ne le couvre pas.

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

Benchmarks : un score indépendant face à une page de chiffres du fournisseur

La qualité des preuves n’a rien de comparable, et mieux vaut être précis sur les raisons plutôt que de désigner un vainqueur.

Le score de 25 de Ling-3.0-flash-VL sur l'Intelligence Index v4.3 provient d'une évaluation tierce réalisée sur un protocole publié, la médiane de la classe étant de 8 pour contexte, et s'accompagne d'un débit mesuré de 142,9 jetons de sortie par seconde contre une médiane des pairs de 105,1, ainsi que d'un temps jusqu'au premier jeton de 2,21 secondes. Sa fiche fournisseur revendique par ailleurs 42 sur le protocole retiré v4.1.1, une échelle différente qui ne peut être placée à côté du 25 comme si le modèle avait régressé ; l'indice a été redéfini en septembre 2026 et tous les scores ont été recalculés. Le fournisseur rapporte aussi une victoire de 1 441 contre 1 440 dans l'Image-to-WebDev Arena face à GPT-5.4 sous le pseudonyme « linthium » — une marge d'un point, dans le bruit de l'Elo, et rapportée par le fournisseur.

Les chiffres d'InternLumina U2 sont ceux du laboratoire lui-même, qualifiés de préliminaires et partiels, les tableaux comparatifs complets et le rapport technique étant encore en attente. Ils figurent désormais dans un tableau sur le README du dépôt plutôt que dans un classement de benchmark, et ils ne peuvent pas encore être vérifiés indépendamment, car aucun tiers n'a publié d'exécution. Tels que le laboratoire les formule :

• Compréhension — ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15, MMMU-Pro 36,13, MathVision 33,22, DynaMath 56,37br /> • Vidéo — Video-MME 51,26, MVBench 59,74, MLVU 57,03br /> • Génération et édition — GenEval 0,81, DPG 87,10, TIIF Short 84,60, TIIF Long 85,95, ImgEdit 3,83br /> • Sources — chaque chiffre d'InternLumina U2 est déclaré par le fournisseur et préliminaire ; chaque chiffre de Ling-3.0-flash-VL est déclaré par le fournisseur, à l'exception de l'Intelligence Index, qui provient d'Artificial Analysis

Deux de ces éléments méritent d’être signalés. GenEval 0,81 est derrière les 0,89 d’un concurrent nommément cité, selon le propre tableau du laboratoire — un rare cas où un fournisseur publie une contre-performance, et une raison de faire un peu plus confiance au reste de la fiche. Et ImgEdit à 3,83 n’a pas de sens sans le tableau qui l’accompagne, lequel fait partie de ce que le rapport technique à venir contiendra. Considérez la liste InternLumina U2 comme des résultats que le laboratoire entend défendre, et non comme des résultats exploitables. Notez aussi que ses scores de compréhension et le score de l’indice de Ling-3.0-flash-VL ne sont pas des grandeurs comparables : l’un est un ensemble de chiffres propres à des tâches fournis par le fournisseur, l’autre un indice composite d’un tiers.

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

Licence, matériel, et ce que coûte réellement un pari sur chacun

Ling-3.0-flash-VL est sous licence MIT pour les deux formats de précision, ce qui est à peu près ce qui se fait de plus propre en matière de poids ouverts — aucune clause additionnelle, aucune restriction de domaine d’utilisation, aucune ambiguïté sur le déploiement commercial. La version FP8, à environ 126 Go, tient dans un nœud de huit accélérateurs de classe 80 Go ; BF16 représente environ le double. La prise en charge du serving existe déjà dans SGLang et dans un fork de vLLM maintenu par Ant. Le risque résiduel est commercial plutôt que juridique : Ant ne publie aucun tarif par token pour le modèle de vision, l’accès gratuit sur Ling Studio est promotionnel plutôt qu’un tarif, et Artificial Analysis ne l’affiche à 0,00 $ par million de tokens en entrée et en sortie que parce que l’endpoint qu’elle peut voir est le gratuit.

InternLumina U2 est sous Apache-2.0 sur le dépôt principal, avec deux exceptions qui valent la peine d'être lues : le répertoire VeOmni/ intégré conserve sa licence Apache-2.0 d'origine, et atoken_inference/ est dérivé du ml-atoken d'Apple et redistribué selon les termes originaux d'Apple. L'affirmation concernant l'infrastructure est sérieuse — elle cible à la fois les GPU NVIDIA et les NPU Ascend de Huawei, avec un alignement numérique au niveau des opérateurs entre les backends, et l'équipe rapporte avoir entraîné de bout en bout sur un cluster Ascend de mille cartes, avec une amélioration de l'efficacité d'entraînement de 1,85× grâce à des opérateurs fusionnés, un sharding HSDP optimisé et du gradient checkpointing. C'est du vrai travail d'ingénierie. C'est aussi orthogonal à la question de savoir si le modèle est bon : l'efficacité d'entraînement sur Ascend ne dit rien de la qualité des sorties, et le checkpoint qui existe aujourd'hui est celui qui vise cette pile.

Donc l’asymétrie pratique n’est pas ouvert contre fermé. Les deux sont ouverts, les deux sont sous licence permissive, et les deux peuvent être téléchargés dès aujourd’hui. C’est que l’une des versions présuppose le matériel que vous avez probablement, et l’autre présuppose le matériel que vous n’avez probablement pas. Si votre parc est NVIDIA, Ling-3.0-flash-VL est l’affaire d’une après-midi et InternLumina U2 est une attente. Si votre parc est Ascend — ce qui est de plus en plus fréquent sur le marché chinois pour lequel ce modèle a été conçu —, cette équation s’inverse complètement, et c’est InternLumina U2 qui dispose d’un parcours finalisé, tandis que les recettes de Ling-3.0-flash-VL présupposent CUDA.

Questions que les gens posent réellement sur cette association

Les poids d'InternLumina U2 sont-ils déjà téléchargeables ?

Oui, le checkpoint entraîné sur Ascend est — sept fragments safetensors publiés sous ascend/ sur Hugging Face, aux côtés des fichiers de configuration, de tokenizer et de modélisation. Le checkpoint entraîné sur NVIDIA se trouve dans un sous-dossier distinct et est toujours annoncé comme bientôt disponible, et le code d'entraînement ainsi que le rapport technique restent à venir.

Ling-3.0-flash-VL est-il strictement meilleur parce qu'il possède un score indépendant ?

Non — il est mieux étayé et plus facile à exécuter sur du matériel courant, ce qui est une affirmation différente. Ling-3.0-flash-VL ne peut ni générer ni modifier des images, ne peut pas traiter des ressources 3D et n'a pas de prix publié. Si votre tâche est la génération d'images, la modification d'images ou la compréhension de la 3D, InternLumina U2 y répond et Ling-3.0-flash-VL n'y répond pas du tout, quel que soit le nombre de benchmarks dont dispose le modèle Ling.

Le 42 sur la fiche modèle de Ling-3.0-flash-VL contredit-il le 25 d’Artificial Analysis ?

Pas directement. Le 42 a été mesuré selon le protocole Intelligence Index v4.1.1 et le 25 selon la v4.3 ; l’indice a été reformulé en septembre 2026 et tous les scores ont été recalculés, et les deux versions reposent sur des ensembles d’évaluation différents. Ce que l’on peut dire, c’est que le 42 n’a jamais été reproduit de manière indépendante et que le 25 a été produit de manière indépendante.

Où l'un ou l'autre de ceux-ci peut être appelé

Ni Ling-3.0-flash-VL ni InternLumina U2 ne figurent dans notre catalogue de modèles, et dire le contraire serait une affirmation qu'un lecteur pourrait vérifier en dix secondes. Ling-3.0-flash-VL est accessible via la plateforme d'Ant elle-même, qui publie un point de terminaison compatible avec OpenAI et un autre compatible avec Anthropic, via un accès d'essai gratuit sur Ling Studio, et via les poids ouverts si vous les servez vous-même. InternLumina U2 est accessible via le checkpoint Hugging Face et le pilote d'inférence du dépôt, sur le matériel ciblé par ce checkpoint.

Ce que nous routons, c'est le modèle de vision auquel cette association est le plus souvent comparée en pratique : DeepSeek V4 Flash Vision Exp, disponible sur le catalogue avec une fenêtre de contexte de 1 M de tokens et un tarif publié, sur le même point de terminaison compatible OpenAI que le reste du catalogue. Lorsqu'un laboratoire publie des poids ouverts, une couche de routage peut généralement proposer le modèle sans attendre que le service hébergé du laboratoire lui-même se stabilise — ce qui constitue la différence pratique entre un modèle citable et un modèle appelable. Cette différence est effective pour Ling-3.0-flash-VL et, pour l'instant, théorique pour InternLumina U2, dont l'histoire de lancement relève d'un parcours matériel plutôt que d'une question d'hébergement.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

Le verdict est véritablement partagé, et il se partage selon le matériel et la tâche plutôt que selon la qualité. Ling-3.0-flash-VL est la version complète : MIT, les deux formats de précision, évaluée par des tiers, CUDA-first, et limitée à la compréhension. InternLumina U2 est la conception la plus ambitieuse et la version la moins aboutie : le checkpoint d'une unique pile matérielle publié, une surface unifiée de six tâches incluant la génération et la 3D, et un rapport technique encore attendu. Si vous avez besoin d'un modèle de vision sur du matériel NVIDIA cette semaine, le choix se fait de lui-même. Si la conception multi-codebook d'InternLumina U2 est ce qui vous intéresse, ce qu'il faut surveiller, c'est le checkpoint NVIDIA — et la position honnête d'ici là est que son tableau de benchmarks, y compris la ligne qu'il perd, décrit un modèle dont la seconde moitié n'a pas encore été livrée.