Une carte de titre auto-construite pour l'article de presse 'LLaDA2.2-mini — News', sous-titre 'Un agent de modèle de langage à diffusion, publié discrètement le 5 septembre 2026', badges pilule '16B MoE / 1.4B actif', 'contexte 128K', 'Apache-2.0', et un pied de page 'Ce qui est connaissable depuis le dépôt, et ce qui n'est pas encore confirmé', avec le logo OrcaRouter composé dans le coin inférieur droit.
Guides & Insights

LLaDA2.2-mini : les poids de l'agent de diffusion d'Ant inclusionAI sont apparus discrètement le 5 septembre.

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 5 septembre 2026 à 05:16 UTC, un dépôt Hugging Face nommé inclusionAI/LLaDA2.2-mini a vu le jour et, à l’heure où nous écrivons, c’est à peu près toute l’histoire de cette publication : les poids sont en ligne, la fiche du modèle est rédigée, et le fournisseur — inclusionAI, le laboratoire d’Ant Group derrière la gamme de modèles de diffusion LLaDA — n’a rien dit à ce sujet. Pas de billet de lancement, pas de déploiement sur les réseaux sociaux, pas d’entrée dans le tableau des modèles du README GitHub d’inclusionAI/LLaDA2.X, où le plus grand LLaDA2.2-flash figure seul. Vingt-quatre heures après l’apparition du dépôt, son compteur de téléchargements affichait zéro. Cet article fait le point sur ce que nous savons pour l’instant de LLaDA2.2-mini, et la discipline de ce format compte ici, car presque chaque chiffre intéressant associé au modèle est un nombre qu’inclusionAI a saisi sur sa propre fiche. Cet article distingue ce qui est vérifiable de manière indépendante dans cette publication de ce qui est déclaré par le fournisseur, et il expose les questions ouvertes plutôt que de les passer sous silence.

La version courte, pour quelqu’un qui veut juste en saisir la forme : LLaDA2.2-mini est le petit frère du modèle de langage à diffusion LLaDA2.2-flash qu’inclusionAI a annoncé en juillet 2026. Il est désormais disponible sous la forme d’un point de contrôle mixture-of-experts de 16 milliards de paramètres qui n’active que 1,4 milliard de paramètres par jeton, gère un contexte de 128K, et est entraîné pour des tâches d’agent — appel d’outils, correction multi-tours — grâce à un décodeur à diffusion capable d’insérer et de supprimer des jetons en cours de génération. Il est sous licence Apache-2.0. Et comme les poids n’ont qu’un jour et qu’aucune annonce ne les accompagne, aucun des outils habituels n’existe encore : pas d’évaluation indépendante, pas d’API hébergée que nous ayons trouvée, pas de guides de déploiement au-delà de ceux recommandés par la fiche du modèle. Ce que vous pouvez vérifier aujourd’hui, c’est l’architecture, la licence et les chiffres qu’inclusionAI a choisi de publier.

La release est un dépôt, pas un événement.

Commençons par ce qui peut être vérifié sans faire confiance à personne. L'API Hugging Face répertorie inclusionAI/LLaDA2.2-mini comme ayant été créé le 5 septembre 2026 et modifié pour la dernière fois le même jour. Il est sous licence Apache-2.0, utilise le format safetensors avec des tenseurs bf16, est doté d'un template de chat et nécessite trust_remote_code car l'architecture de diffusion est fournie sous forme de code de modélisation personnalisé. Le dépôt frère, inclusionAI/LLaDA2.2-flash, a été créé le 16 juillet 2026, a accumulé des milliers de téléchargements et des dizaines de likes au cours des semaines qui ont suivi et a fait l'objet d'une annonce publique. La version mini n'a, elle, ni annonce ni adoption — dès son premier jour, elle n'a enregistré qu'un nombre de likes à un seul chiffre et aucun téléchargement du tout.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

La seule attention tierce que le mini a suscitée jusqu’ici est une page agrégatrice qui a republié la fiche du modèle quelques heures après l’apparition du dépôt ; il s’agit d’un miroir de la fiche, pas d’une source indépendante, et elle ne contient aucune information que le dépôt lui-même ne possède pas. C’est là l’intégralité du dossier public au 6 septembre. La perspective qui compte pour un lecteur qui décide de prêter attention : inclusionAI a désormais publié discrètement des poids de diffusion à deux reprises dans la même semaine — ce modèle le 5 septembre, et les points de contrôle de génération LLaDA-Image la veille —, si bien qu’une publication discrète de dépôt semble être un mode de diffusion établi pour le laboratoire, et non un accident. Rien dans cette démarche ne nous dit si une annonce est à venir.

Ce qu'est réellement LLaDA2.2-mini

C'est au niveau de l'architecture que le modèle est le plus intéressant, et elle est entièrement décrite sur la fiche. LLaDA2.2-mini est un modèle de langage à diffusion à mélange d'experts construit sur le socle LLaDA2.0-mini. Les modèles de langage à diffusion inversent la boucle de génération habituelle : au lieu qu'un modèle autorégressif prédise un jeton à la fois, un LLM à diffusion part d'un bloc de jetons masqués ou bruités et affine l'ensemble du bloc en parallèle, en débruitant vers une séquence cohérente. La génération LLaDA2.2 ajoute ce qu'inclusionAI appelle l'édition de Levenshtein : deux jetons de contrôle, DELETE et INSERT, qui permettent au décodeur de modifier la longueur et la structure de la séquence qu'il produit, et pas seulement son contenu — en supprimant un passage redondant déjà écrit, ou en ouvrant un point d'insertion là où un nouveau contexte (par exemple, le résultat d'un outil) doit prendre place. C'est le mécanisme que la famille utilise pour faire fonctionner le décodage par diffusion dans les boucles multitours avec utilisation d'outils, où un modèle autorégressif peut simplement attendre le tour suivant de l'utilisateur, alors qu'un modèle à diffusion par blocs doit réviser ce qu'il a déjà généré.

Les spécifications en question, tirées directement de la fiche produit : 16 milliards de paramètres au total, hors embeddings ; 1,4 milliard de paramètres actifs par token via un MoE à 256 experts dont 8 routés par token ; 20 couches, 16 têtes d’attention, 4 têtes KV ; un vocabulaire de 157 184 tokens ; des embeddings positionnels rotatifs ; et une fenêtre de contexte de 128K. Une technique appelée Block Routing restreint les experts qui s’activent au niveau des blocs de diffusion ; c’est ainsi que le modèle rend un contexte de 128K exploitable sur une seule carte graphique grand public. La fiche le destine à une carte de 24 Go et plus et recommande SGLang comme backend de serving pour les charges de travail agentiques à long contexte.

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

Ci-dessus, l'endroit où cette version se situe dans la chronologie de la famille — la lignée qui rend « LLaDA2.2-mini » lisible. LLaDA2.0, en novembre 2025, a été le premier modèle de langage à diffusion entraîné à 100 milliards de paramètres ; LLaDA2.1, en février 2026, a ajouté l'édition de jetons pour accélérer la diffusion de texte ; la génération LLaDA2.2, en juillet 2026, annoncée avec LLaDA2.2-flash et son rapport technique, a orienté la famille vers les agents. Le mini est la partie de cette génération qui est restée une promesse jusqu'à présent : la couverture de la sortie de juillet mentionnait déjà une variante 16B plus légère du flash pour un déploiement moins coûteux, mais les poids autonomes ne se sont matérialisés que le 5 septembre.

Les numéros sur la carte, étiquetés pour ce qu'ils sont.

Le tableau de référence sur la fiche du modèle est propre à inclusionAI, imprimé le jour où les poids ont été mis en ligne, et aucun laboratoire indépendant n'en a reproduit la moindre partie — Artificial Analysis n'a aucune entrée pour LLaDA2.2-mini, et nous ne trouvons aucune exécution par un tiers. Lisez ces chiffres comme des affirmations orientées du fournisseur, et non comme des faits mesurés. Dans ce cadre, l'histoire que raconte la fiche est cohérente : LLaDA2.2-mini est un spécialiste des contextes longs et de l'agentique, et il sacrifie quelques points sur les benchmarks généraux pour y parvenir.

• Moyenne agentique — 59,00, issue de τ²-Bench 57,50, Claw-Eval 57,16 et PinchBench 62,33 (rapporté par le fournisseur).

• Appel de fonction — 47,68 sur BFCL v4, contre 25,05 et 28,44 pour LLaDA2.0-mini et LLaDA2.1-mini respectivement ; 69,02 sur l’ancienne version BFCL v3.

• Contexte long — 34,99 sur LongBench v2, plus du double des 15,51 et 12,13 que les précédents minis obtenaient, ce qui constitue le bénéfice concret de la fenêtre de 128K.

• Général — une moyenne générale de 46,47, avec AIME 2026 à 35,05, OlympiadBench 61,11, LiveCodeBench v6 28,14, GPQA-Diamond 44,41 et IFBench 24,93 — plusieurs de ces résultats légèrement inférieurs aux minis précédents, le coût visible d'avoir consacré le budget d'entraînement au comportement agentique plutôt qu'à autre chose.

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

Ce dernier point mérite qu’on s’y attarde, car c’est la raison honnête pour laquelle une équipe choisirait ce modèle plutôt qu’un généraliste plus fort sur le papier. LLaDA2.2-mini ne prétend pas être le meilleur petit modèle en mathématiques ou en suivi d’instructions ; il prétend être bon dans ce que les modèles de diffusion ont historiquement mal réussi — le travail soutenu, multi-tours et avec utilisation d’outils — tout en maintenant un nombre de paramètres actifs assez faible pour avoir un impact sur un seul GPU. Le bond sur BFCL v4 et celui sur LongBench v2 sont les chiffres qui survivraient à une exécution indépendante si la fiche est globalement exacte.

L'exécuter, et l'échafaudage manquant

Sur le papier, lancer le modèle LLaDA2.2-mini est simple : la version publiée est nativement compatible avec Transformers, et sa fiche indique comment le charger avec AutoModelForCausalLM et trust_remote_code=True sur transformers ≥ 5.2.0, puis d'appeler generate avec des paramètres spécifiques à la diffusion — une longueur de bloc de 32 et une température de 0,0 sont les valeurs par défaut recommandées, et la fiche suggère une longueur de sortie de 32 768 jetons pour la plupart des requêtes. Pour le service d'inférence agentique à long contexte, elle renvoie vers SGLang, et les utilisateurs de Chine continentale disposent d'un miroir ModelScope. Ce qui n'existe pas encore, c'est l'écosystème qui l'entoure : aucune API hébergée sur un fournisseur que nous puissions vérifier, aucune compilation GGUF que nous puissions trouver, et une prise en charge par les frameworks encore en cours de stabilisation — les travaux communautaires sur l'architecture llama.cpp LLaDA2 étant récents, la prise en charge de la quantification reste mince.

Cette combinaison — un paradigme de décodage véritablement nouveau, vieux d'un jour, uniquement auto-hébergé — est exactement la situation où une couche de routage justifie son existence sans prétendre que le nouveau modèle est prêt pour la production. La façon de tester LLaDA2.2-mini de manière responsable est de l'exécuter vous-même sur un chemin de test, pendant que la production reste sur un modèle mature ; et c'est exactement à cela que sert la configuration d'OrcaRouter : une API unique donnant accès à plus de 200 modèles, au prix catalogue du fournisseur, avec 0 % de majoration, une bascule automatique afin qu'un éventuel blocage du checkpoint vieux d'un jour ne fasse pas tomber un workflow, et le DSL de routage pour composer un appel de diffusion auto-hébergé avec des modèles autorégressifs hébergés derrière une seule clé. Lorsque — si jamais — un fournisseur référence LLaDA2.2-mini, le même principe de répercussion s'applique et le prix que vous voyez est celui du fournisseur. En attendant, la ligne honnête en matière de disponibilité est la suivante : téléchargez les poids Apache-2.0 depuis Hugging Face ou ModelScope et exécutez-les vous-même.

Que regarder ensuite

Trois choses transformeraient ces informations encore partielles en une véritable histoire, et toutes trois font défaut aujourd'hui. Premièrement, une annonce : si le schéma LLaDA2.2-flash se reproduit, un billet de lancement et des comptes rendus techniques pourraient suivre la mise en ligne discrète du dépôt, ce qui ajouterait probablement des détails d'entraînement que la fiche omet. Deuxièmement, une évaluation indépendante : la moyenne des benchmarks agentiques de 59.00 et le score BFCL v4 de 47.68 sont les affirmations qui méritent le plus d'être reproduites, car les benchmarks agentiques sont ceux où le choix du harnais d'évaluation fait le plus varier les scores. Troisièmement, la maturité du service : des guides de déploiement SGLang, un support vLLM et des quantifications de la communauté diraient si l'empreinte du modèle 1.4B-active est aussi peu coûteuse à exploiter en pratique que la fiche technique le suggère. Rien de tout cela n'existe le 6 septembre. Les poids sont réels, la licence est permissive, et l'architecture est véritablement une façon différente d'exécuter un agent — mais la preuve qu'il s'agit d'un bon agent est, pour l'instant, la fiche d'un seul fournisseur.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube