Carte titre de l’article « LLaDA-Image-Turbo — LIVRAISON DISCRÈTE » avec un badge bleu indiquant « LIVRÉ — NON ANNONCÉ », le sous-titre « inclusionAI d’Ant Group a publié les poids le 4 septembre 2026. Pas de publication de lancement, pas encore de mention de licence. », trois pastilles indiquant « Laboratoire : inclusionAI (Ant Group) », « Sortie : 4 septembre 2026 » et « Échantillonnage : 4 étapes », et deux cartes côte à côte — une carte à bordure bleue intitulée « Ce qui a été livré » indiquant « LLaDA-Image Base + LLaDA-Image-Turbo, BF16 et FP8, sur Hugging Face » et une carte blanche intitulée « Ce qui manque » indiquant « Pas d’annonce, pas de licence, pas encore de benchmark Turbo ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

LLaDA-Image-Turbo : Ant Group a discrètement lancé un générateur d'images open source en 4 étapes

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 4 septembre 2026, le laboratoire open-source d'Ant Group, inclusionAI, a publié les poids de LLaDA-Image-Turbo et LLaDA-Image sur Hugging Face, sans article de lancement, sans communiqué de presse et — au moment où j'écris ces lignes — sans licence déclarée sur aucun des quatre dépôts qu'il a créés. LLaDA-Image-Turbo est le membre rapide de cette publication : un point de contrôle distillé dont la fiche du modèle indique qu'il transforme une invite ou une instruction d'édition en image de 1024×1024 en quatre étapes d'échantillonnage, contre cinquante pour le modèle de base LLaDA-Image dont il est issu. Ce qui rend cette mise en ligne discrète digne d'intérêt, c'est une seule ligne rapportée par le fournisseur dans la fiche du modèle — état de l'art parmi les modèles open-source sur Qwen-Image-Bench — et ce qui la rend difficile à exploiter, c'est tout ce qui entoure cette ligne et que la publication ne dit pas encore.

Ceci est un rapport de premier jour, pas une critique. Les checkpoints sont réels et téléchargeables, le code d’inférence basé sur Diffusers s’exécute à partir d’un dépôt cloné, et l’article de référence, LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes, a été mis en ligne sur arXiv le 3 septembre 2026. Mais il n’existe aucune annonce d’inclusionAI ni d’Ant Group à laquelle recouper, et au moment de la rédaction, le dépôt LLaDA-Image-Turbo affichait deux téléchargements — selon toute mesure visible, personne hors du laboratoire ne l’a encore exécuté. Tout ce qui suit est donc structuré en conséquence : ce que les dépôts contiennent réellement, ce que l’article prétend, et ce qui devrait se produire avant que LLaDA-Image-Turbo représente un pari raisonnable pour une équipe de production.

Ce qui a réellement été livré

Quatre checkpoints sont devenus disponibles sur Hugging Face sous l'org inclusionAI dans les petites heures du 4 septembre 2026 (UTC) : LLaDA-Image, le modèle de base en cinquante étapes en BF16 ; LLaDA-Image-FP8 ; LLaDA-Image-Turbo, le checkpoint rapide distillé en BF16 ; et LLaDA-Image-Turbo-FP8. La ligne d'actualité de la fiche du modèle, datée du 04-09-2026, constitue l'intégralité de l'annonce officielle : « Nous avons publié les checkpoints LLaDA-Image Base et Turbo ainsi que le code d'inférence. » Un dépôt GitHub sous la même org héberge le code d'inférence, et le rapport arXiv est paru la veille.

Les dépôts ne sont pas des stubs. Chaque dépôt Turbo contient un pipeline Diffusers complet — un générateur diffusion-transformer fragmenté, un tokeniseur d'images SigVQ, un connecteur query-former, un scheduler et un encodeur de texte à neuf fragments — donc « le modèle » n'est pas ici un nom générique mais des dizaines de gigaoctets de poids exécutables. La famille est décrite comme un modèle de génération et d'édition d'images de 6 milliards de paramètres ; à strictement parler, le chiffre 6B correspond au backbone diffusion-transformer entraîné à partir de zéro, avec un module de diffusion-language-model figé de la gamme LLaDA2 du laboratoire (l'encodeur de texte à neuf fragments) ajoutant de la compréhension par-dessus.

A screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo (captured September 4, 2026), showing the model name, the inclusionAI organization, the tags for text-to-image, Diffusers, Safetensors, English and Chinese, and a right-hand sidebar reading 7B params, BF16, and 'This model isn't served by any Inference Providers' — with the start of the LLaDA-Image model card below.

Pourquoi la partie en quatre étapes est le titre principal

Pour un modèle de diffusion d'images, le coût réside principalement dans les étapes d'échantillonnage. Chaque étape représente un passage complet à travers le réseau, de sorte que la différence entre un modèle à cinquante étapes et un modèle à quatre étapes représente environ un ordre de grandeur en termes de calcul par image, avant même de considérer la résolution, la taille de lot ou le matériel. C'est exactement l'objet de la gamme « Turbo » de cette version. inclusionAI a distillé LLaDA-Image en LLaDA-Image-Turbo grâce à une technique qu'elle appelle Twin-DMD, et le checkpoint distillé fonctionne en deux à quatre étapes, avec quatre recommandées, à une échelle de guidage de 1,0 contre 5,0 pour le modèle de base. Même objet de pipeline, même prompt, même sortie 1024×1024 — une fraction des passages de débruitage.

La mise en garde est celle qui s'applique d'ordinaire aux modèles d'images distillés, et elle est ici plus nette que d'habitude : la distillation échange un peu de fidélité contre de la vitesse, et inclusionAI n'a publié aucun chiffre de référence pour LLaDA-Image-Turbo. Les scores Qwen-Image-Bench figurant dans la fiche du modèle appartiennent au point de contrôle Base à cinquante étapes. L'écart de qualité réel entre LLaDA-Image-Turbo en quatre étapes et LLaDA-Image en cinquante étapes n'est donc ni quantifié par le fournisseur ni encore testé par quiconque — ce qui fait de « Turbo » une affirmation de vitesse que vous ne pouvez vérifier qu'en l'exécutant.

Un point de contrôle qui génère et modifie.

Le pari architectural derrière cette famille repose sur l’unification. Un seul jeu de poids gère la génération texte-image, la génération conditionnée par VQ, l’édition à partir d’une image de référence et le rendu de texte en chinois et en anglais — sans backbone d’édition séparé, ce qui explique pourquoi la moitié « édition » de cette sortie n’est pas livrée sous la forme d’un modèle dédié. En mode édition, l’image de référence contourne le module linguistique et est injectée directement dans le modèle de diffusion, tandis que le module linguistique ne traite que l’instruction ; la fiche technique revendique une préservation fidèle du contenu avec des modifications visuelles précises, ainsi qu’une génération photoréaliste et un texte typographié propre dans les deux langues.

Deux détails techniques méritent d'être notés dès le premier jour. Le générateur est un transformer de diffusion de 6B entraîné de zéro, avec une RMSNorm sans paramètre et l'optimiseur Muon — des détails que le papier rapporte plutôt que de survoler. Et le récit d'entraînement qui y est présenté est une inversion délibérée de la recette image-texte habituelle : le pré-entraînement et l'entraînement intermédiaire sur images seules construisent d'abord un solide a priori visuel, et ce n'est qu'ensuite que le laboratoire introduit la supervision linguistique appariée et l'entraînement conjoint génération-édition. C'est cet ordre — ainsi que les « Fully Open Training Recipes » du titre de l'article — qui constitue l'accroche de recherche. On notera l'écart entre le cadrage du papier et le plan de publication de Hugging Face : les poids et le code d'inférence sont bien cochés, mais le code d'entraînement est toujours marqué « coming soon ».

A single-column infographic titled 'LLaDA-Image-Turbo — the scoreboard' with rows reading 'Release: Sep 4, 2026 — weights + inference code, no announcement', 'Sampling: 4 steps (Twin-DMD distilled; 2-4 supported)', 'Backbone: 6B DiT + frozen LLaDA2-family text module', 'Modes: text-to-image, VQ-conditioned, editing, EN/ZH text', 'Qwen-Image-Bench: 53.53 EN / 53.38 ZH (Base checkpoint)', 'Access: BF16 + FP8 on Hugging Face; no license declared'. A footer reads 'Benchmark vendor-reported and measured on the Base model; Turbo scores not yet published.' The OrcaRouter logo is composited in the bottom-right corner.

Lecture de la revendication 53.53 / 53.38

Le chiffre qui va circuler est le score du benchmark : sur Qwen-Image-Bench, un benchmark texte-image doté de deux pistes séparées, l'une en anglais et l'autre en chinois, inclusionAI annonce que LLaDA-Image obtient un score global de 53.53 sur la piste anglaise et de 53.38 sur la piste chinoise, ce qu'elle présente comme un nouvel état de l'art parmi les modèles open source sur les deux. À le lire précisément, trois limites apparaissent. Il est annoncé par le fournisseur, repose sur l'évaluation du laboratoire lui-même et n'a encore été reproduit nulle part. Il concerne le modèle de base LLaDA-Image en cinquante étapes, et non LLaDA-Image-Turbo, le checkpoint que cette version est censée mettre en avant. Et « état de l'art open source » est une catégorie qui évolue chaque mois : c'est une affirmation sur la position du modèle face à ses pairs ouverts, non sur les modèles fermés de pointe.

Ce que la figure vous montre, c'est la raison pour laquelle la famille existe. Un modèle bilingue chinois-anglais de génération texte-image et d'édition, arrivé en tête d'un benchmark ouvert sur les deux tableaux, vise précisément le marché très dynamique des modèles d'images ouverts — le même segment où les checkpoints de la famille Qwen-Image, ainsi qu'un flux constant d'autres poids ouverts, donnent le rythme. Si LLaDA-Image-Turbo reproduit ne serait-ce que la majeure partie de la qualité du modèle de base en quatre étapes, il devient l'un des modèles d'images ouverts les moins chers à exécuter avec une crédibilité de qualité derrière lui. C'est le « si » qui fait tout le travail dans cette phrase.

Les lacunes qui empêchent un navire silencieux de devenir un lancement

• Une annonce. La ligne du 2026-09-04 sur la fiche du modèle est la seule déclaration du fournisseur. Il n'y a aucun billet de blog inclusionAI, aucun communiqué d'Ant Group, aucune publication sur les réseaux sociaux, aucune couverture de presse en dehors des agrégateurs — ce qui est en soi un signal à respecter plutôt qu'à masquer.

• Une licence. Aucun des quatre dépôts Hugging Face ne porte de mention de licence, et le dépôt GitHub ne contient aucun fichier LICENSE — seulement une note bilingue LEGAL.md indiquant que les commentaires en chinois dans le code priment sur les versions traduites. Vous ne pouvez pas supposer des droits commerciaux sur des poids sans licence déclarée, quel que soit le caractère « ouvert » du titre de l'article. Pour toute personne dont l'usage est commercial, c'est la première question, et elle reste actuellement sans réponse.

• Chiffres Turbo. Aucun benchmark, aucune donnée de latence ou de qualité n'est publié pour LLaDA-Image-Turbo en particulier. Le tableau ci-dessus est celui du modèle de base ; le checkpoint distillé reste une affirmation non quantifiée tant que le fournisseur ou une exécution indépendante ne l'a pas complétée.

• Vérification indépendante et accès hébergé. Les téléchargements et les likes se comptent en un seul chiffre, aucune reproduction indépendante n'existe, et aucun fournisseur d'inférence que nous ayons trouvé — y compris OrcaRouter — ne sert encore le modèle. Aujourd'hui, ce ne sont que des poids sur Hugging Face, et rien d'autre.

Que faire d'un navire silencieux d'un jour ?

Si vous êtes un chercheur ou une équipe qui auto-héberge, c'est une version à cloner et à exécuter cette semaine : des poids ouverts, un pipeline Diffusers, une variante BF16 et une FP8 pour échanger la mémoire contre la qualité, et un article qui explique comment le modèle a été entraîné, avant même que le code d'entraînement ne soit disponible. Si votre usage est commercial, l'écart de licence passe en premier — un modèle d'images en quatre étapes avec une revendication de qualité plausible ne vaut pas un risque juridique, et la décision responsable consiste à évaluer sur votre propre GPU et à attendre la ligne de licence avant de le mettre près d'un produit.

Quatre choses feraient de ce navire tranquille un lancement sur lequel bâtir, et aucune ne s'est produite au 4 septembre 2026 :

• Une véritable annonce d'inclusionAI ou d'Ant Group, nommant la famille et ses conditions.

{{1}}Une licence déclarée sur les dépôts{{/1}} — {{2}}Apache-2.0 s'alignerait sur la pratique plus large du laboratoire en matière de poids ouverts et supprimerait le blocage commercial.{{/2}}

• Scores LLaDA-Image-Turbo publiés, ou reproduction indépendante du résultat Qwen-Image-Bench du modèle de base.

• Un fournisseur hébergé qui le prend en charge, ce qui est aussi le moment où le modèle acquiert un prix par image et devient quelque chose qu'une API de routage peut vous renvoyer en un seul appel.

An infographic titled 'Turning a quiet ship into a launch' with four numbered rows reading '1. An official inclusionAI or Ant Group announcement', '2. A declared license on the repositories', '3. Published LLaDA-Image-Turbo scores or an independent reproduction', '4. A hosted provider starts serving it'. A footer reads 'None has happened as of Sep 4, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Lorsque ce dernier signal se déclenche — s'il se déclenche — le calcul des prix est simple : le fournisseur fixe le prix catalogue, et une API de routage qui transmet tels quels les prix catalogue du fournisseur, avec une marge de 0 %, est ce qui maintient ce prix en vigueur de votre côté le jour même, sans renégociation ni second contrat. Mais ce jour n'est pas encore arrivé pour LLaDA-Image-Turbo, et rien dans cet article ne doit se lire comme s'il l'était. Aujourd'hui, le résumé honnête est bref : un laboratoire sérieux a discrètement publié un sérieux modèle d'image ouvert, avec une véritable promesse de qualité et plusieurs questions en suspens, et le moyen le plus rapide de savoir quelles parties de cette promesse survivent au contact avec la réalité est d'exécuter vous-même le protocole en quatre étapes.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube