Carte de titre principale avec le texte « Ming-Image-0.1-Design », sous-titre « Un modèle de design 6B livré sans annonce et avec un lien cassé », avec deux cartes indiquant « Dans le dépôt : licence MIT, sortie 2048 x 2048, 12 étapes d'échantillonnage, un GPU de 80 GiB » et « Absents du dépôt : une annonce, une API ou un Quick Start fonctionnel ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Ming-Image-0.1-Design livré discrètement : un modèle de conception 6B qui n’existe que dans un dépôt et nulle part ailleurs

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe un modèle texte-vers-image de 6B appelé Ming-Image-0.1-Design qui se trouve dans l'organisation inclusionAI sur Hugging Face, et à la date du 23 septembre 2026, presque rien d'autre à son sujet n'existe. Le dépôt a été créé le 17 septembre, les poids sont arrivés le même jour, et la fiche du modèle a été réécrite le 22 septembre — trois commits en cinq jours, tous depuis un seul compte, sans article de blog du fournisseur, sans note de lancement, sans page de modèle sur aucune plateforme d'API, et un compteur de téléchargements toujours à zéro. Voilà à quoi ressemble un lancement discret vu de l'extérieur : un artefact complet et aucune annonce. Cet article est donc un inventaire de ce que dit le dépôt, de ce qui y a changé hier, et de ce qui reste invérifiable — pas une évaluation, car personne en dehors d'inclusionAI n'a encore publié de chiffre pour ce modèle.

Ce que le dépôt contient réellement

La fiche décrit Ming-Image-0.1-Design comme un modèle texte-image de 6B pour les interfaces utilisateur, les infographies, les affiches et autres créations visuelles riches en texte, générant des compositions visuelles complètes et prenant en charge la sortie RGBA avec des arrière-plans transparents. Les métadonnées sont inhabituellement permissives pour un modèle aussi récent : licence MIT, diffusers et safetensors, tag de pipeline text-to-image, et des tags couvrant la génération d’images, le design graphique, le rendu de texte et RGBA.

Les paramètres d'inférence recommandés sont suffisamment précis pour être utiles :

• Résolution — 2048 x 2048 recommandée, ou 1024 x 1024 pour une génération plus rapide

• Étapes d'échantillonnage — 12

• Échelle CFG — 1,0

• Précision — BF16

• Matériel — un GPU CUDA avec 80 GiB de VRAM, décrit comme la configuration validée

Douze étapes à une échelle de guidage de 1,0, c’est le profil d’un échantillonneur distillé ou sans guidage : peu coûteux par image, ce qui explique que la fiche puisse proposer une sortie de 2048 pixels à un nombre d’étapes que la plupart des modèles de diffusion ne tenteraient pas. La fiche note également que le code d’inférence public mappe les demandes de résolution text-to-image sur le bucket pris en charge de 1024 ou 2048, de sorte que les tailles intermédiaires sont ramenées à l’une de ces deux valeurs.

L'arborescence de fichiers vous en dit un peu plus que la prose. À côté de vae et scheduler, il y a un dossier transformer avec cinq fragments de poids, plus mllm, connector et mlp, des composants distincts — la forme d'un pipeline multi-étapes avec un modèle de langage multimodal comme encodeur de texte plutôt qu'un débruiteur monolithique unique. Cela concorde avec la note de la fiche selon laquelle l'amélioration de prompt peut être gérée par Ling-3.0-flash-VL ou qwen3.8-27B, deux modèles frères de la même organisation.

Les trois commits qui ont été intégrés le 22 septembre

C'est la seule partie de l'histoire dont l'horodatage se situe dans la semaine écoulée, et c'est la raison pour laquelle le modèle mérite qu'on en parle maintenant plutôt qu'en octobre. Les titres des commits, dans l'ordre :

• 22 septembre, 11:25 UTC — « Publier le paquet de publication Ming-Image-0.1-Design »

• 22 septembre, 12:01 UTC — « Actualiser la fiche du modèle Ming-Image-0.1-Design »

• 22 septembre, 15:17 UTC — « Ajouter des liens de déploiement vLLM-Omni »

Les deux premiers relèvent de la maintenance. Le troisième est le changement de fond : un framework autre que celui du fournisseur lui-même a pris en charge le modèle, et la fiche recommande désormais de le servir via vLLM-Omni, avec des liens vers une recette et un guide d’installation. C’est le signal standard qu’un modèle est passé de « poids sur une étagère » à « quelque chose qu’une équipe peut réellement mettre en place derrière un endpoint », et c’est le genre de changement qui ne génère jamais de communiqué de presse.

Il n’est également qu’à moitié intégré. Le lien vers le guide d’installation, lui, fonctionne. Le chemin de recette propre au modèle dans le même commit, en revanche, ne fonctionne pas — il renvoie un 404 en date du 23 septembre. Ainsi, l’histoire du déploiement de Ming-Image-0.1-Design se présente actuellement comme suit : le cadre général existe bel et bien, mais les instructions pour ce modèle à l’intérieur de celui-ci ne sont encore qu’un emplacement réservé. Si vous prévoyez de le servir, prévoyez de lire le démarrage rapide de vLLM-Omni et de déterminer vous-même le câblage du modèle.

Le classement dans la carte, et le classement sur lequel il ne figure pas

Le dépôt contient un seul visuel de performance : assets/uiux_leaderboard.webp, une image de type classement intitulée « Text to Image Leaderboard: UI/UX Design », avec en pied de page « Elo scores from blind preference votes in our Image Arena » et un badge « Open Weights Leaderboard ». On y voit Ming-Image-0.1-Design en tête avec 1 082 points Elo, devant Ideogram 4.0 (Quality) à 1 052, Ideogram 4.0 à 1 015, HunyuanImage 3.0 Instruct à 1 005, et les variantes FLUX.2 dev entre 994 et 1 000.

Trois choses doivent être dites à propos de cette image, et l’ordre compte.

Premièrement, il s’agit d’illustrations publiées par le fournisseur dans le propre dépôt du fournisseur. Nous rapportons ce que contient le fichier, sans pour autant l’approuver.

Deuxièmement, nous n'avons trouvé Ming-Image-0.1-Design nulle part sur les tableaux en ligne d'Artificial Analysis le 23 septembre — ni sur le classement texte-image, ni dans la vue de la catégorie UI/UX Design, ni sur le tableau d'édition d'images, ni dans la vue des modèles à poids ouverts. Le sommet de la catégorie UI/UX Design en ligne est GPT Image 2.5 Flare à 1 227 Elo, et les entrées FLUX.2 que la carte répertorie apparaissent sur ce même tableau en ligne avec des valeurs différentes : FLUX.2 [flex] à 1 065, FLUX.2 [max] à 1 053, FLUX.2 [dev] à 1 000. Ainsi, le classement de la carte est une affirmation concernant un tableau que nous ne pouvons pas localiser, exprimée sur une échelle environ 150 Elo en dessous de celle que nous pouvons consulter.

Troisièmement, l'Elo est calculé par classement. Un score UI/UX spécifique à une catégorie et un score général texte-image sont des quantités différentes, même pour un même modèle, c'est pourquoi la même version de FLUX.2 apparaît à 1 026 dans un classement Artificial Analysis et à 1 065 dans un autre. Toute comparaison qui mélange les classements n'est pas une comparaison.

Position nette : Ming-Image-0.1-Design ne comporte qu'une seule allégation de performance, qui émane du fournisseur lui-même, et aucune évaluation indépendante de celle-ci n'existe. Ce n'est pas une accusation. C'est la raison pour laquelle le modèle a besoin d'être exécuté par un tiers avant que quiconque n'établisse un budget sur la base du 1 082.

Ce que vous ne pouvez pas encore faire avec

Le guide de démarrage rapide est le problème. Il vous indique de cloner github.com/inclusionAI/Ming-Image, d'installer ses dépendances et d'exécuter infer.py avec l'identifiant de modèle Hugging Face. Ce dépôt n'existe pas. La page renvoie une 404, le README brut renvoie une 404, et aucun dépôt Ming-Image n'apparaît nulle part dans la liste publique des dépôts de l'organisation — laquelle contient bien Ming, Ling, Ring, Ming-UniVision, Ming-UniAudio et une douzaine d'autres, il s'agit donc d'une absence et non d'une URL mal saisie. Le seul chemin documenté pour exécuter Ming-Image-0.1-Design est celui qui n'est pas là.

Le reste de l'histoire de l'accès est tout aussi maigre. La fiche indique inference: false et Hugging Face signale que le modèle n'est déployé par aucun fournisseur d'inférence. Aucun prix publié, aucun identifiant d'API, aucun playground, et aucune condition commerciale au-delà de la licence MIT sur les poids eux-mêmes. Le nombre de téléchargements est de zéro et le nombre de likes est de quatre.

Donc, le bilan honnête de la disponibilité est le suivant : les poids sont réels et sous licence permissive, et tout ce qui les entoure — code, documentation, hébergement, évaluation — est soit absent, soit à l'état de stub.

Le nombre qui détermine qui peut l'utiliser

Quatre-vingts gigaoctets de VRAM, voilà tout l’argument. C’est une carte de classe H100 ou H200, ou une A100 80GB. Ce n’est pas un GPU de station de travail, ce n’est pas un ordinateur portable, et ce n’est pas une instance spot que l’on oublie de détruire. Combiné à une configuration mono-GPU validée, cela signifie que la licence de Ming-Image-0.1-Design est gratuite et son exécution coûteuse, ce qui correspond au profil familier d’une publication à poids ouverts issue d’un laboratoire qui entraîne à grande échelle.

Pour être complet de notre côté : aucun modèle inclusionAI n'est routable via OrcaRouter aujourd'hui. la page du catalogue recensait 199 modèles chez 15 fournisseurs lorsque nous l'avons consultée le 23 septembre, et elle ne contient aucune entrée Ming ni aucune entrée inclusionAI, donc il n'y a rien ici à appeler via nous. Ce qu'une couche de routage vaut réellement dans cette situation, c'est la deuxième étape — le jour où un fournisseur en amont prend en charge le modèle, l'essayer devient un changement d'ID de modèle sur une clé que vous détenez déjà plutôt qu'un nouveau contrat et un nouveau SDK. D'ici là, la seule façon d'exécuter Ming-Image-0.1-Design est de trouver le dépôt manquant et un GPU avec 80 GiB de réserve.

The UI/UX Design leaderboard image published in the Ming-Image-0.1-Design repository. It is headed 'Text to Image Leaderboard: UI/UX Design' with the footer 'Elo scores from blind preference votes in our Image Arena' and an 'Open Weights Leaderboard' badge. Ming-Image-0.1-Design is listed first at 1,082 Elo, above Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005, FLUX.2 [dev] at 1,000, FLUX.2 [dev] Flash at 999, FLUX.2 [dev] Turbo at 994 and HiDream-O1-Image at 987.The commit history page of the Ming-Image-0.1-Design repository on Hugging Face, captured 23 September 2026, showing five commits: 'Add vLLM-Omni deployment links' and 'Refresh Ming-Image-0.1-Design model card' and 'Publish Ming-Image-0.1-Design release package' all dated 22 September, above 'Upload initial model' and 'initial commit' dated 17 September.

Qu'est-ce qui transformerait ceci en une histoire

Quatre choses, par ordre croissant de ce qu’elles vous apprendraient. L’apparition du dépôt compagnon, qui rendrait le modèle exécutable comme documenté. La recette vLLM-Omni qui se complète, qui le rendrait servable sans avoir à deviner. Un fournisseur d’inférence qui le référence, ce qui lui donnerait un prix. Et un Elo indépendant, qui serait le premier chiffre au sujet de ce modèle à ne pas venir des personnes qui l’ont entraîné.

Tant qu'au moins l'un de ces éléments ne s'est pas concrétisé, la bonne posture est étroite et peu glamour. Si vous constituez des ensembles d'évaluation pour la génération d'interfaces et de mises en page, les poids valent la peine d'être récupérés dès maintenant — MIT, 6B, une seule configuration, et un nombre d'étapes suffisamment faible pour rendre abordables quelques milliers d'échantillons. Si vous avez besoin de génération d'images en production ce trimestre, Ming-Image-0.1-Design n'est pas un candidat : aucun endpoint, aucun support et aucun score tiers. Et si vous suivez l'organisation inclusionAI, notez qu'elle dispose désormais d'un modèle d'image pour accompagner ses lignes de langage et de parole, qu'elle a livré celui-ci sans prévenir personne, et que l'écart de deux semaines entre le téléversement initial et le package de publication suggère que la période de silence était délibérée.

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears anywhere on the board.