
Ming-Image-0.1-Design domine le classement Open-Weights de design d'interface — et le chiffre se vérifie
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
L'affirmation qui circule avec Ming-Image-0.1-Design est que le modèle 6B d'inclusionAI est le meilleur modèle texte-image à poids ouverts pour les travaux d'UI et d'UX, occupant la première place dans la vue des poids ouverts du classement UI/UX Design d'Artificial Analysis avec 1 082 Elo. Les captures d'écran de classements fournies par les éditeurs sont généralement le type de preuve le plus faible qui soit, la première chose à faire est donc de consulter le classement en direct. Au 24 septembre 2026, cela se vérifie toujours, avec une réserve importante que la capture d'écran ne mentionne pas : 1 082 correspond à un segment par cas d'usage, pas au classement dans son ensemble, et dans le classement complet Text to Image, le même modèle occupe la 45e place avec un Elo de 995.
Les deux nombres sont réels, ils proviennent de la même arène et décrivent les mêmes poids. Ce qui les distingue, ce sont les invites sur lesquelles les votes ont été exprimés.
Ce que dit réellement le tableau d'affichage en direct
Artificial Analysis mène une arène aveugle de comparaisons par paires, puis filtre le même ensemble de votes en segments par cas d’usage. Le segment UI/UX Design est celui qui compte pour un modèle conçu pour les tableaux de bord, les écrans d’application, les affiches et les infographies, et c’est là que Ming-Image-0.1-Design donne le meilleur de lui-même :
• Classement général Texte vers Image — Ming-Image-0.1-Design à la 45e place, Elo 995, IC à 95 % ±8, 21 342 échantillons, répertorié en septembre 2026, 30,00 $ pour 1 000 images, signalé Poids ouverts
• Tranche UI/UX Design — Ming-Image-0.1-Design à la 16e place, Elo 1 084, 2 100 échantillons dans la tranche
• Entrée à poids ouverts la mieux classée dans ce segment — Ming-Image-0.1-Design ; les prochains modèles à poids ouverts derrière elle sont Ideogram 4.0 (Quality) à la 22e place avec 1 047, Ideogram 4.0 à la 31e place avec 1 018, et HunyuanImage 3.0 Instruct à la 40e place avec 1 005
• En tête du segment UI/UX — GPT Image 2.5 Flare (max) à 1 226, GPT Image 2.5 Sunburst (max) à 1 215, GPT Image 2 (high) à 1 204, Grok Imagine Image 2.0 à 1 183
• Par rapport à la capture d’écran du fournisseur lui-même — inclusionAI a publié 1 082 pour Ming face à Ideogram 4.0 (Quality) à 1 052 et FLUX.2 [dev] à 1 000 ; le segment en direct affiche désormais 1 084, 1 047 et 1 000 respectivement
Le titre est donc exact en soi. Ming-Image-0.1-Design est le modèle à poids ouverts le mieux classé du segment UI/UX Design, et c’est le seul modèle à poids ouverts dans le top 20 de ce segment. Il est aussi à 142 Elo derrière le leader de ce segment, et il se situe au milieu du peloton lorsque le prompt n’est pas un prompt de design. Un modèle qui gagne sur les tableaux de bord et qui atteint 995 au classement général est un spécialiste, pas un généraliste, et les deux chiffres ne se contredisent que si l’on interprète l’un d’eux comme toute l’histoire.
Les 21 342 échantillons du classement complet méritent également d'être notés pour ce qu'ils ne sont pas. C'est un grand nombre de votes, c'est pourquoi l'intervalle de confiance est étroit à ±8 Elo, mais le nombre d'échantillons n'est pas synonyme d'indépendance de la méthode. L'arène repose sur la préférence humaine en aveugle, donc personne chez inclusionAI n'a rédigé le score — cette partie est authentique. Ce que le score mesure, c'est « laquelle de ces deux images un votant a préférée », et les votants chargés de juger une capture d'écran d'interface ont tendance à récompenser un texte lisible et une mise en page cohérente. C'est précisément l'axe sur lequel ce modèle a été entraîné.

Ce qu'est Ming-Image-0.1-Design
Ming-Image-0.1-Design est un modèle de génération d'images à partir de texte d'inclusionAI, le laboratoire d'IA associé à Ant Group, publié sous licence MIT, avec des poids mis en ligne le 17 septembre 2026 et le package complet de publication attendu le 22 septembre. Il génère à partir d'un simple prompt — aucune image de référence n'est requise — et il vise le design graphique à forte composante textuelle plutôt que la photographie : maquettes d'interface utilisateur, tableaux de bord, infographies, affiches, et tout élément où le texte rendu doit rester lisible à la taille à laquelle il sera lu.
La configuration d’inférence documentée est spécifique et inhabituellement peu coûteuse par étape :
• Résolution — 2048 x 2048 recommandée, ou 1024 x 1024 pour une génération plus rapide, avec les tailles intermédiaires ramenées à l’un de ces deux paliers
• Étapes d'échantillonnage — 12
• Guidage — échelle CFG 1.0
• Précision — BF16
• Matériel — un GPU CUDA avec 80 GiB de VRAM, décrit comme la configuration validée
Douze étapes avec une échelle de guidage de 1,0 constituent la signature d’un échantillonneur distillé ou sans guidage. C’est ce qui rend abordable une sortie de 2048 pixels à un nombre d’étapes que la plupart des modèles de diffusion ne tenteraient pas, et c’est la principale raison pour laquelle ce modèle intéresse quiconque génère des images en volume plutôt qu’une image à la fois.
L'autre caractéristique structurelle est la transparence. Ming-Image-0.1-Design peut produire du RGBA natif, de sorte qu'un arrière-plan transparent sort directement de l'échantillonneur plutôt que d'une passe de matting, lorsque le prompt commence par l'une des phrases de transparence documentées. Un modèle compagnon, Ming-Image-0.1-Design-Layer, va plus loin : il prend un design aplati plus un plan de calques et renvoie des PNG RGBA séparés — texte, cartes, sujet principal, arrière-plan — qui se recomposent en l'original. C'est la différence entre un modèle de design et un modèle d'image. Un PNG aplati est une image d'une mise en page ; des calques séparés sont une mise en page que vous pouvez encore modifier.
![Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.](https://cms.orcarouter.ai/api/media/file/3-1273.png)
Le libellé 6B et le téléchargement 26B
« 6B » est exact quant à la partie à laquelle la plupart des gens pensent, mais trompeur quant à celle qui détermine si vous pouvez l'exécuter. Le transformer de diffusion compte 6,15 milliards de paramètres. Le paquet que vous téléchargez réellement fait environ 52,88 Go, car l'encodeur de texte multimodal compte 17,01 milliards de paramètres et le connecteur en ajoute 3,09 milliards — soit environ 26 milliards de paramètres en BF16 au total. Le transformer du modèle Layer est le double de celui du modèle de base, à 12,31 milliards, et son paquet est encore plus volumineux, à environ 65,20 Go.
Cela importe pour deux raisons pratiques. Premièrement, l’exigence de 80 GiB de VRAM ne concerne pas le transformer 6B ; elle concerne tout ce qui doit résider à ses côtés. Deuxièmement, toute comparaison avec un modèle décrit comme « 6B » doit vérifier de quel 6B il s’agit. Un transformer de diffusion 6B avec un encodeur de texte 20B représente un problème de déploiement très différent d’un modèle 6B de bout en bout.
La gestion des prompts est l'autre point que la fiche rend explicite plutôt que de le dissimuler : la recette recommandée exécute d'abord une étape de réécriture, en utilisant un modèle vision-langage pour développer un prompt court en une description de mise en page JSON structurée, de style Figma, avec coordonnées, hiérarchie, spécifications de couleurs et texte exact. Les fiches modèles citent Ling-3.0-flash-VL ou Qwen3.8-27B pour cette tâche. En d'autres termes, le pipeline évalué par le fournisseur est un pipeline à deux modèles. Si vous appelez Ming-Image-0.1-Design avec un prompt d'une seule ligne et sans étape de réécriture, vous n'exécutez pas la configuration qui a produit 1 084 dans le volet UI/UX.
Où cela laisse un pipeline de conception
Le résumé honnête de Ming-Image-0.1-Design est qu’il résout un problème spécifique et coûteux — générer des mises en page à forte densité de texte qui survivent à l’examen — et qu’il le fait au sommet du domaine des modèles à poids ouverts sur le seul classement qui mesure ce problème. Il n’occupe pas la première place du classement général des images, il ne supprime pas le besoin d’un VLM en amont, et il exige un GPU sérieux.
Ce que cela change, c’est le milieu d’un flux de travail de design. Si votre pipeline génère actuellement une image plate, puis paie un humain ou un modèle de segmentation pour la découper, un modèle qui produit nativement du RGBA et un compagnon qui produit 2 à 9 calques nommés suppriment une étape. Cela vaut plus qu’une colonne Elo, et c’est la partie qu’aucun classement ne mesure.
Pour les équipes qui veulent le tester sans engager d'infrastructure, la distinction mérite d'être précisée. Ming-Image-0.1-Design est un téléchargement sous licence MIT, il s'exécute donc sur votre matériel ou pas du tout — OrcaRouter ne route aucun modèle inclusionAI, quelle que soit sa version, et dire le contraire serait une affirmation que nous ne pouvons pas honorer. Ce qu'une couche de routage vous apporte, c'est la surface environnante : un point de terminaison compatible avec OpenAI pour plus de 200 modèles, un basculement automatique entre fournisseurs, et le prix catalogue des fournisseurs répercuté à 0 % de marge, ainsi toute modification de prix d'un fournisseur sur un modèle que vous appelez est prise en compte de notre côté le jour même. Si vous montez un pipeline de conception et souhaitez comparer en A/B ce modèle à un modèle hébergé auquel vous faites déjà confiance, cette comparaison repose sur une seule clé plutôt que sur deux contrats.

Qu'est-ce qui changerait la donne
Trois choses feraient passer Ming-Image-0.1-Design du statut de solide spécialiste open-weights à celui de choix par défaut. Une première reproduction indépendante des chiffres Crello du modèle Layer — la fiche rapporte une erreur RGB L1 de 0,0574 et un alpha soft IoU de 0,8923 à 1024, et aucun groupe externe ne les a exécutés. Un point de terminaison hébergé qui supprime la contrainte des 80 GiB. Et un deuxième segment de cas d’usage où le modèle se place aussi bien qu’en UI/UX Design, car un modèle qui ne gagne que sur un seul segment d’un seul classement est un modèle dont la généralité reste à prouver.
D'ici là, la phrase exacte est la plus étroite : sur le volet UI/UX Design d'Artificial Analysis, lu le 24 septembre 2026, le Ming-Image-0.1-Design d'inclusionAI est le modèle texte-image à poids ouverts le mieux noté, avec 1 084 Elo sur 2 100 votes — et sur le classement complet de la même arène, il est 45e à 995. Ces deux-là sont le modèle. Aucun des deux n'est une revendication de lancement, car ce modèle n'a pas eu de lancement ; il a eu un dépôt.
