
Ming-Image-0.1-Design vs GPT Image 2.5 : le chiffre d'un laboratoire face aux votes d'un panel d'inconnus
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Mettez Ming-Image-0.1-Design et GPT Image 2.5 dans la même phrase et la comparaison évidente est la qualité. La comparaison utile est la provenance. GPT Image 2.5 occupe la première et la deuxième place sur le classement en direct Artificial Analysis UI/UX Design, avec 1 227 et 1 218 Elo, sur 1 287 et 1 303 votes humains en aveugle respectivement — c'est-à-dire un classement produit par des personnes qui n'ont pas construit le modèle et à qui on n'a pas dit quel résultat appartenait à quel modèle. Ming-Image-0.1-Design n'a exactement qu'un seul score qui lui est associé, 1 082 Elo, et ce score apparaît sur un graphique de classement fourni dans le propre dépôt Hugging Face d'inclusionAI, sur un classement que nous n'avons pu trouver nulle part ailleurs, pour un modèle avec zéro téléchargement. L'un de ces chiffres est une preuve. L'autre est une affirmation avec une police de caractères. C'est cet écart, et non les 145 Elo qui les séparent, qui devrait façonner une décision concernant l'un ou l'autre modèle.
Les deux nombres côte à côte, et le piège de les comparer
Les chiffres sont assez proches pour sembler comparables et assez différents par nature pour ne pas l’être. Voici l’ensemble, énoncé avec précision.
• GPT Image 2.5, dans le classement en direct — première place avec 1 227,0 Elo pour la configuration Flare (max), deuxième place avec 1 218,1 pour Sunburst (max), avec des nombres d’échantillons de 1 287 et 1 303 et un prix suivi de 210,72 $ les 1 000 images. Le modèle était répertorié dans ce classement comme publié le 8 septembre 2026.
• Ming-Image-0.1-Design, sur sa propre carte — première place à 1 082 Elo, devant Ideogram 4.0 (Quality) à 1 052 et les variantes FLUX.2 dev entre 994 et 1 000, sur un graphique intitulé « Text to Image Leaderboard: UI/UX Design » avec en pied de page « Elo scores from blind preference votes in our Image Arena ». Aucun nombre d'échantillons n'est indiqué. Aucune méthodologie n'est publiée. Le tableau lui-même n'est pas accessible sur le web public, pour autant que nous puissions le trouver.
• Le piège — L'Elo est calculé par classement. Un score n'a de sens que comparé aux autres scores du même classement, c'est pourquoi la même version de FLUX.2 affiche 1,026 sur le classement général texte-image et 1,065 dans la vue de la catégorie UI/UX Design. Soustrayez 1,082 de 1,227 et vous n'avez pas mesuré un écart de qualité entre deux modèles. Vous avez soustrait un nombre à un nombre différent.

Qu'est-ce qui fait d'un vote à l'aveugle un vote à l'aveugle
Artificial Analysis publie suffisamment d’éléments sur sa méthode pour qu’elle puisse être vérifiée. Son arène d’images apparie deux générations issues de modèles anonymes, demande à un votant de désigner un gagnant, puis convertit les résultats en un classement Elo — les nombres d’échantillons affichés sur le tableau correspondent au nombre de ces comparaisons accumulées par chaque modèle. C’est cette structure qui rend un score résistant aux propres auteurs du modèle : les personnes qui ont entraîné GPT Image 2.5 n’apparaissent pas dans la boucle, et un modèle ne peut pas être classé premier simplement parce qu’il est celui que son créateur préfère. Ce n’est pas un instrument parfait — le vivier de votants est auto-sélectionné et les prompts ne constituent pas une suite de benchmarks contrôlée — mais c’est un instrument que quelqu’un d’autre que le fournisseur tient.
Le graphique à l’intérieur du dépôt Ming-Image-0.1-Design emprunte ce format sans les éléments qui le rendent vérifiable. « Blind preference votes » est l’affirmation. « Our Image Arena » est l’opérateur, et l’opérateur est inclusionAI. Il n’y a aucun décompte de votes publié, aucune distribution des prompts visible, et aucun moyen d’inspecter les appariements. Il est tout à fait possible que l’évaluation derrière ce graphique soit honnête et rigoureuse — l’équipe du modèle le saurait. Elle est aussi totalement invérifiable de l’extérieur, ce qui est la seule chose qui compte si c’est vous qui décidez si vous voulez vous appuyer dessus.
Cela vaut la peine d’être ajouté, car cela va à l’encontre du récit simpliste : Ming-Image-0.1-Design ne figure pas du tout sur le tableau en direct d’Artificial Analysis. Ni dans la catégorie UI/UX Design, ni sur le tableau général de génération d’images à partir de texte, ni dans la vue open-weights. Son absence ne prouve pas qu’il est moins bon — un modèle avec zéro téléchargement et aucun point de terminaison hébergé n’a aucun moyen d’accumuler des votes. Elle prouve qu’aucun chiffre indépendant n’existe encore, ce qui est une affirmation différente.
Le prix est la partie qui n'est pas ambiguë
Côté coût, les deux modèles ne sont pas comparables et il n'y a rien à débattre.
• GPT Image 2.5 est un endpoint commercial. Artificial Analysis le suit à 210,72 $ pour 1 000 images dans la catégorie UI/UX — soit environ 21 cents par image, ce qui le place en haut de la fourchette de prix du domaine. Pour situer le contexte sur le même tableau, Grok Imagine Image 2.0 est suivi à 60 $ pour 1 000, MAI-Image-2.6 à 38,9 $, et Muse Image à 10 $.
• Ming-Image-0.1-Design n'a pas de prix parce qu'il n'a pas de point de terminaison. Les poids sont sous licence MIT et téléchargeables gratuitement ; les faire tourner coûte le tarif horaire d'un GPU CUDA de 80 Gio. La configuration validée de la fiche du modèle est une seule carte de cette classe, en résolution 2048 x 2048 et avec 12 étapes d'échantillonnage.
• Aucun des deux chiffres n'est stable. Les deux fournisseurs révisent leurs tarifs, et une comparaison par image rédigée aujourd'hui a une durée de vie qui se compte en semaines. C'est le seul point où le modèle économique d'OrcaRouter mérite d'être énoncé clairement : nous répercutons les prix catalogue des fournisseurs à 0 % de marge, de sorte qu'un changement de tarif d'un fournisseur est effectif de notre côté le jour même, plutôt qu'après un cycle de révision de nos propres tarifs — ce qui compte lorsque l'écart entre deux candidats est de 21 cents contre 6 cents par image et que les deux peuvent évoluer.
Ce que vous pouvez réellement appeler, aujourd’hui, et où nous nous situons dans tout cela
La disponibilité est le point où cette comparaison cesse d'être une expérience de pensée.
GPT Image 2.5 est un vrai produit avec une véritable API derrière lui, vendu par OpenAI selon ses propres conditions. Il n'est pas routable via OrcaRouter — notre catalogue ne comporte aucune entrée GPT Image 2.5 au 23 septembre 2026 — et nous n'allons pas décrire une route que nous n'avons pas. Ce que le catalogue propose bel et bien dans la même gamme, c'est la génération précédente, openai/gpt-image-2 à 8,00 $ par million de jetons d’entrée et 30,00 $ par million de jetons de sortie, aux côtés de openai/gpt-image-1.5, et ceux-ci se trouvent derrière la même clé que tout le reste de ce que nous routons.
Ming-Image-0.1 n’est routable nulle part. Le dépôt a l’inférence désactivée, Hugging Face ne signale aucun déploiement de fournisseur d’inférence, et le Guide de démarrage rapide pointe vers un dépôt GitHub associé qui renvoie une erreur 404. Aucun modèle inclusionAI, quel qu’il soit, ne figure dans notre catalogue. La seule façon de l’exécuter est de télécharger les shards et de les servir vous-même.
Donc, la nature du choix est la suivante : une option que vous pouvez acheter aujourd'hui au prix le plus élevé du marché, et une option que vous pouvez exécuter aujourd'hui pour le prix d'un GPU et de votre propre temps d'ingénierie, sans aucune preuve indépendante qu'elle soit performante. Quiconque vous dit que Ming-Image-0.1-Design est une alternative moins chère à GPT Image 2.5 n'a pas évalué le coût de la seconde option.

Comment tenir les deux sans parier ni sur l'un ni sur l'autre
Le conseil pratique donné ici est plus restreint qu'un verdict, car les deux modèles ne sont pas encore substituables l'un à l'autre.
Si vous avez besoin en production de génération d'images de qualité UI ou design, GPT Image 2.5 est le choix défendable, et c'est sur le prix que vous devez négocier avec vous-même, pas sur la qualité — il domine le classement indépendant avec une marge assez large pour que sa position ne soit pas discutable. Si vous voulez savoir si Ming-Image-0.1-Design est bon, vous avez deux options et une seule est exempte de conjectures : charger les poids MIT sur une carte de 80 GiB et exécuter votre propre jeu d'évaluation, ou attendre que quelqu'un d'autre s'en charge. En attendant, ne traitez pas le 1 082 comme un résultat. Et si votre véritable exigence est l'optionalité plutôt que l'un ou l'autre de ces modèles en particulier, la discipline qui paie consiste à garder l'appel de génération derrière une interface unique — une seule clé pour plus de 200 modèles, un changement d'ID de modèle au lieu d'une réécriture, un basculement automatique lorsqu'un point de terminaison fait défaut — afin que, quel que soit celui des deux qui publie en premier un chiffre indépendant, son adoption ne vous coûte qu'une ligne de configuration et non un sprint.
Une dernière remarque sur ce qui changerait cet article. Une ligne Ming-Image-0.1-Design apparaissant sur le tableau UI/UX Design d’Artificial Analysis, avec un nombre d’échantillons à côté, ferait passer le 1 082 du fournisseur du statut d’affirmation à celui de point de données — et ce serait la première fois que quelqu’un en dehors d’inclusionAI dirait quoi que ce soit de mesurable sur le modèle. C’est l’événement à guetter, et il est plus utile de surveiller cela que le compteur de téléchargements.

