
Ming-Image-0.1-Design vs Qwen-Image 3.0 : Qui vous montre comment le texte est dessiné
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La chose la plus intéressante à propos de Ming-Image-0.1-Design ne figure pas sur sa fiche de modèle. Elle se trouve dans un commit d'un framework d'inférence. Vers le moment du téléversement discret du modèle sur Hugging Face, le 17 septembre 2026, vLLM-Omni a fusionné une modification intitulée fonctionnalité : ajout de la prise en charge de byte5 pour Ming qui intègre un encodeur de glyphes ByT5 dans un nouveau pipeline ming_flash_omni — un composant dédié dont tout le travail consiste à examiner les caractères que vous avez demandé à rendre, pas l'image que vous avez demandée. C'est le genre de détail que l'on ne peut trouver qu'en lisant le code, et c'est exactement le détail que Qwen-Image 3.0 — le modèle d'image hébergé et fermé du fournisseur, livré le 21 juillet 2026 et passé en disponibilité générale le 5 août — ne laisse personne lire du tout. Les deux modèles visent le travail de design où la typographie lisible est la partie difficile. Un seul d'entre eux vous dira comment il s'y prend.
Ce que chacun d’eux dit à propos du texte
Le discours de Qwen-Image 3.0 sur le rendu de texte est entièrement une promesse de lancement, et c’est une bonne promesse sur le papier. La documentation d’Alibaba décrit des prompts allant jusqu’à environ 4 500 tokens, du texte lisible jusqu’à environ 10 pixels, une couverture de 12 langues sur plus de 20 polices, une sortie jusqu’à 2048×2048 et jusqu’à six images par appel, disponible en éditions Pro et Standard via une API hébergée. Il n’y a pas de publication de poids, pas de licence déclarée, pas de fiche de modèle, pas de rapport technique et pas de tableau de référence publié pour vérifier tout cela. Le chiffre de ~20B paramètres du MMDiT, largement répété, est rapporté plutôt que confirmé.
L'histoire de Ming-Image-0.1-Design est un dépôt. 6 154 901 056 paramètres, licence MIT, un diffusers tag de pipeline, tous les poids en safetensors BF16, environ 71,5 Go répartis dans connector/, mllm/, mlp/, scheduler/, transformer/ et vae/. L'inférence recommandée est 2048×2048 à 12 étapes d'échantillonnage avec un guidage à 1,0 sur un GPU CUDA de 80 GiB, ou 1024 pour la vitesse, avec vLLM-Omni nommé pour le déploiement et un modèle vision-langage distinct nommé pour l'amélioration de prompt. La fiche le décrit comme un modèle texte-image pour l'UI, les infographies, les affiches et autres conceptions visuelles riches en texte, avec une sortie RGBA pour les arrière-plans transparents.
Ces deux paragraphes ne relèvent pas du même type de déclaration, et il vaut la peine d’être direct sur la raison. L’un est une description d’un produit écrite par ceux qui le vendent. L’autre est une description d’un artefact que n’importe qui peut télécharger et vérifier.
L’encodeur de glyphes est la partie qui explique la catégorie.
Le rendu du texte dans les modèles d’image échoue généralement d’une manière bien particulière : le modèle génère quelque chose qui ressemble à de l’écriture sans en être. Les formes des lettres sont plausibles et le mot est incorrect. La raison est architecturale avant tout le reste — la plupart des modèles d’image n’ont aucun composant qui perçoive les caractères comme des caractères, de sorte que la typographie est reconstruite à partir de statistiques visuelles de la même manière que l’herbe.
Le commit vLLM-Omni est intéressant précisément parce qu'il pointe vers cela. Les fichiers ajoutés — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py et un processeur d'entrée d'étape — décrivent un chemin dans lequel un encodeur byte-level ByT5 lit le texte qui doit apparaître dans l'image, le vocabulaire du tokenizer est étendu avec des marqueurs de police et de couleur, et les caractéristiques résultantes sont ajoutées le long de la dimension de séquence, le côté négatif recevant des zéros. Ce dernier détail est l'indice qu'il s'agit d'une véritable décision de conception plutôt que de la plomberie : si la branche négative portait les mêmes caractéristiques de glyphes, le guidage sans classificateur serait tiré vers le rendu du texte et loin du prompt, donc les zéros existent pour empêcher les deux objectifs d'entrer en conflit. L'encodeur ne se charge que lorsque le checkpoint contient effectivement un byte5/ sous-dossier.
Deux notes d'honnêteté. Il s'agit d'un commit d'un framework d'inférence tiers, et non d'une déclaration d'Ant Group, et l'interprétation de ce que ces fichiers signifient est la nôtre, et non celle du fournisseur. Et cela corrobore une intention de conception, pas un résultat : la présence d'un encodeur de glyphes est compatible avec un bon rendu de texte, mais elle ne prouve pas que le rendu de texte est bon. La seule preuve indépendante de qualité est une unique position dans un classement, abordée ci-dessous.

Ce qui oppose Qwen-Image 3.0, ce n’est pas qu’Alibaba rende mal le texte — personne en dehors d’Alibaba ne peut dire avec quelle qualité son modèle restitue le texte, et c’est justement là l’essentiel. C’est que la question « comment ce modèle dessine-t-il les lettres » a une réponse pour l’un de ces modèles et une allégation marketing pour l’autre, et c’est dans l’écart entre une réponse et une allégation que se prennent les décisions d’ingénierie.
Le seul numéro, et le tableau sur lequel il ne figure pas
Ming-Image-0.1-Design est classé premier sur l'Artificial Analysis Text to Image Leaderboard for UI/UX Design, vue open-weights, avec un Elo de 1 082 — devant Ideogram 4.0 (Quality) à 1 052, Ideogram 4.0 à 1 015, HunyuanImage 3.0 Instruct à 1 005, FLUX.2 [dev] à 1 000, FLUX.2 [dev] Flash à 999 et FLUX.2 [dev] Turbo à 994. La copie de ce classement est celle reproduite sur la propre fiche du modèle, et elle porte l'image de marque d'Artificial Analysis ; personne n'a reproduit le score de manière indépendante.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
C'est un classement open-weights, donc Qwen-Image 3.0 n'y figure pas, et son absence ne dit rien de sa qualité. Ce qu'elle dit, en revanche, est structurel : un classement par préférence en aveugle ne peut classer que les modèles dont les poids sont publics. Cela donne à une sortie ouverte une position mesurable des mois avant qu'elle n'ait un produit, et cela donne à une sortie fermée un chiffre marketing et rien d'autre. Les affirmations de Qwen-Image 3.0 — lisibilité à 10 pixels, prompts de 4 500 tokens, plus de 20 polices — ne s'appuient sur aucune mesure indépendante.

Comment vous testeriez réellement cela, et ce que cela coûte d'essayer
Si une typographie lisible est la raison pour laquelle vous lisez ceci, le test n’est pas un classement. C’est votre propre police de caractères, votre propre langue et vos propres chaînes, testées sur les deux candidats et lues par une personne. Ce test exige que l’un de ces modèles soit accessible et bon marché, et que l’autre soit téléchargeable, et leurs prix reposent sur des principes opposés.
• Qwen-Image 3.0 — environ 0,04 $ par image avec l'édition Pro et environ 0,03 $ avec Standard, avec une tarification grand public nationale débutant autour de 0,18 ¥ par image. Ce sont des chiffres de lancement et ils n'ont pas été audités. Vous pouvez exécuter une matrice de prompts cet après-midi et payer à chaque appel.
• Ming-Image-0.1-Design — aucun prix publié, car il n'existe aucun point de terminaison hébergé. Le coût, c'est un téléchargement de 71,5 GB, une carte de 80 GiB et votre propre temps ; l'avantage, c'est que vous pouvez pointer le même test vers le chemin de l'encodeur de glyphes et voir si c'est bien ce composant qui fait le travail.
C'est la situation pour laquelle une couche de routage est conçue, et il vaut la peine de préciser quelle partie s'applique. Ni Qwen-Image 3.0 ni Ming-Image-0.1-Design ne figurent sur notre plateforme, donc une couche de routage ne peut placer ni l'un ni l'autre derrière une clé aujourd'hui. Ce qu'elle peut faire, c'est garder la comparaison honnête pendant que vous l'exécutez : OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans marge, avec bascule automatique entre fournisseurs, afin que le modèle auquel vous faites déjà confiance puisse tenir la voie de production — et son coût reste lié au prix catalogue du fournisseur, de sorte qu'une modification tarifaire d'un fournisseur se répercute de notre côté le jour même — tandis qu'un modèle de design non mesuré est évalué à côté de lui plutôt que devant lui.
Deux versions ouvertes, une fermée, et un motif
Il convient de noter ce dont la publication de Ming est la preuve, au-delà d’elle-même. Ant Group a publié, sans annonce, un modèle de conception de 6,15 milliards de paramètres sous licence MIT, aux côtés d’un second modèle de décomposition en couches sous la même licence. Alibaba a publié un modèle hébergé fermé, sans licence, sans fiche modèle ni rapport, destiné au même type de travail, et l’a facturé à l’image.
Ce sont deux paris différents sur l'endroit où réside la valeur dans les modèles de design. L'un dit que le modèle est le produit et que les poids sont le canal de distribution. L'autre dit que le modèle est un service et que les poids sont ce que l'on garde. Les deux paris peuvent être corrects sur un même marché, et ils donnent des réponses très différentes à la seule question qui compte au moment de l'évaluation : puis-je découvrir comment cela fonctionne avant d'en dépendre ?
• Si vous avez besoin de savoir comment le texte est rendu, et pourquoi il ne l’est parfois pas — Ming-Image-0.1-Design est le seul des deux qui vous permet de regarder, et la licence MIT signifie que vous pouvez agir sur ce que vous découvrez.
• Si vous avez besoin dès aujourd'hui d'un endpoint de production avec un prix par image et sans infrastructure — Qwen-Image 3.0 est le seul des deux à en proposer un, et ses rouages internes font partie du prix.
• Si vous avez besoin de preuves indépendantes avant de vous engager — aucun des deux n'en a suffisamment. L'un n'a qu'une seule position de classement non reproduite ; l'autre a une fiche de déclarations d'un fournisseur sans chiffres à l'appui.
Ce qu’il faut surveiller, c’est si le schéma se maintient. Une sortie MIT non annoncée contenant un encodeur de glyphes est une déclaration sur la manière dont ses auteurs s’attendent à ce que le modèle soit utilisé — inspecté, exécuté localement, modifié. Si la prochaine sortie de la même équipe est annoncée, évaluée selon des benchmarks et hébergée, c’était un cas isolé. S’il s’agit d’un autre dépôt discret, la catégorie des modèles de design compte un deuxième concurrent ouvert, et la moitié fermée du marché a un problème de prix qu’elle n’avait pas en juillet.
