
Ming-Image-0.1-Design vs Qwen-Image 3.0: Chi ti mostra come viene disegnato il testo
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La cosa più interessante di Ming-Image-0.1-Design non è sulla sua scheda del modello. È in un commit a un framework di inferenza. Più o meno al momento del caricamento silenzioso del modello su Hugging Face il 17 settembre 2026, vLLM-Omni ha integrato una modifica intitolata feat: aggiungi il supporto byte5 per Ming che collega un encoder di glifi ByT5 a una nuova pipeline ming_flash_omni — un componente dedicato il cui unico compito è guardare i caratteri che hai chiesto di renderizzare, non l'immagine che hai chiesto. Questo è il tipo di dettaglio che puoi trovare solo leggendo il codice, ed è esattamente il dettaglio che Qwen-Image 3.0 — il modello di immagini chiuso e ospitato del fornitore, rilasciato il 21 luglio 2026 e portato alla disponibilità generale il 5 agosto — non lascia leggere a nessuno. Entrambi i modelli sono pensati per il lavoro di design, dove la parte difficile è il testo leggibile. Solo uno dei due ti dirà come lo fa.
Cosa dice ciascuno di loro sul testo
La storia del rendering del testo di Qwen-Image 3.0 è interamente un'affermazione di lancio, e sulla carta è una buona affermazione. Il materiale di Alibaba descrive prompt fino a circa 4.500 token, testo leggibile fino a circa 10 pixel, copertura di 12 lingue su più di 20 font, output fino a 2048×2048 e fino a sei immagini per chiamata, offerto in edizioni Pro e Standard tramite un'unica API ospitata. Non esiste alcun rilascio di pesi, nessuna licenza dichiarata, nessuna model card, nessun rapporto tecnico e nessuna tabella di benchmark pubblicata con cui verificare una qualsiasi di queste affermazioni. La cifra di ~20B parametri MMDiT, ampiamente ripetuta, è riportata anziché confermata.
La storia di Ming-Image-0.1-Design è un repository. 6.154.901.056 parametri, licenza MIT, con diffusers come tag di pipeline, tutti i pesi in BF16 safetensors, circa 71,5 GB tra connector/, mllm/, mlp/, scheduler/, transformer/ e vae/. L'inferenza consigliata è 2048×2048 a 12 passaggi di campionamento con guidance a 1.0 su una GPU CUDA da 80 GiB, oppure 1024 per la velocità, con vLLM-Omni indicato per il deployment e un modello vision-language separato indicato per il miglioramento del prompt. La scheda lo descrive come un modello da testo a immagine per UI, infografiche, poster e altre grafiche ricche di testo, con output RGBA per sfondi trasparenti.
Quei due paragrafi non sono lo stesso tipo di affermazione, e vale la pena essere schietti sul perché. Uno è una descrizione di un prodotto scritta da chi lo vende. L'altro è una descrizione di un artefatto che chiunque può scaricare e verificare.
Il codificatore di glifi è la parte che spiega la categoria.
Il rendering del testo nei modelli di immagini di solito fallisce in un modo specifico: il modello genera qualcosa che sembra scrittura senza essere scrittura. Le forme delle lettere sono plausibili e la parola è sbagliata. La ragione è architettonica prima di ogni altra cosa — la maggior parte dei modelli di immagini non ha alcun componente che veda i caratteri come caratteri, quindi la tipografia viene ricostruita dalle statistiche visive allo stesso modo in cui viene ricostruita l'erba.
Il commit di vLLM-Omni è interessante proprio perché punta a questo. I file aggiunti — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py e un processore di input di stadio — descrivono un percorso in cui un encoder byte-level ByT5 legge il testo che dovrebbe apparire nell'immagine, il vocabolario del tokenizer viene esteso con marcatori di font e colore, e le feature risultanti vengono accodate lungo la dimensione della sequenza con il lato negativo che riceve zeri. Quest'ultimo dettaglio è l'indizio che si tratta di una vera scelta progettuale e non di semplice impalcatura: se il ramo negativo portasse le stesse feature di glifo, il classifier-free guidance sarebbe trascinato verso il rendering del testo e allontanato dal prompt, quindi gli zeri esistono per impedire che i due obiettivi si combattano. L'encoder si carica solo quando il checkpoint contiene effettivamente una sottocartella byte5/.
Due note di onestà. Questo è un commit di un framework di inferenza di terze parti, non una dichiarazione di Ant Group, e l'interpretazione di ciò che quei file significano è nostra, non del fornitore. E corrobora un'intenzione progettuale, non un risultato: la presenza di un codificatore di glifi è coerente con un buon rendering del testo, e non è prova che il rendering del testo sia buono. L'unica prova indipendente di qualità è una singola posizione in classifica, discussa di seguito.

Il contrasto con Qwen-Image 3.0 non sta nel fatto che il modello di Alibaba renda male il testo — nessuno al di fuori di Alibaba può dire quanto bene renda il testo, ed è proprio questo il punto. Sta nel fatto che la domanda "come disegna le lettere questo modello" ha una risposta per uno di questi modelli e un'affermazione di marketing per l'altro, e lo scarto tra una risposta e un'affermazione è il punto in cui si prendono le decisioni di ingegneria.
L'unico numero, e il tabellone su cui non compare.
Ming-Image-0.1-Design è primo nella classifica Artificial Analysis Text to Image Leaderboard per UI/UX Design, vista open-weights, con un Elo di 1.082 — davanti a Ideogram 4.0 (Quality) a 1.052, Ideogram 4.0 a 1.015, HunyuanImage 3.0 Instruct a 1.005, FLUX.2 [dev] a 1.000, FLUX.2 [dev] Flash a 999 e FLUX.2 [dev] Turbo a 994. La copia di quella classifica è quella riprodotta sulla scheda del modello stesso, e reca il branding di Artificial Analysis; nessuno ha riprodotto il punteggio in modo indipendente.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
È una classifica open-weights, quindi Qwen-Image 3.0 non ha una voce e la sua assenza non dice nulla sulla sua qualità. Quello che dice è strutturale: una classifica basata su preferenze cieche può classificare solo i modelli i cui pesi sono pubblici. Questo dà a un rilascio aperto una posizione misurabile mesi prima che abbia un prodotto, e dà a un rilascio chiuso un numero di marketing e nulla più. Le dichiarazioni di Qwen-Image 3.0 — leggibilità a 10 pixel, prompt da 4.500 token, oltre 20 font — non hanno alcuna misurazione indipendente alle spalle.

Come lo testeresti davvero e quanto costa provarlo
Se un carattere leggibile è il motivo per cui stai leggendo questo, il test non è una classifica. È il tuo carattere, la tua lingua e le tue stringhe, fatti passare attraverso entrambi i candidati e letti da una persona. Quel test richiede che uno di questi modelli sia raggiungibile ed economico, e che l'altro sia scaricabile, e hanno prezzi basati su principi opposti.
• Qwen-Image 3.0 — circa 0,04 $ per immagine nell'edizione Pro e circa 0,03 $ su Standard, con prezzi al consumo sul mercato interno che partono da circa 0,18 ¥ per immagine. Si tratta di cifre di lancio e non sono state verificate. Puoi eseguire una matrice di prompt questo pomeriggio e pagare a chiamata.
• Ming-Image-0.1-Design — nessun prezzo pubblicato, perché non esiste un endpoint ospitato. Il costo è un download di 71,5 GB, una scheda da 80 GiB e il tuo tempo, e il vantaggio è che puoi puntare lo stesso test al percorso dell'encoder di glifi e vedere se è il componente a svolgere il lavoro.
Questa è la situazione per cui è costruito un livello di routing, e vale la pena essere precisi su quale parte di essa si applichi. Né Qwen-Image 3.0 né Ming-Image-0.1-Design sono sulla nostra piattaforma, quindi un livello di routing non può mettere oggi nessuno dei due dietro una chiave. Quello che può fare è mantenere onesto il confronto mentre lo esegui: OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, al prezzo di listino del provider e senza alcun ricarico, con failover automatico tra i provider, così il modello di cui ti fidi già può mantenere il percorso di produzione — e il suo costo resta legato al prezzo di listino del provider, così una variazione delle tariffe del fornitore ricade sulla nostra parte lo stesso giorno — mentre un modello di design non ancora misurato viene valutato accanto ad esso, non davanti ad esso.
Due release aperte, una chiusa e un pattern
Vale la pena notare di che cosa sia prova il rilascio di Ming, al di là di sé stesso. Ant Group ha pubblicato un modello di progettazione da 6,15 miliardi di parametri con licenza MIT, senza alcun annuncio, insieme a un secondo modello per la scomposizione in livelli con la stessa licenza. Alibaba ha pubblicato un modello ospitato chiuso, senza licenza, senza scheda e senza report, destinato alla stessa classe di attività, con tariffazione per immagine.
Quelle sono due scommesse diverse su dove risiede il valore nei modelli di design. Una dice che il modello è il prodotto e i pesi sono il canale di distribuzione. L’altra dice che il modello è un servizio e i pesi sono la cosa che ti tieni. Entrambe le scommesse possono essere giuste nello stesso mercato, e producono risposte molto diverse all’unica domanda che conta al momento della valutazione: posso scoprire come funziona prima di dipenderne?
• Se hai bisogno di sapere come viene renderizzato il testo, e perché a volte non lo è — Ming-Image-0.1-Design è l'unico dei due che ti permette di guardare, e la licenza MIT significa che puoi agire su ciò che scopri.
• Se oggi hai bisogno di un endpoint di produzione con un prezzo per immagine e senza infrastruttura — Qwen-Image 3.0 è l'unico dei due che ne offre uno, e il suo funzionamento interno fa parte del prezzo.
• Se hai bisogno di prove indipendenti prima di impegnarti, nessuno dei due ne ha abbastanza. Uno ha una singola posizione in classifica non riprodotta; l'altro ha un foglio di dichiarazioni del fornitore senza numeri a corredo.
Da tenere d'occhio è se lo schema regge. Un rilascio MIT non annunciato con al suo interno un codificatore di glifi è una dichiarazione su come i suoi autori si aspettano che il modello venga usato — ispezionato, eseguito localmente, modificato. Se il prossimo rilascio dello stesso team viene annunciato, sottoposto a benchmark e ospitato, quello era un caso isolato. Se è un altro repository silenzioso, la categoria dei design-model ha un secondo concorrente open al suo interno, e la metà chiusa del mercato ha un problema di prezzo che non aveva a luglio.
