
Ming-Image-0.1-Design domina la classifica di design UI open-weights — e il numero torna.
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
L'affermazione che circola con Ming-Image-0.1-Design è che il modello 6B di inclusionAI è il miglior modello open-weights text-to-image per lavori di UI e UX, al primo posto nella vista open-weights della classifica Artificial Analysis UI/UX Design con 1.082 Elo. Gli screenshot delle classifiche dei fornitori sono di solito il tipo più debole di prova, quindi la prima cosa che vale la pena fare è leggere la classifica live. Al 24 settembre 2026 regge, con un'importante precisazione che lo screenshot non riporta: 1.082 è un sottoinsieme per caso d'uso, non la classifica, e nella classifica completa Text to Image lo stesso modello si trova al 45° posto con un Elo di 995.
Entrambi i numeri sono reali, provengono dalla stessa arena e descrivono gli stessi pesi. Ciò che li separa è su quali prompt sono stati espressi i voti.
Cosa dice effettivamente la bacheca live
Artificial Analysis esegue un'unica arena pairwise cieca e poi filtra lo stesso pool di voti in sezioni per caso d'uso. La sezione UI/UX Design è quella che conta per un modello creato per dashboard, schermate di app, poster e infografiche, ed è qui che Ming-Image-0.1-Design dà il meglio di sé:
• Classifica complessiva Text to Image — Ming-Image-0.1-Design al n. 45, Elo 995, IC 95% ±8, 21.342 campioni, inserito a settembre 2026, $30,00 per 1.000 immagini, contrassegnato come Open Weights
• Segmento UI/UX Design — Ming-Image-0.1-Design al n. 16, Elo 1.084, 2.100 campioni nel segmento
• La voce open-weights meglio posizionata in quella fascia — Ming-Image-0.1-Design; i successivi modelli open-weights dietro di essa sono Ideogram 4.0 (Quality) al #22 con 1.047, Ideogram 4.0 al #31 con 1.018, e HunyuanImage 3.0 Instruct al #40 con 1.005
• In testa alla sezione UI/UX — GPT Image 2.5 Flare (max) a 1,226, GPT Image 2.5 Sunburst (max) a 1,215, GPT Image 2 (high) a 1,204, Grok Imagine Image 2.0 a 1,183
• Rispetto allo screenshot del fornitore stesso — inclusionAI ha pubblicato 1.082 per Ming contro 1.052 di Ideogram 4.0 (Quality) e 1.000 di FLUX.2 [dev]; la sezione live ora riporta rispettivamente 1.084, 1.047 e 1.000
Quindi il titolo è accurato di per sé. Ming-Image-0.1-Design è il modello a pesi aperti con la valutazione più alta nel segmento UI/UX Design, ed è l'unico modello a pesi aperti tra i primi venti di quel segmento. È anche 142 Elo dietro il leader di quel segmento, e si trova a metà classifica quando il prompt non riguarda il design. Un modello che vince sulle dashboard e totalizza 995 nel complesso è uno specialista, non un tuttofare, e le due cifre sono contraddittorie solo se si legge una delle due come se fosse l'intera storia.
I 21.342 campioni presenti sulla classifica completa meritano di essere notati anche per ciò che non sono. Si tratta di un numero elevato di voti, motivo per cui l'intervallo di confidenza è stretto, a ±8 Elo, ma il numero di campioni non equivale all'indipendenza del metodo. L'arena si basa sulla preferenza umana cieca, quindi nessuno di inclusionAI ha scritto il punteggio — quella parte è autentica. Ciò che il punteggio misura è "quale di queste due immagini un votante ha preferito", e i votanti chiamati a giudicare uno screenshot di UI tendono a premiare testo leggibile e layout coerente. È esattamente l'asse su cui questo modello è stato addestrato.

Che cos'è Ming-Image-0.1-Design
Ming-Image-0.1-Design è un modello text-to-image di inclusionAI, il laboratorio di AI associato ad Ant Group, rilasciato con licenza MIT, con i pesi pubblicati il 17 settembre 2026 e il pacchetto di rilascio completo previsto per il 22 settembre. Genera a partire da un solo prompt — senza bisogno di un'immagine di riferimento — ed è pensato per la grafica con molto testo più che per la fotografia: mockup di UI, dashboard, infografiche, poster e qualsiasi cosa in cui il testo renderizzato debba rimanere leggibile alla dimensione con cui sarà letto.
La configurazione di inferenza documentata è specifica e insolitamente economica per passo:
• Risoluzione — 2048 x 2048 consigliata, oppure 1024 x 1024 per una generazione più veloce, con le dimensioni intermedie ricondotte a una di queste due categorie
• Passaggi di campionamento — 12
• Guida — CFG scale 1.0
• Precisione — BF16
• Hardware — una GPU CUDA con 80 GiB di VRAM, descritta come la configurazione validata
Dodici passaggi con una scala di guidance di 1.0 sono la firma di un campionatore distillato o senza guidance. È ciò che rende sostenibile un output da 2048 pixel a un numero di passaggi che la maggior parte dei modelli di diffusione non tenterebbe, ed è il motivo principale per cui questo modello è interessante per chiunque esegua la generazione di immagini su larga scala anziché un'immagine alla volta.
L'altra caratteristica strutturale è la trasparenza. Ming-Image-0.1-Design può emettere RGBA nativo, quindi uno sfondo trasparente esce dal sampler anziché da un passaggio di matting, quando il prompt inizia con una delle frasi di trasparenza documentate. Un modello complementare, Ming-Image-0.1-Design-Layer, va oltre: prende un design appiattito più un piano di livelli e restituisce PNG RGBA separati — testo, card, soggetto principale, sfondo — che si ricompongono nell'originale. Questa è la differenza tra un modello di design e un modello di immagini. Un PNG piatto è l'immagine di un layout; livelli separati sono un layout che puoi ancora modificare.
![Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.](https://cms.orcarouter.ai/api/media/file/3-1273.png)
L'etichetta 6B e il download 26B
"6B" è accurato riguardo alla parte a cui la maggior parte delle persone si riferisce ed è fuorviante riguardo alla parte che determina se puoi eseguirlo. Il diffusion transformer ha 6,15 miliardi di parametri. Il pacchetto che scarichi effettivamente è di circa 52,88 GB, perché il text encoder multimodale ha 17,01 miliardi di parametri e il connettore ne aggiunge 3,09 — circa 26 miliardi di parametri in BF16 in totale. Il transformer del modello Layer è il doppio di quello del modello base, con 12,31 miliardi, e il suo pacchetto è ancora più grande, circa 65,20 GB.
Questo è importante per due ragioni pratiche. In primo luogo, il requisito di 80 GiB di VRAM non riguarda il transformer da 6B; riguarda tutto ciò che deve risiedere insieme ad esso. In secondo luogo, qualsiasi confronto con un modello descritto come "6B" deve verificare a quale 6B ci si riferisce. Un transformer di diffusione da 6B con un text encoder da 20B è un problema di deployment molto diverso da un modello da 6B end-to-end.
La gestione dei prompt è l'altra cosa che la scheda rende esplicita invece di nasconderla: la ricetta consigliata esegue prima un passaggio di riscrittura, usando un modello visione-linguaggio per espandere un prompt breve in una descrizione strutturata del layout in stile Figma in JSON, con coordinate, gerarchia, specifiche di colore e testo letterale. Le schede modello indicano Ling-3.0-flash-VL o Qwen3.8-27B per quel compito. In altre parole, la pipeline che il fornitore valuta nei benchmark è una pipeline a due modelli. Se chiami Ming-Image-0.1-Design con un prompt di una riga e senza passaggio di riscrittura, non stai eseguendo la configurazione che ha prodotto 1.084 nella sezione UI/UX.
Dove questo lascia una pipeline di progettazione
La sintesi onesta di Ming-Image-0.1-Design è che risolve un problema specifico e costoso — generare layout densi di testo che sopravvivono all'essere guardati — e lo fa al vertice del campo open-weights sull'unica classifica che misura quel problema. Non guida la classifica generale delle immagini, non elimina la necessità di un VLM davanti ad esso e richiede una GPU seria.
Ciò che cambia è la parte centrale di un flusso di lavoro di progettazione. Se la tua pipeline attualmente genera un'immagine piatta e poi paga una persona o un modello di segmentazione per ritagliarla, un modello che emette RGBA nativamente e un compagno che emette da 2 a 9 livelli denominati eliminano una fase. Questo vale più di una colonna Elo, ed è la parte che nessuna classifica misura.
Per i team che vogliono testarlo senza impegnare infrastruttura, vale la pena essere precisi su questa distinzione. Ming-Image-0.1-Design è un download con licenza MIT, quindi gira sul vostro hardware o non gira affatto — OrcaRouter non instrada alcun modello inclusionAI di nessuna versione, e affermare il contrario sarebbe una promessa che non possiamo mantenere. Quello che un layer di routing vi offre è la superficie che lo circonda: un unico endpoint compatibile con OpenAI su oltre 200 modelli, failover automatico tra provider e prezzo di listino del provider passato senza alcun ricarico, allo 0% di markup, così una variazione di prezzo del fornitore su qualsiasi modello chiamiate è attiva dalla nostra parte lo stesso giorno. Se state allestendo una pipeline di design e volete fare un confronto A/B di questo modello con uno hosted di cui vi fidate già, quel confronto funziona con una sola chiave invece che con due contratti.

Cosa cambierebbe il quadro
Tre cose sposterebbero Ming-Image-0.1-Design da uno specialista open-weights a un default. Una prima riproduzione indipendente dei dati Crello del modello Layer — la scheda riporta un errore RGB L1 di 0.0574 e un alpha soft IoU di 0.8923 a 1024, e nessun gruppo esterno li ha eseguiti. Un endpoint ospitato che elimina il requisito di 80 GiB. E una seconda slice di caso d'uso dove il modello si posiziona bene quanto in UI/UX Design, perché un modello che vince solo su una slice di una classifica è un modello la cui generalità è ancora non dimostrata.
Fino ad allora, la frase accurata è quella ristretta: nella sezione UI/UX Design di Artificial Analysis, letta il 24 settembre 2026, Ming-Image-0.1-Design di inclusionAI è il modello text-to-image open-weights con la valutazione più alta, a 1.084 Elo su 2.100 voti — e nella classifica completa della stessa arena è al 45º posto a 995. Entrambi questi dati riguardano il modello. Nessuno dei due è un'affermazione di lancio, perché questo modello non ha avuto un lancio; ha avuto un repository.
