Scheda del titolo per un confronto tra Ming-Image-0.1-Design e Qwen-Image 2.1, con sottotitolo che la licenza e il costo dell'hardware decidono la scelta, con una scheda che riporta licenza più flessibile e l'altra licenza più restrittiva.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 2.1: La licenza è la vera differenza

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli di immagini open sono arrivati a tre giorni di distanza l'uno dall'altro nel settembre 2026 e, letti su una scheda tecnica, sembrano lo stesso acquisto. Ming-Image-0.1-Design, sviluppato dal team inclusionAI di Ant Group, ha pubblicato i suoi pesi su Hugging Face il 17 settembre con licenza MIT. Qwen-Image 2.1, del team Qwen di Alibaba, è seguito il 20 settembre con il Qwen Research License Agreement. Entrambi emettono RGBA nativo, entrambi dichiarano un output 2K e entrambi si rivolgono allo stesso acquirente: un team che vuole una generazione di immagini che possa ospitare, ispezionare e modificare in autonomia. Le due cose che li distinguono davvero sono le due che una scheda tecnica mostra peggio: ciò che ti è legalmente consentito fare con il risultato e quanto silicio serve per produrne uno.

Non è una cornice retorica. Per uno di questi modelli la licenza è un blocco netto all’uso commerciale; per l’altro è un non-problema. E il numero di parametri che ciascun fornitore stampa sulla confezione sottostima il download di un fattore tre o quattro. Questi due fatti decidono l’acquisto molto prima di qualunque benchmark — e i benchmark, guarda caso, non sono affatto confrontabili.

Cosa contiene effettivamente ciascun repository

Nessuno dei due modelli è una singola rete. Entrambi sono pipeline, ed è nella pipeline che risiede la dimensione:

• Generatore — Ming-Image-0.1-Design include un transformer per il design da 6,15 miliardi di parametri (12,31 GB in BF16); Qwen-Image 2.1 include un DiT single-stream da 7,1 miliardi con 32 livelli, attenzione block-causal e un numero non divulgato di parametri attivi (circa 14,2 GB).

• Lato testo — Ming-Image-0.1-Design abbina il suo transformer a un LLM multimodale da 17,01B (34,02 GB) e a un connettore da 3,09B (6,17 GB); Qwen-Image 2.1 utilizza un encoder di testo Qwen3-VL 8B (circa 17,5 GB).

• Parametri totali — 26,44B per Ming-Image-0.1-Design rispetto a circa 15–16B per Qwen-Image 2.1. Nota che nessuno dei numeri principali dei due fornitori costituisce il totale: "6B" e "7B" descrivono entrambi solo il generatore.

• Dimensione del repository — 52,88 GB per Ming-Image-0.1-Design (49,25 GiB di cui pesi); circa 33 GB per Qwen-Image 2.1.

• Trasparenza — entrambi producono RGBA nativo direttamente dal modello anziché tramite un passaggio di matting post-hoc. Ming-Image-0.1-Design usa il proprio VAE RGBA; Qwen-Image 2.1 usa un VAE RGBA a 64 canali con compressione spaziale 16×.

• Generazione predefinita — Ming-Image-0.1-Design è validato a 2048×2048, 12 passaggi, BF16, CFG 1.0; Qwen-Image 2.1 usa per impostazione predefinita 2048×2048 su 40 passaggi con sette preset di proporzioni.

• Licenza — MIT per Ming-Image-0.1-Design; il Qwen Research License Agreement, non commerciale, per Qwen-Image 2.1.

L'etichetta "6B" sta facendo un sacco di lavoro

Il repository di Ant Group è intitolato a un modello da 6 miliardi di parametri, e il transformer in realtà è da 6,15 miliardi. Ma i pesi che scarichi sono 49,25 GiB, il repository è di 52,88 GB, e la configurazione convalidata dal fornitore — 2048×2048 in BF16 con l'intero stack di testo residente — è specificata per una sola GPU CUDA da 80 GiB. Non è un errore di arrotondamento su una scheda da 48 GB; è una scheda che non puoi usare. Un acceleratore da 48 GB non conterrà la pipeline, e non ci riusciranno nemmeno due di essi senza acrobazie di offload che il fornitore non documenta.

Qwen-Image 2.1 è il download più indulgente, con l'avvertenza che Alibaba non pubblica nessun dato ufficiale sulla VRAM. L'unica indicazione della scheda del modello è di abilitare l'offload su CPU sulle schede più piccole. Ciò che è stato misurato dal lancio è più utile di ciò che è stato pubblicato: una pipeline int8 viene eseguita in circa 16 GiB in totale ed entra completamente residente in una scheda da 24 GB, mentre per un'esecuzione completa in BF16 sono stati segnalati valori da circa 17 GB con offload su CPU fino a un picco di circa 40 GiB a 1024×1024, a seconda di come viene posizionato il text encoder. La latenza segnalata per singola immagine varia da pochi secondi su una B200 a meno di dieci su una scheda workstation attuale. Considera ognuno di questi numeri come una misurazione della community anziché una specifica: variano con la strategia di offload più di quanto i modelli differiscano tra loro.

Il riepilogo pratico: Qwen-Image 2.1 è un modello di classe 3090 se sei disposto a fare offload; Ming-Image-0.1-Design è un modello di classe datacenter senza configurazioni più piccole.

La licenza è il bivio.

Questa è la parte che fermerà davvero un progetto, ed è la parte che le due release trattano in modo più diverso.

Ming-Image-0.1-Design è MIT. Inseriscilo in un prodotto a pagamento, esegui il fine-tuning, ridistribuisci i pesi, mantieni chiuse le tue modifiche — nulla di tutto ciò richiede una conversazione con Ant Group.

Qwen-Image 2.1 non lo è. È coperto dall'Accordo di licenza Qwen Research datato 20 settembre 2026, che concede in licenza i pesi solo per ricerca e valutazione. L'uso commerciale richiede un accordo separato con Alibaba, e non è pubblicato alcun prezzo per tale accordo. Le opere derivate e le ridistribuzioni devono riportare la licenza, un avviso "Realizzato con Qwen" o "Migliorato usando Qwen" e la riga di copyright di Hangzhou Tongyi Laboratory, e "Qwen" non può essere il nome principale di un modello derivato. La licenza è disciplinata dal diritto cinese con giurisdizione a Hangzhou.

C'è un punto davvero chiarificatore nel seguito fornito direttamente dal fornitore: Alibaba ha dichiarato che le immagini generate non fanno parte dei "Materiali" concessi in licenza, quindi conservi i diritti su ciò che il modello produce. La restrizione si applica ai pesi e al modello, non al tuo output. Si tratta di un'eccezione significativa e vale la pena leggerla con precisione, perché la sintesi facile — "le immagini sono tue, il modello no" — è quella corretta.

È anche un cambio di rotta. I rilasci precedenti di Qwen-Image, inclusi l'originale Qwen-Image e le build 2511 e 2512, restano Apache 2.0 e permissivi per l'uso commerciale. Un team che l'anno scorso ha scelto Qwen-Image per la sua licenza e questo mese esegue l'aggiornamento alla 2.1 eredita una restrizione solo per ricerca che non aveva mai accettato. Se i termini permissivi sono il requisito, Qwen-Image 2.1 non è la versione più recente di ciò che avevate — è un accordo diverso.

Per che cosa è progettato ciascuno

La divisione delle licenze rispecchia una differenza di intenti, ed è quella differenza che dovrebbe guidare la scelta quando entrambe sono opzioni legali per te.

Ming-Image-0.1-Design è uno strumento di progettazione. Lo stack testuale esiste per espandere un breve brief in un prompt strutturato da 8K, e il fornitore distribuisce delle "skills" attorno ad esso — una Design Skill che produce una bozza visiva in circa 15 secondi, e una PPT Skill pensata per output a forma di slide. Il suo repository complementare, Ming-Image-0.1-Design-Layer, prende un design appiattito e lo restituisce come livelli separati, che è l'unica capacità qui che nient'altro nel campo aperto offre. inclusionAI riporta che il modello Layer è circa 4,3× più veloce di un modello layer aperto da 20B sullo stesso compito (183 secondi contro 795) — dato riportato dal fornitore, non replicato, e il termine di confronto non è indicato con precisione sufficiente per verificarlo.

Qwen-Image 2.1 è un generatore e editor. Un unico checkpoint esegue sia la generazione da testo a immagine sia la modifica basata su istruzioni, accetta fino a 10 immagini di riferimento per una singola modifica e supporta modifiche locali che lasciano intatto il resto dell'inquadratura. È stato rilasciato con supporto day-zero in ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion e LightX2V — una storia di serving che Ming-Image-0.1-Design non ha ancora, poiché la sua stessa guida di serving punta a vLLM-Omni.

Leggilo come una biforcazione più che come una classifica. Se il compito è "produrre una risorsa di design stratificata e modificabile da un brief", Ming-Image-0.1-Design è l'unico dei due a farlo. Se il compito è "generare e poi modificare iterativamente rispetto a riferimenti", Qwen-Image 2.1 lo fa in un unico modello e Ming-Image-0.1-Design non lo fa affatto.

I benchmark non reggono il confronto, e questa è la risposta onesta

Entrambi i fornitori hanno dei numeri. Nessuno dei due numeri può essere collocato accanto all'altro, e qualsiasi articolo che lo faccia sta inventando un risultato.

La prova di Ming-Image-0.1-Design è una classifica di Artificial Analysis: primo posto nella Text-to-Image Leaderboard filtrata per pesi aperti per UI/UX Design, con un Elo di 1.082, davanti a Ideogram 4.0 Quality a 1.052, Ideogram 4.0 a 1.015, HunyuanImage 3.0 Instruct a 1.005 e FLUX.2 [dev] a 1.000. Il fornitore riporta inoltre tassi di vittoria del 67,4% sul layout, del 67,0% sulla composizione complessa e del 66,7% sul rendering del testo, e il primo posto in 12 metriche su Crello. La classifica è uno strumento di terze parti, il che rende l'Elo la più solida delle due tipologie di prova in questo caso; i tassi di vittoria e la sweep di Crello sono riportati dal fornitore e vanno letti come dichiarazioni.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

La prova di Qwen-Image 2.1 è Qwen-Image-Bench, un benchmark creato dal team Qwen, sul quale ottiene 60,28 e guida il campo open source, davanti a Nano Banana 2.0 con 59,82 e a GPT Image 1.5 con 59,65. Il materiale di partenza del benchmark in quanto costruito da Qwen, e i primi tre si collocano entro un punto l'uno dall'altro — un divario ben all'interno del rumore di un benchmark il cui autore è anche un concorrente.

Dunque: un Elo di terze parti su un sottoinsieme di design UI/UX, contro un punteggio generale creato dal fornitore. Strumenti diversi, compiti diversi, giudici diversi. Nessuno ha pubblicato un confronto testa a testa di questi due modelli l'uno contro l'altro, e in base alle prove disponibili nessuno può farlo. La lettura utile è limitata e va detta chiaramente — Ming-Image-0.1-Design ha una conferma di terze parti specificamente sul lavoro di design, Qwen-Image 2.1 ha una forza dichiarata dal fornitore su generazione ed editing generali, e la sovrapposizione tra queste due affermazioni è minore di quanto suggeriscano i numeri principali.

Far arrivare uno dei due su un endpoint

Nessuno dei due modelli è oggi nel catalogo di OrcaRouter. Ming-Image-0.1-Design e Qwen-Image 2.1 sono al momento entrambi proposte self-host: i pesi sono scaricabili e le guide al serving esistono davvero, ma sei tu a dover allestire la GPU, e nel caso di Ming quella GPU è da 80 GiB. Qui li elenchiamo come rilasci open-weight, non come route.

Ciò che vale la pena sapere prima di impegnare hardware è quanto costa lo stesso carico di lavoro come chiamata. I nostri modelli di immagini instradati includono google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, i tre livelli di Imagen 4.0 (fast, standard e ultra), grok/grok-imagine-image e la famiglia GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 e openai/gpt-image-2. Eseguire un brief di design con uno di questi per una settimana ti dice se l'output a livelli di Ming-Image-0.1-Design è una capacità di cui hai davvero bisogno, a una frazione del costo della scheda da 80 GiB, e lo fa prima che tu scopra se la licenza o la VRAM sarebbe stato il blocco. Quando poi sposti un modello self-hosted in un percorso di produzione, lo stesso endpoint è dove risiede il routing — una chiave per oltre 200 modelli, failover automatico tra provider e 0% di markup, così un taglio di prezzo di un fornitore è attivo dalla nostra parte lo stesso giorno in cui viene annunciato.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

Chi dovrebbe scegliere cosa

Scegli Ming-Image-0.1-Design se il deliverable è un asset di design e non un’immagine: output a livelli, espansione strutturata del prompt, generazione in formato slide e una licenza che ti consente di vendere qualunque cosa tu realizzi con esso. Prevedi un budget per una scheda seria e accetta che l’ecosistema di serving attorno ad essa è più ridotto rispetto al lato Qwen. È anche il più utile dei due se devi mettere un numero davanti a un cliente, perché la sua prova più forte è l’unico numero di terze parti in questo confronto.

Scegli Qwen-Image 2.1 se il flusso di lavoro è genera-poi-modifica, se hai bisogno del condizionamento con immagini di riferimento, o se vuoi eseguirlo su hardware che possiedi già. È più piccolo, meglio servito dal giorno zero, e la sua licenza va bene per il lavoro di ricerca e valutazione che la maggior parte delle persone fa effettivamente per prima. Diventa la scelta sbagliata nel momento in cui l'output è commerciale e la revisione legale è reale, perché l'unica via per una licenza commerciale è un accordo diretto con Alibaba e non esiste un prezzo pubblicato su cui pianificare.

Non scegliere nessuno dei due, per ora, se ciò che ti serve è la generazione di immagini in produzione questo mese. Entrambi questi sono pesi, e i pesi sono un impegno hardware e legale prima di essere una capacità. La domanda di progettazione — l'output a livelli cambia ciò che il mio team può rilasciare — può trovare risposta prima su un endpoint ospitato, ed è quella risposta a dover decidere se acquistare la scheda da 80 GiB.

Cosa guardare

Tre cose faranno pendere questa comparazione. Se Ming-Image-0.1-Design otterrà un percorso di serving al di là della sua guida vLLM-Omni, perché è proprio questo, al momento, il divario tra esso e la lista day-zero a cinque framework di Qwen-Image 2.1. Se Alibaba attribuirà un prezzo alla licenza commerciale Qwen, perché un prezzo non definito è la più grande incognita di questo confronto. E se qualcuno — un laboratorio, un valutatore indipendente o un fornitore senza nulla da perdere — metterà questi due a confronto diretto sugli stessi prompt. Finché ciò non accadrà, la cosa più vicina a un confronto equo non è affatto un punteggio. È la riga della licenza, e Ming-Image-0.1-Design vince quella senza discussione.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.