Scheda hero per il confronto tra Qwen-Image 2.1, un modello a pesi aperti senza punteggio indipendente, e MAI-Image-2.5-Pro, il leader misurato dell'arena di image editing di Artificial Analysis con Elo 1.272
Guides & Insights

Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6.100 voti in cieco contro zero

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Uno di questi due modelli è stato classificato attraverso circa 6.100 confronti umani in cieco. L'altro non è stato classificato da nessuno al di fuori del proprio laboratorio. MAI-Image-2.5-Pro, il modello di immagini premium di Microsoft, si trova al primo posto nell'arena di image editing di Artificial Analysis con un Elo di 1.272 — il risultato con il maggior numero di voti della categoria. Qwen-Image 2.1, che il team di Qwen-Image ha reso open source il 20 settembre 2026, non ha alcun punteggio indipendente, e non ne avrà fino a quando non ci saranno abbastanza persone a eseguirlo pubblicamente da generare voti. Questo divario è il vero oggetto di questo confronto, perché è l'unica differenza tra i due modelli che non sia una dichiarazione del fornitore. Tutto il resto — l'architettura, la risoluzione, il prezzo — è conoscibile ma non dimostrato, e i due modelli sono abbastanza vicini sulla carta che è il divario di misurazione a dover guidare la decisione.

Cosa dicono effettivamente i voti, e cosa non dicono

Artificial Analysis esegue confronti a coppie in cieco: due modelli ricevono lo stesso prompt, chi vota sceglie l'output migliore, e l'Elo deriva dai risultati. Non è uno strumento perfetto, ma è la cosa più vicina che questa categoria abbia a un tabellone condiviso, e la dimensione del campione conta tanto quanto il numero.

MAI-Image-2.5-Pro — n. 1 nella modifica delle immagini con Elo 1.272 su circa 6.100 confronti. Nel text-to-image si posiziona al n. 7 con Elo 1.292, dietro GPT Image 2 (high) a 1.369, Reve 2.1 a 1.322, Nano Banana 2 a 1.320, GPT Image 1.5 (high) a 1.310 e MAI-Image-2.5 a 1.304.

Qwen-Image 2.1 — nessuna voce in nessuna delle due classifiche. Non un punteggio basso; nessun punteggio. Al momento della stesura, il rilascio ha un giorno di vita.

La forma di quei numeri merita di essere letta con attenzione, perché non è la forma che il marketing lascia intendere. Il modello di Microsoft è davvero primo nella modifica e davvero settimo nella generazione. Questa è una posizione specifica e difendibile — uno specialista della modifica che guida la sua categoria — ed è una cosa diversa dall'essere il miglior modello di immagini, cosa che non è. Nel frattempo, il modello che lo batte sul text-to-image è GPT Image 2 (high), che non è nemmeno il modello OpenAI più recente in questo campo. Le classifiche indipendenti premiano il modello che è stato misurato di più, e in questo confronto è inequivocabilmente quello di Microsoft.

L'unica specifica in cui il modello aperto vince nettamente

C'è una differenza concreta e non soggettiva tra questi due, ed è la risoluzione.

Qwen-Image 2.1genera nativamente a 2K, con 2048×2048 come default documentato a 40 passaggi di inferenza, sette preset di proporzioni e output RGBA con un vero canale alfa anziché un matte.

MAI-Image-2.5-Pro limita l'output a 1.048.576 pixel — circa un megapixel. I suoi numeri di specifica principali sono altrove: 32.000 token di input di testo, una finestra di contesto di 131k e 4.096 token di output, il che è un'affermazione su quanta istruzione può assorbire, non su quanta immagine può emettere.

Per gran parte del lavoro social e di prodotto, un limite di un megapixel non è un vincolo. Per la stampa, per la composizione in grande formato, per qualsiasi cosa in cui un ritaglio debba reggere, lo è. Questa è l'unica dimensione nell'intera comparazione in cui puoi indicare un numero e dire che il modello aperto è avanti — e nota che si tratta di un fatto architetturale tratto dalla scheda del modello, non di un'affermazione sulla qualità. Qwen-Image 2.1 renderizzerà a 2048×2048 che renderizzi o meno qualcosa che valga la pena guardare.

Il prezzo, che è il punto in cui il confronto diventa scomodo

MAI-Image-2.5-Pro ha un prezzo da modello premium e i numeri non sono affatto modesti: 5 $ per milione di token di input di testo, 8 $ per milione di token di input di immagini e 106 $ per milione di token di output di immagini. Con un output a 1024 pixel, si traduce in circa 108,50 $ per mille immagini. Per dare un’idea della scala, si tratta di circa 2,3 volte il costo di MAI-Image-2.5 e all’incirca 5,4 volte quello di MAI-Image-2.5-Flash, quindi Microsoft ha deliberatamente segmentato la propria linea invece di posizionare il livello Pro come un semplice aggiornamento incrementale.

Qwen-Image 2.1 non ha un prezzo in hosting, perché non esiste un endpoint ospitato: è un download di pesi con licenza di ricerca. Il suo costo è il tempo della tua GPU, e il suo vincolo è che non puoi vendere legalmente ciò che produce. Confrontare 108,50 $ per mille immagini con "pesi gratuiti" significa confrontare un servizio con una macchina, e la versione onesta di quel confronto è: il prezzo a consumo ti compra un modello misurato, supportato e con licenza commerciale, mentre i pesi ti comprano un download da 33 GB e un file di licenza che dice solo uso non commerciale.

Quel compromesso è esattamente il punto in cui un livello di routing si guadagna il suo posto. OrcaRouter mette davanti oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, al prezzo di listino del provider e senza alcun ricarico, con failover automatico tra i provider — così un team che vuole valutare un modello open non ancora misurato non deve per forza spostare la produzione su di esso per farlo, e poiché il prezzo di listino viene trasferito così com'è, qualsiasi variazione di prezzo di un fornitore su un modello instradato arriva dalla nostra parte lo stesso giorno, anziché al rinnovo contrattuale successivo. Né MAI-Image-2.5-Pro né Qwen-Image 2.1 figura tra i modelli che instradiamo oggi, e questo articolo non intende suggerire il contrario. La linea di immagini che mettiamo davanti è la famiglia GPT-Image di OpenAI, i livelli di Imagen 4 di Google e le anteprime immagine di Gemini, e l'endpoint immagini Grok Imagine di xAI.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Dove si collocano le dichiarazioni dei fornitori, e quanto peso attribuire loro

Entrambi i fornitori pubblicano numeri che nessuna terza parte ha riprodotto, e vanno letti con lo stesso scetticismo in entrambe le direzioni.

Le dichiarazioni di Microsoft — accuratezza di rendering del testo del 96,8% in inglese, cinese, giapponese, coreano e spagnolo; aderenza ai prompt superiore del 27% rispetto a GPT-Image-1.5; coerenza dei personaggi su più immagini del 94%; e costi GPU inferiori fino all'84–89% in specifici scenari interni a Microsoft. E proprio su quest'ultima bisogna essere cauti: descrive la configurazione di erogazione di Microsoft stessa, non qualcosa che un cliente possa verificare.

Le dichiarazioni di Alibaba — il post del blog su Qwen-Image 2.1 contiene un grafico comparativo di Qwen-Image-Bench, e i numeri che vi compaiono sono quelli forniti dallo stesso venditore. Circola inoltre una cifra in resoconti di terze parti che descrive il modello come un transformer a 20 layer, il che contraddice i 32 layer del DiT single-stream riportati nella model card; la model card è la fonte primaria e la cifra di 32 layer è quella da usare.

La differenza tra le due situazioni non sta nell'onestà di nessuno dei due fornitori. Sta nel fatto che il modello di Microsoft è stato misurato in modo indipendente, mentre quello di Alibaba no, quindi le affermazioni di Microsoft possono essere verificate rispetto a qualcosa, mentre quelle di Alibaba non possono ancora essere verificate rispetto a nulla.

A cosa serve ciascuno

Letti insieme, questi non competono per lo stesso spazio.

MAI-Image-2.5-Pro è lo strumento di editing. Guida la classifica dell'editing su un'ampia base di voti, accetta un'istruzione lunga (32k token di input testuale, 131k di contesto), è concesso in licenza commerciale ed è disponibile ora come anteprima pubblica su Microsoft Foundry e nel MAI Playground. Se il tuo lavoro è la correzione iterativa delle immagini e devi sapere prima di impegnarti che è il migliore disponibile in quel compito, questa è la risposta misurata, e costa circa $108,50 per mille immagini.

Qwen-Image 2.1 è l'artefatto di ricerca aperto. Genera immagini più grandi, viene distribuito insieme al modello di immagini con un checkpoint ispezionabile di riscrittura dei prompt, accetta fino a 10 immagini di riferimento con modifiche locali tramite cerchio, annotazione dipinta o maschera, ed è gratuito da scaricare mentre la vendita è illegale. Se il tuo lavoro è la valutazione, il benchmarking o la costruzione su pesi che puoi leggere, è l'oggetto più interessante — e stai svolgendo quel lavoro senza una classifica che ti dica se vale qualcosa.

C'è anche un'asimmetria temporale che vale la pena menzionare. MAI-Image-2.6 è entrato in anteprima privata il 19 agosto 2026, il che significa che il modello in cima alla classifica di editing è già una generazione indietro rispetto a ciò che Microsoft si prepara a rilasciare. Qwen-Image 2.1, al contrario, è al primo giorno, con un programma di accesso anticipato che ha chiesto ai suoi tester di pubblicare entro il 29 settembre. Entrambe le classifiche in questo confronto appariranno diverse entro un mese.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Cosa lo risolverebbe

Una cosa: Qwen-Image 2.1 che compare in una classifica. Tutto ciò che in questo articolo non è il limite di risoluzione o il prezzo è un'affermazione di un laboratorio o dell'altro, e l'intera ragione per cui MAI-Image-2.5-Pro può essere raccomandato con la faccia seria è che 6.100 persone che non lavoravano per Microsoft hanno guardato il suo output accanto a qualcos'altro e l'hanno preferito. Questo è lo standard che il modello aperto non ha raggiunto, e lo standard a cui dovrebbe essere tenuto.

Fino ad allora, la lettura pratica è semplice. Se oggi ti serve un modello di editing, sotto licenza commerciale, con una classifica alle spalle, la risposta è quella di Microsoft e costa circa 108,50 $ per mille immagini. Se vuoi scoprire se un modello open-weights da 7B con output nativo 2K e un riscrittore di prompt ispezionabile sia migliore, devi fare tu stesso la misurazione — e la cosa più utile che puoi fare con il risultato è pubblicarlo, perché all'intera categoria attualmente manca un punto dati.