
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6.100 voti in cieco contro zero
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Uno di questi due modelli è stato classificato attraverso circa 6.100 confronti umani in cieco. L'altro non è stato classificato da nessuno al di fuori del proprio laboratorio. MAI-Image-2.5-Pro, il modello di immagini premium di Microsoft, si trova al primo posto nell'arena di image editing di Artificial Analysis con un Elo di 1.272 — il risultato con il maggior numero di voti della categoria. Qwen-Image 2.1, che il team di Qwen-Image ha reso open source il 20 settembre 2026, non ha alcun punteggio indipendente, e non ne avrà fino a quando non ci saranno abbastanza persone a eseguirlo pubblicamente da generare voti. Questo divario è il vero oggetto di questo confronto, perché è l'unica differenza tra i due modelli che non sia una dichiarazione del fornitore. Tutto il resto — l'architettura, la risoluzione, il prezzo — è conoscibile ma non dimostrato, e i due modelli sono abbastanza vicini sulla carta che è il divario di misurazione a dover guidare la decisione.
Cosa dicono effettivamente i voti, e cosa non dicono
Artificial Analysis esegue confronti a coppie in cieco: due modelli ricevono lo stesso prompt, chi vota sceglie l'output migliore, e l'Elo deriva dai risultati. Non è uno strumento perfetto, ma è la cosa più vicina che questa categoria abbia a un tabellone condiviso, e la dimensione del campione conta tanto quanto il numero.
• MAI-Image-2.5-Pro — n. 1 nella modifica delle immagini con Elo 1.272 su circa 6.100 confronti. Nel text-to-image si posiziona al n. 7 con Elo 1.292, dietro GPT Image 2 (high) a 1.369, Reve 2.1 a 1.322, Nano Banana 2 a 1.320, GPT Image 1.5 (high) a 1.310 e MAI-Image-2.5 a 1.304.
• Qwen-Image 2.1 — nessuna voce in nessuna delle due classifiche. Non un punteggio basso; nessun punteggio. Al momento della stesura, il rilascio ha un giorno di vita.
La forma di quei numeri merita di essere letta con attenzione, perché non è la forma che il marketing lascia intendere. Il modello di Microsoft è davvero primo nella modifica e davvero settimo nella generazione. Questa è una posizione specifica e difendibile — uno specialista della modifica che guida la sua categoria — ed è una cosa diversa dall'essere il miglior modello di immagini, cosa che non è. Nel frattempo, il modello che lo batte sul text-to-image è GPT Image 2 (high), che non è nemmeno il modello OpenAI più recente in questo campo. Le classifiche indipendenti premiano il modello che è stato misurato di più, e in questo confronto è inequivocabilmente quello di Microsoft.
L'unica specifica in cui il modello aperto vince nettamente
C'è una differenza concreta e non soggettiva tra questi due, ed è la risoluzione.
• Qwen-Image 2.1genera nativamente a 2K, con 2048×2048 come default documentato a 40 passaggi di inferenza, sette preset di proporzioni e output RGBA con un vero canale alfa anziché un matte.
• MAI-Image-2.5-Pro limita l'output a 1.048.576 pixel — circa un megapixel. I suoi numeri di specifica principali sono altrove: 32.000 token di input di testo, una finestra di contesto di 131k e 4.096 token di output, il che è un'affermazione su quanta istruzione può assorbire, non su quanta immagine può emettere.
Per gran parte del lavoro social e di prodotto, un limite di un megapixel non è un vincolo. Per la stampa, per la composizione in grande formato, per qualsiasi cosa in cui un ritaglio debba reggere, lo è. Questa è l'unica dimensione nell'intera comparazione in cui puoi indicare un numero e dire che il modello aperto è avanti — e nota che si tratta di un fatto architetturale tratto dalla scheda del modello, non di un'affermazione sulla qualità. Qwen-Image 2.1 renderizzerà a 2048×2048 che renderizzi o meno qualcosa che valga la pena guardare.
Il prezzo, che è il punto in cui il confronto diventa scomodo
MAI-Image-2.5-Pro ha un prezzo da modello premium e i numeri non sono affatto modesti: 5 $ per milione di token di input di testo, 8 $ per milione di token di input di immagini e 106 $ per milione di token di output di immagini. Con un output a 1024 pixel, si traduce in circa 108,50 $ per mille immagini. Per dare un’idea della scala, si tratta di circa 2,3 volte il costo di MAI-Image-2.5 e all’incirca 5,4 volte quello di MAI-Image-2.5-Flash, quindi Microsoft ha deliberatamente segmentato la propria linea invece di posizionare il livello Pro come un semplice aggiornamento incrementale.
Qwen-Image 2.1 non ha un prezzo in hosting, perché non esiste un endpoint ospitato: è un download di pesi con licenza di ricerca. Il suo costo è il tempo della tua GPU, e il suo vincolo è che non puoi vendere legalmente ciò che produce. Confrontare 108,50 $ per mille immagini con "pesi gratuiti" significa confrontare un servizio con una macchina, e la versione onesta di quel confronto è: il prezzo a consumo ti compra un modello misurato, supportato e con licenza commerciale, mentre i pesi ti comprano un download da 33 GB e un file di licenza che dice solo uso non commerciale.
Quel compromesso è esattamente il punto in cui un livello di routing si guadagna il suo posto. OrcaRouter mette davanti oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, al prezzo di listino del provider e senza alcun ricarico, con failover automatico tra i provider — così un team che vuole valutare un modello open non ancora misurato non deve per forza spostare la produzione su di esso per farlo, e poiché il prezzo di listino viene trasferito così com'è, qualsiasi variazione di prezzo di un fornitore su un modello instradato arriva dalla nostra parte lo stesso giorno, anziché al rinnovo contrattuale successivo. Né MAI-Image-2.5-Pro né Qwen-Image 2.1 figura tra i modelli che instradiamo oggi, e questo articolo non intende suggerire il contrario. La linea di immagini che mettiamo davanti è la famiglia GPT-Image di OpenAI, i livelli di Imagen 4 di Google e le anteprime immagine di Gemini, e l'endpoint immagini Grok Imagine di xAI.

Dove si collocano le dichiarazioni dei fornitori, e quanto peso attribuire loro
Entrambi i fornitori pubblicano numeri che nessuna terza parte ha riprodotto, e vanno letti con lo stesso scetticismo in entrambe le direzioni.
• Le dichiarazioni di Microsoft — accuratezza di rendering del testo del 96,8% in inglese, cinese, giapponese, coreano e spagnolo; aderenza ai prompt superiore del 27% rispetto a GPT-Image-1.5; coerenza dei personaggi su più immagini del 94%; e costi GPU inferiori fino all'84–89% in specifici scenari interni a Microsoft. E proprio su quest'ultima bisogna essere cauti: descrive la configurazione di erogazione di Microsoft stessa, non qualcosa che un cliente possa verificare.
• Le dichiarazioni di Alibaba — il post del blog su Qwen-Image 2.1 contiene un grafico comparativo di Qwen-Image-Bench, e i numeri che vi compaiono sono quelli forniti dallo stesso venditore. Circola inoltre una cifra in resoconti di terze parti che descrive il modello come un transformer a 20 layer, il che contraddice i 32 layer del DiT single-stream riportati nella model card; la model card è la fonte primaria e la cifra di 32 layer è quella da usare.
La differenza tra le due situazioni non sta nell'onestà di nessuno dei due fornitori. Sta nel fatto che il modello di Microsoft è stato misurato in modo indipendente, mentre quello di Alibaba no, quindi le affermazioni di Microsoft possono essere verificate rispetto a qualcosa, mentre quelle di Alibaba non possono ancora essere verificate rispetto a nulla.
A cosa serve ciascuno
Letti insieme, questi non competono per lo stesso spazio.
• MAI-Image-2.5-Pro è lo strumento di editing. Guida la classifica dell'editing su un'ampia base di voti, accetta un'istruzione lunga (32k token di input testuale, 131k di contesto), è concesso in licenza commerciale ed è disponibile ora come anteprima pubblica su Microsoft Foundry e nel MAI Playground. Se il tuo lavoro è la correzione iterativa delle immagini e devi sapere prima di impegnarti che è il migliore disponibile in quel compito, questa è la risposta misurata, e costa circa $108,50 per mille immagini.
• Qwen-Image 2.1 è l'artefatto di ricerca aperto. Genera immagini più grandi, viene distribuito insieme al modello di immagini con un checkpoint ispezionabile di riscrittura dei prompt, accetta fino a 10 immagini di riferimento con modifiche locali tramite cerchio, annotazione dipinta o maschera, ed è gratuito da scaricare mentre la vendita è illegale. Se il tuo lavoro è la valutazione, il benchmarking o la costruzione su pesi che puoi leggere, è l'oggetto più interessante — e stai svolgendo quel lavoro senza una classifica che ti dica se vale qualcosa.
C'è anche un'asimmetria temporale che vale la pena menzionare. MAI-Image-2.6 è entrato in anteprima privata il 19 agosto 2026, il che significa che il modello in cima alla classifica di editing è già una generazione indietro rispetto a ciò che Microsoft si prepara a rilasciare. Qwen-Image 2.1, al contrario, è al primo giorno, con un programma di accesso anticipato che ha chiesto ai suoi tester di pubblicare entro il 29 settembre. Entrambe le classifiche in questo confronto appariranno diverse entro un mese.


Cosa lo risolverebbe
Una cosa: Qwen-Image 2.1 che compare in una classifica. Tutto ciò che in questo articolo non è il limite di risoluzione o il prezzo è un'affermazione di un laboratorio o dell'altro, e l'intera ragione per cui MAI-Image-2.5-Pro può essere raccomandato con la faccia seria è che 6.100 persone che non lavoravano per Microsoft hanno guardato il suo output accanto a qualcos'altro e l'hanno preferito. Questo è lo standard che il modello aperto non ha raggiunto, e lo standard a cui dovrebbe essere tenuto.
Fino ad allora, la lettura pratica è semplice. Se oggi ti serve un modello di editing, sotto licenza commerciale, con una classifica alle spalle, la risposta è quella di Microsoft e costa circa 108,50 $ per mille immagini. Se vuoi scoprire se un modello open-weights da 7B con output nativo 2K e un riscrittore di prompt ispezionabile sia migliore, devi fare tu stesso la misurazione — e la cosa più utile che puoi fare con il risultato è pubblicarlo, perché all'intera categoria attualmente manca un punto dati.
