
MAI-Image-2.5-Pro vs Qwen-Image 3.0: Quattro volte il prezzo per un tipo diverso di testo
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
Metti MAI-Image-2.5-Pro e Qwen-Image 3.0 fianco a fianco e la prima cosa che noti è il prezzo: circa $108.50 per 1,000 immagini per il livello premium di Microsoft contro circa $25–30 per 1,000 per Qwen-Image 3.0 di Alibaba — la tariffa dichiarata da Alibaba si aggira intorno a $25, mentre la classifica di Artificial Analysis elenca $30. Più del triplo del prezzo, in entrambi i casi. Ciò che quel sovrapprezzo in realtà compra è un tipo diverso di lavoro sul testo. Qwen-Image 3.0, rilasciato dal team Qwen di Alibaba il 21 luglio 2026 e aperto a un'API internazionale il 4 agosto, grazie al prezzo si propone come il renderer di testo ad alto volume — leggibile fino a ~10px in dodici lingue, con una finestra di prompt da 4.500 token per brief complessi. MAI-Image-2.5-Pro, in anteprima pubblica su Microsoft Foundry dal 23 luglio, è l'editor più apprezzato su una classifica indipendente, con una precisione di rendering del testo dichiarata dal fornitore ma un tetto di output rigido di ~1 megapixel. Entrambi sono modelli di immagini via API incentrati sul testo; competono sul prezzo per operazione, non su un singolo punteggio di qualità.
Due storie testuali, nessuna delle due completamente verificata.
La battaglia testuale è il motivo per cui entrambi i modelli esistono, ed è anche dove le prove sono più scarse — ogni dato in questa sezione è dichiarato dal fornitore e nessuno è stato riprodotto in modo indipendente.
• Qwen-Image 3.0 — i materiali di rilascio di Alibaba affermano una resa leggibile fino a circa 10px, supporto nativo per 12 lingue con oltre 20 font e 100+ stili artistici, notazione matematica, pedici, apici e formule multilinea, oltre alla familiarità con le interfacce web, di gioco e software comuni. La finestra di prompt arriva fino a 4.500 token di input — un balzo di 4,5× rispetto alla generazione precedente — che è ciò che gli consente di assorbire contenuti densi come prime pagine di giornali o una griglia di conoscenza a nove pannelli in un'unica chiamata.
• MAI-Image-2.5-Pro — Microsoft afferma 96.8% di precisione nel rendering del testo in cinese, inglese, giapponese, coreano e spagnolo, un'aderenza al prompt superiore del 27% rispetto a GPT-Image-1.5 nelle valutazioni interne e 94% di coerenza dei personaggi tra più immagini. Le specifiche di input sono più ampie sulla carta — fino a 32,000 token di testo in input con una finestra di contesto di 131k — e l'output è limitato a 1,048,576 pixel, un equivalente di 1024×1024.
Entrambe le affermazioni non sono state riprodotte al momento in cui scriviamo. La differenza sta nella forma delle affermazioni: quella di Qwen riguarda volume e leggibilità tra i sistemi di scrittura, quella di Microsoft riguarda accuratezza e coerenza su un insieme definito di cinque lingue. Nessuno dei due fornitori ha pubblicato un benchmark che un altro laboratorio possa eseguire e verificare.
È nell'editing che vive il premium.
Ciò che distingue i due è l'editing, e questa è l'unica dimensione con prove indipendenti. MAI-Image-2.5-Pro si colloca al No. 1 nell'Artificial Analysis Image Editing Arena con un Elo di 1.272 (~6.100 voti ciechi), davanti a Reve 2.1, MAI-Image-2.5 e GPT Image 2. Nella stessa classifica, il più recente Qwen-Image-3.0-Pro si attesta a 1.249 — un punteggio competitivo, a 23 Elo di distanza, e degno di nota per un modello che ha raggiunto l'API internazionale solo questo mese.
Oltre al modello di base, il portfolio di editing di Alibaba è un insieme di trucchi specialistici piuttosto che un'unica corona: restauro di dipinti antichi, generazione di panorami, da schizzo a PPT e storyboarding multi-shot. Quella di Microsoft è una scommessa più ristretta e profonda: modifiche precise, chirurgiche, che mantengono coerente il resto dell'inquadratura (sostituzione di oggetti, modifiche al layout, aggiornamenti del testo nell'immagine, pulizia della sfocatura), la categoria di modifica in cui i modelli più vecchi rigenerano l'intera scena e perdono il soggetto. Per un flusso di lavoro che è "prendi questa risorsa esistente, cambia una cosa, pubblicala", il #1 indipendente del livello Pro è il segnale più forte; per un insieme eterogeneo di formati creativi di editing, la lista di Qwen è più ampia.

Il contrasto delle specifiche
• Prezzo — ~$108,50 per 1.000 immagini (1024×1024, conversione AA) vs ~$25–30 per 1.000 immagini (preventivo Alibaba vs tariffa indicata da AA)• Rilascio — 23 luglio 2026 (anteprima pubblica, Foundry) vs 21 luglio 2026, API internazionale il 4 agosto• Input di testo — 32.000 token, contesto da 131k vs finestra del prompt da 4.500 token• Limite massimo di output — ~1.048.576 pixel (~1K) vs fino a 2048×2048• Immagini per chiamata — output singolo per richiesta vs fino a sei immagini per chiamata• Ranking di editing — N. 1, Elo 1.272 (AA) vs 1.249 per Qwen-Image-3.0-Pro sulla stessa classifica• Provenienza — affermazione Microsoft "nessuna distillazione da modelli di terze parti" vs etichetta di provenienza AIGC sugli output• Pesi — chiusi, solo API vs chiusi, solo API
Il limite massimo di output e il conteggio per chiamata contano più di quanto sembri. Qwen-Image 3.0 può generare un'immagine 2048×2048 e restituire fino a sei immagini per chiamata, una caratteristica di economia di batch; il livello Pro raggiunge un massimo di circa 1K e restituisce un singolo output per richiesta. Se il tuo brief è "dammi una serie di sei foto di prodotto", il modello Alibaba è progettato per questo, mentre il modello Microsoft non lo è.

Quando il premio si ripaga da solo
La regola decisionale riguarda a cosa servono le immagini, non quale modello sia 'migliore.'
• Paga il prezzo premium per MAI-Image-2.5-Pro quando il risultato è un asset principale — una visual di prodotto, un poster, un keyframe, un'immagine che viene pubblicata in una campagna e non verrà rigenerata cinquanta volte. Il primo posto nella classifica di editing e il claim sulla coerenza dei personaggi contano di più quando una modifica deve essere giusta al primo colpo.
• Acquista in volume con Qwen-Image 3.0 quando l'output è usa e getta o in grandi quantità — varianti pubblicitarie localizzate, immagini segnaposto, presentazioni da schizzo a PPT, fotogrammi di storyboard, qualsiasi cosa in cui rigenererai piuttosto che rifinire. A $25–30 per 1k, una generazione fallita è un errore di arrotondamento; a $108,50 per 1k non lo è.
C'è una via di mezzo che vale la pena menzionare: per il lavoro denso e multilingue di testo nelle immagini — un mockup di landing page con testi in giapponese e spagnolo, un'infografica con formule — la leggibilità a 10px di Qwen e le dodici lingue sono la scelta migliore sulla carta, e a un quarto del prezzo. La controargomentazione del modello Microsoft è la sua affermazione di accuratezza del 96,8% in cinque lingue, ma tale affermazione non è verificata, e un acquirente che sceglie tra due affermazioni testuali non verificate dovrebbe probabilmente dare più peso al prezzo.

Il livello di instradamento, quando si applica
Nessuno dei due modelli è ancora raggiungibile tramite OrcaRouter — Qwen-Image 3.0 vive sull'API propria di Alibaba (Alibaba Cloud Bailian e la piattaforma Qwen) e su diverse piattaforme di terze parti, mentre MAI-Image-2.5-Pro è su Microsoft Foundry — quindi un confronto onesto afferma chiaramente che nessuno dei due è dalla nostra parte oggi. Quando uno dei due diventerà disponibile tramite un provider hosted chiamabile, si applicano le economie del pass-through: 0% di ricarico sul prezzo di listino del provider, quindi paghi la tariffa del fornitore, e uno sconto di lancio o un taglio di prezzo arriva sulla tua fattura il giorno stesso in cui viene annunciato. L'argomento del failover è l'altra metà: Qwen-Image 3.0 è un'API internazionale vecchia di poche settimane, il tipo di modello a cui instradi una parte del traffico mentre un fallback collaudato assorbe i casi limite — che è esattamente lo scenario per cui un livello di routing è progettato.
Il verdetto
Qwen-Image 3.0 e MAI-Image-2.5-Pro non sono lo stesso prodotto a prezzi diversi; sono prodotti differenti che capita siano prezzati in modo diverso. Il modello di Microsoft vince per quanto riguarda l'editing, offre una finestra di contesto più ampia e avanza un'asserzione di accuratezza non verificata su cinque lingue — per asset principali e modifiche chirurgiche, il sovrapprezzo è difendibile. Il modello di Alibaba rende più leggibili più sistemi di scrittura, accetta brief più densi per generazione alle sue condizioni, produce immagini più grandi e in lotti di sei, e costa un quarto — per volume e lavoro testo-in-immagine multilingue, è la scelta economicamente razionale. Comprate il premium dove l'immagine è il prodotto; comprate il volume dove l'immagine è inventario.
