
MAI-Image-2.5-Pro Conquista il Primo Posto nell'Editing delle Immagini: Cosa Dimostra Davvero la Vittoria Indipendente di Microsoft
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
MAI-Image-2.5-Proè ora il modello di editing immagini con il punteggio più alto nella classifica di Artificial Analysis — una classifica indipendente basata su voti alla cieca — pur classificandosi solo al settimo posto nella generazione di immagini da testo. È questa divaricazione la notizia: un modello che è in anteprima pubblica da meno di un mese, costruito interamente in casa da Microsoft AI, ha superato GPT Image 2, Reve 2.1, e il suo stesso fratello MAI-Image-2.5 nella classifica di editing, ma resta indietro rispetto alla maggior parte degli stessi modelli quando il prompt è «disegnami qualcosa dal nulla». Mettendo insieme i due punteggi si ottiene un quadro preciso di ciò che Microsoft ha rilasciato: uno specialista nella modifica di immagini esistenti, non un generatore generalista.
I due numeri, affiancati
Secondo lo snapshot di agosto 2026, l'Image Editing Arena di Artificial Analysis colloca MAI-Image-2.5-Pro al No. 1 con Elo 1.272, basato su circa 6.100 confronti alla cieca tra utenti. Il gruppo degli inseguitori è compatto: Reve 2.1 a 1.262, poi MAI-Image-2.5 e GPT Image 2 (high) appaiati a 1.256, GPT Image 1.5 (high) a 1.250, Qwen-Image-3.0-Pro a 1.249 e il Nano Banana 2 di Gogle a 1.249. Nella Text-to-Image Arena si colloca al No. 7 con Elo 1.292, dietro GPT Image 2 (high) a 1.369, Reve 2.1 a 1.322, Nano Banana 2 a 1.320, GPT Image 1.5 (high) a 1.310, MAI-Image-2.5 a 1.304 e Nano Banana Pro a 1.296.
• Modifica: No. 1 — 1.272 Elo, ~6.100 campioni
• Text-to-image: No. 7 — 1.292 Elo, ~11.500 campioni
• Distacco dalla n. 2 nell'editing: 10 Elo sopra Reve 2.1
• Divario dal n. 1 in text-to-image: 77 Elo dietro GPT Image 2 (alto)
Ciò che rende la classifica di editing più preziosa di un numero di vanità è il meccanismo. L'arena di Artificial Analysis è una preferenza umana alla cieca: i votanti vedono la stessa immagine di input e la stessa istruzione, ottengono due risultati modificati e scelgono quello più forte. Nessuno script del fornitore scrive il punteggio. Quindi un #1 lì è la cosa più vicina che il mercato abbia a "la gente ha gradito di più l'output di questo editor" — ed è una recente scalata, non un fuoco di paglia del giorno del lancio. Considera la direzione come solida e l'Elo esatto come provvisorio; le classifiche con pochi voti si muovono.

La classifica text-to-image, catturata lo stesso giorno, è lo stesso modello sotto una luce diversa — non più in testa, ma ancora comodamente tra i primi dieci di un gruppo che si attesta tra 1.290 e 1.370 Elo.

Cosa è MAI-Image-2.5-Pro in realtà
MAI-Image-2.5-Pro è il livello di qualità di Microsoft AI della famiglia MAI-Image-2.5, annunciato il 23 luglio 2026 insieme a MAI-Voice-2-Flash e reso disponibile in anteprima pubblica su Microsoft Foundry (Azure AI Foundry) e nel gratuito MAI Playground. Microsoft lo descrive come il suo modello di immagini a più alta fedeltà fino ad oggi, pensato per immagini hero, editing dettagliato e rendering preciso del testo all'interno delle immagini. La famiglia ora copre l'intera curva dei costi: MAI-Image-2.5 per lavoro bilanciato, MAI-Image-2.5-Flash per volumi elevati e il livello Pro all'estremità di qualità, con un nuovo fratello, MAI-Image-2.6, già in anteprima privata dal 19 agosto.
Le affermazioni di Microsoft stessa per il livello Pro, tutte riportate dal fornitore e nessuna ancora riprodotta in modo indipendente:
• 96,8% di precisione nel rendering del testo — segnalato come in grado di coprire cinese, inglese, giapponese, coreano e spagnolo, sebbene la stessa documentazione limiti l'output a circa un megapixel, quindi è meglio considerare l'espressione "8K" nell'affermazione come marketing.
• 27% migliore aderenza al prompt rispetto a GPT-Image-1.5 nelle valutazioni interne di Microsoft.
• 94% di coerenza dei personaggi multi-immagine tra le generazioni.
• Costi GPU inferiori fino all'84–89% rispetto ai modelli GPT in scenari Microsoft specifici (PowerPoint, OneDrive), non un numero generale.
La scheda tecnica documentata è ciò che fonda queste affermazioni: input di testo fino a 32.000 token, una finestra di contesto di 131k, 4.096 token di output, input di immagini JPEG/PNG, e output limitato a 1.048.576 pixel (equivalente a 1024×1024). Questo ultimo numero conta per gli acquirenti: questo è un eccellente editor, non un generatore a risoluzione di stampa.
Dove la qualità si vede
La forza di editing che la leaderboard misura corrisponde a ciò che Microsoft enfatizza: modifiche precise e chirurgiche che mantengono coerente il resto dell'immagine. Sostituzione mirata di oggetti, modifiche al layout, aggiornamenti del testo nell'immagine e pulizia di artefatti come il motion blur — la classe di modifiche in cui i modelli più vecchi rigenerano l'intera scena e perdono il soggetto. Combina questo con l'affermazione del 94% di coerenza del personaggio e ottieni un modello progettato per il flusso di lavoro che conta commercialmente: prendi un asset esistente, cambia una cosa, pubblicalo.
Il ranking #7 per text-to-image è il contrappeso onesto. Partendo da un prompt vuoto, MAI-Image-2.5-Pro è buono ma non è il leader — 77 Elo dietro a GPT Image 2 (high) è un divario reale su una classifica cieca. Microsoft non sta attualmente rivendicando la corona text-to-image; sta rivendicando la corona dell'editing, e i dati supportano l'affermazione più ristretta molto meglio di quella più ampia.
Quanto costa
MAI-Image-2.5-Pro è misurato a token su Foundry: $5 per milione di token di input di testo, $8 per milione di token di input di immagine, $106 per milione di token di output di immagine. Microsoft non pubblica i token per immagine, quindi il costo per immagine è aritmetico, non un preventivo; usando la conversione di Artificial Analysis, un'immagine 1024×1024 si aggira intorno a $108,50 per 1.000 immagini. Si tratta di circa 2,3× il modello gemello MAI-Image-2.5 (~$48 per 1k) e 5,4× MAI-Image-2.5-Flash (~$20 per 1k) — il livello Pro è un sovrapprezzo voluto.
Il prezzo in anteprima non è il prezzo GA; il listino prezzi in anteprima può variare prima della disponibilità generale. Quando ciò accade, un livello di routing pass-through è il modo in cui un taglio di prezzo arriva sulla tua fattura lo stesso giorno: su OrcaRouter, il prezzo di listino del fornitore viene trasferito con ricarico dello 0%, quindi una volta che MAI-Image-2.5-Pro è raggiungibile tramite un'API di terze parti chiamabile, qualunque cosa Microsoft addebiti è esattamente ciò che paghi — nessuna rinegoziazione, nessun secondo contratto.

Perché il #1 appartiene a Microsoft, l'azienda, non solo al modello
Il risultato della classifica arriva in un momento in cui Microsoft sta visibilmente sostituendo i modelli di immagini di terze parti con i propri. MAI-Image-2.5 è già il motore predefinito in Bing Image Creator e funziona in PowerPoint, OneDrive e Dynamics 365 Contact Center; il livello Pro è della stessa famiglia, pensato per lavori a più alta fedeltà. Microsoft ha dichiarato che i modelli MAI sono addestrati su dati puliti e tracciabili "senza distillazione da modelli di terze parti" — una risposta diretta alla questione della dipendenza da OpenAI, e le affermazioni sui costi (fino all'84% di costo GPU inferiore in PowerPoint, dichiarate dal fornitore e specifiche per scenario) fanno parte della stessa storia: un modello interno che è più economico per attività rispetto al modello che sostituisce.
Niente di tutto ciò sarebbe dimostrabile a un acquirente scettico senza la classifica indipendente, motivo per cui il #1 è strategicamente significativo e non solo un punteggio. È la prima prova indipendente che la linea di immagini interna di Microsoft supera tutti gli altri nel compito specifico per cui è stata progettata.
Cosa guardare dopo
• Il vantaggio nell'editing regge man mano che i voti si accumulano? 1,272 Elo su ~6,100 campioni è un vantaggio, non una certezza; Reve 2.1 è indietro di 10 punti.
• Disponibilità generale e tariffario finale — il prezzo in anteprima non è il prezzo GA.
• Il tetto della risoluzione. Un limite di 1 megapixel esclude Pro dai lavori di stampa; se Microsoft lo rimuove, la storia cambia.
• MAI-Image-2.6 (anteprima privata, 19 agosto) — il prossimo passo della famiglia, classificato al 2° posto per text-to-image nell'altra arena principale.
• Valutazioni indipendenti delle affermazioni del fornitore — l'accuratezza del rendering del testo e la coerenza dei caratteri non sono verificate al di fuori di Microsoft.
Il punto della classifica divisa non è "Microsoft ora produce il miglior modello di immagini." È più ristretto e più utile: Microsoft ora produce l'editor di immagini più apprezzato su una classifica indipendente, a un prezzo premium, in anteprima, con un limite massimo di risoluzione. Se il tuo lavoro consiste nel modificare immagini esistenti — scatti hero, visual di prodotto, testo nelle immagini — è esattamente il modello da tenere d'occhio. Se il tuo lavoro è la generazione da tela bianca, la posizione #7 indica che la scelta migliore è ancora GPT Image 2 — e questa è la lettura onesta che entrambi i numeri ti danno.
