Hero card per MAI-Image-2.5-Pro, il modello di generazione immagini di Microsoft incentrato sulla qualità, che mostra il suo 1° posto nell'editing delle immagini e il 7° nella generazione testo-immagine sulla classifica Artificial Analysis.
Guides & Insights

MAI-Image-2.5-Pro Conquista il Primo Posto nell'Editing delle Immagini: Cosa Dimostra Davvero la Vittoria Indipendente di Microsoft

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Image-2.5-Proè ora il modello di editing immagini con il punteggio più alto nella classifica di Artificial Analysis — una classifica indipendente basata su voti alla cieca — pur classificandosi solo al settimo posto nella generazione di immagini da testo. È questa divaricazione la notizia: un modello che è in anteprima pubblica da meno di un mese, costruito interamente in casa da Microsoft AI, ha superato GPT Image 2, Reve 2.1, e il suo stesso fratello MAI-Image-2.5 nella classifica di editing, ma resta indietro rispetto alla maggior parte degli stessi modelli quando il prompt è «disegnami qualcosa dal nulla». Mettendo insieme i due punteggi si ottiene un quadro preciso di ciò che Microsoft ha rilasciato: uno specialista nella modifica di immagini esistenti, non un generatore generalista.

I due numeri, affiancati

Secondo lo snapshot di agosto 2026, l'Image Editing Arena di Artificial Analysis colloca MAI-Image-2.5-Pro al No. 1 con Elo 1.272, basato su circa 6.100 confronti alla cieca tra utenti. Il gruppo degli inseguitori è compatto: Reve 2.1 a 1.262, poi MAI-Image-2.5 e GPT Image 2 (high) appaiati a 1.256, GPT Image 1.5 (high) a 1.250, Qwen-Image-3.0-Pro a 1.249 e il Nano Banana 2 di Go​gle a 1.249. Nella Text-to-Image Arena si colloca al No. 7 con Elo 1.292, dietro GPT Image 2 (high) a 1.369, Reve 2.1 a 1.322, Nano Banana 2 a 1.320, GPT Image 1.5 (high) a 1.310, MAI-Image-2.5 a 1.304 e Nano Banana Pro a 1.296.

Modifica: No. 1 — 1.272 Elo, ~6.100 campioni

Text-to-image: No. 7 — 1.292 Elo, ~11.500 campioni

Distacco dalla n. 2 nell'editing: 10 Elo sopra Reve 2.1

Divario dal n. 1 in text-to-image: 77 Elo dietro GPT Image 2 (alto)

Ciò che rende la classifica di editing più preziosa di un numero di vanità è il meccanismo. L'arena di Artificial Analysis è una preferenza umana alla cieca: i votanti vedono la stessa immagine di input e la stessa istruzione, ottengono due risultati modificati e scelgono quello più forte. Nessuno script del fornitore scrive il punteggio. Quindi un #1 lì è la cosa più vicina che il mercato abbia a "la gente ha gradito di più l'output di questo editor" — ed è una recente scalata, non un fuoco di paglia del giorno del lancio. Considera la direzione come solida e l'Elo esatto come provvisorio; le classifiche con pochi voti si muovono.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 and 6,133 samples, ahead of Reve 2.1 at 1,262, MAI-Image-2.5 at 1,256, and GPT Image 2 (high) at 1,256

La classifica text-to-image, catturata lo stesso giorno, è lo stesso modello sotto una luce diversa — non più in testa, ma ancora comodamente tra i primi dieci di un gruppo che si attesta tra 1.290 e 1.370 Elo.

Screenshot of the Artificial Analysis Text to Image Leaderboard showing MAI-Image-2.5-Pro at No. 7 with Elo 1,292 behind GPT Image 2 (high), Reve 2.1, Nano Banana 2, GPT Image 1.5 (high), MAI-Image-2.5, and Nano Banana Pro

Cosa è MAI-Image-2.5-Pro in realtà

MAI-Image-2.5-Pro è il livello di qualità di Microsoft AI della famiglia MAI-Image-2.5, annunciato il 23 luglio 2026 insieme a MAI-Voice-2-Flash e reso disponibile in anteprima pubblica su Microsoft Foundry (Azure AI Foundry) e nel gratuito MAI Playground. Microsoft lo descrive come il suo modello di immagini a più alta fedeltà fino ad oggi, pensato per immagini hero, editing dettagliato e rendering preciso del testo all'interno delle immagini. La famiglia ora copre l'intera curva dei costi: MAI-Image-2.5 per lavoro bilanciato, MAI-Image-2.5-Flash per volumi elevati e il livello Pro all'estremità di qualità, con un nuovo fratello, MAI-Image-2.6, già in anteprima privata dal 19 agosto.

Le affermazioni di Microsoft stessa per il livello Pro, tutte riportate dal fornitore e nessuna ancora riprodotta in modo indipendente:

96,8% di precisione nel rendering del testo — segnalato come in grado di coprire cinese, inglese, giapponese, coreano e spagnolo, sebbene la stessa documentazione limiti l'output a circa un megapixel, quindi è meglio considerare l'espressione "8K" nell'affermazione come marketing.

27% migliore aderenza al prompt rispetto a GPT-Image-1.5 nelle valutazioni interne di Microsoft.

94% di coerenza dei personaggi multi-immagine tra le generazioni.

Costi GPU inferiori fino all'84–89% rispetto ai modelli GPT in scenari Microsoft specifici (PowerPoint, OneDrive), non un numero generale.

La scheda tecnica documentata è ciò che fonda queste affermazioni: input di testo fino a 32.000 token, una finestra di contesto di 131k, 4.096 token di output, input di immagini JPEG/PNG, e output limitato a 1.048.576 pixel (equivalente a 1024×1024). Questo ultimo numero conta per gli acquirenti: questo è un eccellente editor, non un generatore a risoluzione di stampa.

Dove la qualità si vede

La forza di editing che la leaderboard misura corrisponde a ciò che Microsoft enfatizza: modifiche precise e chirurgiche che mantengono coerente il resto dell'immagine. Sostituzione mirata di oggetti, modifiche al layout, aggiornamenti del testo nell'immagine e pulizia di artefatti come il motion blur — la classe di modifiche in cui i modelli più vecchi rigenerano l'intera scena e perdono il soggetto. Combina questo con l'affermazione del 94% di coerenza del personaggio e ottieni un modello progettato per il flusso di lavoro che conta commercialmente: prendi un asset esistente, cambia una cosa, pubblicalo.

Il ranking #7 per text-to-image è il contrappeso onesto. Partendo da un prompt vuoto, MAI-Image-2.5-Pro è buono ma non è il leader — 77 Elo dietro a GPT Image 2 (high) è un divario reale su una classifica cieca. Microsoft non sta attualmente rivendicando la corona text-to-image; sta rivendicando la corona dell'editing, e i dati supportano l'affermazione più ristretta molto meglio di quella più ampia.

Quanto costa

MAI-Image-2.5-Pro è misurato a token su Foundry: $5 per milione di token di input di testo, $8 per milione di token di input di immagine, $106 per milione di token di output di immagine. Microsoft non pubblica i token per immagine, quindi il costo per immagine è aritmetico, non un preventivo; usando la conversione di Artificial Analysis, un'immagine 1024×1024 si aggira intorno a $108,50 per 1.000 immagini. Si tratta di circa 2,3× il modello gemello MAI-Image-2.5 (~$48 per 1k) e 5,4× MAI-Image-2.5-Flash (~$20 per 1k) — il livello Pro è un sovrapprezzo voluto.

Il prezzo in anteprima non è il prezzo GA; il listino prezzi in anteprima può variare prima della disponibilità generale. Quando ciò accade, un livello di routing pass-through è il modo in cui un taglio di prezzo arriva sulla tua fattura lo stesso giorno: su OrcaRouter, il prezzo di listino del fornitore viene trasferito con ricarico dello 0%, quindi una volta che MAI-Image-2.5-Pro è raggiungibile tramite un'API di terze parti chiamabile, qualunque cosa Microsoft addebiti è esattamente ciò che paghi — nessuna rinegoziazione, nessun secondo contratto.

Scoreboard for MAI-Image-2.5-Pro: image editing rank No. 1 at 1,272 Elo, text-to-image rank No. 7 at 1,292 Elo, price about USD 108.50 per 1k images, 32k text input tokens, 131k context window, ~1-megapixel output cap, preview status on Microsoft Foundry

Perché il #1 appartiene a Microsoft, l'azienda, non solo al modello

Il risultato della classifica arriva in un momento in cui Microsoft sta visibilmente sostituendo i modelli di immagini di terze parti con i propri. MAI-Image-2.5 è già il motore predefinito in Bing Image Creator e funziona in PowerPoint, OneDrive e Dynamics 365 Contact Center; il livello Pro è della stessa famiglia, pensato per lavori a più alta fedeltà. Microsoft ha dichiarato che i modelli MAI sono addestrati su dati puliti e tracciabili "senza distillazione da modelli di terze parti" — una risposta diretta alla questione della dipendenza da OpenAI, e le affermazioni sui costi (fino all'84% di costo GPU inferiore in PowerPoint, dichiarate dal fornitore e specifiche per scenario) fanno parte della stessa storia: un modello interno che è più economico per attività rispetto al modello che sostituisce.

Niente di tutto ciò sarebbe dimostrabile a un acquirente scettico senza la classifica indipendente, motivo per cui il #1 è strategicamente significativo e non solo un punteggio. È la prima prova indipendente che la linea di immagini interna di Microsoft supera tutti gli altri nel compito specifico per cui è stata progettata.

Cosa guardare dopo

Il vantaggio nell'editing regge man mano che i voti si accumulano? 1,272 Elo su ~6,100 campioni è un vantaggio, non una certezza; Reve 2.1 è indietro di 10 punti.

Disponibilità generale e tariffario finale — il prezzo in anteprima non è il prezzo GA.

Il tetto della risoluzione. Un limite di 1 megapixel esclude Pro dai lavori di stampa; se Microsoft lo rimuove, la storia cambia.

MAI-Image-2.6 (anteprima privata, 19 agosto) — il prossimo passo della famiglia, classificato al 2° posto per text-to-image nell'altra arena principale.

Valutazioni indipendenti delle affermazioni del fornitore — l'accuratezza del rendering del testo e la coerenza dei caratteri non sono verificate al di fuori di Microsoft.

Il punto della classifica divisa non è "Microsoft ora produce il miglior modello di immagini." È più ristretto e più utile: Microsoft ora produce l'editor di immagini più apprezzato su una classifica indipendente, a un prezzo premium, in anteprima, con un limite massimo di risoluzione. Se il tuo lavoro consiste nel modificare immagini esistenti — scatti hero, visual di prodotto, testo nelle immagini — è esattamente il modello da tenere d'occhio. Se il tuo lavoro è la generazione da tela bianca, la posizione #7 indica che la scelta migliore è ancora GPT Image 2 — e questa è la lettura onesta che entrambi i numeri ti danno.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube