Card hero per il confronto tra MAI-Image-2.5-Pro, disponibile in anteprima su Microsoft Foundry, e Flux 3, il modello foundation multimodale di Black Forest Labs la cui componente immagine non è ancora stata rilasciata.
Guides & Insights

MAI-Image-2.5-Pro vs Flux 3: Stessa settimana di lancio, due realtà diverse

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Image-2.5-Pro e Flux 3 sono stati annunciati entrambi nella stessa settimana — 23 luglio 2026. Un mese dopo occupano universi diversi. MAI-Image-2.5-Pro, il modello di immagini di fascia alta di Microsoft, è in anteprima pubblica su Microsoft Foundry ed è salito al n. 1 nell'Artificial Analysis Image Editing Arena (Elo 1.272 su ~6.100 voti alla cieca). Flux 3, il modello di base multimodale unificato di Black Forest Labs, ha rilasciato esattamente uno dei suoi livelli — video — e il suo livello immagini non ha endpoint pubblico, né prezzo, né benchmark che qualcuno possa eseguire. Un lettore che chiede "quale modello di immagini dovrei usare" non ha due candidati qui; ha un prodotto e una promessa.

Cosa sia in realtà ognuno

MAI-Image-2.5-Pro — un modello proprietario e specializzato per la generazione e la modifica di immagini, il livello di massima fedeltà della famiglia MAI-Image-2.5 interna di Microsoft. A consumo di token, ospitato su Foundry, pensato per immagini hero, modifiche dettagliate e rendering di testo nelle immagini. Questo è l'intero modello: immagini.

Flux 3 — un modello foundation multimodale unificato, addestrato congiuntamente su immagini, video e audio (oltre alla previsione delle azioni dei robot), basato su un metodo di flow-matching che BFL chiama Self-Flow. Sono state annunciate cinque varianti: Flux 3 Video, Flux 3 Image, Flux 3 Action, Flux-mimic per la robotica e Flux 3 Dev (pesi aperti previsti più avanti nel 2026). L'immagine è una modalità all'interno di una scommessa più ampia, non il prodotto stesso.

Questa differenza strutturale conta più di qualsiasi specifica. Un modello di immagine focalizzato mette tutta la sua capacità nelle immagini fisse; un modello multimodale distribuisce la capacità tra i media. MAI-Image-2.5-Pro esiste per vincere nell'editing delle immagini. Flux 3 esiste per essere un modello che fa tutto, e il suo livello immagini è la parte di quella visione che non è ancora arrivata.

Disponibilità: l'intero confronto

A partire da metà agosto 2026, l'asimmetria è assoluta:

MAI-Image-2.5-Pro — anteprima pubblica su Azure AI Foundry in sette regioni globali, più il MAI Playground gratuito. Puoi utilizzarlo oggi con un account Microsoft; è già il livello di qualità di una famiglia che alimenta Bing Image Creator, PowerPoint e OneDrive.

Flux 3 Image — non ancora rilasciato. La documentazione di BFL non elenca alcun endpoint per le immagini; l'attuale gamma di modelli immagine richiamabili rimane FLUX.2 (Pro, Dev, Flex, Klein). La pagina di Flux 3 presenta un'etichetta "coming soon" con un modulo di richiesta anziché un pulsante per iniziare. BFL ha dichiarato che l'accesso anticipato alle immagini sarebbe stato aperto "nelle settimane successive" dopo l'annuncio del 23 luglio; al momento non risultano pubblicati né un ID modello, né specifiche per le immagini, né un limite di prompt. Solo Flux 3 Video ha raggiunto la disponibilità generale (4 agosto, fatturato al secondo).

Quindi la risposta pratica a "su quale si può costruire oggi per l'editing di immagini" contiene esattamente un solo nome.

Le prove che ciascuna parte può mostrare

La forza di editing di MAI-Image-2.5-Pro è misurata in modo indipendente. Oltre all'Elo di editing n. 1, il suo punteggio text-to-image è n. 7 con 1.292 Elo — buono, non il leader, che è il modo onesto di interpretare uno specialista. Microsoft pubblica inoltre dichiarazioni del fornitore: 96,8% di accuratezza nella resa del testo (segnalata come copertura di cinque lingue), aderenza ai prompt superiore del 27% rispetto a GPT Image 1.5 nelle valutazioni interne e coerenza dei personaggi multi-immagine del 94%. Etichetta tutti questi come numeri propri di Microsoft; la classifica è la parte indipendente.

Flux 3 Image non ha alcuna prova pubblica. Non esistono benchmark per le immagini, perché non c'è alcun endpoint immagini da testare. Gli unici punteggi riportati da BFL per la famiglia riguardano Flux 3 Video — un Elo interno di 1.135 per text-to-video e 1.051 per image-to-video che BFL dichiara essere superiori ad Omni Flash, H3 e Seedance 2.0 — e sono dichiarati dal fornitore, mai replicati e comunque non applicabili al livello immagini. Qualunque cosa leggiate che "valuta" la qualità delle immagini di Flux 3 è un'estrapolazione dai dati video o dalla vecchia linea FLUX.2.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2Comparison scoreboard for MAI-Image-2.5-Pro and Flux 3: availability in preview on Microsoft Foundry versus image tier unreleased; image editing rank No. 1 at 1,272 Elo versus no image benchmarks; scope focused image model versus unified multimodal; text rendering 96.8% claimed versus roadmap claim of multilingual accuracy; price USD 108.50 per 1k versus no image price published; callable today versus coming soon

Cosa promette Flux 3 per le immagini (roadmap del produttore, non specifica)

Le affermazioni della roadmap di BFL per il livello delle immagini meritano di essere conosciute proprio perché sono affermazioni:

• Sintesi e modifica di immagini in diversi stili, proporzioni e risoluzioni

• Gestione migliorata dei prompt complessi e rendering testuale multilingue ad alta precisione

• Trasferimento di stile zero-shot da un'immagine di riferimento, con più riferimenti di stile combinati in un'unica passata

• Coerenza del personaggio e del marchio attraverso le generazioni senza fine-tuning

• Modifica non distruttiva — preservando texture, grana, illuminazione e sfondo, affinché le modifiche in più passaggi non degradino l'immagine.

Quest'ultima è l'affermazione interessante: è la stessa proprietà di "modifica senza rigenerare la scena" che il design surgical-edit di MAI-Image-2.5-Pro sta già offrendo e su cui sta già ottenendo punteggi. Se Flux 3 Image la manterrà, sarà in competizione diretta con ciò che MAI-Image-2.5-Pro fa già. "Se" è la parola chiave — tutto in quella lista è non verificato finché l'endpoint non esiste.

Costo

MAI-Image-2.5-Pro — $5 per milione di token di input di testo, $8 per milione di token di input di immagini, $106 per milione di token di output di immagini. La conversione di Artificial Analysis colloca un'immagine 1024×1024 vicino a $108,50 per 1.000. Prezzo di anteprima; la GA potrebbe modificarlo.

Flux 3 Image — non esiste alcun prezzo, perché non esiste alcun endpoint. L'unico prezzo di Flux 3 pubblicato è per il video: $0.17/secondo (HD) e $0.29/secondo (FHD) per render completi. Per la linea di immagini FLUX.2 richiamabile come punto di riferimento, BFL addebita circa $0.04 per immagine per Flux Pro e $0.015 per Flux Dev — ma quella è la generazione precedente, non una previsione.

Non puoi confrontare un prezzo con una riga vuota. Il confronto dei costi oggi è tra la tariffa premium di MAI-Image-2.5-Pro e niente del tutto.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, showing the preview launch and positioning as Microsoft's highest-fidelity image model

Su quale basarsi

Se ciò che devi consegnare sono immagini nel 2026, la risposta è MAI-Image-2.5-Pro (o uno degli altri editor ospitati — GPT Image 2 è ancora leader nella text-to-image e nell'altra principale area di editing). È chiamabile, ha un punteggio di editing indipendente al #1, e il limite di risoluzione intorno al megapixel è la cosa principale da verificare rispetto al tuo caso d'uso. Flux 3 è un elemento da tenere d'occhio: quando arriverà il livello immagine, le sue dichiarazioni di editing non distruttivo e coerenza del marchio meriteranno un test serio contro esattamente il modello che Microsoft sta valutando al #1 in questo momento.

C'è anche un modo di pensare all'attesa basato sul routing. Quando Flux 3 Image avrà finalmente un endpoint, il modo a basso rischio di adottare un modello completamente nuovo, privo di benchmark, è instradare una fetta di traffico verso di esso e mantenere il modello collaudato come failover automatico: un unico endpoint, prezzi del provider applicati con markup allo 0%, e il modello non ancora provato che si guadagna il posto sul traffico reale invece che su una slide di roadmap. Questo è il modello per cui esiste OrcaRouter, ed è lo stesso modello che rende adottabili modelli di livello anteprima come MAI-Image-2.5-Pro prima che raggiungano la disponibilità generale.

Il verdetto

Stessa settimana di lancio, un mese dopo: MAI-Image-2.5-Pro è un editor classificato al #1 che puoi invocare oggi, e Flux 3 è un modello fondativo multimodale il cui livello per le immagini è ancora una promessa con una roadmap. Confrontarli sulla qualità delle immagini sarebbe come confrontare un pugile con un combattente che non è ancora salito sul ring. Usa MAI-Image-2.5-Pro per il lavoro sulle immagini ora; tieni Flux 3 Image nella lista delle cose da rivalutare il giorno in cui il suo endpoint verrà effettivamente rilasciato.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube