Scheda hero per il confronto tra MAI-Image-2.5-Pro, un modello di editing premium in anteprima su Microsoft Foundry, e Bernini-Diffusers-v2, la pipeline open-weights Apache-2.0 di ByteDance
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Un #1 Misurato Contro una Scommessa Open-Weights Non Misurata

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Confrontare MAI-Image-2.5-Pro con Bernini-Diffusers-v2 non è davvero confrontare due modelli di immagine. È confrontare due risposte diverse alla stessa domanda — "come ottengo una buona modifica di un'immagine esistente?" — dove un lato ha 6.100 voti umani alla cieca a sostegno del suo primo posto nella classifica di editing e l'altro ha un README. MAI-Image-2.5-Pro, il modello di immagine di fascia qualità di Microsoft, è entrato in anteprima pubblica su Microsoft Foundry il 23 luglio 2026 e ora è in cima alla Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, il framework di generazione unificata di seconda generazione di ByteDance, è approdato su Hugging Face il 13 agosto 2026 come pesi Apache-2.0 senza alcun annuncio e senza benchmark di qualità delle immagini eseguito da chiunque al di fuori di ByteDance. Ogni differenza pratica in questo confronto deriva da questi due fatti.

Uno lo chiami, uno lo corri.

MAI-Image-2.5-Pro — un modello API ospitato in anteprima pubblica su Azure AI Foundry e nel MAI Playground. Proprietario, a pagamento per token, senza fine-tuning, senza self-hosting. Ottieni un endpoint e paghi per token; Microsoft gestisce l'infrastruttura.

Bernini-Diffusers-v2 — pesi Apache-2.0 che scarichi da Hugging Face ed esegui tu stesso. Lo stack è un planner semantico Qwen2.5-VL-7B che guida un renderer DiT basato su Wan2.2, e la raccomandazione hardware del README è GPU di classe Hopper (H100/H800/H200) con Python 3.11.2 / PyTorch 2.5.1+cu124. Il cluster lo porti tu.

Questa è la regola decisionale in una riga: se la tua organizzazione vuole possedere lo stack, {{1}}Bernini{{/1}} è un'opzione; se la tua organizzazione vuole una fattura e uno SLA, solo {{2}}MAI-Image-2.5-Pro{{/2}} è in lizza. Non sono sostituti l'uno dell'altro.

Il divario di prove è la vera notizia.

I due modelli si trovano su fronti opposti del più grande problema di qualità nell'IA per le immagini: misurare l'output. La capacità di editing di MAI-Image-2.5-Pro è valutata in modo indipendente — N. 1 nella Artificial Analysis Image Editing Arena con un Elo di 1.272 basato su ~6.100 confronti alla cieca, davanti a Reve 2.1, GPT Image 2 e al suo modello gemello MAI-Image-2.5. Il suo posizionamento text-to-image è settimo con 1.292 Elo, che è l'onesto contrappeso: è uno specialista dell'editing, non il leader della tela bianca. Questi numeri sono verificabili da chiunque abbia un browser.

Bernini-Diffusers-v2 non ha un punteggio pubblico equivalente. La scheda del modello riporta EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 e VBench 84.46 — tutti dichiarati dal vendor e tutte metriche lato video. Non c'è nulla nella scheda che un acquirente di immagini riconoscerebbe come risultato di una classifica text-to-image o di image editing. La scheda afferma che Bernini raggiunge "il primo livello" dei modelli commerciali chiusi nell'arena interna di confronto alla cieca di ByteDance — che è esattamente il tipo di autovalutazione del vendor che richiede una verifica indipendente prima di avere un significato.

MAI-Image-2.5-Pro: editing Elo 1,272 (indipendenti, ~6,100 voti); text-to-image Elo 1,292 (indipendenti, ~11,500 voti)

Bernini-Diffusers-v2: nessun benchmark pubblico per le immagini; solo metriche video, riportate dal fornitore

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Due diverse teorie del montaggio

Entrambi i modelli sono costruiti attorno all'idea che la modifica non debba significare rigenerare la scena. Ma ci arrivano in modo diverso.

MAI-Image-2.5-Pro è la proposta di Microsoft per "modifiche precise e chirurgiche con coerenza": cambia un oggetto, aggiorna il testo nell'immagine, elimina il motion blur e mantieni tutto il resto — identità del soggetto, illuminazione, texture — stabile. È proprio questa coerenza il meccanismo alla base dell'affermazione del 94% di coerenza dei personaggi in più immagini (dichiarato dal fornitore, non verificato). L'obiettivo del prodotto è un modello che esegue la modifica mirata e si ferma.

Bernini-Diffusers-v2 è una pipeline pianifica-poi-render: il pianificatore Qwen2.5-VL scompone un'istruzione in passi semantici — cambia il meteo, scambia lo stile, inserisci un oggetto, mantieni il soggetto — e il renderer disegna il risultato. Il design è pensato per istruzioni complesse e multi-step, e gli stessi pesi coprono attività text-to-image, image-to-image e video (t2i, i2i, t2v, v2v, rv2v, r2v). Questa ampiezza è il lato positivo; il costo non misurato è che un pianificatore da 7B rappresenta un vero collo di bottiglia per modifiche molto sottili, e nessuno al di fuori di ByteDance ha quantificato come le gestisce.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Il rendering del testo, il campo di battaglia pratico

Il testo nell'immagine è il punto in cui un editor di immagini moderno dimostra il proprio valore, e qui l'asimmetria è netta. La capacità principale di MAI-Image-2.5-Pro è la resa precisa del testo: Microsoft dichiara una precisione del 96,8% in inglese, cinese, giapponese, coreano e spagnolo (dato dichiarato dal fornitore; gli stessi documenti limitano l'output a circa un megapixel, quindi trattate il numero come indicativo). Bernini-Diffusers-v2 non ha pubblicato alcuna accuratezza di resa del testo. Per un flusso di lavoro che produce annunci localizzati, packaging o qualsiasi cosa contenga una parola leggibile, un candidato offre un dato misurabile e l'altro non offre nulla.

Costo e forma del conto

MAI-Image-2.5-Pro — $5 per million text-input tokens, $8 per million image-input tokens, $106 per million image-output tokens. Per-image cost is not published; Artificial Analysis's conversion puts a 1024×1024 image near $108.50 per 1,000. Preview pricing, subject to change at GA.

Bernini-Diffusers-v2 — i pesi sono gratuiti, ma l'hosting autonomo richiede hardware di classe H100 (o noleggio cloud), le operazioni per mantenerlo in funzione e la propria scalabilità. L'economia inverte il modello API: costoso per dieci immagini al giorno, conveniente a volumi elevati.

Per la maggior parte dei team, la lettura onesta è questa: il costo totale di proprietà di Bernini è vantaggioso solo se si dispone già di una flotta di GPU e il carico di lavoro è ampio e costante. Altrimenti, un'API a consumo con tariffa premium è il fallimento più economico.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Cosa un router può e non può fare qui

Nessuno dei due modelli è instradabile tramite OrcaRouter oggi, per ragioni opposte: MAI-Image-2.5-Pro si trova dietro l'anteprima diretta di Microsoft Foundry, mentre Bernini-Diffusers-v2 non è affatto un endpoint — è un insieme di pesi. Questo conta come principio per questo confronto: il pattern del router si applica solo alla metà di questo confronto che è un'API chiamabile. Quando MAI-Image-2.5-Pro raggiungerà un'API di terze parti chiamabile, il modo per adottarlo senza scommettere un percorso di produzione su codice in anteprima è instradare una parte del traffico verso di esso con un modello collaudato come failover automatico — su OrcaRouter questo significa un endpoint, prezzi dei provider applicati con markup allo 0%, e un fallback che intercetta ciò che la classifica con pochi voti non ha potuto vedere. Il lato dei pesi aperti non ha alcun equivalente: o gestisci tu stesso lo stack di Bernini, oppure non lo usi.

Il verdetto

MAI-Image-2.5-Pro è un editor ospitato premium e misurabile: n. 1 in una classifica editoriale indipendente, una vera credenziale di rendering del testo e un prezzo all'altezza. Bernini-Diffusers-v2 è una pipeline open-weights gratuita, ampia, non dimostrata nel campo delle immagini, che fa anche video — davvero interessante se fai self-hosting, davvero non valutabile finché qualcuno non esegue un benchmark pubblico sulle immagini. Se il tuo flusso di lavoro richiede un'API richiamabile e una cifra che puoi difendere, la scelta è MAI-Image-2.5-Pro o uno degli altri editor ospitati che supera. Se il tuo flusso di lavoro richiede la proprietà del modello e puoi gestire l'hardware, Bernini-Diffusers-v2 merita di essere testato — ma consideralo una scommessa su un potenziale non misurato, non un concorrente di un n. 1 misurato.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube