Hero-kort för MAI-Image-2.5-Pro, Microsofts kvalitetsfokuserade bildmodell, som visar dess #1-placering i bildredigering och #7 i text-till-bild på Artificial Analysis-ledartavlan.
Guides & Insights

MAI-Image-2.5-Pro tar förstaplatsen inom bildredigering: Vad Microsofts oberoende seger faktiskt bevisar

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MAI-Image-2.5-Pro är nu den högst rankade bildredigeringsmodellen på Artificial Analysis ledartavla — en oberoende, blindröstad lista — medan den fortfarande rankas bara som sjua på ren text-till-bild. Den klyftan är hela historien: en modell som har varit i offentlig förhandsvisning i mindre än en månad, helt byggd internt av Microsoft AI, har gått om GPT Image 2, Reve 2.1, och dess eget syskon MAI-Image-2.5 på redigeringslistan, men hamnar efter de flesta av samma fält när prompten är "rita mig något från ingenting." Läs båda siffrorna tillsammans så får du en exakt bild av vad Microsoft levererade: en specialist på att ändra befintliga bilder, inte en generell generator.

De två siffrorna, sida vid sida.

Enligt ögonblicksbilden från augusti 2026 placerar Artificial Analysis's Image Editing Arena MAI-Image-2.5-Pro på Nr 1 med Elo 1 272, baserat på cirka 6 100 blinda användarjämförelser. Förföljarna ligger tätt: Reve 2.1 på 1 262, sedan MAI-Image-2.5 och GPT Image 2 (high) delade på 1 256, GPT Image 1.5 (high) på 1 250, Qwen-Image-3.0-Pro på 1 249, och Go​gle's Nano Banana 2 på 1 249. På Text-to-Image Arena ligger den på Nr 7 med Elo 1 292, bakom GPT Image 2 (high) på 1 369, Reve 2.1 på 1 322, Nano Banana 2 på 1 320, GPT Image 1.5 (high) på 1 310, MAI-Image-2.5 på 1 304, och Nano Banana Pro på 1 296.

Redigering: Nr 1 — 1 272 Elo, ~6 100 prover

Text-till-bild: Nr. 7 — 1 292 Elo, ~11 500 prover

Avstånd till Nr. 2 inom redigering: 10 Elo över Reve 2.1

Avstånd till nr 1 i text-till-bild: 77 Elo efter GPT Image 2 (högt)

Det som gör redigeringsrankningen värd mer än en fåfäng siffra är mekanismen. Artificial Analysis-arenan bygger på blind mänsklig preferens: väljarna ser samma indatabild och instruktion, får två redigerade resultat och väljer det starkare. Inget leverantörsskript sätter poängen. Så en #1 där är det närmaste marknaden har till "folk gillade den här redigerarens utdata mest" — och det är en nylig uppgång, inte en tillfällig avvikelse på lanseringsdagen. Behandla riktningen som fast och det exakta Elo som preliminärt; topplistor med få röster rör sig.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 and 6,133 samples, ahead of Reve 2.1 at 1,262, MAI-Image-2.5 at 1,256, and GPT Image 2 (high) at 1,256

Text-till-bild-listan, fångad samma dag, är samma modell i ett annat ljus — inte längre ledande, men fortfarande bekvämt inom topp tio i ett fält som ligger tätt samlat från 1 290 till 1 370 i Elo.

Screenshot of the Artificial Analysis Text to Image Leaderboard showing MAI-Image-2.5-Pro at No. 7 with Elo 1,292 behind GPT Image 2 (high), Reve 2.1, Nano Banana 2, GPT Image 1.5 (high), MAI-Image-2.5, and Nano Banana Pro

Vad MAI-Image-2.5-Pro faktiskt är

MAI-Image-2.5-Pro är Microsoft AI:s kvalitetsnivå i MAI-Image-2.5-familjen, tillkännagiven den 23 juli 2026 tillsammans med MAI-Voice-2-Flash och placerad i offentlig förhandsvisning på Microsoft Foundry (Azure AI Foundry) och den kostnadsfria MAI Playground. Microsoft beskriver den som sin mest verklighetstrogna bildmodell hittills, avsedd för herobilder, detaljerad redigering och exakt textåtergivning i bilder. Familjen täcker nu hela kostnadskurvan: MAI-Image-2.5 för balanserat arbete, MAI-Image-2.5-Flash för hög volym och Pro-nivån i kvalitetsänden – med ett nyare syskon, MAI-Image-2.6, som redan är i privat förhandsvisning sedan 19 augusti.

Microsofts egna påståenden för Pro-nivån, alla leverantörsrapporterade och ingen oberoende reproducerad ännu:

96.8% textåtergivningsnoggrannhet — angiven att täcka kinesiska, engelska, japanska, koreanska och spanska, även om samma dokumentation begränsar utmatningen till ungefär en megapixel, så är "8K"-formuleringen i påståendet bäst att betrakta som marknadsföring.

27% bättre följsamhet till prompten än GPT-Image-1.5 på Microsofts interna utvärderingar.

94% karaktärskonsistens mellan bilder över generationer.

Upp till 84–89 % lägre GPU-kostnad jämfört med GPT-modeller i specifika Microsoft-scenarier (PowerPoint, OneDrive), inte en generell siffra.

Det dokumenterade specifikationsbladet är det som ligger till grund för dessa påståenden: textinmatning upp till 32 000 token, ett 131k kontextfönster, 4 096 utdatatoken, JPEG/PNG-bildinmatning och utdatabegränsning till 1 048 576 pixlar (motsvarande 1024×1024). Den sistnämnda siffran är viktig för köpare: detta är en högkvalitativ redigerare, inte en tryckupplösningsgenerator.

Där kvaliteten syns

Den redigeringsstyrka som leaderboarden mäter matchar det Microsoft betonar: precisa, kirurgiska redigeringar som håller resten av bilden konsekvent. Riktad objektersättning, layoutändringar, textuppdateringar i bilden och rensning av artefakter som rörelseoskärpa – den typ av redigering där äldre modeller regenererar hela scenen och tappar motivet. Kombinera det med påståendet om 94 % karaktärskonsistens så har du en modell som är designad för det arbetsflöde som har kommersiell betydelse: ta en befintlig tillgång, ändra en sak, leverera den.

Rankningen #7 för text-till-bild är den ärliga motvikten. Från en tom prompt är MAI-Image-2.5-Pro bra men inte ledaren — 77 Elo efter GPT Image 2 (högt) är ett verkligt gap på en blind topplista. Microsoft gör för närvarande inte anspråk på text-till-bild-kronan; man gör anspråk på redigeringskronan, och datan stöder det snävare påståendet mycket bättre än det bredare.

Vad det kostar

MAI-Image-2.5-Pro debiteras per token på Foundry: $5 per miljon textinmatningstokens, $8 per miljon bildinmatningstokens, $106 per miljon bildutdatatokens. Microsoft publicerar inte tokens per bild, så kostnaden per bild är aritmetisk, inte ett offertpris; med Artificial Analysis omvandling hamnar en 1024×1024-bild nära $108,50 per 1 000 bilder. Det är ungefär 2,3× syskonmodellen MAI-Image-2.5 (~$48 per 1k) och 5,4× MAI-Image-2.5-Flash (~$20 per 1k) — Pro-nivån är ett medvetet premium.

Preview-prissättning är inte GA-prissättning; priskortet för preview kan ändras innan allmän tillgänglighet. När det sker är ett pass-through-routingskikt hur en prissänkning når din faktura samma dag: på OrcaRouter skickas leverantörens listpris vidare med 0 % påslag, så när MAI-Image-2.5-Pro är tillgänglig via ett anropsbart tredjeparts-API, är det exakt vad Microsoft tar ut som du betalar – ingen omförhandling, inget andra kontrakt.

Scoreboard for MAI-Image-2.5-Pro: image editing rank No. 1 at 1,272 Elo, text-to-image rank No. 7 at 1,292 Elo, price about USD 108.50 per 1k images, 32k text input tokens, 131k context window, ~1-megapixel output cap, preview status on Microsoft Foundry

Varför ettan tillhör Microsoft som företag, inte bara modellen

Topplistans resultat landar vid en tidpunkt då Microsoft på ett synligt sätt ersätter tredjepartsbildmodeller med egna. MAI-Image-2.5 är redan standardmotorn i Bing Image Creator och körs i PowerPoint, OneDrive och Dynamics 365 Contact Center; Pro-nivån är samma familj inriktad på arbete med högre detaljgrad. Microsoft har sagt att MAI-modellerna tränas på ren, spårbar data "utan destillering från tredjepartsmodeller" — ett direkt svar på frågan om OpenAI-beroendet, och kostnadspåståendena (upp till 84% lägre GPU-kostnad i PowerPoint, leverantörsrapporterat och scenariospecifikt) är en del av samma berättelse: en intern modell som är billigare per uppgift än modellen den ersätter.

Inget av det skulle kunna bevisas för en skeptisk köpare utan den oberoende topplistan, vilket är anledningen till att #1 är strategiskt betydelsefull snarare än bara en poäng. Det är det första oberoende beviset på att Microsofts interna bildlinje slår konkurrensen på den specifika uppgift som den är byggd för.

Vad du ska titta på härnäst

Håller redigeringsledningen i sig allteftersom rösterna räknas in? 1 272 Elo på ~6 100 sampel är en ledning, inte en säker sak; Reve 2.1 ligger 10 poäng efter.

Allmän tillgänglighet och den slutgiltiga prislistan — förhandspriset är inte GA-priset.

Upplösningstaket. En 1-megapixelgräns hindrar Pro från tryckarbete; om Microsoft tar bort den ändras situationen.

MAI-Image-2.6 (privat förhandsvisning, 19 augusti) — nästa steg i familjen, rankad som nr 2 för text-till-bild på den andra huvudarenan.

Oberoende utvärderingar av leverantörens påståenden — textåtergivningens noggrannhet och teckenkonsekvens är overifierade utanför Microsoft.

Slutsatsen från den uppdelade rankingen är inte "Microsoft har nu den bästa bildmodellen." Den är snävare och mer användbar: Microsoft har nu den mest ansedda bildredigeraren på en oberoende rankinglista, till ett premiumpris, i förhandsversion, med en hård upplösningsgräns. Om ditt arbete går ut på att ändra befintliga bilder — hjältebilder, produktbilder, text i bild — är det exakt den modell du bör hålla koll på. Om ditt arbete är generering från tom duk, säger #7-placeringen att det bättre valet fortfarande är GPT Image 2 — och det är den ärliga tolkningen som båda siffrorna ger dig.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube