
MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: En uppmätt #1 mot ett ouppmätt open-weights-vågspel
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
Att jämföra MAI-Image-2.5-Pro med Bernini-Diffusers-v2 är egentligen inte att jämföra två bildmodeller. Det är att jämföra två olika svar på samma fråga – "hur får jag en bra redigering av en befintlig bild?" – där den ena sidan har 6 100 blinda mänskliga röster bakom sin förstaplats i redigeringsrankingen och den andra har en README. MAI-Image-2.5-Pro, Microsofts bildmodell i kvalitetsklassen, gick i offentlig förhandsvisning på Microsoft Foundry den 23 juli 2026 och toppar nu Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, ByteDances andra generationens enhetliga genereringsramverk, dök upp på Hugging Face den 13 augusti 2026 som Apache-2.0-vikter utan tillkännagivande och utan något benchmark för bildkvalitet som någon utanför ByteDance har kört. Alla praktiska skillnader i denna jämförelse följer av dessa två fakta.
En ringer du, en kör du
• MAI-Image-2.5-Pro — en värdbaserad API-modell i offentlig förhandsvisning på Azure AI Foundry och MAI Playground. Proprietär, tokenbaserad debitering, ingen finjustering, ingen självhosting. Du får en slutpunkt och betalar per token; Microsoft driver infrastrukturen.
• Bernini-Diffusers-v2 — Apache-2.0-vikter som du laddar ner från Hugging Face och kör själv. Stacken består av en Qwen2.5-VL-7B semantisk planerare som driver en Wan2.2-baserad DiT-renderare, och README:ns hårdvarurekommendation är Hopper-klass GPU:er (H100/H800/H200) med Python 3.11.2 / PyTorch 2.5.1+cu124. Du står för klustret.
Det är beslutsregeln på en rad: om din organisation vill äga stacken är Bernini ett alternativ; om din organisation vill ha en faktura och ett SLA är det bara MAI-Image-2.5-Pro som ens är aktuellt. De kan inte ersätta varandra.
Evidensgapet är den verkliga rubriken.
De två modellerna står på motsatta sidor av det största kvalitetsproblemet inom bild-AI: att mäta resultatet. MAI-Image-2.5-Pro:s redigeringsförmåga har poängsatts oberoende — Nr 1 på Artificial Analysis Image Editing Arena med Elo 1 272 från ~6 100 blinda jämförelser, före Reve 2.1, GPT Image 2 och dess egen syskonmodell MAI-Image-2.5. Dess text-till-bild-rankning är sjua med 1 292 Elo, vilket är den ärliga motvikten: den är en specialistredigerare, inte ledaren för den tomma duken. De siffrorna är granskningsbara av vem som helst med en webbläsare.
Bernini-Diffusers-v2 har ingen motsvarande offentlig poäng. Modellkortet rapporterar EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 och VBench 84.46 — alla leverantörsrapporterade och alla video-relaterade mått. Det finns inget på kortet som en bildköpare skulle känna igen som ett resultat från en text-till-bild- eller bildredigeringsliga. Kortet hävdar dock att Bernini når "den första nivån" av stängda kommersiella modeller i ByteDances interna blinda parvisa arena — vilket är precis den typ av leverantörsbedömning som behöver en oberoende kontroll innan den betyder något.
• MAI-Image-2.5-Pro: Elo för redigering 1 272 (oberoende, ~6 100 röster); Elo för text-till-bild 1 292 (oberoende, ~11 500 röster)
• Bernini-Diffusers-v2: ingen offentlig bildbenchmark; endast videorelaterade mätvärden, leverantörsrapporterade

Två olika teorier om redigering
Båda modellerna är byggda kring idén att redigering inte ska innebära att scenen regenereras. Men de kommer dit på olika sätt.
MAI-Image-2.5-Pro är Microsofts pitch om "precisa, kirurgiska redigeringar med konsekvens": ändra ett objekt, uppdatera texten i bilden, ta bort rörelseoskärpan och behåll allt annat – motivets identitet, ljus, textur – stabilt. Den konsekvensen är mekanismen bakom påståendet om 94 % karaktärskonsekvens över flera bilder (leverantörsrapporterat, overifierat). Produktmålet är en modell som gör den avgränsade redigeringen och slutar.
Bernini-Diffusers-v2 är en planera-sedan-rendera-pipeline: Qwen2.5-VL-planeraren delar upp en instruktion i semantiska steg — ändra vädret, byt stil, infoga ett objekt, behåll subjektet — och renderaren ritar resultatet. Designen är avsedd för komplexa, flerstegsinstruktioner, och samma vikter täcker text-till-bild, bild-till-bild och video-uppgifter (t2i, i2i, t2v, v2v, rv2v, r2v). Den bredden är fördelen; den omätta kostnaden är att en 7B-planerare är en verklig flaskhals för mycket subtila redigeringar, och ingen utanför ByteDance har kvantifierat hur den hanterar dem.

Textrendering, det praktiska slagfältet
Text i bild är där en modern bildredigerare förtjänar sitt pris, och här är asymmetrin påfallande. MAI-Image-2.5-Pro:s främsta styrka är exakt textåtergivning — Microsoft hävdar 96,8 % noggrannhet på engelska, kinesiska, japanska, koreanska och spanska (leverantörsrapporterat; samma dokumentation begränsar utdata till cirka en megapixel, så betrakta siffran som vägledande). Bernini-Diffusers-v2 har inte publicerat någon textåtergivningsnoggrannhet alls. För ett arbetsflöde som producerar lokaliserade annonser, förpackningar eller något med ett läsbart ord i sig, erbjuder den ena kandidaten ett mätbart påstående och den andra erbjuder ingenting.
Kostnad, och formen på räkningen
• MAI-Image-2.5-Pro — 5 dollar per miljon textinmatningstokens, 8 dollar per miljon bildinmatningstokens, 106 dollar per miljon bildutdatstokens. Kostnaden per bild publiceras inte; Artificial Analysis' omräkning anger en 1024×1024-bild till cirka 108,50 dollar per 1 000. Förhandsversionspris, kan komma att ändras vid GA.
• Bernini-Diffusers-v2 — vikterna är gratis, men självhosting innebär hårdvara i H100-klass (eller molnhyra), drift för att hålla det igång, och din egen skalning. Ekonomin vänder på API-modellen: dyrt för tio bilder om dagen, billigt vid seriös volym.
För de flesta team är det ärliga perspektivet: Berninis totala ägandekostnad är bara fördelaktig om du redan driver en GPU-flotta och arbetsbelastningen är stor och jämn. Annars är ett mätbaserat API till premiumpris det billigare misslyckandet.

Vad en router kan och inte kan göra här
Ingen av modellerna kan routas genom OrcaRouter idag, av motsatta skäl: MAI-Image-2.5-Pro ligger bakom Microsoft Foundrys direkta förhandsversion, och Bernini-Diffusers-v2 är inte en endpoint överhuvudtaget — det är vikter. Detta har principiell betydelse för denna jämförelse: routermönstret tillämpas bara på den hälft av jämförelsen som är ett anropsbart API. När MAI-Image-2.5-Pro blir tillgänglig som ett anropsbart tredjeparts-API, är sättet att adoptera den utan att satsa produktionsvägen på förhandsversionskod att dirigera en del av trafiken till den, med en beprövad modell som automatisk failover — på OrcaRouter är det en endpoint, leverantörspriser som förs vidare med 0 % påslag, och en fallback som fångar upp det som topplistan med få röster inte kunde se. Den öppna viktsidan har ingen motsvarighet: antingen kör du Berninis stack själv eller så använder du den inte.
Domen
MAI-Image-2.5-Pro är en premium, mätbar, värdbaserad editor: #1 på en oberoende redigeringstopplista, ett äkta anspråk på textåtergivning och ett pris därefter. Bernini-Diffusers-v2 är en gratis, bred open-weights-pipeline som är obeprövad för bild och som även hanterar video — genuint intressant om du hostar den själv, genuint omöjlig att poängsätta tills någon kör en offentlig bildevaluering. Om ditt arbetsflöde behöver ett anropsbart API och en siffra du kan försvara, är valet MAI-Image-2.5-Pro eller någon av de andra värdbaserade editorerna som den överträffar. Om ditt arbetsflöde behöver ägande och du kan driva hårdvaran, är Bernini-Diffusers-v2 värd att testa — men köp den som en satsning på ouppmätt potential, inte som en konkurrent till en uppmätt #1.
