
MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Een gemeten #1 tegen een ongemeten open-weights-weddenschap
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
Het vergelijken van MAI-Image-2.5-Pro met Bernini-Diffusers-v2 is niet echt het vergelijken van twee beeldmodellen. Het is het vergelijken van twee verschillende antwoorden op dezelfde vraag — "hoe krijg ik een goede bewerking van een bestaande afbeelding?" — waarbij de ene kant 6.100 blinde menselijke stemmen achter zijn nummer 1-bewerkingsrangschikking heeft en de andere kant een README. MAI-Image-2.5-Pro, Microsofts beeldmodel van kwaliteitsklasse, ging op 23 juli 2026 in openbare preview op Microsoft Foundry en staat nu bovenaan de Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, ByteDances tweede generatie uniforme generatieframework, verscheen op 13 augustus 2026 op Hugging Face als Apache-2.0-gewichten zonder aankondiging en zonder beeldkwaliteitsbenchmark die iemand buiten ByteDance heeft uitgevoerd. Elk praktisch verschil in deze vergelijking vloeit voort uit die twee feiten.
Eén bel je, één laat je draaien.
• MAI-Image-2.5-Pro — een gehost API-model in openbare preview op Azure AI Foundry en de MAI Playground. Propriëtair, met afrekening per token, geen fine-tuning, geen self-hosting. Je krijgt een endpoint en betaalt per token; Microsoft beheert de infrastructuur.
• Bernini-Diffusers-v2 — Apache-2.0-gewichten die je downloadt van Hugging Face en zelf draait. De stack is een Qwen2.5-VL-7B semantische planner die een op Wan2.2 gebaseerde DiT-renderer aanstuurt, en de hardware-aanbeveling in de README is Hopper-klasse GPU's (H100/H800/H200) met Python 3.11.2 / PyTorch 2.5.1+cu124. Jij levert het cluster.
Dat is de beslissingsregel in één zin: als uw organisatie de stack in eigen beheer wil hebben, is Bernini een optie; als uw organisatie een factuur en een SLA wil, komt alleen MAI-Image-2.5-Pro in aanmerking. Ze zijn geen vervangingen voor elkaar.
De bewijskloof is de echte kop.
De twee modellen staan aan weerszijden van het grootste kwaliteitsprobleem in beeld-AI: het meten van de output. De beeldbewerkingsvaardigheid van MAI-Image-2.5-Pro wordt onafhankelijk beoordeeld — Nr. 1 op de Artificial Analysis Image Editing Arena met een Elo van 1.272 op basis van ~6.100 blinde vergelijkingen, vóór Reve 2.1, GPT Image 2 en zijn eigen zustermodel MAI-Image-2.5. Op de text-to-image-ranglijst staat het zevende met 1.292 Elo, wat het eerlijke tegenwicht is: het is een gespecialiseerde editor, niet de leider op het lege canvas. Die cijfers zijn voor iedereen met een browser controleerbaar.
{{1}}Bernini-Diffusers-v2 heeft geen gelijkwaardige publieke score.{{/1}} {{2}}De modelkaart rapporteert EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 en VBench 84.46{{/2}} {{3}}— allemaal door de leverancier gerapporteerd, en allemaal metrics aan de videokant.{{/3}} {{4}}Er staat niets op de kaart dat een koper van afbeeldingen zou herkennen als een leaderboard-resultaat voor tekst-naar-afbeelding of beeldbewerking.{{/4}} {{5}}De kaart beweert wel dat Bernini "het eerste niveau" van gesloten commerciële modellen bereikt in de interne blinde paarsgewijze arena van ByteDance — wat precies het soort leverancierszelfbeoordeling is dat een onafhankelijke controle nodig heeft voordat het iets betekent.{{/5}}
• MAI-Image-2.5-Pro: beeldbewerking Elo 1.272 (onafhankelijk, ~6.100 stemmen); tekst-naar-afbeelding Elo 1.292 (onafhankelijk, ~11.500 stemmen)
• Bernini-Diffusers-v2: geen openbare image-benchmark; alleen metrics aan de videokant, gerapporteerd door de leverancier

Twee verschillende theorieën over redigeren
Beide modellen zijn gebouwd rond het idee dat bewerken niet het opnieuw genereren van de scène mag betekenen. Maar ze bereiken dat anders.
MAI-Image-2.5-Pro is de pitch van Microsoft voor 'precieze, chirurgische bewerkingen met consistentie': verander één object, update de tekst in de afbeelding, verwijder de bewegingsonscherpte en houd al het andere stabiel — de identiteit van het onderwerp, de belichting, de textuur. Die consistentie is het mechanisme achter de claim van 94% personageconsistentie over meerdere afbeeldingen (door de leverancier gerapporteerd, niet geverifieerd). Het productdoel is een model dat de beperkte bewerking uitvoert en daarna stopt.
Bernini-Diffusers-v2 is een plan-then-render-pijplijn: de Qwen2.5-VL-planner ontleedt een instructie in semantische stappen — verander het weer, wissel de stijl, voeg een object in, behoud het onderwerp — en de renderer produceert het resultaat. Het ontwerp is gericht op complexe, meerstapsinstructies, en dezelfde gewichten bestrijken text-to-image-, image-to-image- en videotaken (t2i, i2i, t2v, v2v, rv2v, r2v). Die breedte is het voordeel; de ongemeten kosten zijn dat een 7B-planner een echt knelpunt vormt voor zeer subtiele bewerkingen, en niemand buiten ByteDance heeft gekwantificeerd hoe hij daarmee omgaat.

Tekstweergave, het praktische slagveld
In-afbeeldingstekst is waar een moderne beeldeditor zijn prijs verdient, en hier is de asymmetrie groot. Het belangrijkste kenmerk van MAI-Image-2.5-Pro is nauwkeurige tekstweergave — Microsoft claimt 96,8% nauwkeurigheid voor Engels, Chinees, Japans, Koreaans en Spaans (door de leverancier gerapporteerd; dezelfde documenten beperken de uitvoer tot ongeveer één megapixel, dus beschouw het getal als richtinggevend). Bernini-Diffusers-v2 heeft helemaal geen nauwkeurigheid voor tekstweergave gepubliceerd. Voor een workflow die gelokaliseerde advertenties, verpakkingen of iets met een leesbaar woord erin produceert, biedt de ene kandidaat een meetbare claim en de andere niets.
Kosten en de vorm van de rekening
• MAI-Image-2.5-Pro$5 per miljoen tekstinvoertokens, $8 per miljoen beeldinvoertokens, $106 per miljoen beelduitvoertokens. De kosten per afbeelding worden niet gepubliceerd; volgens de omrekening van Artificial Analysis kost een 1024×1024-afbeelding ongeveer $108,50 per 1.000. Voorlopige prijzen, onder voorbehoud van wijzigingen bij GA.
• Bernini-Diffusers-v2 — de weights zijn gratis, maar self-hosting betekent H100-klasse hardware (of cloudhuur), de operaties om het draaiende te houden, en je eigen opschaling. De economie keert het API-model om: duur voor tien afbeeldingen per dag, goedkoop bij serieus volume.
Voor de meeste teams is het eerlijke kader: Bernini's totale eigendomskosten zijn alleen gunstig als je al een GPU-vloot draait en de werklast groot en stabiel is. Anders is een gemeten API tegen een premietarief de goedkopere mislukking.

Wat een router hier wel en niet kan doen
Geen van beide modellen is vandaag routeerbaar via OrcaRouter, om tegengestelde redenen: MAI-Image-2.5-Pro zit achter de directe preview van Microsoft Foundry, en Bernini-Diffusers-v2 is helemaal geen endpoint — het zijn gewichten. Dat is principieel van belang voor deze vergelijking: het routerpatroon is alleen van toepassing op de helft van deze vergelijking die een aanroepbare API is. Wanneer MAI-Image-2.5-Pro een aanroepbare API van een derde partij bereikt, is de manier om het te adopteren zonder een productiepad op previewcode in te zetten, door een deel van het verkeer ernaartoe te routeren met een bewezen model als automatische failover — op OrcaRouter is dat één endpoint, providerprijzen doorgegeven met 0% opslag, en een fallback die opvangt wat het leaderboard met weinig stemmen niet kon zien. De open-weights-kant heeft geen equivalent: je draait Bernini's stack zelf of je gebruikt hem niet.
Het vonnis
MAI-Image-2.5-Pro is een premium, meetbare, gehoste editor: nummer 1 op een onafhankelijke beoordelingslijst, een echte claim op tekstweergave en een prijs die daarbij past. Bernini-Diffusers-v2 is een gratis, brede, qua afbeeldingen onbewezen open-weights-pijplijn die ook video doet — echt interessant als je zelf host, echt niet te scoren totdat iemand een publieke image-evaluatie draait. Als je workflow een aanroepbare API en een verdedigbaar cijfer nodig heeft, is de keuze MAI-Image-2.5-Pro of een van de andere gehoste editors die het verslaat. Als je workflow eigendom nodig heeft en je de hardware kunt draaien, is Bernini-Diffusers-v2 het testen waard — maar koop het als een gok op ongemeten potentieel, niet als concurrent voor een gemeten nummer 1.
