Carte vedette pour la confrontation entre MAI-Image-2.5-Pro, un modèle d'édition premium en aperçu dans Microsoft Foundry, et Bernini-Diffusers-v2, le pipeline open-weights de ByteDance sous licence Apache-2.0.
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2 : un #1 mesuré contre un pari open-weights non mesuré.

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Comparer MAI-Image-2.5-Pro avec Bernini-Diffusers-v2 ne revient pas vraiment à comparer deux modèles d'image. C'est comparer deux réponses différentes à la même question — « comment obtenir une bonne édition d'une image existante ? » — où l'un a 6 100 votes humains à l'aveugle derrière son rang n°1 en édition et l'autre n'a qu'un README. MAI-Image-2.5-Pro, le modèle d'image haut de gamme de Microsoft, est passé en aperçu public sur Microsoft Foundry le 23 juillet 2026 et trône désormais en tête de l'Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, le framework de génération unifiée de deuxième génération de ByteDance, est arrivé sur Hugging Face le 13 août 2026 sous forme de poids Apache-2.0, sans annonce ni benchmark de qualité d'image que quiconque en dehors de ByteDance ait exécuté. Chaque différence concrète dans ce face-à-face découle de ces deux faits.

L'un que vous appelez, l'autre que vous exécutez

MAI-Image-2.5-Pro — un modèle d’API hébergé en aperçu public sur Azure AI Foundry et le MAI Playground. Propriétaire, facturé au token, sans fine-tuning, sans auto-hébergement. Vous obtenez un endpoint et payez au token ; Microsoft gère l’infrastructure.

Bernini-Diffusers-v2 — des poids Apache-2.0 que vous téléchargez depuis Hugging Face et exécutez vous-même. La pile est un planificateur sémantique Qwen2.5-VL-7B qui pilote un rendu DiT basé sur Wan2.2, et la recommandation matérielle du README est des GPU de classe Hopper (H100/H800/H200) avec Python 3.11.2 / PyTorch 2.5.1+cu124. C'est à vous de fournir le cluster.

{{1}}Voilà la règle de décision en une ligne : si votre organisation veut posséder le stack, Bernini est une option ; si votre organisation veut une facture et un SLA, seul MAI-Image-2.5-Pro est même en lice.{{/1}} Ils ne sont pas des substituts l'un pour l'autre.

Le manque de preuves est le véritable titre.

Les deux modèles se situent de part et d'autre du plus grand problème de qualité en IA d'image : mesurer la sortie. La compétence d'édition de MAI-Image-2.5-Pro est évaluée indépendamment — N° 1 sur l'Artificial Analysis Image Editing Arena avec un Elo de 1 272 sur ~6 100 comparaisons en aveugle, devant Reve 2.1, GPT Image 2, et son propre jumeau MAI-Image-2.5. Son classement texte-à-image est septième avec 1 292 Elo, ce qui constitue le contrepoids honnête : c'est un éditeur spécialiste, pas le leader de la création sur toile vierge. Ces chiffres sont vérifiables par quiconque dispose d'un navigateur.

Bernini-Diffusers-v2 n'a pas de score public équivalent. La fiche modèle rapporte EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 et VBench 84.46 — tous déclarés par le fournisseur, et tous des métriques côté vidéo. Il n'y a rien sur la fiche qu'un acheteur d'images reconnaîtrait comme un résultat de classement texte-à-image ou d'édition d'images. La fiche prétend que Bernini atteint « le premier rang » des modèles commerciaux fermés dans l'arène interne de comparaison en aveugle par paires de ByteDance — ce qui est exactement le type d'auto-évaluation du fournisseur qui nécessite une vérification indépendante avant de signifier quoi que ce soit.

MAI-Image-2.5-Pro:édition Elo 1 272 (indépendant, ~6 100 votes) ; texte-vers-image Elo 1 292 (indépendant, ~11 500 votes)

Bernini-Diffusers-v2: aucun benchmark d'image public ; uniquement des métriques côté vidéo, rapportées par le fournisseur

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Deux théories différentes de l'édition

Les deux modèles reposent sur l'idée que l'édition ne devrait pas signifier régénérer la scène. Mais ils y parviennent différemment.

MAI-Image-2.5-Pro est le pitch de Microsoft pour des « modifications précises et chirurgicales avec cohérence » : changer un objet, mettre à jour le texte dans l'image, nettoyer le flou de mouvement, et conserver tout le reste — identité du sujet, éclairage, texture — stable. Cette cohérence est le mécanisme derrière son affirmation de cohérence des personnages multi-images à 94 % (rapportée par le fournisseur, non vérifiée). L'objectif du produit est un modèle qui effectue la modification ciblée et s'arrête.

Bernini-Diffusers-v2 est un pipeline planifier-puis-rendre : le planificateur Qwen2.5-VL décompose une instruction en étapes sémantiques — changer la météo, modifier le style, insérer un objet, conserver le sujet — et le moteur de rendu dessine le résultat. La conception vise des instructions complexes et multi-étapes, et les mêmes poids couvrent les tâches texte-vers-image, image-vers-image et vidéo (t2i, i2i, t2v, v2v, rv2v, r2v). Cette largeur de spectre est l’avantage ; le coût non mesuré est qu’un planificateur de 7B constitue un réel goulot d’étranglement pour des modifications très subtiles, et personne en dehors de ByteDance n’a quantifié la manière dont il les gère.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Le rendu de texte, le champ de bataille pratique

Le texte intégré à l'image est ce qui justifie le prix d'un éditeur d'images moderne, et ici l'asymétrie est frappante. La capacité phare de MAI-Image-2.5-Pro est le rendu précis du texte — Microsoft revendique une précision de 96,8 % sur l'anglais, le chinois, le japonais, le coréen et l'espagnol (chiffres communiqués par le fournisseur ; les mêmes documents plafonnent la sortie à près d'un mégapixel, donc considérez ce chiffre comme une indication). Bernini-Diffusers-v2 n'a publié aucune précision de rendu de texte. Pour un flux de travail qui produit des publicités localisées, des emballages ou tout élément contenant un mot lisible, un candidat offre une affirmation mesurable et l'autre n'offre rien.

Le coût et la forme de la facture.

MAI-Image-2.5-Pro — 5 $ par million de jetons de texte en entrée, 8 $ par million de jetons d'image en entrée, 106 $ par million de jetons d'image en sortie. Le coût par image n'est pas publié ; la conversion d'Artificial Analysis situe une image 1024×1024 à environ 108,50 $ pour 1 000. Tarification préliminaire, sujette à changement à la GA.

Bernini-Diffusers-v2 — les poids sont gratuits, mais l'auto-hébergement implique du matériel de classe H100 (ou une location cloud), les opérations pour le faire fonctionner, et votre propre mise à l'échelle. La logique économique inverse le modèle API : cher pour dix images par jour, économique à volume important.

Pour la plupart des équipes, la formulation honnête est la suivante : le coût total de possession de Bernini n'est avantageux que si vous disposez déjà d'un parc de GPU et que la charge de travail est importante et stable. Sinon, une API facturée à l'usage à un tarif premium est l'échec le moins coûteux.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Ce qu'un routeur peut et ne peut pas faire ici

Aucun des deux modèles n’est routable via OrcaRouter aujourd’hui, pour des raisons opposées : MAI-Image-2.5-Pro se trouve derrière l’aperçu direct de Microsoft Foundry, et Bernini-Diffusers-v2 n’est pas du tout un endpoint — c’est des poids. C’est un point de principe important pour cette confrontation : le schéma de routage ne s’applique qu’à la moitié de cette comparaison qui est une API appelable. Quand MAI-Image-2.5-Pro arrivera sur une API tierce appelable, la façon de l’adopter sans engager une voie de production sur du code d’aperçu est de router une partie du trafic vers lui, avec un modèle éprouvé en bascule automatique — sur OrcaRouter, cela donne un endpoint, des prix fournisseur répercutés à 0% de marge, et un fallback qui rattrape ce que le classement à faible vote n’a pas pu voir. Le côté des poids ouverts n’a pas d’équivalent : soit vous faites tourner la pile de Bernini vous-même, soit vous ne l’utilisez pas.

Le verdict

MAI-Image-2.5-Pro est un éditeur hébergé premium et mesurable : n°1 sur un classement indépendant, une véritable promesse de rendu de texte, et un prix à la hauteur. Bernini-Diffusers-v2 est un pipeline open-weights gratuit, polyvalent, non éprouvé pour l'image, qui fait aussi de la vidéo — véritablement intéressant si vous auto-hébergez, véritablement impossible à noter tant que personne n'a mené une évaluation publique d'images. Si votre flux de travail nécessite une API appelable et un score que vous pouvez défendre, le choix est MAI-Image-2.5-Pro ou l'un des autres éditeurs hébergés qu'il devance. Si votre flux de travail exige la propriété et que vous pouvez faire tourner le matériel, Bernini-Diffusers-v2 vaut la peine d'être testé — mais voyez-le comme un pari sur un potentiel non mesuré, pas comme un concurrent d'un n°1 mesuré.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube