Carte vedette pour le match entre MAI-Image-2.5-Pro à environ 108,50 $ pour 1 000 images et Qwen-Image 3.0 à environ 25 $ pour 1 000 images, deux modèles d’images API qui excellent tous deux dans le rendu de texte.
Guides & Insights

MAI-Image-2.5-Pro vs Qwen-Image 3.0 : Quatre fois le prix pour un autre type de texte

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez MAI-Image-2.5-Pro et Qwen-Image 3.0 côte à côte et la première chose que vous remarquez est le prix : environ 108,50 $ pour 1 000 images pour le niveau premium de Microsoft contre environ 25–30 $ pour 1 000 pour le Qwen-Image 3.0 d'Alibaba — le tarif annoncé par Alibaba lui-même est proche de 25 $, tandis que le classement d'Artificial Analysis indique 30 $. Cela représente plus de trois fois le prix, quel que soit le chiffre retenu. Ce que cette prime achète en réalité, c'est un autre type de rendu de texte. Qwen-Image 3.0, publié par l'équipe Qwen d'Alibaba le 21 juillet 2026 et disponible via une API internationale depuis le 4 août, est proposé à un prix qui en fait le moteur de rendu de texte à grand volume — lisible jusqu'à ~10 px dans douze langues, avec une fenêtre de prompt de 4 500 jetons pour des briefs denses. MAI-Image-2.5-Pro, en aperçu public sur Microsoft Foundry depuis le 23 juillet, est l'éditeur le mieux considéré d'un classement indépendant, avec une précision de rendu de texte revendiquée par le fournisseur mais une limite de sortie stricte d'environ 1 mégapixel. Ce sont deux modèles d'image par API dont les arguments phares portent sur le texte ; ils sont en concurrence sur le prix par tâche, et non sur un score de qualité unique.

Deux histoires textuelles, ni l'une ni l'autre entièrement vérifiée.

La bataille du texte explique pourquoi les deux modèles existent, et c'est aussi là que les preuves sont les plus ténues — chaque chiffre de cette section est rapporté par le fournisseur et aucun n'a été reproduit de manière indépendante.

Qwen-Image 3.0 — les documents de lancement d'Alibaba affirment un rendu lisible jusqu'à environ 10px, une prise en charge native de 12 langues avec plus de 20 polices et plus de 100 styles artistiques, la notation mathématique, les indices, les exposants et les formules sur plusieurs lignes, ainsi qu'une familiarité avec les interfaces Web, de jeu et logicielles courantes. La fenêtre de prompt peut aller jusqu'à 4 500 jetons d'entrée — un bond de 4,5× par rapport à la génération précédente — ce qui lui permet d'absorber des briefs denses comme des unes de journaux ou une grille de connaissances à neuf panneaux en un seul appel.

MAI-Image-2.5-Pro — Microsoft affirme une précision de rendu du texte de 96,8 %sur le chinois, l'anglais, le japonais, le coréen et l'espagnol, une adhérence aux prompts supérieure de 27 %à celle de GPT-Image-1.5 lors d'évaluations internes, et une cohérence des personnages sur plusieurs images de 94 %. La spécification d'entrée est plus généreuse sur le papier — jusqu'à 32 000 tokens de texte en entrée avec une fenêtre de contexte de 131k — et la sortie est plafonnée à 1 048 576 pixels, soit l'équivalent d'une image 1024×1024.

Les deux affirmations n'ont pas été reproduites à ce jour. La différence tient à la forme des affirmations : celle de Q​wen porte sur le volume et la lisibilité selon les écritures, celle de Microsoft sur la précision et la cohérence dans un ensemble défini de cinq langues. Aucun des deux fournisseurs n'a publié de benchmark qu'un autre laboratoire pourrait exécuter et vérifier.

C'est dans l'édition que réside le premium.

Ce qui sépare les deux, c'est l'édition, et c'est le seul axe avec des preuves indépendantes. MAI-Image-2.5-Pro se situe à la première place sur l'Artificial Analysis Image Editing Arena avec un Elo de 1 272 (environ 6 100 votes à l'aveugle), devant Reve 2.1, MAI-Image-2.5 et GPT Image 2. Sur le même classement, le plus récent Qwen-Image-3.0-Pro est à 1 249 — un score compétitif, à 23 Elo de distance, et remarquable pour un modèle qui n'a atteint l'API internationale que ce mois-ci.

Au-delà du modèle de base, le portefeuille d'édition d'Alibaba est un ensemble d'astuces spécialisées plutôt qu'une couronne unique : restauration de peintures anciennes, génération de panoramas, du croquis au PPT et storyboarding multi-images. Celui de Microsoft est un pari plus étroit mais plus profond — des modifications précises et chirurgicales qui maintiennent la cohérence du reste du cadre (remplacement d'objets, changements de mise en page, mises à jour de texte dans l'image, nettoyage du flou), soit la catégorie de modifications où les anciens modèles régénèrent toute la scène et perdent le sujet. Pour un flux de travail qui consiste à « prendre cet actif existant, changer une chose, le livrer », la première place indépendante du niveau Pro est le signal le plus fort ; pour un fourre-tout de formats d'édition créative, la liste de Qwen est plus large.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

Le contraste de spécification

• Prix — ~108,50 $ pour 1k images (1024×1024, conversion AA) contre ~25–30 $ pour 1k images (devis Alibaba contre tarif indiqué par AA)br />• Sortie — 23 juillet 2026 (préversion publique, Foundry) contre 21 juillet 2026, API internationale le 4 aoûtbr />• Entrée de texte — 32 000 jetons, contexte de 131k contre fenêtre de prompt de 4 500 jetonsbr />• Plafond de sortie — ~1 048 576 pixels (~1K) contre jusqu’à 2048×2048br />• Images par appel — sortie unique par requête contre jusqu’à six images par appelbr />• Rang en édition — n° 1, Elo 1 272 (AA) contre 1 249 pour Qwen-Image-3.0-Pro sur le même classementbr />• Provenance — affirmation de Microsoft « aucune distillation de modèles tiers » contre étiquette de provenance AIGC sur les sortiesbr />• Poids — fermés, API uniquement contre fermés, API uniquement

Le plafond de sortie et le nombre par appel comptent plus qu'il n'y paraît. Qwen-Image 3.0 peut générer une image de 2048×2048 et peut renvoyer jusqu'à six images par appel, ce qui est un avantage économique pour le traitement en lot ; le niveau Pro plafonne à près de 1K et renvoie une seule sortie par requête. Si votre brief est « donnez-moi une série de six photos produit », le modèle Alibaba est conçu pour cela, et le modèle Microsoft ne l'est pas.

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

Quand la prime se rentabilise.

La règle de décision concerne l'objectif des images, et non quel modèle est « meilleur ».

Payez le supplément pour MAI-Image-2.5-Pro lorsque le résultat est un visuel vedette — un visuel produit, une affiche, une image clé, une image qui entre dans une campagne et ne sera pas régénérée cinquante fois. Le classement n°1 en édition et la promesse de cohérence des personnages comptent surtout lorsqu'une retouche doit être juste du premier coup.

Achetez en volume avec Qwen-Image 3.0 lorsque le résultat est jetable ou en grande quantité — variantes publicitaires localisées, illustrations provisoires, présentations croquis-vers-PowerPoint, storyboards, tout ce que vous régénérerez plutôt que d'affiner. À 25–30 $ par 1k, une génération ratée ne coûte qu'une erreur d'arrondi ; à 108,50 $ par 1k, ce n'est plus le cas.

Il existe un juste milieu qui mérite d'être nommé : pour les travaux denses de texte dans l'image multilingue — une maquette de page d'accueil avec des textes en japonais et en espagnol, une infographie avec des formules — la lisibilité à 10 px de Q​wen et ses douze langues constituent le meilleur choix sur le papier, et pour un quart du prix. Le contre-argument du modèle Microsoft est sa revendication de précision de 96,8 % dans cinq langues, mais cette affirmation n'est pas vérifiée, et un acheteur qui doit choisir entre deux affirmations non vérifiées devrait probablement accorder du poids au prix.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

La couche de routage, lorsqu'elle s'applique.

Aucun des deux modèles n'est encore accessible via OrcaRouter — Qwen-Image 3.0 est disponible sur la propre API d'Alibaba (Alibaba Cloud Bailian et la plateforme Q​wen) et sur plusieurs plateformes tierces, et MAI-Image-2.5-Pro est sur Microsoft Foundry — donc une comparaison honnête dit clairement qu'aucun des deux n'est de notre côté aujourd'hui. Lorsque l'un ou l'autre deviendra disponible via un fournisseur hébergé appelable, l'économie du pass-through s'applique : 0 % de marge sur le prix catalogue du fournisseur, donc vous payez la grille tarifaire du vendeur, et une remise de lancement ou une baisse de prix est répercutée sur votre facture le jour même de son annonce. L'argument du basculement est l'autre moitié : Qwen-Image 3.0 est une API internationale vieille de quelques semaines, le genre de modèle vers lequel on route une partie du trafic tandis qu'une solution de repli éprouvée absorbe les cas limites — ce qui est précisément la configuration pour laquelle une couche de routage est conçue.

Le verdict

Qwen-Image 3.0 et MAI-Image-2.5-Pro ne sont pas le même produit à des prix différents ; ce sont des produits différents qui se trouvent être facturés différemment. Le modèle de Microsoft remporte la couronne en matière d’édition, dispose d’une fenêtre de contexte plus large et avance une affirmation de précision non vérifiée dans cinq langues — pour les visuels vedettes et les retouches chirurgicales, la prime se justifie. Le modèle d’Alibaba rend davantage de scripts lisibles, accepte des briefs plus denses par génération selon ses propres conditions, produit des sorties plus grandes et par lots de six, et coûte un quart du prix — pour le volume et le travail multilingue de texte dans l’image, c’est le choix économiquement rationnel. Achetez la prime là où l’image est le produit ; achetez le volume là où l’image est un inventaire.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube