
MAI-Image-2.5-Pro vs Grok Imagine Image 2.0 : Deux paris centrés sur l'édition en matière de génération d'images
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
Deux des modèles d'image les plus intéressants de l'année s'accordent sur l'idée clé : l'édition est l'avenir, la génération n'est qu'un prérequis. MAI-Image-2.5-Pro (Microsoft, en aperçu public sur Foundry depuis le 23 juillet) et Grok Imagine Image 2.0 (xAI, sorti le 7 août comme « Quality Mode » par défaut dans les applications Grok) se présentent tous deux avant tout comme des outils d'édition. Mais ils ont développé des outils différents pour le prouver. Le modèle de Microsoft est un moteur de qualité — des retouches chirurgicales et cohérentes appuyées par une première place sur l'Artificial Analysis Image Editing Arena. Le modèle de xAI est un environnement d'édition — une suite d'outils destinés aux utilisateurs (Magic Wand, segmentation, suppression d'arrière-plan, Smart Resize) autour d'un générateur classé n° 2 à 3 sur l'autre grande arène. L'un est évalué sur la fidélité, l'autre sur le flux de travail. C'est là la vraie différence entre eux.
Les ensembles d'outils d'édition n'ont pas la même forme.
• MAI-Image-2.5-Pro — un moteur, pas une boîte à outils. Vous apportez l'instruction et l'image ; il effectue des modifications précises et chirurgicales — remplacement ciblé d'objets, modifications de mise en page, mises à jour du texte dans l'image, nettoyage des artefacts — tout en maintenant l'identité du sujet, l'éclairage et la texture cohérents au fil des itérations. L'affirmation de Microsoft d'une cohérence des personnages multi-images de 94 % (rapportée par le fournisseur) est tout l'argumentaire : changez une chose, gardez tout le reste.
• Grok Imagine Image 2.0 — un environnement. Il inclut Magic Wand (éditer uniquement une région sélectionnée), Segmentation (recolorer ou remplacer des zones précises), la suppression d’arrière-plan, l’entrée multi-référence (jusqu’à 5 images dans les applications grand public, 3 dans l’API), Smart Resize (recomposer une image selon neuf ratios d’aspect), et Templates pour la photographie de produits, les portraits, le e-commerce, les assets de jeux et les affiches marketing.
Lisez cette liste et le positionnement devient clair : MAI-Image-2.5-Pro est le modèle auquel un développeur connecte une API ; Grok Imagine Image 2.0 est le modèle avec lequel une personne travaille dans une interface utilisateur. xAI l'a qualifié d'« environnement d'édition » au lancement, et la boîte à outils est exactement cela.
Où chacun se classe
• MAI-Image-2.5-Pro — n° 1 sur l'Artificial Analysis Image Editing Arena (Elo 1 272, ~6 100 votes à l'aveugle) ; n° 7 en texte-vers-image (1 292 Elo). Évaluation indépendante basée sur des préférences à l'aveugle.
• Grok Imagine Image 2.0 — Au lancement, xAI a revendiqué la 2e place mondiale au classement texte-image d'Arena, derrière GPT Image 2 ; lors de l'instantané du 10 août, le modèle occupait la 3e place (Elo 1 316), derrière GPT Image 2 (1 381) et le plus récent MAI-Image-2.6 de Microsoft (1 336). Ce rang est indépendant et préliminaire, et la formulation « n° 2 mondial » de xAI doit être qualifiée pour ce qu'elle est : une revendication de lancement émanant du fournisseur, que le classement en direct a depuis révisée.
Aucun modèle ne mène sur le terrain de l'autre, et aucun ne trône en tête du tableau principal de l'autre. La lecture la plus simple : le modèle de Microsoft domine le score d'édition, celui de xAI domine l'outillage et se place près du sommet en génération.

Le rendu du texte, la fonctionnalité décisive
Le texte dans l'image est le point où les deux divergent le plus nettement, et là où les preuves indépendantes sont unilatérales. Microsoft revendique une précision de rendu du texte de 96,8 % pour MAI-Image-2.5-Pro en anglais, chinois, japonais, coréen et espagnol — un chiffre fourni par le vendeur, non vérifié, couplé à un plafond de sortie d'un mégapixel, mais une capacité réelle annoncée avec une couverture multilingue. Les résultats de tests indépendants de Grok Imagine Image 2.0, publiés par l'évaluation propre d'OrcaRouter du modèle face à GPT Image 2, révèlent qu'il rend le texte CJK de manière peu fiable — lors d'un test, il a rendu du chinois traditionnel alors que du chinois simplifié était demandé pour un titre d'affiche de film, un critère rédhibitoire pour le travail publicitaire localisé. Pour tout flux de travail comportant un mot lisible dans l'image, MAI-Image-2.5-Pro est le choix le plus sûr sur le papier ; la qualité textuelle de Grok nécessite une validation sur votre propre contenu avant de lui faire confiance.
Prix
• MAI-Image-2.5-Pro — tarification au token : 5 $ par million de tokens en entrée texte, 8 $ par million de tokens en entrée image, 106 $ par million de tokens en sortie image. Selon la conversion d'Artificial Analysis, une image 1024×1024 revient à près de 108,50 $ par 1 000.
• Grok Imagine Image 2.0 — tarification fixe par image, sans jetons : 0,05 $ par image en 1K ou 2K pour le niveau qualité (`grok-imagine-image-quality`), 0,02 $ pour le niveau standard, avec une facturation de l’entrée et de la sortie pour les modifications. En 1K, cela représente 50 $ pour 1 000 images de qualité — soit environ la moitié du tarif par millier de MAI-Image-2.5-Pro, avec un coût fixe qui ne varie pas selon la longueur du prompt.
Les modèles de tarification sont philosophiquement différents. La facturation par token de Microsoft pénalise les prompts longs et les sorties volumineuses ; le tarif fixe par image de xAI est prévisible et indépendant de la longueur du prompt. À volume important, le tarif fixe est le plus facile à prévoir, et le tarif du palier qualité est inférieur à celui de MAI-Image-2.5-Pro.

Disponibilité et angle de routage
Les deux sont accessibles, mais par des portes différentes. MAI-Image-2.5-Pro est une préversion Microsoft Foundry et le MAI Playground — vous avez besoin d'un compte Microsoft et le tarif de préversion s'applique. Grok Imagine Image 2.0 est sorti dans les applications grand public de xAI le 7 août et son niveau de qualité est appelable via l'API Imagine de xAI ; il est également disponible sur le point de terminaison compatible OpenAI d'OrcaRouter depuis la mi-août, où le niveau standard et le niveau de qualité se trouvent derrière une seule clé avec les prix des fournisseurs répercutés à 0% de marge et un basculement automatique vers une solution de repli comme GPT Image 2.
La différence pratique que cela implique : adopter Grok Imagine Image 2.0 dans un pipeline de production est un changement de chaîne de modèle sur un endpoint que vous utilisez peut-être déjà, avec un tarif forfaitaire avantageux et un repli intégré pour les cas où il échoue — précisément le mode de défaillance que la couche de routage existe pour attraper. Adopter MAI-Image-2.5-Pro signifie pour l'instant contracter directement avec Foundry, et la note de routage honnête est la même qu'il y a un mois : lorsque l'aperçu de Microsoft deviendra largement appelable via une API tierce, c'est à ce moment-là que le même modèle à une seule clé s'ouvrira pour lui.

Le verdict
Choisissez MAI-Image-2.5-Pro lorsque votre travail est une modification en haute fidélité d’une image existante et que le résultat doit tenir la route — c’est l’éditeur indépendant n°1 sur Artificial Analysis, il revendique un véritable rendu multilingue du texte, et son prix est à la hauteur. Choisissez Grok Imagine Image 2.0 lorsque vous souhaitez un flux de travail d’édition avec de véritables outils, un prix forfaitaire facile à prévoir et environ la moitié du coût par image, ainsi qu’un modèle que vous pouvez router dès aujourd’hui avec une solution de repli. Le cadrage honnête n’est pas « lequel est meilleur » — c’est quel pari correspond à votre flux de travail : Microsoft parie que la fidélité gagne la modification, et xAI parie que l’ensemble d’outils gagne l’utilisateur. Les deux sont défendables ; vos exigences de qualité de sortie et votre tolérance au risque de rendu du texte sont ce qui départage.
