Carte de titre principale pour Grok Imagine Image 2.0 indiquant « Grok Imagine Image 2.0 — n° 2 sur l’Arena text-to-image, édition de précision, désormais disponible dans les applications Grok » avec la légende « Annoncé le 7 août 2026 par xAI » et une icône d’édition plate représentant un cadre photo avec un stylo.
Guides & Insights

Grok Imagine Image 2.0 : n° 4 sur Artificial Analysis, à un tiers du prix

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Grok Imagine Image 2.0 a atteint la 4e place du Text to Image Leaderboard d’Artificial Analysis, et le chiffre qui compte n’est pas le rang — c’est le prix à côté. Le modèle se situe à 1 153,66 Elo, derrière trois entrées : GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) et GPT Image 2 (high). Devant le modèle de tous les autres laboratoires, y compris MAI-Image-2.6 de Microsoft et le modèle Nano Banana 2. Ce qui fait de ce modèle le générateur d’images le mieux classé en dehors de ce trio, et, de loin, l’élément le moins cher de ce top quatre : Artificial Analysis le tarifie à 60 $ pour 1 000 images, contre environ 211 $ pour les trois entrées au-dessus. Le modèle lui-même date du 7 août 2026 — ce qui a changé, c’est la place que lui attribue le classement indépendant, et l’effet que cela a sur le positionnement « n°2 mondial » utilisé par son créateur au lancement.

Ce que mesure réellement le placement #4

Le classement Text to Image d'Artificial Analysis est une arène en aveugle fondée sur les préférences humaines : les votants voient les résultats issus d'un même prompt, sans étiquette de modèle, et choisissent le meilleur ; l'Elo qui en résulte est publié indépendamment de tout fournisseur. L'entrée de Grok Imagine Image 2.0 le place n° 4, avec un Elo de 1 153,66 et un intervalle de confiance à 95 % allant de 1 141,66 à 1 165,66. Aucun de ces chiffres ne provient de xAI. (Un détail pratique à connaître lorsque vous consultez le classement : Artificial Analysis indique que le créateur du modèle est SpaceXAI.)

Le volet tarifaire de l'histoire est le plus intéressant. La même page trace la qualité en fonction du prix, avec une courbe de Pareto qui marque les modèles offrant le meilleur rendement en Elo par dollar, et selon les chiffres publiés par le classement lui-même, Grok Imagine Image 2.0 est le modèle le mieux noté dont le prix est inférieur à 100 $ pour 1 000 images. Le modèle immédiatement supérieur en qualité, GPT Image 2 (high), coûte 211 $ pour 1 000 images — soit environ trois fois et demie plus cher pour environ 17 points d'Elo de plus. Il s'agit d'une affirmation sur le rapport prix-performance, et non d'une affirmation selon laquelle il serait le meilleur modèle, et c'est la version de l'histoire que les données indépendantes étayent réellement.

La position à la frontière est réelle, mais étroite, et il vaut la peine de le dire clairement. MAI-Image-2.6 de Microsoft se classe un rang en dessous, à 38,90 $ les 1 000, et Muse Image de Meta est à 10 $ les 1 000, à 1 111 Elo. Les intervalles d'Elo sur ce classement sont d'environ ±12 points, donc les n° 4 et n° 5 — séparés par 6,5 Elo — se trouvent dans les barres d'erreur l'un de l'autre. Considérez ce placement comme un « top cinq », et non comme une place définitive.

Le bond de 14 places correspond à l’écart avec le palier que Grok Imagine Image 2.0 a remplacé. Le précédent palier de qualité de xAI, grok-imagine-image-quality, occupe la 18e place du même classement avec 1 043,21 Elo, et le grok-imagine-image d’origine est 29e avec 1 017,86 Elo. Cela représente environ 110 points Elo et 14 places de classement d’écart entre le modèle que xAI documente désormais comme son modèle d’image par défaut et celui qu’il remplace.

Où en est aujourd'hui la revendication du « monde n°2 »

Lors du lancement, xAI a cité une deuxième place sur les tableaux Arena de génération d'images à partir de texte et d'édition d'images, avec environ 1 320 Elo et la mention Preliminary. Il s'agissait de chiffres que xAI a mis en avant dans sa propre annonce — et non d'une évaluation indépendante qu'elle aurait commandée — et ils ont évolué depuis : l'instantané du 10 août plaçait le modèle à la 3e place avec 1 316 Elo, derrière MAI-Image-2.6 et GPT Image 2. La 2e place en édition d'images demeure une citation de xAI elle-même.

Artificial Analysis est un classement différent, avec une méthode différente et un autre public de votants, et il place désormais le modèle à la 4e place. Les deux ne se contredisent pas vraiment — ils échantillonnent la préférence humaine différemment, et tous deux sont des instantanés de classements qui évoluent d’une semaine à l’autre. Le résumé honnête de six semaines de classements indépendants est que Grok Imagine Image 2.0 figure constamment dans le top cinq et n’a jamais tout à fait été le n°2 annoncé par xAI.

Ce que Grok Imagine Image 2.0 propose réellement

xAI positionne Grok Imagine Image 2.0 comme un environnement d'édition plutôt qu'un simple générateur à usage unique. Les fonctionnalités :

Magic Wand — des modifications au niveau de la région qui laissent le reste de l'image intact

Segmentation — sélection précise de régions pour l'étalonnage des couleurs, le remplacement ou l'ajustement

Suppression d'arrière-plan — export du sujet sur fond transparent

Entrée multi-images — jusqu'à cinq images sources par édition ; la documentation de xAI en mentionne désormais cinq, contre les trois que l'API limitait au lancement

Smart Resize — recompose une image en 9 ratios d'aspect (de 1:2 en hauteur à 2:1 en largeur), en inventant un nouveau contenu de cadre plutôt que de recadrer

Modèles — flux de travail prédéfinis pour la photographie de produits, les portraits, les fiches e-commerce, les ressources de jeux et les affiches marketing

L'API expose des réglages que l'application grand public ne rend pas accessibles : le rapport d'aspect — notamment 21:9 et 5:2, tous deux nouveaux avec la version 2.0 —, la résolution (1K par défaut, 2K en option) et un paramètre de qualité pouvant prendre les valeurs low, medium ou auto. Côté grand public, le modèle est proposé comme Quality Mode par défaut sur grok.com/imagine, iOS et Android, et depuis le 13 août, il figure également sur la plateforme de Runway, où il a rejoint les modèles d'image et de vidéo que Runway héberge déjà. Cette inscription relève d'une déclaration du fournisseur et de son partenaire plutôt que d'une évaluation indépendante, mais elle a été le premier signe d'une distribution par des tiers après le lancement.

En matière de rendu du texte des titres, xAI affirme que le modèle « planifie la typographie et la mise en page comme le ferait un designer », en maintenant intactes les compositions denses à plusieurs parties et en restituant les petits textes avec netteté. Il préserve également l’identité et les paramètres d’un sujet lors de modifications itératives sur plusieurs tours.

Ce qu'un premier test indépendant a découvert

Une comparaison en six prompts, à graine unique et sans sélection des résultats, face à gpt-image-2 a mis en évidence un clivage net, et rien dans le nouveau positionnement au classement ne vient le remettre en cause.

Grok l'emporte : photoréalisme et conservation de l'identité. L'anatomie des mains sur les portraits était correcte, avec un rendu de la peau au niveau des pores, une diffusion sous-surfacique, ainsi que des reflets naturels et une lumière de contour. Lors d'un test de rotation géométrique de 45 degrés, Grok a maintenu l'identité du visage au-dessus du seuil de 0,5 d'ArcFace, tandis que gpt-image-2 s'en éloignait davantage.

Grok perd : sur les domaines critiques pour la production. Sollicité pour un titre d'affiche de film en chinois simplifié, il a rendu des caractères en chinois traditionnel — un « disqualifiant rédhibitoire » pour les pipelines de localisation et de publication. Une demande de fusion de style aquarelle a renvoyé une image photoréaliste avec seulement une légère passe de texture picturale — une « disqualification catégorielle ». Les modifications locales ont répondu aux trois demandes, mais n'ont pas préservé la vue de la fenêtre et ont mal ancré un rehaut.

Résumé : Grok Imagine Image 2.0 « est en tête sur le photoréalisme et l'identité, et en retrait sur la fiabilité d'édition, le texte multilingue et le véritable transfert de style. » Un classement calcule une moyenne de préférence sur des milliers de comparaisons à l'aveugle ; il ne peut pas vous dire si le modèle rendra correctement votre titre en chinois. Un test à six prompts n'est pas non plus un ensemble de preuves — mais entre les deux, l'échec spécifique est le signal le plus exploitable pour une équipe qui livre des ressources localisées.

L'API et le calcul des prix

Le discours pour les développeurs a changé depuis le lancement. grok-imagine-image-2.0 est désormais le modèle que xAI documente pour la génération d’images, l’édition d’une seule image et l’édition multi-images, et c’est ce que la page de modèle de xAI recommande pour les images. La mention « accès API pour les développeurs bientôt disponible » de l’époque du lancement a disparu des pages de modèle et de tarification du fournisseur.

• grok-imagine-image-2.0 : à partir de 0,04 $ par image, facturé selon la qualité réellement servie

• grok-imagine-image (1.0) : 0,02 $ par image, non concerné par la modification ci-dessous

• grok-imagine-image-quality : 0,05 $ par image, retiré le 2 novembre 2026

La qualité est le levier du coût. Auto — la valeur par défaut lorsque le paramètre est omis — applique actuellement low pour la génération et medium pour l'édition : une requête de génération est donc facturée au tarif low et une édition au tarif medium. Épingler low ou medium rend la facture prévisible plutôt que dépendante du chemin que le service choisit.

Ce dernier point comporte une échéance. Le guide de migration d’xAI indique que le slug grok-imagine-image-quality est retiré le 2 novembre 2026, après un préavis de 60 jours commencé le 2 septembre. À compter de cette date, le slug continue de se résoudre, mais les requêtes sont servies par grok-imagine-image-2.0 avec le paramètre quality défini sur low — une redirection de compatibilité, pas un arrêt brutal. Comme le palier low est moins cher de 0,01 $ par image que l’ancien palier de qualité, et ce à toutes les résolutions, les équipes qui ne changent rien verront une baisse de prix et un changement silencieux de la qualité de sortie. Migrer délibérément, en nommant grok-imagine-image-2.0 et en épinglant la qualité là où une sortie stable importe, est la version de cette opération qu’il vous faut. Cette date et le comportement de redirection proviennent de la documentation d’xAI elle-même — il s’agit de déclarations du fournisseur, non de tests indépendants.

Face aux options d’OpenAI, la comparaison tient autant à une différence de modèle tarifaire qu’à une différence de prix. gpt-image-2 est facturé au token — 8 $ par million de tokens d’entrée d’image et 30 $ par million de tokens de sortie d’image selon les tarifs publiés d’OpenAI — de sorte que le coût par image varie selon la résolution et le niveau de détail. Le chiffre représentatif d’Artificial Analysis de 211 $ pour 1 000 images pour GPT Image 2 (high), face aux 60 $ de Grok, montre cette variation condensée en un seul nombre. Une tarification forfaitaire par image est bien plus facile à prévoir à grande échelle, ce qui explique en grande partie pourquoi un modèle classé quatrième mérite tout de même le coup d’œil.

L'essayer sans miser le pipeline

La réaction raisonnable face à Grok Imagine Image 2.0 reste toujours « essayez-le, ne vous y engagez pas encore ». Sa position se situe dans des intervalles de confiance qui se chevauchent, un test indépendant a signalé de réelles faiblesses sur le texte localisé et le transfert de style, et xAI met hors service un slug sous-jacent en novembre. C'est exactement ce qui plaide en faveur du routage plutôt que du câblage d'une intégration directe.

Sur OrcaRouter, grok-imagine-image — le modèle d'image de xAI présent dans notre catalogue — se trouve sur le même endpoint compatible OpenAI que gpt-image-2, si bien que passer d'un modèle d'image xAI à un modèle d'image OpenAI se résume à changer la chaîne du modèle : pas de second contrat, pas de nouveau SDK. OrcaRouter répercute les prix de liste des fournisseurs sans marge, de sorte qu'une baisse de prix d'un fournisseur est effective ici le jour même, et le basculement automatique peut rediriger les erreurs, les limites de débit ou les refus vers un modèle de repli plutôt que vers votre environnement de production. Une réserve honnête, inchangée depuis la revue d'origine : le tout nouveau palier de qualité de xAI constitue une entrée distincte du modèle d'image Grok déjà présent dans notre catalogue, alors vérifiez la liste actuelle des modèles plutôt que de supposer qu'une variante Grok donnée est routable aujourd'hui.

Que regarder ensuite

1. La migration du 2 novembre.Que les équipes passent explicitement à grok-imagine-image-2.0 ou dérivent vers la redirection et son option par défaut de faible qualité, c'est la plus grande chose que xAI puisse encore faire de travers avec ce modèle — et la redirection rend l'erreur invisible à moins de lire le champ model dans vos réponses.

2. Si la 4e place se maintient. L'écart avec MAI-Image-2.6 est de 6,5 Elo, avec des intervalles de ±12 points, si bien que quelques milliers de votes supplémentaires pourraient réordonner le classement dans un sens comme dans l'autre. Le gain de 110 Elo par rapport au palier précédent semble durable ; le rang exact, lui, ne l'est pas.

3. Quelle part de la surface grand public atteint l'API. La génération, l'édition et l'édition multi-images sont documentées. Les modèles et le flux de travail nommé Smart Resize restent des fonctionnalités de l'application, et c'est dans cet écart que subsiste la réserve restante de « grand public uniquement ».

En résumé : Grok Imagine Image 2.0 est un modèle véritable et performant, désormais classé de manière indépendante — 4e au Text to Image Leaderboard d’Artificial Analysis, la meilleure entrée non-OpenAI, avec environ 110 points Elo d’avance sur le palier qu’il remplace, et sur la frontière prix-qualité du classement, à 60 $ pour 1 000 images contre environ 211 $ pour les modèles OpenAI directement au-dessus. Le positionnement « n° 2 mondial » a toujours été l’instantané de lancement de xAI, et les classements indépendants ne l’ont jamais vraiment affirmé. Ses deux faiblesses indépendantes les plus évidentes — la conformité au chinois simplifié et la fiabilité du transfert de style — portent sur des fonctionnalités que les équipes recherchent le plus souvent dans une API d’image. Testez-le immédiatement pour les travaux photoréalistes préservant l’identité ; attendez avant de l’adopter pour les pipelines qui livrent du texte localisé ou des ressources stylisées, et si vous appelez déjà le slug de qualité en cours de retrait, migrez avant le 2 novembre.