Une carte titre héroïque pour la comparaison « GPT-Image-2.5 vs LLaDA-Image » avec le sous-titre « Une API à 30 $/M tokens contre un modèle de diffusion gratuit de 6B », montrant une carte arrondie à gauche étiquetée « GPT-Image-2.5 · API PHARE FERMÉE — facturé au token, hébergé » et une carte arrondie à droite étiquetée « LLaDA-Image · POIDS OUVERTS — auto-hébergé, carte Apache-2.0 », reliées par une icône de balance ; le logo OrcaRouter est en bas à droite.
Guides & Insights

GPT-Image-2.5 vs LLaDA-Image : une API à 30 $/M de tokens face à un modèle de diffusion 6B gratuit

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Demandez combien devrait coûter la génération d'images et deux laboratoires ont apporté les deux réponses opposées à une semaine d'intervalle. Le 8 septembre 2026, OpenAI a lancé GPT-Image-2.5 — le modèle derrière ChatGPT Images 2.5, vendu via l'API sous les noms GPT-Image-2.5 Flare et GPT-Image-2.5 Sunburst — avec un tarif de 8 $ par million de jetons d'image en entrée et 30 $ par million de jetons d'image en sortie. Cinq jours plus tôt, le 4 septembre, inclusionAI (le laboratoire soutenu par Ant Group à l'origine de la famille de langages LLaDA) a discrètement publié LLaDA-Image, un générateur et éditeur d'images à diffusion-transformer de six milliards de paramètres dont les poids sont téléchargeables gratuitement. L'un est le modèle d'image le plus puissant commercialement qu'OpenAI ait jamais placé derrière un compteur de jetons ; l'autre est une tentative de prouver qu'un modèle d'image performant peut être construit avec une recette d'entraînement ouverte et offert gratuitement. Les comparer relève moins d'un face-à-face que d'une décision sur la définition du coût que vous payez réellement.

Presque tous les chiffres du côté de GPT-Image-2.5 proviennent du fournisseur et aucun n'a encore été vérifié de manière indépendante : OpenAI affirme que Flare réduit la latence jusqu'à 50 % par rapport à GPT-Image-2 et que des tests tiers de la société d'agents Manus ont mesuré une génération 2 à 4 fois plus rapide, mais au 9 septembre 2026, aucun des deux modèles GPT-Image-2.5 ne figure dans les classements d'images d'Artificial Analysis. Le chiffre principal de LLaDA-Image est tout aussi non reproduit — inclusionAI rapporte 53,53 en anglais / 53,38 en chinois sur Qwen-Image-Bench, premier parmi les modèles à poids ouverts lors de sa sortie — et comme le modèle ne dispose pas d'API hébergée, il ne peut pas du tout apparaître dans les classements réservés aux API. Les deux côtés de cette comparaison reposent sur les propres déclarations de leurs créateurs, ce qu'il convient de garder à l'esprit pour la suite de cet article.

Deux modèles qui partagent à peine une catégorie.

GPT-Image-2.5 est un modèle d'image hébergé et fermé, dans la même lignée que ChatGPT Images 2.0 d'avril 2026. Il est multimodal côté entrée et produit des images qu'OpenAI affirme être plus nettes dans les détails fins, plus naturelles dans l'éclairage et la texture, et plus stables lors des modifications multi-tours — le endpoint Sunburst existe spécifiquement pour les travaux de production intensifs en édition où une génération plus lente est acceptable en échange d'un contrôle d'instructions plus strict, tandis que Flare est le défaut rapide pour la génération à grand volume. Les sorties vont jusqu'à 2048×2048 et 3840×2160, les fonds transparents sont pris en charge, et chaque sortie porte des métadonnées de provenance C2PA ainsi qu'un filigrane invisible.

LLaDA-Image est une publication ouverte de type recherche, reposant sur un pari complètement différent. Là où GPT-Image-2.5 est servi par l'infrastructure d'OpenAI, LLaDA-Image est un ensemble de poids que vous exécutez vous-même : un transformeur de diffusion (DiT) de 6 milliards de paramètres côté génération — la fiche du modèle enregistre environ 7 milliards de paramètres une fois le côté linguistique compté — associé à LLaDA 2.0-mini, un modèle de langage à diffusion de type mixture-of-experts (16B au total / 1B actifs), comme côté « compréhension » qui transforme les invites textuelles ou les instructions d'édition en le signal que suit le DiT. L’affirmation inhabituelle du rapport arXiv (2609.03796) concerne la recette d’entraînement : plus de 90 % des quelque 220 millions d’échantillons cumulés de pré-entraînement et d’entraînement intermédiaire sont composés uniquement d’images, un modèle vision-langage figé extrayant la sémantique des images non étiquetées comme signal d’auto-conditionnement, de sorte que le modèle « apprend d’abord à dessiner, puis à obéir ». La résolution progressive fait passer l’entraînement de 256×256 à 512×512, puis à un affinage en 1024×1024, suivi d’un entraînement mixte texte-à-image et édition, et d’une distillation TwinFlow en quelques étapes qui produit la variante LLaDA-Image-Turbo.

Ce en quoi chacun est réellement bon.

L'argument de GPT-Image-2.5, c'est la précision et le contrôle à qualité commerciale. L'annonce d'OpenAI met l'accent sur la fidélité à la référence — garder une personne, un animal ou un produit reconnaissable lorsqu'on change le décor ou le style — et sur une édition qui ne modifie que ce que l'on a demandé de modifier, de façon soutenue sur de nombreux cycles d'édition dans une même conversation. Le rendu du texte dans les images est spécifiquement souligné, notamment l'élimination des caractères chinois illisibles qui affectaient les modèles d'images précédents. Ce sont exactement les capacités qu'une équipe produit, marque ou publicité sollicite en permanence.

L'argument de LLaDA-Image est un ensemble unique de poids qui assure la génération bilingue et l'édition guidée par instructions avec une recette ouverte. inclusionAI fait état d'un rendu de texte natif en chinois et en anglais, d'un parcours d'édition qui injecte des images de référence via une conception à double chemin destinée à préserver le contenu non modifié, et — sur Qwen-Image-Bench — des meilleurs scores en poids ouverts lors de la sortie. Les mises en garde honnêtes de la sortie sont que la qualité d'édition perceptuelle reste en retrait par rapport aux éditeurs spécialisés et que le comptage des objets demeure faible. C'est un modèle ouvert généraliste, pas un produit commercial abouti.

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

Le classement n'est délibérément pas un concours de qualité d'image — les deux modèles n'ont jamais été soumis à la même évaluation. Ce qu'il montre, c'est là où circulent l'argent et le contrôle.

Le prix d'une image est le nombre qu'aucun des deux côtés ne vous donnera

OpenAI publie pour GPT-Image-2.5 une grille tarifaire des tokens identique à celle de GPT-Image-2 : 8 $ par million de tokens d'entrée d'image, 30 $ par million de tokens de sortie d'image, 2 $ pour les tokens d'entrée d'image en cache, et des tokens de texte facturés séparément à 5 $ par million. En revanche, OpenAI ne publie pas le nombre de tokens consommés par une image donnée, ce qui implique l'absence de prix officiel par image et de calculateur de coût. Au prix affiché par AA pour le prédécesseur sur son classement — environ 211 $ pour 1 000 images pour GPT Image 2 en qualité « high » — un produit phare facturé au token devient un outil coûteux à grande échelle, mais ce chiffre concerne GPT-Image-2, pas la 2.5, et le coût par image du nouveau modèle est réellement inconnu en dehors d'OpenAI.

LLaDA-Image a le problème d'honnêteté inverse. Les poids ne coûtent rien et la fiche porte une mention Apache-2.0, mais le vrai prix est l'infrastructure : un transformateur de diffusion 6B nécessite un GPU sérieux pour la variante Base en 50 étapes, et les points de contrôle FP8 (environ 49 Go dans une structure diffusers) sont l'option pratique pour la plupart des utilisateurs. La distillation en 2 à 4 étapes de LLaDA-Image-Turbo est la concession à cette réalité. Les outils communautaires ont évolué rapidement — une pull request SGLang ajoute la génération texte-image, l'édition, le parallélisme de séquence et le support FP8, et un package de nœuds RebelAI ComfyUI prend en charge l'inférence locale quantifiée INT8 et GGUF — mais « modèle gratuit » signifie toujours « c'est vous qui fournissez l'hébergement ». Pour une équipe qui dispose déjà d'une capacité GPU, le coût marginal de LLaDA-Image approche zéro ; pour tous les autres, le coût global de service peut dépasser les factures d'API à l'usage une fois que l'on compte le temps d'ingénierie.

La voie honnête si vous voulez les deux

Ce ne sont pas des choix exclusifs pour la plupart des équipes. Un pipeline de production peut utiliser une API hébergée comme GPT-Image-2.5 pour le travail orienté client, très axé sur l'édition, qui ne doit pas échouer, et garder un modèle ouvert comme LLaDA-Image pour les expériences, les traitements par lots hors ligne et tout ce qui ne peut pas envoyer de requêtes à un tiers. Cette répartition est exactement le type de problème pour lequel une couche de routage est conçue — une API qui accède aux modèles hébergés que vous utilisez réellement, avec le prix catalogue du fournisseur transmis sans marge, de sorte qu'essayer un modèle à poids ouverts via une route hébergée coûte ensuite le même prix que d'aller directement au fournisseur. Aucun des deux modèles n'est au catalogue d'OrcaRouter au 9 septembre 2026 : GPT-Image-2.5 n'est disponible que via l'API OpenAI pour l'instant (la génération précédente, GPT-Image-2, est routée), et LLaDA-Image est disponible uniquement en poids, sans inférence hébergée. L'intention de conception reste valable quel que soit le catalogue actuel.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

Sur lequel devriez-vous construire ?

Si votre travail est la génération commerciale d'images, où une modification ratée coûte une relation client — photos de produits, créations publicitaires, visuels cohérents avec la référence, longues sessions d'édition multitours — GPT-Image-2.5 est le modèle dont toute la conception cible ce travail, et l'endpoint Sunburst est la raison d'y prêter attention avant même que des scores indépendants n'existent. Les risques sont l'opacité du prix par image et le fait que chaque allégation de qualité émane d'OpenAI lui-même. Si votre travail est la recherche, l'expérimentation à haut volume, la génération bilingue chinois-anglais, ou tout ce qui doit s'exécuter dans votre propre environnement ou sur vos propres données, LLaDA-Image est la sortie la plus intéressante — des poids véritablement ouverts avec une recette publiée, au prix d'être votre propre infrastructure et de vivre avec des scores non reproduits. Les modèles sont sortis à une semaine d'écart et un monde les sépare en matière de modèle opérationnel ; le bon choix est celui qui correspond au coût que vous êtes réellement en mesure de payer.

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.