Carte titre hero pour GPT-Image-2 vs Flux 3, titre « GPT-Image-2 vs Flux 3 » avec sous-titre « Un modèle en direct, une feuille de route », deux cartes présentant GPT-Image-2 avec un badge « API publique depuis mai 2026 » et Flux 3 avec un badge « Niveau image : bientôt disponible », logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GPT-Image-2 vs Flux 3 : Comparer un modèle opérationnel à une feuille de route

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ceci n'est pas un article comparant deux modèles comme d'habitude, car GPT-Image-2 et Flux 3 ne sont pas au même stade d'existence. GPT-Image-2, lancé le 21 avril 2026, est invocable via l'API d'Ope​nAI depuis début mai, et a gagné cette semaine une nouvelle capacité — la génération d'images à arrière-plan transparent dans l'API, annoncée le 20 août et disponible dès maintenant. Flux 3 est le modèle de fondation multimodal de Black Forest Labs, annoncé le 23 juillet 2026, et son offre image n'a toujours ni endpoint public, ni identifiant de modèle, ni grille tarifaire au moment où nous écrivons ces lignes. L'un d'eux peut être invoqué à 3 heures du matin avec une clé valide ; pour l'autre, vous pouvez vous inscrire et être placé sur liste d'attente. La comparaison utile, dès lors, n'est pas « lequel est meilleur » — c'est ce que le modèle livré fait réellement aujourd'hui, ce que la feuille de route promet pour celui qui n'est pas encore sorti, et comment un développeur devrait considérer un modèle promis qui ne cesse d'être repoussé, tandis qu'un modèle disponible ne cesse de s'améliorer.

L'un de ceux-ci a un point de terminaison.

Commencez par la disponibilité, car c'est elle qui décide de tout le reste. Black Forest Labs a dévoilé Flux 3 le 23 juillet en tant que modèle unique entraîné conjointement sur la prédiction d'images, de vidéos, d'audio et d'actions robotiques, bâti sur une approche de flow-matching que le laboratoire appelle Self-Flow. Selon les rapports, plus de 95 % de la puissance de calcul de cet entraînement a été consacrée à la prédiction vidéo, ce qui est visible dans ce qui a réellement été livré : seul Flux 3 Video a atteint la disponibilité générale, le 4 août, avec une API payante. La page du modèle du niveau image porte toujours une étiquette « coming soon » avec un formulaire de demande, et non un bouton « get started » — aucun endpoint, aucun paramètre documenté, aucun coût par image, et aucun benchmark que n'importe qui puisse exécuter.

GPT-Image-2, en revanche, est en production depuis quatre mois. OpenAI a ouvert l'accès à son API début mai, et l'identifiant du modèle, gpt-image-2, est suffisamment stable pour qu'un instantané épinglé, gpt-image-2-2026-04-21, coexiste avec lui. C'est actuellement le modèle texte-image n°1 sur les deux principaux classements indépendants — 1 381 Elo sur le leaderboard texte-image d'Arena (build moyen) et 1 369 Elo pour le build haute définition sur Artificial Analysis — et il rend du texte multilingue, y compris du CJK, fonde la génération sur la recherche web, et produit des sorties jusqu'en 4K. Quatre mois de trafic en production font la différence entre une affirmation et un bilan.

Le récent changement du côté de GPT-Image-2

L’événement qui rend ce duel opportun n’a rien à voir avec Flux 3. Le 20 août, Ope​nAI a ouvert un aperçu à fond transparent pour GPT-Image-2 dans l’API Images : définissez l’arrière-plan sur "transparent" et le endpoint renvoie un PNG ou un WebP avec un véritable canal alpha, détouré et prêt à être composité. C’est une fonctionnalité qui vise précisément le travail de production que la feuille de route de l’image Flux 3 met aussi en avant — photos de produits, icônes, supports marketing — et elle est arrivée comme paramètre sur un endpoint déjà en production, plutôt que comme un nouveau modèle. Ainsi, pendant que le monde attend un endpoint pour l’image Flux 3 qui affiche encore « à venir », l’acteur établi vient de combler l’une des lacunes qui le tenaient à l’écart des pipelines de composition.

Cette capacité est uniquement accessible via l'API — il n'y a pas de bascule ChatGPT — et c'est un paramètre, pas un nouveau produit. Les deux points de terminaison de l'API Images, génération et édition, acceptent un champ `background` avec les valeurs « transparent », « opaque » et « auto » (la valeur par défaut, où le modèle décide). Le canal alpha n'étant préservé que dans les sorties PNG ou WebP, la requête fixe donc explicitement le format de sortie. La référence API d'OpenAI elle-même marque toujours la prise en charge de la transparence pour gpt-image-2 et son snapshot gpt-image-2-2026-04-21 comme « in preview » — c'est l'étiquette du fournisseur, pas une annonce de passage en disponibilité générale — et sa recommandation est de garder le prompt exempt de tout arrière-plan décrit afin que le modèle honore réellement la demande de transparence. Pas de nouveau point de terminaison, pas de nouvel identifiant de modèle, pas de grille tarifaire distincte : le même appel gpt-image-2 qui renvoyait un PNG opaque renvoie désormais un sujet détouré.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Ce que promet l'image Flux 3, et ce qui est réellement livré

La fiche technique du niveau d'image Flux 3 est une feuille de route du fournisseur, il faut donc la traiter comme telle. Black Forest Labs a promis la synthèse et l'édition d'images sur différents styles et résolutions, une meilleure gestion des invites complexes, un rendu de texte multilingue très précis, un transfert de style zéro-shot à partir d'images de référence, la cohérence des personnages et des marques sans ajustement, ainsi qu'une édition non destructive qui préserve la texture et l'éclairage. Ce sont les bonnes choses à promettre — ce sont exactement les fonctionnalités sur lesquelles les leaders actuels du marché se concurrencent — mais aucune d'entre elles n'est testable aujourd'hui, car aucune ne dispose d'un point d'accès.

Ce qui est réellement appelable chez BFL, c'est l'offre vidéo et l'ancienne gamme d'images FLUX. Flux 3 Video se vend à 0,17 $ par seconde en HD et 0,29 $ par seconde en FHD pour les rendus complets, avec un mode brouillon à 0,06 $ par seconde. Ses propres chiffres annoncés sont un Elo de 1 135 pour la génération texte-vers-vidéo et de 1 051 pour image-vers-vidéo, ainsi que des victoires en préférence face à Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video et Kling v3 Pro — le tout déclaré par le fournisseur et non reproduit, et rien de cela ne se transpose à l'offre image de toute façon. Pour les images fixes, l'offre actuelle de BFL reste la gamme FLUX.2, qui se situe à 1 226 Elo sur le même classement Artificial Analysis, où GPT-Image-2 mène avec 1 369. Cet écart est le contexte pratique de « Flux 3 image is coming » : l'API d'images de BFL est aujourd'hui environ 140 Elo derrière celle d'Ope​nAI, et le modèle promis est ce dont BFL a besoin pour le combler.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Tarification : il n'existe qu'une seule véritable carte de prix.

Il n’existe pas de prix pour l’image Flux 3, car il n’y a pas de produit d’image Flux 3. Les seuls chiffres publiés sont les tarifs par token de GPT-Image-2 : 5 $ par million de tokens de texte en entrée, 8 $ par million de tokens d’image en entrée et 30 $ par million de tokens d’image en sortie, avec l’API Batch facturée environ la moitié pour un délai allant jusqu’à 24 heures. Ope​nAI ne publie pas de nombre de tokens par image, aussi les montants par image sont des conversions, pas des tarifs officiels : environ 0,006 $ pour une image 1024×1024 en basse qualité, environ 0,05 $ pour une qualité moyenne, environ 0,21 $ en haute qualité et jusqu’à environ 0,41 $ pour un rendu haute résolution en 4K. Pour comparaison, c’est le seul côté du registre qui soit réel ; la colonne des images Flux 3 est une cellule vide.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Ce qu'un constructeur devrait faire avec un modèle promis

La posture raisonnable lorsqu'un modèle concurrent ne cesse de prendre du retard est de bâtir sur l'existant et de faire de l'avenir un changement de configuration plutôt qu'une réarchitecture. GPT-Image-2 est routable dès aujourd'hui via OrcaRouter — une seule clé API, le prix catalogue d'OpenAI répercuté sans aucune marge, bascule automatique entre fournisseurs — de sorte qu'un pipeline qui génère des assets avec ce modèle peut plus tard pointer le même endpoint vers l'API de Flux 3 image le jour où un endpoint existera réellement, et y router une partie du trafic à l'aide du DSL de routage sans toucher au code appelant. Vous obtenez le modèle livré dès maintenant, et lorsque le modèle promis arrivera, vous l'évaluerez par rapport à une base de référence fonctionnelle plutôt que par rapport à un communiqué de presse. L'attente ne vous coûte rien ; ne rien construire pendant que vous attendez vous coûte tout.

Le verdict est déséquilibré par conception. Si vous avez besoin de génération d'images ce trimestre, GPT-Image-2 est le choix évident, et il n'y a pas de débat — c'est le numéro un indépendant, il vient d'ajouter la sortie en arrière-plan transparent dans l'API, et il dispose d'une API publique et d'un prix stable. Flux 3 image est une raison de garder un œil sur Black Forest Labs, pas une raison de retenir un projet. Suivez l'ouverture de l'accès anticipé et les premiers benchmarks indépendants ; dès qu'un endpoint existe, la comparaison de cet article devient un test que vous pouvez réellement exécuter.