OpenAI's gpt-image-2 est la prochaine génération de la série gpt-image — un modèle d'image facturé par token, accessible via l'API Images standard d'OpenAI. Il s'agit d'une mise à niveau directe par rapport à gpt-image-1 : même SDK, même format d'appel, mêmes paramètres. Pointez votre client OpenAI existant vers l'URL de base d'OrcaRouter et définissez le modèle sur `openai/gpt-image-2`. La tarification est de 5,00 $ en entrée / 30,00 $ en sortie par million de tokens, facturée au coût — zéro marge, zéro migration.
OpenAI GPT-Image-2 est un modèle multimodal d'OpenAI spécialisé dans la génération et l'édition d'images. Il accepte des invites textuelles et des entrées d'images optionnelles pour produire des…
GPT-Image-2 est conçu pour générer des images à partir de descriptions textuelles et pour modifier des images existantes en fonction d'instructions textuelles. Il peut modifier des attributs tels que la couleur, la texture, la forme et la composition, ainsi qu'ajouter ou supprimer des objets. Le modèle prend en charge l'inpainting (remplacement de parties d'une image) et l'outpainting (extension du canevas) implicitement par la conception des invites. Il permet également le transfert de style, permettant aux utilisateurs d'appliquer une esthétique donnée à une image source. Ces capacités le rendent adapté à des tâches allant de simples corrections à des expérimentations visuelles créatives.
Oui, GPT-Image-2 peut générer des images entièrement nouvelles à partir d'instructions textuelles sans nécessiter d'image d'entrée. Le modèle utilise la description fournie pour créer une représentation visuelle, incluant des détails sur la composition de la scène, l'éclairage, les couleurs et les objets. La qualité et la fidélité de l'image générée dépendent de la spécificité de l'instruction et des contraintes de l'architecture sous-jacente. Pour de meilleurs résultats, les instructions doivent être claires et éviter les références ambiguës. Cette capacité est utile pour l'idéation, le prototypage et la génération d'illustrations uniques à partir de descriptions de concepts.
GPT-Image-2 accepte les invites textuelles comme entrée principale. Lors de l'édition d'images, il nécessite qu'une image existante soit fournie soit sous forme d'URL, soit sous forme de données brutes encodées en base64 dans la requête API. L'image doit être dans un format standard tel que PNG ou JPEG, avec des limites de résolution et de taille déterminées par les spécifications de l'API OpenAI. Le modèle ne prend pas en charge les entrées vidéo ou multi-images de manière native ; chaque requête opère sur une seule paire invite-image. Les images de sortie sont générées dans des formats courants, généralement PNG, et peuvent être livrées sous forme d'URL ou de données base64 selon la préférence du client.
GPT-Image-2 ne conserve pas l'état entre les requêtes ; chaque appel API est indépendant. L'édition en plusieurs étapes — où une image est progressivement affinée via une série d'invites — doit être gérée par l'application appelante. Les développeurs peuvent mettre en œuvre un flux de travail où chaque étape transmet la sortie précédente comme entrée de la requête suivante. Cette approche permet une édition itérative, par exemple en ajustant d'abord les couleurs, puis en ajoutant un arrière-plan, puis en redimensionnant. Bien que fonctionnelle, l'absence d'état intégré signifie que l'application doit gérer le contexte, comme le stockage des images intermédiaires et la construction des invites appropriées pour chaque étape.
Le score Elo de 1467,0 de l'Image Edit de LM Arena est un benchmark qui mesure la qualité des résultats d'édition d'images. Les scores Elo dans ce contexte sont calculés sur la base de comparaisons par paires des sorties de modèles effectuées par des évaluateurs humains. Un score de 1467 indique que GPT-Image-2 surpasse significativement les modèles de référence et est compétitif avec d'autres grands modèles d'édition d'images. Il reflète de solides performances dans des tâches comme l'insertion d'objets, le remplacement d'arrière-plan, les changements de couleur et les modifications de composition. Ce score est l'un des plus élevés du classement LM Arena pour la catégorie d'édition d'images, ce qui suggère que le modèle produit des modifications cohérentes, fidèles aux instructions et visuellement attrayantes.
La latence de GPT-Image-2 varie en fonction de la complexité de l'invite, de la taille de l'entrée (le cas échéant) et de la résolution de sortie souhaitée. OpenAI ne publie pas de garanties de latence fixes pour ce modèle ; les temps de réponse typiques vont de quelques secondes à plusieurs dizaines de secondes pour les grandes images ou les modifications complexes. Étant donné qu'OrcaRouter est un relais qui n'ajoute aucun surcoût au temps de traitement du fournisseur, le temps d'attente réel est le même que si l'on appelait OpenAI directement. Pour les applications de production, les utilisateurs doivent implémenter des délais d'attente et une logique de reprise, et envisager un traitement par lots pour gérer le débit.
GPT-Image-2 excelle dans les tâches d'édition d'images nécessitant des modifications précises basées sur des instructions en langage naturel. Son score élevé dans l'LM Arena Elo reflète sa capacité à produire des éditions à la fois précises et esthétiquement plaisantes. Le modèle gère bien les changements compositionnels complexes, comme le remplacement d'objets tout en conservant un éclairage et des ombres appropriés. Il génère également des images de haute qualité à partir de zéro, avec un bon photoréalisme et un respect des consignes. Les utilisateurs rapportent couramment qu'il gère des instructions créatives (par exemple, « fais ressembler cette scène à une peinture à l'huile ») avec un transfert de style plausible.
Malgré ses performances de référence solides, GPT-Image-2 présente des limites. Il peut avoir du mal avec des instructions très longues ou en plusieurs parties, surtout lorsque plusieurs objets nécessitent une modification simultanée. Le modèle peut produire des artefacts occasionnels, comme des visages déformés ou des textures irréalistes, en particulier dans des scènes complexes. Il a également des restrictions de sécurité qui empêchent la génération de certains types de contenu, ce qui peut limiter certains usages créatifs. De plus, comme le modèle est accessible via l'infrastructure d'OpenAI, les utilisateurs sont soumis à la politique de contenu et aux limites de débit d'OpenAI, ce qui peut affecter les workflows d'édition en masse.
GPT-Image-2 est facturé par token : 8,00 $ par million de tokens d'entrée et 30,00 $ par million de tokens de sortie. Les tokens d'entrée incluent le prompt textuel et toutes les données d'image encodées en base64 (car les images sont tokenisées). Les tokens de sortie correspondent à la représentation de l'image générée. Le coût total d'une requête dépend de la longueur du prompt et de la résolution des images d'entrée et de sortie. OrcaRouter transmet cette tarification sans marge, ce qui signifie que le coût est exactement celui facturé par OpenAI. Aucun frais supplémentaire n'est ajouté par la plateforme OrcaRouter.
Non. OrcaRouter indique explicitement qu'il facture GPT-Image-2 au tarif du fournisseur sans aucune majoration. Cela signifie que le prix par jeton est exactement de $8.00 en entrée et $30.00 en sortie. Il n'y a pas de frais d'abonnement mensuel, de coûts de base ou de pourcentage de majoration ajoutés par OrcaRouter. Les seuls frais sont les coûts des jetons consommés par OpenAI. Les utilisateurs doivent s'assurer d'avoir une méthode de facturation valide configurée avec OrcaRouter pour éviter une interruption de service, mais la formule de tarification est transparente et prévisible.
OpenAI n'offre pas publiquement de mise en cache pour les invites de génération ou d'édition d'images ; chaque requête est traitée indépendamment. Par conséquent, répéter des invites identiques avec la même image d'entrée entraînera généralement des coûts en tokens complets à chaque appel. Cependant, si votre application utilise fréquemment la même image d'entrée, vous pourriez réduire l'utilisation de tokens en entrée en stockant l'image en externe et en y faisant référence via une URL (si pris en charge) plutôt que de la réencoder en base64. OrcaRouter ne fournit aucune couche de mise en cache supplémentaire qui réduirait la consommation de tokens pour ce modèle.
Le prix de GPT-Image-2 est fixé par OpenAI et fait partie des options les plus coûteuses pour les modèles d'image en raison de ses capacités d'édition spécialisées. Des alternatives moins chères, telles que les modèles Stability AI disponibles sur OrcaRouter, peuvent offrir des tarifs par jeton plus bas mais peuvent ne pas égaler la précision d'édition mesurée par le benchmark LM Arena. Le compromis se situe entre le coût et la qualité de la sortie. Pour des modifications simples ou des applications à faible enjeu, un modèle moins coûteux pourrait suffire, tandis que GPT-Image-2 est préférable lorsque la haute fidélité et la conformité aux instructions sont critiques.
Pour utiliser GPT-Image-2 via OrcaRouter, envoyez une requête HTTP POST au point de terminaison compatible OpenAI à l'adresse https://api.orcarouter.ai/v1/images/generations (ou un point de terminaison similaire selon l'opération). Définissez le paramètre model sur "openai/gpt-image-2". Incluez une chaîne de prompt et éventuellement une image (au format base64 ou URL) pour les tâches d'édition. OrcaRouter authentifie les requêtes à l'aide de votre clé API (généralement transmise dans l'en-tête Authorization sous la forme "Bearer <key>"). La réponse contiendra les données de l'image générée dans le format spécifié par la requête, généralement sous forme d'URL ou de chaîne base64.
Les paramètres de l'API suivent en grande partie le schéma de génération d'images d'OpenAI. Les paramètres clés incluent "model" (défini sur "openai/gpt-image-2"), "prompt" (l'instruction textuelle), "n" (nombre d'images à générer, par défaut 1), "size" (dimensions de sortie comme "1024x1024"), "response_format" ("url" ou "b64_json"), et "user" (pour le suivi des limites de taux). Pour les tâches d'édition, vous pouvez également inclure "image" (l'image d'entrée en base64) et "mask" (pour l'inpainting, spécifiant les zones à modifier). Référez-vous à la documentation officielle d'OpenAI pour la liste complète des paramètres pris en charge et leurs contraintes.
La migration est simple car OrcaRouter fournit une API entièrement compatible avec OpenAI. Les seuls changements nécessaires sont de mettre à jour l'URL de base de https://api.openai.com à https://api.orcarouter.ai/v1 et de modifier la chaîne de modèle de quelque chose comme "gpt-image-2" à "openai/gpt-image-2". Votre code existant pour l'authentification, la sérialisation des requêtes et la gestion des réponses devrait fonctionner sans modification. Aucune modification des noms de paramètres ou des structures de données n'est nécessaire. Après avoir mis à jour le point de terminaison et l'ID du modèle, testez avec une seule requête pour confirmer la connectivité et le comportement de facturation.
OrcaRouter utilise l'authentification par clé API. Vous devez inclure votre clé API OrcaRouter dans l'en-tête de la requête. Les limites de débit sont déterminées à la fois par OrcaRouter et OpenAI. OrcaRouter peut imposer des limites pour éviter les abus, mais celles-ci sont généralement généreuses. OpenAI applique ses propres limites de débit en fonction du niveau et de la facturation, qui s'appliquent que vous accédiez au modèle via OrcaRouter ou directement. Les utilisateurs doivent surveiller l'utilisation via le tableau de bord OrcaRouter et ajuster le rythme des requêtes en conséquence. Aucune authentification supplémentaire n'est requise au-delà de la clé API.
GPT-Image-2 et DALL-E 3 sont tous deux des modèles de génération d'images d'OpenAI, mais ils ciblent des cas d'utilisation différents. DALL-E 3 est un modèle texte-image polyvalent conçu pour générer des images créatives et photoréalistes à partir de zéro. GPT-Image-2 est optimisé pour l'édition d'images existantes, comme en témoigne son score élevé dans le LM Arena Image Edit Elo. Bien que DALL-E 3 puisse également effectuer certaines modifications, sa force réside dans la génération originale. GPT-Image-2 a tendance à produire des modifications plus précises des images d'entrée, surtout lorsque l'invite implique de préserver des éléments de la composition originale.
Les modèles Stability AI comme SD3.5 sont des générateurs d'images open-source qui offrent un coût par token plus faible, mais peuvent nécessiter plus d'ingénierie de prompt pour atteindre une qualité similaire. GPT-Image-2, en tant que modèle propriétaire, bénéficie de données d'entraînement étendues et d'un réglage fin pour les tâches d'édition, ce qui se reflète dans son score LM Arena. Le choix entre eux dépend du budget et des exigences de qualité. Pour les tâches d'édition à fort enjeu où la précision compte, GPT-Image-2 est préférable. Pour la génération en masse ou lorsque le coût est la préoccupation principale, les modèles Stability AI disponibles sur OrcaRouter peuvent être une alternative viable, bien que vous deviez évaluer les différences de qualité pour votre application spécifique.
Choisissez un modèle moins cher lorsque votre tâche est une génération d'images simple sans besoins d'édition, ou lorsque la tolérance pour des éditions imparfaites est élevée. Par exemple, générer des images de remplacement, des icônes simples ou des graphiques basse résolution peut ne pas nécessiter la sophistication de GPT-Image-2. De même, si votre prompt ne concerne que des ajustements mineurs (par exemple, changer la luminosité ou recadrer), un modèle moins spécialisé peut suffire. OrcaRouter propose une gamme de modèles d'images avec des prix variables. Évaluez votre cas d'utilisation spécifique—si la tâche d'édition est complexe et nécessite une haute fidélité, GPT-Image-2 est justifié ; sinon, envisagez les économies réalisées avec des modèles alternatifs.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1| Entrée / 1M tokens | $8.00 |
|---|---|
| Sortie / 1M tokens | $30.00 |
| Lecture cache / 1M | $1.25 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/openai/gpt-image-2Ouvrir @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2