OpenAI's gpt-image-2 es la próxima generación de la serie gpt-image — un modelo de imagen facturado por tokens accedido a través de la API estándar de OpenAI Images. Es una actualización directa desde gpt-image-1: mismo SDK, misma forma de llamada, mismos parámetros. Apunte su cliente existente de OpenAI a la URL base de OrcaRouter y configure el modelo a `openai/gpt-image-2`. El precio es $5.00 de entrada / $30.00 de salida por 1M de tokens, facturado al costo — sin margen, sin migración.
OpenAI GPT-Image-2 es un modelo multimodal de OpenAI especializado en generar y editar imágenes. Acepta indicaciones de texto y entradas de imagen opcionales para producir resultados visuales…
GPT-Image-2 está diseñado para generar imágenes a partir de descripciones de texto y para editar imágenes existentes basándose en instrucciones textuales. Puede modificar atributos como el color, la textura, la forma y la composición, así como añadir o eliminar objetos. El modelo admite inpainting (reemplazar partes de una imagen) y outpainting (extender el lienzo) de forma implícita mediante el diseño de las indicaciones. También permite la transferencia de estilo, lo que permite a los usuarios aplicar una estética determinada a una imagen de origen. Estas capacidades lo hacen adecuado para tareas que van desde correcciones simples hasta la experimentación visual creativa.
Sí, GPT-Image-2 puede generar imágenes completamente nuevas a partir de indicaciones de texto sin requerir ninguna imagen de entrada. El modelo utiliza la descripción proporcionada para crear una representación visual, incluyendo detalles sobre la composición de la escena, iluminación, colores y objetos. La calidad y fidelidad de la imagen generada dependen de la especificidad de la indicación y de las limitaciones de la arquitectura subyacente. Para obtener mejores resultados, las indicaciones deben ser claras y evitar referencias ambiguas. Esta capacidad es útil para la ideación, prototipado y generación de ilustraciones únicas a partir de descripciones conceptuales.
GPT-Image-2 acepta indicaciones de texto como entrada principal. Al editar imágenes, requiere que se proporcione una imagen existente, ya sea como URL o como datos sin procesar codificados en base64 dentro de la solicitud de la API. La imagen debe estar en un formato estándar como PNG o JPEG, con límites de resolución y tamaño determinados por las especificaciones de la API de OpenAI. El modelo no admite video ni entradas de múltiples imágenes de forma nativa; cada solicitud opera sobre un par de indicación e imagen única. Las imágenes de salida se generan en formatos comunes, normalmente PNG, y pueden entregarse como URL o datos base64 según la preferencia del cliente.
GPT-Image-2 no mantiene estado entre solicitudes; cada llamada a la API es independiente. La edición en múltiples pasos, donde una imagen se refina progresivamente mediante una serie de indicaciones, debe ser gestionada por la aplicación que realiza la llamada. Los desarrolladores pueden implementar un flujo de trabajo donde cada paso pasa el resultado anterior como entrada para la siguiente solicitud. Este enfoque permite la edición iterativa, como ajustar los colores primero, luego agregar un fondo y luego cambiar el tamaño. Si bien es funcional, la falta de estado incorporado significa que la aplicación debe manejar el contexto, como almacenar imágenes intermedias y construir las indicaciones adecuadas para cada paso.
La puntuación Elo de Edición de Imagen de LM Arena de 1467.0 es un punto de referencia que mide la calidad de las salidas de edición de imágenes. Las puntuaciones Elo en este contexto se calculan en base a comparaciones por pares de las salidas del modelo por parte de evaluadores humanos. Una puntuación de 1467 indica que GPT-Image-2 supera significativamente a los modelos de referencia y es competitivo con otros modelos líderes de edición de imágenes. Refleja un rendimiento sólido en tareas como inserción de objetos, reemplazo de fondo, cambios de color y ediciones compositivas. Esta puntuación es una de las más altas en el tablero de líderes de LM Arena para la categoría de edición de imágenes, lo que sugiere que el modelo produce ediciones coherentes, fieles a las indicaciones y visualmente atractivas.
La latencia de GPT-Image-2 varía según la complejidad del prompt, el tamaño de la entrada (si la hay) y la resolución de salida deseada. OpenAI no publica garantías de latencia fijas para este modelo; los tiempos de respuesta típicos oscilan entre unos segundos y decenas de segundos para imágenes grandes o ediciones complejas. Dado que OrcaRouter es un relé que no añade sobrecarga al tiempo de procesamiento del proveedor, el tiempo de espera real es el mismo que al llamar a OpenAI directamente. Para aplicaciones de producción, los usuarios deben implementar tiempos de espera y lógica de reintentos, y considerar el procesamiento por lotes para gestionar el rendimiento.
GPT-Image-2 sobresale en tareas de edición de imágenes que requieren modificaciones precisas basadas en instrucciones en lenguaje natural. Su alto puntaje en la Arena Elo de LM refleja su capacidad para producir ediciones que son precisas y estéticamente agradables. El modelo maneja bien cambios compositivos complejos, como reemplazar objetos manteniendo la iluminación y las sombras adecuadas. También genera imágenes de alta calidad desde cero con buen fotorrealismo y adherencia al prompt. Los usuarios suelen informar que maneja instrucciones creativas (ej., "haz que esta escena parezca una pintura al óleo") con una transferencia de estilo plausible.
A pesar de su sólido rendimiento en pruebas comparativas, GPT-Image-2 tiene limitaciones. Puede tener dificultades con instrucciones muy largas o de varias partes, especialmente cuando varios objetos requieren modificación simultánea. El modelo puede producir artefactos ocasionales, como rostros distorsionados o texturas poco realistas, particularmente en escenas complejas. También tiene restricciones de seguridad que impiden generar ciertos tipos de contenido, lo que puede limitar algunos usos creativos. Además, dado que el modelo se accede a través de la infraestructura de OpenAI, los usuarios están sujetos a la política de contenido y los límites de velocidad de OpenAI, lo que puede afectar los flujos de trabajo de edición masiva.
GPT-Image-2 tiene un precio por token: $8.00 por millón de tokens de entrada y $30.00 por millón de tokens de salida. Los tokens de entrada incluyen el texto del prompt y cualquier dato de imagen codificado en base64 (ya que las imágenes se tokenizan). Los tokens de salida son la representación de la imagen generada. El costo total de una solicitud depende de la longitud del prompt y de la resolución tanto de las imágenes de entrada como de salida. OrcaRouter transmite este precio sin margen adicional, lo que significa que el costo es exactamente el que cobra OpenAI. La plataforma OrcaRouter no añade tarifas adicionales.
No. OrcaRouter declara explícitamente que factura GPT-Image-2 a la tarifa del proveedor sin margen adicional. Esto significa que el precio por token es exactamente $8.00 por entrada y $30.00 por salida. No hay tarifas de suscripción mensual, costos base ni porcentajes de margen añadidos por OrcaRouter. Los únicos cargos son los costos de tokens consumidos por OpenAI. Los usuarios deben asegurarse de tener un método de facturación válido configurado con OrcaRouter para evitar interrupciones del servicio, pero la fórmula de precios es transparente y predecible.
OpenAI no ofrece públicamente caché para la generación de imágenes o las solicitudes de edición; cada solicitud se procesa de forma independiente. Por lo tanto, repetir las mismas solicitudes con la misma imagen de entrada normalmente incurrirá en costos completos de tokens en cada invocación. Sin embargo, si su aplicación utiliza con frecuencia la misma imagen de entrada, podría reducir el uso de tokens de entrada almacenando la imagen externamente y haciendo referencia a ella mediante una URL (si es compatible) en lugar de volver a codificarla como base64. OrcaRouter no proporciona ninguna capa de caché adicional que reduzca el consumo de tokens para este modelo.
GPT-Image-2 pricing is set by OpenAI y se encuentra entre las opciones de mayor costo para modelos de imagen debido a sus capacidades especializadas de edición. Alternativas más económicas, como los modelos de Stability AI disponibles en OrcaRouter, pueden ofrecer tarifas más bajas por token, pero quizás no igualen la precisión de edición medida por el benchmark LM Arena. El equilibrio está entre el costo y la calidad del resultado. Para ediciones simples o aplicaciones de bajo riesgo, un modelo menos costoso podría ser suficiente, mientras que GPT-Image-2 es preferible cuando la alta fidelidad y el cumplimiento de las instrucciones son críticos.
Para usar GPT-Image-2 a través de OrcaRouter, envíe una solicitud HTTP POST al endpoint compatible con OpenAI en https://api.orcarouter.ai/v1/images/generations (o un endpoint similar dependiendo de la operación). Establezca el parámetro model en "openai/gpt-image-2". Incluya una cadena de prompt y opcionalmente una imagen (como base64 o URL) para tareas de edición. OrcaRouter autentica las solicitudes usando su clave de API (generalmente pasada en el encabezado Authorization como "Bearer <key>"). La respuesta contendrá los datos de la imagen generada en el formato especificado por la solicitud, usualmente como una URL o una cadena base64.
Los parámetros de la API siguen en gran medida el esquema de generación de imágenes de OpenAI. Los parámetros clave incluyen "model" (configurado como "openai/gpt-image-2"), "prompt" (la instrucción de texto), "n" (número de imágenes a generar, por defecto 1), "size" (dimensiones de salida como "1024x1024"), "response_format" ("url" o "b64_json") y "user" (para el seguimiento de límite de tasa). Para tareas de edición, también puede incluir "image" (la imagen de entrada como base64) y "mask" (para inpainting, especificando qué áreas modificar). Consulte la documentación oficial de OpenAI para obtener la lista completa de parámetros admitidos y sus restricciones.
La migración es sencilla porque OrcaRouter proporciona una API completamente compatible con OpenAI. Los únicos cambios necesarios son actualizar la URL base de https://api.openai.com a https://api.orcarouter.ai/v1 y modificar la cadena del modelo de algo como "gpt-image-2" a "openai/gpt-image-2". Su código existente para autenticación, serialización de solicitudes y manejo de respuestas debería funcionar sin modificaciones. No se requieren cambios en los nombres de los parámetros ni en las estructuras de datos. Después de actualizar el endpoint y el ID del modelo, pruebe con una sola solicitud para confirmar la conectividad y el comportamiento de facturación.
OrcaRouter utiliza autenticación mediante clave de API. Debes incluir tu clave de API de OrcaRouter en el encabezado de la solicitud. Los límites de velocidad son determinados tanto por OrcaRouter como por OpenAI. OrcaRouter puede imponer límites para evitar abusos, pero estos suelen ser generosos. OpenAI aplica sus propios límites de velocidad según el nivel y la facturación, que se aplican independientemente de si accedes al modelo a través de OrcaRouter o directamente. Los usuarios deben monitorear el uso a través del panel de control de OrcaRouter y ajustar el ritmo de las solicitudes en consecuencia. No se requiere autenticación adicional más allá de la clave de API.
GPT-Image-2 y DALL-E 3 son ambos modelos de generación de imágenes de OpenAI, pero están dirigidos a diferentes casos de uso. DALL-E 3 es un modelo general de texto a imagen enfocado en generar imágenes creativas y fotorrealistas desde cero. GPT-Image-2 está optimizado para editar imágenes existentes, como lo demuestra su alto puntaje en LM Arena Image Edit Elo. Si bien DALL-E 3 también puede realizar algunas ediciones, su fortaleza radica en la generación original. GPT-Image-2 tiende a producir modificaciones más precisas en las imágenes de entrada, especialmente cuando la indicación implica preservar elementos de la composición original.
Los modelos de Stability AI como SD3.5 son generadores de imágenes de código abierto que ofrecen un costo menor por token, pero pueden requerir más ingeniería de prompts para lograr una calidad similar. GPT-Image-2, como modelo propietario, se beneficia de un entrenamiento extenso y ajuste fino para tareas de edición, lo que se refleja en su puntuación en LM Arena. La elección entre ellos depende del presupuesto y los requisitos de calidad. Para ediciones críticas donde la precisión importa, GPT-Image-2 es preferible. Para generación masiva o cuando el costo es la principal preocupación, los modelos de Stability AI disponibles en OrcaRouter pueden ser una alternativa viable, aunque debes evaluar las diferencias de calidad para tu aplicación específica.
Elige un modelo más económico cuando tu tarea sea generación simple de imágenes sin requisitos de edición, o cuando la tolerancia a ediciones imperfectas sea alta. Por ejemplo, generar imágenes de relleno, iconos simples o gráficos de baja resolución puede no requerir la sofisticación de GPT-Image-2. De manera similar, si tu indicación implica solo ajustes menores (por ejemplo, cambiar el brillo o recortar), un modelo menos especializado puede ser suficiente. OrcaRouter ofrece una gama de modelos de imágenes con diferentes puntos de precio. Evalúa tu caso de uso específico: si la tarea de edición es compleja y requiere alta fidelidad, GPT-Image-2 está justificado; de lo contrario, considera el ahorro de costos de modelos alternativos.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1| Entrada / 1M tokens | $8.00 |
|---|---|
| Salida / 1M tokens | $30.00 |
| Lectura caché / 1M | $1.25 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/openai/gpt-image-2Abrir @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2