
GPT-Image-2 vs Flux 3: Comparando un modelo en vivo con una hoja de ruta
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Esta no es una publicación normal de modelo contra modelo, porque GPT-Image-2 y Flux 3 no están en el mismo estado de existencia. GPT-Image-2 se lanzó el 21 de abril de 2026, ha sido invocable a través de la API de OpenAI desde principios de mayo, y ganó una nueva capacidad esta semana: generación de imágenes con fondo transparente en la API, anunciada el 20 de agosto y disponible ahora. Flux 3 es el modelo fundacional multimodal de Black Forest Labs, anunciado el 23 de julio de 2026, y el nivel de imágenes aún no tiene endpoint público, ni ID de modelo, ni lista de precios al momento de escribir esto. A uno de estos puedes llamarlo a las 3 a.m. con una clave válida; para el otro puedes registrarte para estar en la lista de espera. La comparación útil, entonces, no es "cuál es mejor" — es lo que el modelo lanzado realmente hace hoy, lo que la hoja de ruta promete para el no lanzado, y cómo un desarrollador debería tratar un modelo prometido que sigue retrasándose mientras uno activo sigue mejorando.
Uno de estos tiene un endpoint
Empieza por la disponibilidad, porque decide todo lo demás. Black Forest Labs presentó Flux 3 el 23 de julio como un único modelo entrenado conjuntamente para la predicción de imagen, video, audio y acciones de robots, construido sobre un enfoque de emparejamiento de flujos que el laboratorio llama Self-Flow. Se informa que más del 95 % de ese cómputo de entrenamiento se destinó a la predicción de video, lo cual es visible en lo que realmente se lanzó: solo Flux 3 Video alcanzó disponibilidad general, el 4 de agosto, con una API de pago. La página del modelo de la capa de imágenes todavía muestra una etiqueta de «próximamente» con un formulario de solicitud, no un botón de «comenzar»: sin endpoint, sin parámetros documentados, sin costo por imagen y sin ningún punto de referencia que alguien pueda ejecutar.
GPT-Image-2, por el contrario, lleva cuatro meses en producción. OpenAI abrió el acceso a su API a principios de mayo, y el identificador del modelo, gpt-image-2, es lo suficientemente estable como para que una versión fijada, gpt-image-2-2026-04-21, coexista con él. Es el actual modelo número uno de texto a imagen en ambos paneles independientes principales: 1.381 Elo en la tabla de clasificación de texto a imagen de Arena (la versión media) y 1.369 Elo para la versión alta en Artificial Analysis. Además, renderiza texto multilingüe, incluido el CJK, fundamenta la generación en la búsqueda web y produce resultados de hasta 4K. Cuatro meses de tráfico de producción son la diferencia entre una afirmación y un historial contrastado.
El reciente cambio en el lado de GPT-Image-2
El evento que hace que este enfrentamiento sea oportuno no tiene nada que ver con Flux 3. El 20 de agosto, OpenAI abrió una vista previa con fondo transparente para GPT-Image-2 en la API de Imágenes: establece el fondo en "transparent" y el endpoint devuelve un PNG o WebP con un canal alfa real, recortado y listo para componer. Es una función dirigida directamente al trabajo de producción que la hoja de ruta del modelo de imagen Flux 3 también está vendiendo — fotos de producto, iconos, activos de marketing — y llegó como un parámetro en un endpoint ya activo, en lugar de un modelo nuevo. Así que, mientras el mundo espera un endpoint de imagen de Flux 3 que todavía dice "próximamente", el incumbente acaba de cerrar una de las brechas que lo mantenían fuera de los pipelines de composición.
La capacidad es solo mediante API — no hay un interruptor de ChatGPT — y es un parámetro, no un producto nuevo. Ambos endpoints de la API de Images, generación y edición, aceptan un campo background con los valores «transparent», «opaque» y «auto» (el valor predeterminado, donde el modelo decide). El canal alfa solo se conserva en la salida PNG o WebP, por lo que la solicitud fija explícitamente el formato de salida. La propia referencia de API de OpenAI todavía marca el soporte de transparencia para gpt-image-2 y su instantánea gpt-image-2-2026-04-21 como «en vista previa» — esa es la etiqueta del proveedor, no un anuncio de graduación — y su recomendación es mantener el prompt libre de cualquier fondo descrito para que el modelo realmente respete la solicitud de transparencia. No hay un endpoint nuevo, ni un ID de modelo nuevo, ni una tarjeta de precios aparte: la misma llamada a gpt-image-2 que devolvía un PNG opaco ahora devuelve un recorte.

Lo que promete Flux 3, y lo que realmente se está enviando
La ficha técnica de la capa de imágenes Flux 3 es una hoja de ruta del proveedor, así que trátala como tal. Black Forest Labs ha prometido síntesis y edición de imágenes en varios estilos y resoluciones, mejor manejo de indicaciones complejas, renderizado de texto multilingüe de alta precisión, transferencia de estilo zero-shot a partir de imágenes de referencia, consistencia de personajes y marca sin ajuste fino, y edición no destructiva que preserve la textura y la iluminación. Esas son las cosas correctas que prometer — son exactamente las características en las que compiten los líderes actuales del mercado — pero ninguna de ellas se puede probar hoy porque ninguna tiene un endpoint.
Lo que realmente se puede llamar desde BFL es el nivel de video y la línea de imágenes FLUX más antigua. Flux 3 Video se vende a $0.17 por segundo en HD y $0.29 por segundo en FHD para renderizados completos, con un modo de borrador de $0.06 por segundo. Sus propias cifras reportadas son un Elo de 1,135 para texto a video y 1,051 para imagen a video, y victorias por preferencia sobre Luma Ray 3.2, Runway Gen-4.5, Grok Imagine Video y Kling v3 Pro — todo reportado por el proveedor y sin reproducir, y nada de eso se transfiere al nivel de imagen de todos modos. Para imágenes fijas, la oferta actual de BFL sigue siendo la línea FLUX.2, que se sitúa en 1,226 Elo en la misma tabla de Artificial Analysis donde GPT-Image-2 lidera con 1,369. Esa brecha es el contexto práctico de "Flux 3 image is coming": la API de imágenes actual de BFL está aproximadamente 140 Elo por detrás de la de OpenAI, y el modelo prometido es lo que BFL necesita para cerrarla.

Precios: solo existe una tarjeta de precios real.
No hay un precio de imagen de Flux 3, porque no existe un producto de imagen de Flux 3. Los únicos números publicados son las tarifas de tokens de GPT-Image-2: $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen y $30 por millón de tokens de salida de imagen, con la Batch API funcionando a aproximadamente la mitad para una entrega en hasta 24 horas. OpenAI no publica tokens por imagen, así que las cifras por imagen son conversiones, no cotizaciones: aproximadamente $0.006 para una imagen de baja calidad de 1024×1024, alrededor de $0.05 para una de calidad media, alrededor de $0.21 en alta calidad, y hasta unos $0.41 para un render de alta resolución 4K. Para comparar, ese es el lado del balance que es real; la columna de imágenes de Flux 3 es una celda vacía.

Lo que un constructor debe hacer con un modelo prometido
La postura sensata cuando el modelo de un competidor sigue retrasándose es construir sobre lo que existe y convertir el futuro en un cambio de configuración en lugar de una re-arquitectura. GPT-Image-2 es enrutable hoy a través de OrcaRouter — una clave de API, el precio de lista de OpenAI transmitido sin margen de beneficio, conmutación automática entre proveedores — de modo que un pipeline que genera activos con él pueda más tarde apuntar el mismo endpoint a la API de Flux 3 image el día en que realmente exista un endpoint, y enrutar una porción del tráfico hacia ella con el DSL de enrutamiento sin tocar el código llamante. Recibes el modelo publicado ahora, y cuando llegue el prometido, lo evalúas contra una línea base funcional en lugar de contra un comunicado de prensa. La espera no te cuesta nada; construir sobre nada mientras esperas te cuesta todo.
El veredicto es unilateral por diseño. Si necesitas generación de imágenes este trimestre, GPT-Image-2 es la elección y no hay discusión: es el número uno independiente, acaba de añadir salida con fondo transparente en la API y tiene una API pública y un precio estable. Flux 3 image es una razón para seguir de cerca a Black Forest Labs, no para frenar un proyecto. Sigue la apertura del acceso temprano y los primeros puntos de referencia independientes; en el momento en que exista un endpoint, la comparación de esta publicación se convierte en una prueba que realmente puedes ejecutar.
