Una tarjeta hero con el título para la comparación 'GPT-Image-2.5 vs LLaDA-Image' y el subtítulo 'Una API de $30/M-token frente a un modelo de difusión gratuito de 6B', que muestra una tarjeta redondeada a la izquierda etiquetada como 'GPT-Image-2.5 · API INSIGNIA CERRADA — medida por tokens, alojada' y una tarjeta redondeada a la derecha etiquetada como 'LLaDA-Image · PESOS ABIERTOS — autoalojada, tarjeta Apache-2.0', unidas por un icono de balanza; el logotipo de OrcaRouter está en la esquina inferior derecha.
Guides & Insights

GPT-Image-2.5 vs LLaDA-Image: una API de $30/M-Token contra un modelo de difusión 6B gratuito

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pregunta cuánto debería costar la generación de imágenes y dos laboratorios construyeron las dos respuestas opuestas con una semana de diferencia. El 8 de septiembre de 2026, OpenAI lanzó GPT-Image-2.5 —el modelo detrás de ChatGPT Images 2.5, vendido a través de la API como GPT-Image-2.5 Flare y GPT-Image-2.5 Sunburst— con una tarifa de tokens de 8 $ por millón de tokens de entrada de imagen y 30 $ por millón de tokens de salida de imagen. Cinco días antes, el 4 de septiembre, inclusionAI (el laboratorio respaldado por Ant Group detrás de la familia de lenguajes LLaDA) publicó silenciosamente LLaDA-Image, un generador y editor de imágenes de difusión-transformer de seis mil millones de parámetros cuyos pesos se pueden descargar gratis. Uno es el modelo de imagen comercialmente más potente que OpenAI ha puesto jamás detrás de un medidor de tokens; el otro es un intento de demostrar que se puede construir un modelo de imagen sólido con una receta de entrenamiento abierta y regalarlo. Compararlos es menos un cara a cara que una decisión sobre qué definición de coste estás pagando en realidad.

Casi todos los números del lado de GPT-Image-2.5 son reportados por el proveedor y ninguno cuenta todavía con una verificación independiente: OpenAI afirma que Flare reduce la latencia hasta en un 50% en comparación con GPT-Image-2, y que pruebas de terceros realizadas por la empresa de agentes Manus midieron una generación entre 2 y 4 veces más rápida; sin embargo, al 9 de septiembre de 2026, ninguno de los modelos GPT-Image-2.5 tiene una entrada en las tablas de clasificación de imágenes de Artificial Analysis. La cifra principal de LLaDA-Image tampoco ha sido reproducida — inclusionAI reporta 53,53 en inglés / 53,38 en chino en Qwen-Image-Bench, lo que lo convierte en el primero entre los modelos de pesos abiertos en el momento de su lanzamiento — y, debido a que el modelo no tiene una API alojada, no puede aparecer en absoluto en las tablas de clasificación solo API. Ambos lados de esta comparación se basan en las afirmaciones de sus propios creadores, algo que conviene tener presente en el resto de este artículo.

Dos modelos que apenas comparten una categoría.

GPT-Image-2.5 es un modelo de imagen alojado y cerrado, de la misma línea que ChatGPT Images 2.0 de abril de 2026. Es multimodal en el lado de entrada y produce imágenes que, según OpenAI, son más nítidas en el detalle fino, más naturales en iluminación y textura, y más estables en ediciones de múltiples turnos: el endpoint Sunburst existe específicamente para trabajos de producción con muchas ediciones, donde la generación más lenta es aceptable a cambio de un control de instrucciones más estricto, mientras que Flare es el modo rápido predeterminado para generación de gran volumen. Las salidas alcanzan hasta 2048×2048 y 3840×2160, se admiten fondos transparentes, y cada salida lleva metadatos de procedencia C2PA además de una marca de agua invisible.

LLaDA-Image es un lanzamiento abierto de estilo investigativo basado en una apuesta completamente distinta. Mientras que GPT-Image-2.5 se sirve a través de la infraestructura de OpenAI, LLaDA-Image es un conjunto de pesos que tú mismo ejecutas: un transformador difusor (DiT) de 6 mil millones de parámetros en el lado de generación —la ficha del modelo registra unos 7 mil millones de parámetros una vez que se cuenta el lado lingüístico—, junto con LLaDA 2.0-mini, un modelo de lenguaje difusor de mezcla de expertos con 16 mil millones de parámetros en total y 1 mil millones activos, como lado de "comprensión" que convierte las indicaciones de texto o las instrucciones de edición en la señal que sigue el DiT. Lo inusual de la afirmación en el informe de arXiv (2609.03796) es la receta de entrenamiento: más del 90% de las aproximadamente 220 millones de muestras acumuladas de preentrenamiento y entrenamiento intermedio son solo de imagen, con un modelo de visión-lenguaje congelado que extrae semántica de imágenes no etiquetadas como señal de autocondicionamiento, de modo que el modelo "aprende a dibujar primero, y luego obedece". La resolución progresiva lleva el entrenamiento de 256×256 a través de 512×512 hasta el ajuste fino a 1024×1024, seguido de entrenamiento mixto de texto-a-imagen y edición, y una destilación de pocos pasos TwinFlow que produce la variante LLaDA-Image-Turbo.

Para qué es realmente bueno cada uno

La propuesta de GPT-Image-2.5 es precisión y control con calidad comercial. El anuncio de OpenAI destaca la fidelidad de referencia —mantener reconocible a una persona, una mascota o un producto al cambiar el entorno o el estilo— y una edición que cambia solo lo que se pidió cambiar, mantenida a lo largo de muchas rondas de edición en una misma conversación. El renderizado de texto dentro de las imágenes se menciona específicamente, incluida la eliminación de los caracteres chinos distorsionados que afectaron a los modelos de imagen anteriores. Son exactamente las capacidades que un equipo de producto, marca o publicidad necesita una y otra vez.

La propuesta de LLaDA-Image es un único conjunto de pesos que permite generación bilingüe y edición guiada por instrucciones con una receta abierta. inclusionAI reporta renderizado nativo de texto en chino e inglés, una ruta de edición que inyecta imágenes de referencia mediante un diseño de doble vía destinado a preservar el contenido no modificado y —en Qwen-Image-Bench— las mejores puntuaciones de pesos abiertos en el momento del lanzamiento. Las advertencias honestas del lanzamiento son que la calidad de edición perceptiva todavía va por detrás de los editores especializados y que el conteo de objetos sigue siendo débil. Es un modelo abierto generalista, no un producto comercial terminado.

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

El marcador no es deliberadamente un concurso sobre calidad de imagen — a los dos modelos nunca se les ha mostrado la misma evaluación. Lo que muestra es hacia dónde fluyen el dinero y el control.

El precio de una imagen es el número que ninguno de los dos lados te dará.

OpenAI publica una tarjeta de tarifas por tokens para GPT-Image-2.5 idéntica a la de GPT-Image-2: $8 por millón de tokens de entrada de imagen, $30 por millón de tokens de salida de imagen, entrada de imagen en caché a $2, y tokens de texto facturados por separado a $5 por millón. Lo que no publica es cuántos tokens consume una imagen determinada, lo que significa que no hay un precio oficial por imagen ni una calculadora de costos. Al precio que AA lista para el predecesor en su tabla de clasificación — aproximadamente $211 por 1.000 imágenes para GPT Image 2 en calidad "alta" — un buque insignia medido por tokens es una herramienta costosa a gran escala, pero esa cifra corresponde a GPT-Image-2, no a 2.5, y el costo por imagen del nuevo modelo es realmente desconocido fuera de OpenAI.

LLaDA-Image tiene el problema de honestidad opuesto. Los pesos no cuestan nada y la tarjeta lleva la etiqueta Apache-2.0, pero el precio real es la infraestructura: un transformador de difusión de 6B necesita una GPU seria para la variante Base de 50 pasos, y los checkpoints FP8 (unos 49 GB en un diseño de diffusers) son la opción práctica para la mayoría de los usuarios. La destilación de 2–4 pasos de LLaDA-Image-Turbo es la concesión a esa realidad. Las herramientas comunitarias han avanzado rápido — una solicitud de pull de SGLang añade soporte de texto a imagen, edición, paralelismo de secuencia y FP8, y un paquete de nodos ComfyUI de RebelAI soporta inferencia local cuantizada INT8 y GGUF — pero "modelo gratuito" sigue significando "tú eres el proveedor de alojamiento". Para un equipo que ya cuenta con capacidad de GPU, el coste marginal de LLaDA-Image se acerca a cero; para todos los demás, el coste total de servirlo puede superar las facturas de API medidas una vez que cuentas el tiempo de ingeniería.

El camino honesto si quieres ambos.

Para la mayoría de los equipos, estas no son opciones excluyentes. Un pipeline de producción puede usar una API alojada como GPT-Image-2.5 para el trabajo orientado al cliente, con muchas ediciones y que no puede fallar, y conservar un modelo abierto como LLaDA-Image para experimentos, trabajos por lotes sin conexión y cualquier caso que no pueda enviar prompts a un tercero. Esa división es exactamente el tipo de problema para el que está construida una capa de enrutamiento: una única API que llega a los modelos alojados que realmente usas, con el precio de lista del proveedor trasladado sin recargo, de modo que probar más adelante un modelo de pesos abiertos a través de una ruta alojada cueste lo mismo que acudir directamente al proveedor. Ninguno de los dos modelos está en el catálogo de OrcaRouter al 9 de septiembre de 2026: GPT-Image-2.5 es solo de API de OpenAI por ahora (la generación anterior, GPT-Image-2, sí está enrutada), y LLaDA-Image es solo de pesos, sin inferencia alojada. La intención de diseño se mantiene independientemente del catálogo actual.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

¿Sobre cuál deberías construir?

Si tu trabajo es la generación comercial de imágenes, donde una edición fallida cuesta la relación con un cliente — tomas de producto, creatividades de campaña, imágenes consistentes con la referencia, largas sesiones de edición de múltiples turnos — GPT-Image-2.5 es el modelo cuyo diseño completo está orientado a esa tarea, y el endpoint Sunburst es la razón para prestarle atención incluso antes de que existan puntuaciones independientes. Los riesgos son la opacidad del precio por imagen y el hecho de que cada afirmación de calidad proviene de la propia OpenAI. Si tu trabajo es investigación, experimentación de alto volumen, generación bilingüe chino-inglés o cualquier cosa que deba ejecutarse en tu propio entorno o con tus propios datos, LLaDA-Image es el lanzamiento más interesante — pesos genuinamente abiertos con una receta publicada, a costa de ser tu propia infraestructura y de convivir con puntuaciones no reproducidas. Los modelos se lanzaron con una semana de diferencia y están a un mundo de distancia en su modelo operativo; la elección correcta es aquella que coincida con el costo que realmente puedes pagar.

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.