Tarjeta de título principal para Meta Muse Image vs GPT Image 2, que dice 'Meta Muse Image vs GPT Image 2' con el subtítulo 'El modelo que piensa antes de dibujar vs el rey del texto', y dos tarjetas planas redondeadas etiquetadas como 'Agentic' y 'Text-first' debajo.
Guides & Insights

Meta Muse Image vs GPT Image 2: El novato pensante vs el rey del texto

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Meta Muse Image no genera imágenes de la manera en que se supone que los modelos de imagen generan. Lanzado el 7 de julio de 2026 como el primer modelo de imagen interno de Meta Superintelligence Labs, bajo el nombre clave Mango, funciona como un agente: puede buscar en la web para fundamentar una indicación en hechos, escribir y ejecutar código para colocar correctamente gráficos y códigos QR, y revisar su propio borrador antes de que veas el resultado: un hábito de autocorrección que, según Meta, no se programó explícitamente, sino que surgió mediante aprendizaje por refuerzo. El objetivo de toda esa maquinaria es GPT Image 2 de OpenAI, el modelo lanzado en abril de 2026 que sigue en el número uno de todas las clasificaciones públicas de modelos de imagen. Un mes después del lanzamiento de Muse Image, la evaluación honesta es que es el lanzamiento de modelo de imagen más interesante del año — y sigue siendo claramente el segundo.

Ninguno de los dos modelos es una noticia de última hora, y es exactamente por eso que este enfrentamiento merece una comparación tranquila en lugar de un artículo de lanzamiento. GPT Image 2 ha sido el líder desde la primavera y acaba de coger un segundo aire: OpenAI va a retirar la herramienta DALL-E de ChatGPT el 30 de agosto y a fusionar toda la generación en ChatGPT Images, la cual funciona con GPT Image 2, y los nuevos benchmarks del 7 de agosto reafirmaron su ventaja. Muse Image pasó sus primeras dos semanas en los titulares por un tropiezo de privacidad que Meta ha revertido desde entonces, y todavía no tiene API para desarrolladores. Detrás del ruido, la historia técnica es real: Meta construyó el primer modelo de imagen que piensa de manera visible, y OpenAI construyó el primero que dibuja texto que de verdad se puede leer. Todo lo demás en esta comparación es una consecuencia de esos dos hechos.

Two-column comparison scoreboard for Meta Muse Image and GPT Image 2: availability 'App-only; no developer API yet' vs 'API-first; OpenAI API + OrcaRouter'; working mode 'Agentic: web search + code + self-correction' vs 'Autoregressive; optional thinking mode'; Text-to-Image Arena 'Elo 1,281, #3 (Jul 31)' vs 'Elo 1,381, #1'; in-image text 'claimed, unverified' vs 'best-in-class, CJK Hindi Bengali'; price 'free tier in Meta apps' vs '~$0.05 to $0.21 per 1024x1024 image'; editing 'strong multi-image (Meta-reported)' vs 'leader on edit boards'. Footer reads 'Muse Image figures per arena.ai + Meta; GPT Image 2 per arena.ai + OpenAI — August 2026.'

El marcador

Las mismas seis dimensiones, en ambos lados, para que el contraste siga siendo escaneable sin una tabla. La cifra de arena de Muse Image es de terceros y su capacidad de edición está reportada por Meta; las cifras de GPT Image 2 son según arena.ai y la propia página de precios de OpenA​I. Cada número reportado por el proveedor está marcado.

• Disponibilidad — Muse Image solo en la aplicación, gratis en Meta AI, Instagram y WhatsApp, sin API para desarrolladores todavía, frente a GPT Image 2 que es API-first, invocable en la API de OpenAI y a través de OrcaRouter.

• Modo de trabajo — Muse Image agéntico por defecto: búsqueda web, ejecución de código, autocorrección, frente a GPT Image 2: una sola pasada autorregresiva con un modo de «pensamiento» opcional.

• Text-to-Image Arena — Elo de Muse Image 1.281, tercero al 31 de julio, vs. Elo de GPT Image 2 1.381, primero — una brecha de 100 puntos que equivale aproximadamente a una tasa de victoria esperada del 64%.

{{1}}Texto en imagen — Muse Image afirma generar texto preciso mediante su ruta de código y renderizado, {{/1}}{{2}}sin evaluación comparativa independiente frente a GPT Image 2, el mejor de su clase, {{/2}}{{3}}renderizando japonés, coreano, chino, hindi y bengalí de forma legible.{{/3}}

• Precio — Muse Image tiene un nivel gratuito en las aplicaciones de Meta, y para un uso más intensivo está Meta One a $7.99 o $19.99 al mes, frente a GPT Image 2, que cuesta aproximadamente entre $0.05 y $0.21 por imagen de 1024×1024 en la API.

• Edición — Muse Image es fuerte en edición de una y múltiples imágenes según las evaluaciones propias de Meta frente a GPT Image 2, el líder indiscutible en los rankings públicos de edición de imágenes.

El bucle agéntico es el verdadero producto.

La propuesta de Meta para Muse Image no es "más píxeles fotorrealistas" — es un modo de trabajo diferente. En una instrucción densa en conocimiento, por ejemplo, una imagen del trofeo de Wimbledon con el nombre del campeón actual, Muse Image primero busca en la web, fundamenta la generación en lo que encontró, y solo entonces dibuja. Para gráficos, infografías y códigos QR, escribe y ejecuta código, representa el resultado y usa esa representación para calibrar la imagen final. Los materiales posteriores al lanzamiento de Meta describen al modelo reflexionando sobre su propia salida: correcciones pequeñas para errores menores, rediseños completos para errores mayores, otra búsqueda cuando no está seguro. La afirmación sorprendente es que el comportamiento de revisión no fue programado explícitamente — surgió durante el aprendizaje por refuerzo porque revisar conducía a mayores recompensas de preferencia humana. Meta reporta la ganancia de autocorrección como un aumento en la tasa de victorias de aproximadamente el 57% en texto a imagen y el 56% en ambas categorías de edición; son cifras del proveedor que esperan una replicación independiente.

Pensar durante la generación también cambia qué palanca accionas para mejorar el modelo. Meta dice que la calidad de Muse Image mejora logarítmicamente con más pasos de razonamiento, y que gastar cómputo en un razonamiento más profundo supera a generar varios candidatos y elegir el mejor — una postura que trata el cómputo en tiempo de prueba como la frontera. GPT Image 2 tiene una idea paralela en su modo de pensamiento opcional, que planifica el diseño, puede buscar en la web y verifica su trabajo antes de dibujar; en la API se expone como un parámetro de pensamiento en bajo, medio o alto, facturado como tokens adicionales. La diferencia es una cuestión de valores predeterminados: Muse Image es un agente por construcción, diseñado para iterar; la ruta predeterminada de GPT Image 2 es una sola pasada, con el razonamiento como una mejora de pago. Si crees que la generación de imágenes se dirige hacia pipelines que usan herramientas y se autocorrigen, Muse Image es el primer modelo de producción construido enteramente en torno a esa premisa — y su combinación con el modelo de lenguaje Muse Spark de Meta, que planifica mientras el modelo de imágenes dibuja, es la articulación más clara de ese futuro lanzada hasta ahora.

El texto es donde la brecha es más amplia.

La ventaja más defendible del lado de GPT Image 2 es el texto legible dentro de las imágenes, la capacidad más solicitada en la generación de imágenes de producción. GPT Image 2 es el primer modelo que renderiza de manera fiable menús, carteles, infografías y diseños de varios paneles sin palabras distorsionadas, incluidos alfabetos no latinos que históricamente rompían todos los modelos anteriores. Por eso también arrasó en las clasificaciones de edición de imágenes: un diseño editado solo funciona si el texto que contiene permanece correcto. La vía de código y renderizado de Muse Image es un intento genuinamente ingenioso del mismo problema: no intenta dibujar texto, lo compone tipográficamente y lo integra en el resultado, pero ningún punto de referencia independiente muestra aún que iguale la salida de GPT Image 2 en imágenes con mucho texto, y los materiales de la propia Meta posicionan sus fortalezas en la edición y la composición, más que en la tipografía.

Uno de estos es invocable; el otro es una aplicación.

La brecha práctica para cualquiera que construya un producto es más marcada que la de los benchmarks. {{1}}GPT Image 2 es API-first: la invocas a través de la API de imágenes de OpenAI con tarifas por tokens —entrada de imagen a $8 por millón de tokens, salida de imagen a $30, entrada de texto a $5, salida de texto a $10, y entrada en caché a mitad de precio—, lo que equivale a unos $0.05 por imagen de 1024×1024 en calidad media y a $0.21 en calidad alta, antes de que la opción de thinking añada más coste.{{/1}} {{2}}Muse Image no tiene ninguna API para desarrolladores. Es gratuita en la app de Meta AI, en Instagram Stories y en WhatsApp, con el uso más intensivo limitado por la suscripción a Meta One por $7.99 o $19.99 al mes, y Meta ha dicho que sigue evaluando si abrirá el modelo a desarrolladores externos.{{/2}} {{3}}Puedes probar Muse Image esta misma tarde; no puedes construir sobre ella.{{/3}}

Screenshot of the Meta AI chat interface on meta.ai, showing the 'What can I do for you?' prompt box, a left rail with 'New chat' and 'Vibes', a 'Sign up' button, and suggested prompts such as 'Create a 3-in-3 arcade game' — the consumer app where Muse Image is free to use.

Esa asimetría es la razón por la que esta página puede enrutar uno de estos modelos y no el otro. GPT Image 2 ya está disponible en OrcaRouter en openai/gpt-image-2: una actualización directa desde gpt-image-1 con la misma forma de API, facturada al precio de lista de OpenAI sin margen, por lo que la tarifa de $8/$30 por millón de tokens que ves es la del proveedor, y cualquier recorte de precio del vendedor llega aquí el mismo día en que se anuncia. En el momento en que Meta abra un endpoint de Muse Image — y su propio lanzamiento de una API paga de Muse Spark sugiere que ese día se acerca — los dos se convierten en una decisión de enrutamiento en lugar de un uno u otro: una sola clave para probar A/B al recién llegado contra el titular en tus propios prompts, con conmutación automática por error a un generador probado mientras el modelo recién estrenado todavía está encontrando su ventaja. Ese es el patrón para el que existe la capa de enrutamiento: probar el modelo nuevo interesante sin apostar una ruta de producción por él.

Screenshot of the OrcaRouter model page for openai/gpt-image-2, showing the $8.00 per million input tokens and $30.00 per million output tokens pricing, the 'drop-in upgrade from gpt-image-1' description, the OpenAI-compatible endpoint api.orcarouter.ai/v1/images/generations, and a 7-day performance block.

El tropiezo de privacidad que casi definió el lanzamiento

Las dos primeras semanas de Muse Image no estuvieron dominadas por los benchmarks, sino por una función: los usuarios podían mencionar con @ una cuenta pública de Instagram en un prompt, y el modelo extraía la imagen de esa persona de las fotos públicas para incorporarla a escenas generadas — con las cuentas públicas activadas por defecto. Los grupos de privacidad y los gremios de Hollywood protestaron en cuestión de horas; Meta eliminó la función el 10 de julio, menos de una semana después del lanzamiento, aunque mantuvo el modelo subyacente. El episodio es un arma de doble filo para la comparación. Es un recordatorio de la verdadera ventaja de Meta — la distribución, que puede poner un modelo de imágenes ante miles de millones de usuarios de la noche a la mañana — y del escrutinio que conlleva. Por otra parte, Reuters descubrió que el detector de marcas de agua Content Seal de Meta no lograba verificar el 55% de las imágenes marcadas después de ser recortadas, por lo que la trazabilidad es más débil de lo que se anuncia. Nada de eso cambia la historia en cuanto a calidad, pero forma parte del historial público del modelo.

Cuál usar

Para todo lo que necesite texto correcto — envases, carteles, maquetas de interfaz, infografías o un flujo de trabajo que toque alfabetos no latinos — GPT Image 2 es la opción, y es el único de los dos al que puedes llamar desde código hoy en día. Muse Image es el experimento más interesante: su bucle agéntico apunta hacia dónde se dirige la generación de imágenes, su edición es realmente sólida, y ahora mismo es gratis para jugar en las aplicaciones de Meta. La brecha entre ambos es real, pero no es estructural: un modelo que ha aprendido a revisar su propio trabajo es un tipo de competidor distinto al que el campo se ha enfrentado, y si su autocorrección se generaliza, estos 100 puntos Elo en particular no parecerán estables por mucho tiempo. Adopta GPT Image 2 para producción, vigila el estado de la API de Muse Image y pon al recién llegado detrás de un enrutador el día en que se pueda llamar.