
Muse Spark 1.2 vs Muse Spark 1.1: ¿Deberías actualizar?
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencia69Código60Matemáticas
Meta reemplazó Muse Spark 1.1 por Muse Spark 1.2 el 5 de agosto de 2026 sin cambiar el precio, la ventana de contexto, la lista de modalidades, los parámetros admitidos ni el dial de razonamiento. La migración, por tanto, parece gratuita — la misma familia de cadenas de modelo, la misma facturación, nada que renegociar. No es gratis. Una medición independiente sitúa el tiempo de la nueva versión hasta el primer token en 26,12 segundos frente a los 2,90 de la versión anterior, y su rendimiento sostenido en 165 tokens por segundo frente a 213,5. Estás comprando tres puntos de inteligencia medida con una espera aproximadamente nueve veces mayor antes de que llegue cualquier respuesta.
Si vale la pena hacerlo depende casi por completo de cuánto tiempo se ejecuten tus tareas. He aquí lo que realmente difiere, lo que permaneció idéntico y lo que nadie puede decirte todavía.
La decisión en cuatro líneas
• Índice de Inteligencia: 51 → 54, medido de forma independiente por Artificial Analysis en la configuración xhigh de cada versión.
• Tiempo hasta el primer token: 2.90s → 26.12s, misma fuente, mismas condiciones.
• Costo de ejecutar la misma suite de benchmarks: $548.07 → $637.85, con el mismo precio por token. El 16% adicional es pura quema de tokens.
• Todo lo que pregunta un formulario de adquisición: sin cambios.

¿Qué es genuinamente idéntico?
Vale la pena enumerar esto porque es la razón por la que una migración parece trivial sobre el papel, y porque una diferencia que no existe es una que no necesitas probar.
• Precio — $1.25 por millón de tokens de entrada, $4.25 por millón de salida, $0.15 por millón en acierto de caché, $2.50 por mil búsquedas web integradas. Cada una de esas cifras es la misma en ambas versiones.
• Contexto — 1,048,576 tokens en ambos, sin nivel de recargo por contexto largo en ninguno de los dos.
• Modalidades — texto, imágenes, video, audio y PDF de entrada; texto de salida. Ambos listados anuncian los mismos cinco tipos de entrada.
• Control de razonamiento — obligatorio en ambos, cinco niveles (mínimo, bajo, medio, alto, extra alto), por defecto medio en ambos. No hay ninguna opción en ninguna de las versiones que desactive el razonamiento.
• Parámetros — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Listas idénticas.
• Servicio — un solo proveedor, la propia Meta, en ambos. Sin hosts de terceros, sin variantes de cuantización.
• Precio combinado — Artificial Analysis sitúa ambos en $0,78 por millón de tokens en su ponderación combinada, lo cual es lo que cabría esperar de tarifas idénticas.
Si esperabas que la actualización incluyera más contexto, una garantía de longitud de finalización o una caché más barata, no fue así. Se trata de un lanzamiento de pesos y post-entrenamiento con una tarifa copiada y pegada de la anterior.
Lo que realmente se movió
Artificial Analysis es actualmente el único organismo independiente que ha evaluado ambas versiones, y las evaluó con el máximo esfuerzo de razonamiento, por lo que la comparación es en igualdad de condiciones.
• Índice de Inteligencia — 51 para 1.1 (puesto #22 de 185) a 54 para 1.2 (puesto #13). Nueve puestos en una tabla donde la mediana de la clase es 32, por lo que la ganancia compra una posición real, no solo un decimal.
• Tiempo hasta el primer token — de 2.90s a 26.12s. Esta es la regresión principal y no es marginal.
• Velocidad de salida — de 213.5 a 165.0 tokens por segundo. Sigue ocupando el puesto #16 de 185 y sigue siendo descrito por Artificial Analysis como "notablemente rápido", pero un 23% más lento que el modelo al que reemplaza.
• Verbosidad — 94M de tokens de salida para recorrer el índice, frente a 95M. Prácticamente sin cambios, y ambos alrededor de un 45% por encima de la mediana de 65M.
• Gasto total de evaluación — $548.07 a $637.85. Dado que la verbosidad apenas varió y los precios no se movieron en absoluto, ese aumento del 16 % proviene de algo distinto del resultado visible: más trazas de razonamiento interno, más reintentos o más turnos de herramientas por tarea.
El patrón es coherente. Meta no hizo el modelo más barato, más rápido ni más grande. Hizo que el modelo deliberara más tiempo antes de comprometerse, y la deliberación adicional se manifiesta como latencia, como un streaming ligeramente más lento y como una factura un 16% más alta por el mismo trabajo. Tres puntos de índice es lo que eso compró.
Qué tan mala es realmente la latencia
La cifra de 26.12 segundos se citará fuera de contexto, así que trátala correctamente: se mide en xhigh, el más caro de los cinco niveles de esfuerzo, en un conjunto de pruebas diseñado para ser difícil. La API usa por defecto medium.
Para hacerse una idea de cómo se siente realmente el valor predeterminado, Muse Spark 1.1 en OrcaRouter — atendiendo llamadas reales con el nivel de esfuerzo que soliciten — muestra un tiempo p50 hasta el primer token de 1,84 segundos y un p95 de 6,00 segundos en una semana móvil. Son datos de producción con niveles de esfuerzo de producción, y se sitúan más de un orden de magnitud por debajo de la cifra de referencia. La versión 1.2 aún no tiene telemetría de producción.

Así que la lectura honesta no es «1.2 tarda 26 segundos en responder». Es: en la configuración donde 1.2 consigue sus tres puntos extra, el primer token te cuesta 26 segundos, y en la misma configuración el modelo antiguo te costaba tres. Si ya estabas usando xhigh — que es exactamente la configuración donde existe la ganancia de inteligencia — ese es el número que heredas. Si ejecutas en medium o inferior, verás algo mucho más corto, y también verás menos de la mejora.
Ese acoplamiento es la verdadera trampa en esta actualización. No puedes obtener la inteligencia sin la deliberación, porque la deliberación es de donde surge la inteligencia.
El reposicionamiento detrás de los números
Meta no publicó ninguna publicación de lanzamiento para 1.2 — la página de anuncio de Muse Spark aún describe 1.1 — pero reescribió la descripción del producto, y la reescritura explica el trade-off.
Muse Spark 1.1 se vendió como un modelo de razonamiento multimodal con una superficie de entrada inusualmente amplia, dirigido a "agentes multimodales, investigación profunda sobre medios mixtos y análisis de contexto largo": informes largos, bibliotecas de medios, grabaciones y video junto con texto.
La descripción de Muse Spark 1.2 omite casi todo eso y menciona la ingeniería de software en su lugar — refactorizaciones de múltiples archivos, sesiones de depuración extendidas, generación de repositorios completos — y luego añade una afirmación explícita sobre multiagentes: el modelo puede actuar como el agente principal que reúne contexto, planifica y delega, o como un subagente que se ejecuta en paralelo bajo uno de ellos. También afirma que el almacenamiento en caché de prompts puede reducir el costo efectivo entre un 60 y un 80 %, dependiendo de cuánto contexto se repita entre llamadas. Esa última cifra es una estimación de Meta más que un resultado medido, aunque la tarifa de caché de $0.15 la hace aritméticamente creíble.
Lee la regresión de latencia en relación con ese reposicionamiento y deja de parecer un error. Nadie que refactorice una docena de archivos se preocupa por 26 segundos de planificación. Meta eligió a un cliente, y no es a aquel al que se le vendió la 1.1.
Lo que 1.1 todavía tiene que 1.2 no tiene
Cuatro semanas de existencia no son suficientes para acumular un historial, y en tres aspectos concretos el modelo más antiguo es actualmente el producto mejor documentado.
• Un récord de arena.Muse Spark 1.1 tiene un historial sustancial en Design Arena: 1334 Elo en el puesto 5 en desarrollo de juegos, 1334 en el puesto 7 en componentes de UI, 1320 en el puesto 3 en arte ASCII, 1318 en visualización de datos, 1309 en categorías generales de código, además de una escalera completa de agents-arena que cubre aplicaciones web, diapositivas HTML y desarrollo de juegos con Godot. Muse Spark 1.2 no tiene ninguna entrada. En el eje que Meta ahora está promocionando con más esfuerzo, no hay ningún dato de comparación directa para el nuevo modelo.
• Puntuaciones de subíndices. Artificial Analysis publica un índice de codificación de 71,3 y un índice agéntico de 37,5 para 1.1. No existe una contraparte publicada para 1.2. Dado que la puntuación agéntica fue la dimensión más débil de 1.1 por un amplio margen, y la capacidad agéntica es exactamente lo que 1.2 afirma mejorar, este es el número que resolvería la cuestión de la actualización — y aún no existe.
• Telemetría de producción. 1.1 tiene una semana de latencia real p50 y p95 a sus espaldas y 4.4M de tokens de tráfico en vivo en OrcaRouter. 1.2 no tiene ninguna de las dos; su endpoint actualmente no reporta estadísticas de latencia ni de throughput en absoluto porque el volumen es demasiado bajo para muestrear.
• Un lugar donde alquilarlo aparte de Meta. Muse Spark 1.1 está en el catálogo de OrcaRouter a $1.25 y $4.25 — el precio de lista de Meta, transmitido sin margen (0%). Muse Spark 1.2 aún no está allí, por lo que hoy es una integración directa con Meta con un solo proveedor y sin ruta de conmutación por error.

Nada de esto significa que 1.2 sea peor. Significa que la evidencia para 1.2 consiste en una puntuación compuesta de un solo evaluador, mientras que la evidencia para 1.1 es un mes de arenas, subíndices y tráfico en vivo. Esa asimetría debería afectar cómo organizas la migración, no si la intentas.
Una lista de verificación de migración que realmente sea breve
Dado que la tarjeta de tarifas y la superficie de parámetros son idénticas, {{1}}el intercambio es un cambio en la cadena del modelo{{/1}}. El trabajo consiste en verificar {{2}}las tres cosas que sí se movieron{{/2}}.
• Mide tu propio tiempo hasta el primer token con tu propia configuración de esfuerzo. No aceptes ni la cifra de 2.90s ni la de 26.12s. Ejecuta tus prompts reales con cualquier reasoning_effort que realmente pases y compara directamente. Este es el número que puede matar la migración por completo.
• Revisa tu configuración de tiempo de espera y streaming. Un aumento de 9x en la latencia del primer token con esfuerzo alto superará los tiempos de espera del cliente que se ajustaron para la versión 1.1, y hará que cualquier integración sin streaming parezca un cuelgue.
• Recalcule el costo a partir de los recuentos de tokens medidos, no de la tarifa. Los precios son idénticos, por lo que cualquier cambio de costo es de comportamiento. Artificial Analysis vio un 16 % más de gasto por el mismo trabajo; si usted ve eso depende de su combinación de tareas.
• Verifique primero la estabilidad de la clave de caché.Con un prefijo estable de 60,000 tokens, un paso de agente típico baja de aproximadamente 8.8 centavos a aproximadamente 2.2 centavos en cualquiera de las versiones. Ese cambio del 75% es mayor que cualquier efecto del cambio de versión, y está totalmente bajo su control.
• Vuelva a probar las rutas de audio y video explícitamente.Ambos listados anuncian las mismas cinco modalidades de entrada, pero la tarjeta de especificaciones de Artificial Analysis para 1.2 solo registra texto e imagen como evaluados. Meta reescribió la propuesta para alejarla del trabajo con medios mixtos. Nadie independiente ha comprobado si la capacidad se mantuvo.
• Mantén la 1.1 accesible como respaldo. Ejecutar ambas detrás de una misma clave significa que la reversión es un cambio de configuración en lugar de un incidente, y te permite hacer A/B de las dos en tráfico real en lugar de discutir sobre un benchmark.
Quién se mueve ahora, quién espera
Muévete ya si ejecutas agentes de codificación de horizonte largo con un alto esfuerzo de razonamiento. Las tareas ya tardan minutos, la penalización de latencia desaparece en eso, la ganancia de inteligencia la mide un tercero en lugar de reclamarla Meta, y tres puntos de índice es un salto significativo en este nivel: nueve puestos en una tabla de 185 modelos.
Espera si algo de lo que sirves es interactivo. No existe configuración en la que 1.2 sea más rápido que 1.1, y el razonamiento obligatorio significa que no puedes recuperar la capacidad de respuesta desactivando el pensamiento. La versión 1.1 sigue siendo el modelo más rápido en todos los niveles de esfuerzo y cuesta exactamente lo mismo.
Espera si tu carga de trabajo es el análisis de medios mixtos — el caso de uso de informes extensos, video y audio para el que 1.1 fue explícitamente construido y comercializado. Meta dejó de promocionarlo y la única evaluación independiente de 1.2 cubre texto e imágenes. La capacidad bien podría estar intacta; simplemente no hay evidencia en ningún sentido, y 1.1 tiene un mes de ello.
Espera si necesitas los datos de la arena. Un modelo que se vende por su generación de repositorios completos, sin entradas en Design Arena y sin un subíndice agéntico publicado, te pide que te fíes de la palabra de Meta sobre lo que cambió. Dale tres o cuatro semanas y eso dejará de ser cierto, momento en el que esta decisión será mucho más fácil de tomar con base en la evidencia en lugar de en un único número compuesto.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
