Muse Spark 1.2 y Muse Code-1
Guides & Insights

Muse Spark 1.2 y Muse Code: el tercer modelo de Meta en cuatro meses empata con Grok 4.5

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026, cuatro semanas después de Muse Spark 1.1 y aproximadamente cuatro meses después del primer Muse Spark. Esta versión llegó con algo que las dos anteriores no tenían: un agente de codificación propio de Meta, Muse Code, lanzado en versión beta y co-entrenado con el modelo en el que se ejecuta. Y en el único marcador que ni Meta ni sus rivales controlan, el lanzamiento coloca a Meta en un empate técnico con SpaceXAI: Muse Spark 1.2 y Grok 4.5 ahora obtienen ambos 54 en el Índice de Inteligencia de Artificial Analysis. Cinco días después llegó el acontecimiento más importante: el 10 de agosto, Meta anunció que abrirá los pesos de Muse Spark 1.2, un anuncio que, si se concreta, convertiría al modelo en el rival actual más fuerte de EE. UU. de pesos abiertos frente a los modelos chinos.

Conviene separar dos cosas antes de que cualquiera de las cifras siguientes tenga sentido. La puntuación del Intelligence Index, las cifras de latencia y los recuentos de tokens provienen de Artificial Analysis, que realiza sus propias evaluaciones y publica la factura; esos datos son independientes. Los resultados de codificación con los que Meta encabezó su anuncio —Terminal-Bench 2.1, DeepSWE v1.1 y un benchmark interno— fueron ejecutados por Meta, en el harness de Meta, con cada modelo competidor emparejado con su propio producto de agente. Ambos tipos de cifras son útiles. No son el mismo tipo de evidencia, y este artículo las mantiene separadas.

Lo que Meta realmente lanzó

Muse Spark 1.2 and Muse Code-2

El anuncio, publicado en el blog de investigación de IA de Meta y fechado el 5 de agosto, cubre dos productos a la vez.

Muse Spark 1.2 — una actualización centrada en la codificación para la familia Muse Spark. Meta afirma que amplió el cómputo de entrenamiento en tareas de codificación y diversificó los entornos de entrenamiento, manteniendo a la vez la capacidad de agente general con la que se comercializó la versión 1.1. Los objetivos de entrenamiento declarados son de horizonte largo: generación de repositorios completos, proyectos integrales de extremo a extremo y lo que Meta denomina auto-investigación, con planificación para secuenciar el trabajo, condicionamiento de objetivos para mantener el rumbo a lo largo de muchos pasos y compactación de contexto para conservar el estado relevante mientras la sesión se prolonga.

Muse Code — un agente de codificación de terminal en beta, instalado con un script de shell de una línea desde el dominio de desarrolladores de Meta. Ejecuta agentes asíncronos persistentes en segundo plano que sobreviven a lo largo de una sesión, en un runtime local de registro de eventos que Meta describe como de reproducción exacta y seguro ante reinicios, y coordina múltiples subagentes por tarea en árboles de trabajo aislados. Incluye tres habilidades integradas: /plan para planificación con aprobación, /grill para poner a prueba el trabajo ya realizado, y /goal para llevar una tarea hasta su finalización.

El emparejamiento no es incidental. Meta dice que ambos fueron coentrenados: el modelo se ajustó con trayectorias muestreadas por rechazo del arnés, con optimizaciones de receta para objetivos, compactación y subagentes. Esa es la misma jugada de coentrenamiento que produjo Claude Code y Codex, y tiene una consecuencia para cualquiera que lea los números de los benchmarks: las puntuaciones de codificación destacadas del modelo se produjeron dentro del arnés contra el que fue entrenado. Eso no es hacer trampa; así es como funciona ahora la evaluación agéntica. Pero sí significa que una puntuación de 1.2 obtenida a través de otro andamiaje es una cuestión abierta, no una suposición segura.

El resto de la especificación no cambia con respecto a la {{1}}1.1, que es en sí misma informativa{{/1}}. El contexto se mantiene en 1,048,576 tokens. El razonamiento sigue siendo obligatorio en cinco niveles de esfuerzo — mínimo, bajo, medio, alto, {{2}}xhigh{{/2}} — con medio como predeterminado; no existe ninguna configuración en la que obtengas los pesos sin pagar por cierta deliberación. En el lanzamiento, los pesos estaban cerrados, sin {{3}}repositorio de Hugging Face{{/3}} y con la Model API propia de Meta como el único punto de acceso de primera parte para invocarlo. Eso ahora está programado para cambiar: el 10 de agosto Meta anunció que abrirá los pesos, revirtiendo la política de pesos cerrados que rigió los primeros tres lanzamientos de {{4}}Muse Spark{{/4}}.

43, luego 51, luego 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis puntúa Muse Spark 1.2 con 54 en su índice de inteligencia en la configuración de razonamiento xhigh, clasificándolo en el puesto #13 de 185 modelos frente a una mediana de clase de 32. El índice es un compuesto ponderado de nueve evaluaciones — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR — repartidas por igual entre agentes, codificación, capacidad general y razonamiento científico.

Leída como una serie en lugar de una instantánea, la trayectoria de Meta es la historia real. El Muse Spark original obtuvo 43 en abril. Muse Spark 1.1 alcanzó 51 el 9 de julio, una mejora de ocho puntos en un trimestre. Muse Spark 1.2 suma tres más en menos de un mes. Meta ha movido 11 puntos de índice en cuatro meses y ahora está lanzando más rápido de lo que el ecosistema de evaluación puede seguir: todavía no hay un desglose publicado por punto de referencia para la 1.2, y ningún registro en Design Arena en absoluto, mientras que la 1.1 tiene ambos.

Cincuenta y cuatro puntos sitúan a Meta a la par con Grok 4.5, el modelo que SpaceXAI lanzó un día antes de Muse Spark 1.1, y por detrás de un grupo de vanguardia muy cerrado: Claude Opus 5 con 61, Claude Fable 5 con 60, GPT-5.6 Sol con 59. La diferencia con la cima es de seis o siete puntos. La diferencia desde donde Meta comenzó el año es de once. Que eso se cierre depende de si se mantiene el ritmo, y Meta está actualmente en un ciclo de lanzamiento de cuatro semanas.

Sin embargo, un empate en un índice compuesto no es un empate en un trabajo, y vale la pena decir qué resuelve y qué no resuelve el 54. Establece que Muse Spark 1.2 pertenece a la misma conversación que Grok 4.5 en cuanto a capacidad agregada. No te dice cuál escribe mejores parches, porque el subíndice de codificación que respondería a eso aún no se ha publicado para 1.2.

Los números de codificación de Meta, léelos con atención.

El anuncio de Meta lidera en tres gráficos. En sus propias ejecuciones, reportado como pass@1 sobre cinco intentos con cada modelo competidor emparejado con su propio producto de agente:

Terminal-Bench 2.1 — 82.9% para Muse Spark 1.2, frente al 76.2% de la versión 1.1. Claude Opus 5 se muestra por delante con un 86.7%.

DeepSWE v1.1 — 59,3%, frente al 53,0%.

El benchmark interno de codificación de Meta — 70.6%, frente al 68.3%.

Los deltas son la parte creíble. Una mejora de 6,7 puntos en Terminal-Bench y de 6,3 en DeepSWE, medida de la misma manera en el mismo harness por el mismo equipo con un mes de diferencia, es una lectura razonable de cuánto mejoró 1.2 respecto a 1.1 en lo que Meta estaba optimizando. La posición entre proveedores es la parte que hay que tomar con cautela: el emparejamiento del harness es una gran variable libre, y un laboratorio que ajusta su propio harness junto con su propio modelo no está en condiciones de ajustar el de los demás con la misma eficacia. Meta quedó en segundo lugar en su propia diapositiva, lo que al menos no es la forma habitual de un benchmark de proveedor, pero ningún tercero ha reproducido nada de esto hasta el momento de escribir estas líneas.

La segunda lista de precios

Lo más importante de esta versión no está en los gráficos de referencia. Muse Spark 1.2 incluye dos listas de precios.

Nivel estándar — $1.25 por millón de tokens de entrada, $0.15 por millón en acierto de caché, $4.25 por millón de salida. Sin cambios respecto a 1.1, al céntimo. Tope de tasa de alrededor de 3,000 solicitudes por minuto. El grounding de búsqueda web se factura por separado a $2.50 por cada mil consultas.

Nivel de colaborador — $0.10 de entrada, $0.002 de entrada en caché, $0.20 de salida. Eso es 12.5× más barato en entrada y 21.25× más barato en salida. El precio de admisión es el permiso para que Meta entrene modelos futuros con tu tráfico, y un tope de 60 solicitudes por minuto: el 2 % del presupuesto estándar.

A $0.10 y $0.20, Muse Spark 1.2 quedaría por debajo de casi todos los modelos fronterizos del mercado, incluido el nivel económico de peso abierto con el que de otro modo pierde en precio. Ese es el número interesante en este lanzamiento, y no es realmente una decisión de precios. Sesenta solicitudes por minuto descartan por sí solas la mayoría de los patrones de fan-out en producción, así que el nivel está pensado para experimentación y trabajo en equipos pequeños, no para servir tráfico. Y "podemos entrenar con tu tráfico" es una pregunta para quien apruebe la gobernanza de datos en tu organización, no para quien elige modelos. Trátalo como una revisión legal con descuento adjunto, no como una SKU más barata.

Lo que cuesta producir el 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publica lo que cuestan sus propias ejecuciones de evaluación, y es en esa columna donde se aprecia el perfil de Muse Spark 1.2. Completar la suite de nueve puntos de referencia costó $637.85 y consumió 95 millones de tokens de salida, frente a los $548.07 y 94 millones de Muse Spark 1.1 — con un precio idéntico por token. El 16% adicional es pura deliberación.

Las cifras de latencia se comportan de la misma manera. Medido en xhigh, el tiempo hasta el primer token es de 26.12 segundos para 1.2 frente a 2.90 segundos para 1.1, y la velocidad de salida cae de 213.5 a 165.0 tokens por segundo. Meta compró tres puntos de índice con tiempo de pensamiento, y el diseño de razonamiento obligatorio significa que no puedes rechazar la compra — solo elegir cuánto de ella haces.

Ese número de 26 segundos será mal citado, así que aquí está la corrección de antemano: es una medición en el nivel de esfuerzo más costoso que expone el modelo, y la API usa el nivel medio por defecto. Como punto de referencia del tráfico real y no de un banco de pruebas, Muse Spark 1.1 servido a través de OrcaRouter — con el esfuerzo que los clientes realmente soliciten — muestra un tiempo p50 hasta el primer token de 1.84 segundos en 7 días y un p95 de 6.00 segundos, a 519 tokens por segundo y con una tasa de error de cero. La latencia de benchmark con esfuerzo máximo y la latencia de producción con esfuerzo por defecto son cantidades diferentes, y normalmente difieren en un orden de magnitud. Lee 26.12s como el techo del razonamiento profundo, no como lo que se sentirá en una solicitud.

Dónde puedes llamarlo hoy

Muse Spark 1.2 se sirve a través de la propia API de Model de Meta y, al momento de escribir esto, en ningún otro lugar: todavía no hay un repositorio en Hugging Face y no está en el catálogo de OrcaRouter. Eso es lo que el anuncio del 10 de agosto pretende cambiar: Meta dice que los pesos se abrirán 'en las próximas semanas', y una vez que lo hagan, la cuestión de disponibilidad pasa de '¿dónde se sirve?' a '¿qué pesos, bajo qué licencia y en qué entornos de ejecución?'. Muse Spark 1.1 está en el catálogo de OrcaRouter, a $1.25 y $4.25 — los mismos precios que Meta cobra, porque OrcaRouter aplica un margen del 0% y transmite directamente el precio de lista del proveedor.

Eso importa más para la comparación que para el propio modelo. Si estás construyendo un modelo de costos para esta versión, los modelos con los que lo compararías — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — están detrás de una sola clave a precio de lista, así que la cifra en tu hoja de cálculo es la cifra en la factura, y un recorte de precio del proveedor se aplica el mismo día en lugar de después de una renovación. Para Muse Spark 1.2 específicamente, hoy la respuesta es el endpoint de Meta, un segundo contrato y una factura separada — y una vez que los pesos estén disponibles, una instalación autoalojada se convierte en una tercera opción.

Qué cambió el 10 de agosto

Cinco días después del lanzamiento, la postura de Meta hacia su propio buque insignia cambió. En un anuncio con fecha del 10 de agosto, Meta dijo que abrirá los pesos de Muse Spark 1.2 «en las próximas semanas», convirtiéndolo en el primer lanzamiento de Muse Spark que un equipo podría ejecutar por sí mismo. La declaración es de nivel ejecutivo, no está publicada: aún no hay un repositorio de Hugging Face, y la fecha exacta, el número de parámetros y la licencia no están confirmados.

Lo que está en juego es la carrera por los pesos de frontera. Muse Spark 1.2 obtiene 54 en el Artificial Analysis Intelligence Index, por encima de todos los modelos estadounidenses de pesos abiertos actualmente descargables; así que, si los pesos llegan como se prometió, sería el rival estadounidense de pesos abiertos más fuerte frente a los laboratorios chinos, el planteamiento que Zuckerberg argumentó extensamente el 10 de agosto en un ensayo de 6.500 palabras en el que acusaba a las restricciones de EE. UU. sobre los datos de entrenamiento de entregar el liderazgo de los pesos abiertos a laboratorios extranjeros. El giro ya tiene una primera entrega: Muse Glimmer, un modelo de 30.000 millones de parámetros lanzado el mismo día bajo licencia Apache 2.0, destilado de Muse Spark y creado para cargas de trabajo agénticas locales. Los propios puntos de referencia de Meta lo sitúan por delante de Gemma4-31B de Google y Qwen3.6-27B en tareas de agentes; esas cifras han sido obtenidas por el proveedor y no han sido reproducidas hasta ahora.

Lo que el anuncio no respondió

Sin número de codificación independiente. Artificial Analysis publica un compuesto para 1.2, pero aún no los subíndices de codificación y de agentes que publicó para 1.1 (71.3 y 37.5, respectivamente). Dado que el trabajo de agentes fue la dimensión más débil de 1.1 por un amplio margen, y la codificación de agentes es exactamente lo que 1.2 afirma haber corregido, este es el número que resolvería el lanzamiento.

No se han reproducido los resultados del harness. Todas las cifras de codificación del anuncio son ejecutadas por Meta. Nadie ha publicado aún puntuaciones de Muse Spark 1.2 desde un scaffold neutral.

Sin verificación multimodal.El listado de Muse Spark promociona entrada de texto, imagen, video, audio y PDF. La evaluación independiente cubre texto e imagen. La mensajería 1.2 de Meta ha pasado casi por completo al trabajo de software, y el caso de uso de medios mixtos 1.1 se vendió explícitamente; por ahora, no tiene ni marketing ni medición detrás.

No hay historial de rendimiento.El volumen en el endpoint sigue siendo demasiado bajo para que se generen las estadísticas habituales de latencia en ventana móvil.

Qué ver durante las próximas cuatro semanas

Cuatro cosas decidirán si esta versión es lo que Meta dice que es. La primera es una puntuación agéntica independiente para la 1.2: si el subíndice que estaba en 37.5 en la 1.1 se ha movido sustancialmente, la propuesta de codificación es real. La segunda es si alguien reproduce el resultado de Terminal-Bench fuera de Muse Code; un modelo que solo se desempeña dentro de su propio banco de pruebas es un producto, no una capacidad. La tercera es qué ocurre con el nivel de colaboradores: si se flexibiliza el límite de 60 solicitudes, un modelo adyacente a la frontera a $0.10 de entrada y $0.20 de salida cambia la aritmética del nivel de presupuesto de una manera que una ganancia de tres puntos en el índice nunca lograría. La cuarta es la promesa de los pesos: Meta dice que los pesos de Muse Spark 1.2 se abrirán "en las próximas semanas", y si el repositorio llega en ese plazo — bajo qué licencia y con qué rapidez los entornos de ejecución locales lo adoptan — decidirá si el giro hacia los pesos abiertos es real.

Y si el ritmo se mantiene, Muse Spark 1.3 está previsto para principios de septiembre. A juzgar por esto, la cifra que hay que observar cuando llegue no es la puntuación del índice. Es si Meta puede añadir capacidad sin añadir otros veinte segundos de pensamiento al frente de cada solicitud. El primer fruto de ese giro ya está aquí: Muse Glimmer, un modelo de pesos abiertos de 30 mil millones de parámetros que Meta publicó el 10 de agosto bajo licencia Apache 2.0, creado para ejecutar agentes localmente: la vista previa más cercana hasta ahora de cómo se ve un Muse Spark 1.2 abierto.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario