Muse Spark 1.2 y Muse Code-1
Guides & Insights

Muse Spark 1.2 y Muse Code: el tercer modelo de Meta en cuatro meses empata con Grok 4.5

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026, cuatro semanas después de Muse Spark 1.1 y aproximadamente cuatro meses después del primer Muse Spark. Esta versión llegó con algo que las dos anteriores no tenían: un agente de codificación propio de Meta, Muse Code, lanzado en versión beta y co-entrenado con el modelo en el que se ejecuta. Y en el único marcador que ni Meta ni sus rivales controlan, el lanzamiento coloca a Meta en un empate técnico con SpaceXAI — Muse Spark 1.2 y Grok 4.5 ahora obtienen ambos 54 en el Artificial Analysis Intelligence Index.

Conviene separar dos cosas antes de que cualquiera de las cifras siguientes tenga sentido. La puntuación del Intelligence Index, las cifras de latencia y los recuentos de tokens provienen de Artificial Analysis, que realiza sus propias evaluaciones y publica la factura; esos datos son independientes. Los resultados de codificación con los que Meta encabezó su anuncio —Terminal-Bench 2.1, DeepSWE v1.1 y un benchmark interno— fueron ejecutados por Meta, en el harness de Meta, con cada modelo competidor emparejado con su propio producto de agente. Ambos tipos de cifras son útiles. No son el mismo tipo de evidencia, y este artículo las mantiene separadas.

Lo que Meta realmente lanzó

Muse Spark 1.2 and Muse Code-2

El anuncio, publicado en el blog de investigación de IA de Meta y fechado el 5 de agosto, cubre dos productos a la vez.

Muse Spark 1.2 — una actualización centrada en la codificación para la familia Muse Spark. Meta afirma que amplió el cómputo de entrenamiento en tareas de codificación y diversificó los entornos de entrenamiento, manteniendo a la vez la capacidad de agente general con la que se comercializó la versión 1.1. Los objetivos de entrenamiento declarados son de horizonte largo: generación de repositorios completos, proyectos integrales de extremo a extremo y lo que Meta denomina auto-investigación, con planificación para secuenciar el trabajo, condicionamiento de objetivos para mantener el rumbo a lo largo de muchos pasos y compactación de contexto para conservar el estado relevante mientras la sesión se prolonga.

Muse Code — un agente de codificación de terminal en beta, instalado con un script de shell de una línea desde el dominio de desarrolladores de Meta. Ejecuta agentes asíncronos persistentes en segundo plano que sobreviven a lo largo de una sesión, en un runtime local de registro de eventos que Meta describe como de reproducción exacta y seguro ante reinicios, y coordina múltiples subagentes por tarea en árboles de trabajo aislados. Incluye tres habilidades integradas: /plan para planificación con aprobación, /grill para poner a prueba el trabajo ya realizado, y /goal para llevar una tarea hasta su finalización.

El emparejamiento no es incidental. Meta dice que ambos fueron coentrenados: el modelo se ajustó con trayectorias muestreadas por rechazo del arnés, con optimizaciones de receta para objetivos, compactación y subagentes. Esa es la misma jugada de coentrenamiento que produjo Claude Code y Codex, y tiene una consecuencia para cualquiera que lea los números de los benchmarks: las puntuaciones de codificación destacadas del modelo se produjeron dentro del arnés contra el que fue entrenado. Eso no es hacer trampa; así es como funciona ahora la evaluación agéntica. Pero sí significa que una puntuación de 1.2 obtenida a través de otro andamiaje es una cuestión abierta, no una suposición segura.

El resto de la especificación no cambia respecto de la 1.1, que en sí misma es informativa. El contexto se mantiene en 1 048 576 tokens. El razonamiento sigue siendo obligatorio en los cinco niveles de esfuerzo —mínimo, bajo, medio, alto, xhigh—, siendo medio el predeterminado; no existe configuración en la que se obtengan los pesos sin pagar por cierta deliberación. Los pesos son cerrados, sin repositorio de Hugging Face, y la API Model de Meta sigue siendo el único lugar de primera parte para invocarlo.

43, luego 51, luego 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis puntúa Muse Spark 1.2 con 54 en su índice de inteligencia en la configuración de razonamiento xhigh, clasificándolo en el puesto #13 de 185 modelos frente a una mediana de clase de 32. El índice es un compuesto ponderado de nueve evaluaciones — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR — repartidas por igual entre agentes, codificación, capacidad general y razonamiento científico.

Leída como una serie en lugar de una instantánea, la trayectoria de Meta es la historia real. El Muse Spark original obtuvo 43 en abril. Muse Spark 1.1 alcanzó 51 el 9 de julio, una mejora de ocho puntos en un trimestre. Muse Spark 1.2 suma tres más en menos de un mes. Meta ha movido 11 puntos de índice en cuatro meses y ahora está lanzando más rápido de lo que el ecosistema de evaluación puede seguir: todavía no hay un desglose publicado por punto de referencia para la 1.2, y ningún registro en Design Arena en absoluto, mientras que la 1.1 tiene ambos.

Cincuenta y cuatro puntos sitúan a Meta a la par con Grok 4.5, el modelo que SpaceXAI lanzó un día antes de Muse Spark 1.1, y por detrás de un grupo de vanguardia muy cerrado: Claude Opus 5 con 61, Claude Fable 5 con 60, GPT-5.6 Sol con 59. La diferencia con la cima es de seis o siete puntos. La diferencia desde donde Meta comenzó el año es de once. Que eso se cierre depende de si se mantiene el ritmo, y Meta está actualmente en un ciclo de lanzamiento de cuatro semanas.

Sin embargo, un empate en un índice compuesto no es un empate en un trabajo, y vale la pena decir qué resuelve y qué no resuelve el 54. Establece que Muse Spark 1.2 pertenece a la misma conversación que Grok 4.5 en cuanto a capacidad agregada. No te dice cuál escribe mejores parches, porque el subíndice de codificación que respondería a eso aún no se ha publicado para 1.2.

Los números de codificación de Meta, léelos con atención.

El anuncio de Meta lidera en tres gráficos. En sus propias ejecuciones, reportado como pass@1 sobre cinco intentos con cada modelo competidor emparejado con su propio producto de agente:

Terminal-Bench 2.1 — 82.9% para Muse Spark 1.2, frente al 76.2% de la versión 1.1. Claude Opus 5 se muestra por delante con un 86.7%.

DeepSWE v1.1 — 59,3%, frente al 53,0%.

El benchmark interno de codificación de Meta — 70.6%, frente al 68.3%.

Los deltas son la parte creíble. Una mejora de 6,7 puntos en Terminal-Bench y de 6,3 en DeepSWE, medida de la misma manera en el mismo harness por el mismo equipo con un mes de diferencia, es una lectura razonable de cuánto mejoró 1.2 respecto a 1.1 en lo que Meta estaba optimizando. La posición entre proveedores es la parte que hay que tomar con cautela: el emparejamiento del harness es una gran variable libre, y un laboratorio que ajusta su propio harness junto con su propio modelo no está en condiciones de ajustar el de los demás con la misma eficacia. Meta quedó en segundo lugar en su propia diapositiva, lo que al menos no es la forma habitual de un benchmark de proveedor, pero ningún tercero ha reproducido nada de esto hasta el momento de escribir estas líneas.

La segunda lista de precios

Lo más importante de esta versión no está en los gráficos de referencia. Muse Spark 1.2 incluye dos listas de precios.

Nivel estándar — $1.25 por millón de tokens de entrada, $0.15 por millón en acierto de caché, $4.25 por millón de salida. Sin cambios respecto a 1.1, al céntimo. Tope de tasa de alrededor de 3,000 solicitudes por minuto. El grounding de búsqueda web se factura por separado a $2.50 por cada mil consultas.

Nivel de colaborador — $0.10 de entrada, $0.002 de entrada en caché, $0.20 de salida. Eso es 12.5× más barato en entrada y 21.25× más barato en salida. El precio de admisión es el permiso para que Meta entrene modelos futuros con tu tráfico, y un tope de 60 solicitudes por minuto: el 2 % del presupuesto estándar.

A $0.10 y $0.20, Muse Spark 1.2 quedaría por debajo de casi todos los modelos fronterizos del mercado, incluido el nivel económico de peso abierto con el que de otro modo pierde en precio. Ese es el número interesante en este lanzamiento, y no es realmente una decisión de precios. Sesenta solicitudes por minuto descartan por sí solas la mayoría de los patrones de fan-out en producción, así que el nivel está pensado para experimentación y trabajo en equipos pequeños, no para servir tráfico. Y "podemos entrenar con tu tráfico" es una pregunta para quien apruebe la gobernanza de datos en tu organización, no para quien elige modelos. Trátalo como una revisión legal con descuento adjunto, no como una SKU más barata.

Lo que cuesta producir el 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publica lo que cuestan sus propias ejecuciones de evaluación, y es en esa columna donde se aprecia el perfil de Muse Spark 1.2. Completar la suite de nueve puntos de referencia costó $637.85 y consumió 95 millones de tokens de salida, frente a los $548.07 y 94 millones de Muse Spark 1.1 — con un precio idéntico por token. El 16% adicional es pura deliberación.

Las cifras de latencia se comportan de la misma manera. Medido en xhigh, el tiempo hasta el primer token es de 26.12 segundos para 1.2 frente a 2.90 segundos para 1.1, y la velocidad de salida cae de 213.5 a 165.0 tokens por segundo. Meta compró tres puntos de índice con tiempo de pensamiento, y el diseño de razonamiento obligatorio significa que no puedes rechazar la compra — solo elegir cuánto de ella haces.

Ese número de 26 segundos será mal citado, así que aquí está la corrección de antemano: es una medición en el nivel de esfuerzo más costoso que expone el modelo, y la API usa el nivel medio por defecto. Como punto de referencia del tráfico real y no de un banco de pruebas, Muse Spark 1.1 servido a través de OrcaRouter — con el esfuerzo que los clientes realmente soliciten — muestra un tiempo p50 hasta el primer token de 1.84 segundos en 7 días y un p95 de 6.00 segundos, a 519 tokens por segundo y con una tasa de error de cero. La latencia de benchmark con esfuerzo máximo y la latencia de producción con esfuerzo por defecto son cantidades diferentes, y normalmente difieren en un orden de magnitud. Lee 26.12s como el techo del razonamiento profundo, no como lo que se sentirá en una solicitud.

Dónde puedes llamarlo hoy

Muse Spark 1.2 se sirve a través de la propia API de Modelos de Meta y, al momento de escribir esto, en ningún otro lugar: no se enrutó en OpenRouter en su lanzamiento, no hay un repositorio de Hugging Face y no está en el catálogo de OrcaRouter. Muse Spark 1.1 se ofrece a $1.25 y $4.25 — los mismos precios que cobra Meta, porque OrcaRouter no aplica ningún margen y pasa directamente el precio de lista del proveedor.

Eso importa más para la comparación que para el modelo en sí. Si estás creando un modelo de costos para esta versión, los modelos con los que la compararías — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — están detrás de una única clave al precio de lista, así que la cifra en tu hoja de cálculo es la cifra en la factura, y un recorte de precios del proveedor entra en vigor el mismo día en lugar de después de una renovación. Para Muse Spark 1.2 específicamente, hoy la respuesta es el endpoint de Meta, un segundo contrato y una factura separada.

Lo que el anuncio no respondió

Sin número de codificación independiente. Artificial Analysis publica un compuesto para 1.2, pero aún no los subíndices de codificación y de agentes que publicó para 1.1 (71.3 y 37.5, respectivamente). Dado que el trabajo de agentes fue la dimensión más débil de 1.1 por un amplio margen, y la codificación de agentes es exactamente lo que 1.2 afirma haber corregido, este es el número que resolvería el lanzamiento.

No se han reproducido los resultados del harness. Todas las cifras de codificación del anuncio son ejecutadas por Meta. Nadie ha publicado aún puntuaciones de Muse Spark 1.2 desde un scaffold neutral.

Sin verificación multimodal.El listado de Muse Spark promociona entrada de texto, imagen, video, audio y PDF. La evaluación independiente cubre texto e imagen. La mensajería 1.2 de Meta ha pasado casi por completo al trabajo de software, y el caso de uso de medios mixtos 1.1 se vendió explícitamente; por ahora, no tiene ni marketing ni medición detrás.

No hay historial de rendimiento.El volumen en el endpoint sigue siendo demasiado bajo para que se generen las estadísticas habituales de latencia en ventana móvil.

Qué ver durante las próximas cuatro semanas

Tres cosas decidirán si este lanzamiento es lo que Meta dice que es. La primera es una puntuación agéntica independiente para 1.2 — si el subíndice que era 37.5 en 1.1 se ha movido sustancialmente, la propuesta de codificación es real. La segunda es si alguien reproduce el resultado de Terminal-Bench fuera de Muse Code; un modelo que solo se desempeña dentro de su propio entorno de evaluación es un producto, no una capacidad. La tercera es qué sucede con el nivel de contribuidor: si el límite de 60 solicitudes se flexibiliza, un modelo adyacente a la frontera a $0.10 de entrada y $0.20 de salida cambia la aritmética del nivel de presupuesto de una manera que una ganancia de tres puntos en el índice nunca lo haría.

Y si el ritmo se mantiene, Muse Spark 1.3 llegará a principios de septiembre. Según esta evidencia, el número a vigilar cuando llegue no es la puntuación del índice. Es si Meta puede añadir capacidad sin añadir otros veinte segundos de pensamiento al inicio de cada solicitud.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube