Muse Code vs Muse Spark 1.1: Qué está midiendo realmente la mejora de 6,7 puntos de Meta
Guides & Insights

Muse Code vs Muse Spark 1.1: Qué está midiendo realmente la mejora de 6,7 puntos de Meta

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Haz primero la resta. La presentación de lanzamiento de Meta para Muse Code, el agente de codificación para terminal que lanzó el 5 de agosto de 2026, reporta un 82,9% en Terminal-Bench 2.1 y presenta esa cifra como una mejora de 6,7 puntos sobre Muse Spark 1.1, el modelo por el que la mayoría de quienes leen esto ya están pagando. Resta 6,7 a 82,9 y obtienes 76,2 — que no es un número que Meta haya publicado, pero es exactamente la puntuación que aparece en la clasificación pública de Terminal-Bench 2.1 para Muse Spark 1.1 con esfuerzo xhigh, presentada en julio, ejecutada por el harness mini-SWE-agent de Princeton.

Esa coincidencia es el hecho más útil de esta comparación, porque mini-SWE-agent es un andamiaje deliberadamente mínimo — unos cientos de líneas, sin subagentes persistentes, sin registro de eventos, sin habilidades de planificación. El 82.9% de Meta es Muse Spark 1.2 ejecutándose dentro de un agente creado a medida con el que Meta coentrenó el modelo. Si esas dos filas son lo que abarcan los 6.7 puntos, entonces la ganancia generacional principal es una actualización del modelo y una actualización del andamiaje empaquetadas en un solo número, y Meta no ha publicado nada que las separe.

Meta no indicó qué banco de pruebas utilizó para su línea base 1.1, por lo que la comparación es sugerente más que probada. Pero replantea la decisión para cualquiera que actualmente esté llamando a Muse Spark 1.1 a través de una API, que es la versión honesta de este enfrentamiento: no estás eligiendo entre dos modelos. Estás eligiendo entre un modelo que manejas tú mismo y un agente que maneja un modelo más nuevo por ti, y solo una de esas dos cosas ha sido medida por alguien que no sea Meta.

No son la misma categoría, y la ficha técnica lo dice.

La mitad de la confusión en torno a este emparejamiento proviene de tratar Muse Code como una versión de modelo. No lo es. Es una CLI, y Muse Spark 1.2 es a lo que llama.

Qué es — Muse Code es un agente de terminal que se instala con una línea (curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1 es un endpoint de modelo al que llamas desde tu propio código, tu propio framework de agentes, o cualquier CLI que acepte una URL base personalizada.

Modelo subyacente — Muse Code ejecuta Muse Spark 1.2, co-entrenado con el agente; Muse Spark 1.1 es la generación de julio, que aún se sirve y sigue en la lista.

Dónde se ejecuta — Muse Code es solo para macOS y Linux, solo terminal, sin GUI, sin extensión de IDE; Muse Spark 1.1 funciona dondequiera que HTTPS funcione, incluido Windows.

Entradas — Muse Code toma un repositorio y un prompt; Muse Spark 1.1 acepta texto, imágenes, vídeo, audio y documentos PDF en un único contexto de 1,048,576 tokens y devuelve texto.

Estado — Muse Code está en versión beta pública y etiquetado como tal; Muse Spark 1.1 está disponible de forma general desde julio de 2026 y está manejando tráfico real de producción.

Precio de lista — ambos se facturan a través de la API Meta Model a $1.25 por millón de tokens de entrada, $0.15 de entrada en caché y $4.25 de salida en el nivel estándar. La tarifa es la misma tarifa.

La última línea es la que sorprende a la gente, y mata la suposición obvia. Adoptar Muse Code no cuesta más por token que lo que ya ejecutas. Lo que cuesta se mide en otras monedas — soporte de plataforma, latencia, modalidad y, en el nivel barato, tu código fuente. Esos son los cuatro ejes por los que vale la pena discutir.

El benchmark donde divergen, leído con el arnés adjunto

Meta publicó dos deltas generacionales contra Muse Spark 1.1: +6.7 puntos en Terminal-Bench 2.1 y +6.3 en DeepSWE 1.1. Ambos son reportados por el proveedor, ambos provienen de gráficos publicados como imágenes sin una descripción de la metodología, y ninguno ha sido reproducido por un tercero. Si se descuentan, las líneas base implícitas de Meta para 1.1 son aproximadamente 76.2% y 53.0%.

Ahora pongamos el 82,9 % de Meta junto al panel que no citó. El ranking público de Terminal-Bench 2.1, en el momento de escribir esto, tiene a Claude Code emparejado con Claude Fable 5 al 83,8 % ± 1,2 %, a Codex con GPT-5.5 al 83,1 % ± 1,1 %, a Terminus 2 con Claude Fable 5 al 80,4 %, a Cursor CLI con Grok 4.5 al 79,3 %, y a mini-SWE-agent con Muse Spark 1.1 al 76,2 % en octavo lugar. El 82,9 % autoinformado de Muse Code se situaría en tercer lugar, por debajo de dos pares agente-modelo que no aparecen en ninguna parte de la presentación de Meta, que en su lugar compara contra Claude Opus 5 al 86,7 %, GPT-5.6 Terra al 81,8 % y a Grok 4.5 al 81,6 % en ejecuciones separadas con el máximo esfuerzo.

Dos tablas, un mismo benchmark, cifras que no cuadran — y una tercera escala completamente distinta si se consulta Artificial Analysis, cuya evaluación independiente de Terminal-Bench v2.1 alcanza un máximo de casi 89.5% para GPT-5.6 Sol, frente a un techo del 83.8% en el leaderboard público. Ninguna de estas partes miente. Una fila de Terminal-Bench es una puntuación compuesta por un harness, más un modelo, más un ajuste de esfuerzo, más una asignación de cómputo, y alterar cualquiera de esos elementos mueve el resultado más que toda la brecha que Meta presenta como una generación.

Por eso, la cifra interesante en la tabla pública no es la columna de precisión, sino la de costo. Muse Spark 1.1 completó su ejecución del 76.2% por $198.05. Claude Code con Claude Fable 5 obtuvo su 83.8% por $552.67, y Codex con GPT-5.5 pagó $2,059.19 por un 83.1%. Eso es 7.6 puntos de precisión por 2.8 veces el dinero en el primer caso y aproximadamente 10 veces en el segundo — medido por el mismo operador, en las mismas tareas, bajo las mismas reglas, que es exactamente la comparación de igual a igual que la gráfica de Meta no te da. La tabla también descuenta por tareas resueltas explotando el entorno; la presentación de Muse Spark 1.1 no muestra tal descuento, mientras que la ejecución de Grok 4.5 de Cursor CLI lleva una de 9 puntos.

Meta no publicó ninguna cifra de costo para su 82,9%.

Lo que Muse Spark 1.1 ya hace que Muse Code no puede

La propuesta de Muse Code es que un agente co-entrenado supera a «un envoltorio genérico alrededor de un modelo externo» — la frase de Meta, la afirmación de Meta, sin probar por nadie más. Es una afirmación razonable. También apunta a una brecha que Muse Spark 1.1 fue específicamente diseñado para cerrar.

Muse Spark 1.1 habla el Model Context Protocol de forma nativa, gestiona sus propias conexiones MCP sin un framework externo, orquesta internamente los roles de agente principal y subagente, y generaliza zero-shot a nuevas herramientas y habilidades personalizadas. Los propios números de lanzamiento de Meta para él fueron cifras de uso de herramientas: 88.1 en MCP Atlas para el uso de herramientas a escala — por delante del 82.2 que reportó para Claude Opus 4.8 y del 75.3 para GPT-5.5 — y 54.7 en JobBench. Todo reportado por el proveedor, todo de julio, nada reproducido de forma independiente. El punto sigue en pie de todos modos: 1.1 no es un modelo de chat al que alguien le acopló un agente. Ponlo en OpenCode, Cline o cualquier CLI que acepte un endpoint personalizado y tienes un agente hoy.

Y luego está todo lo que Muse Code estructuralmente no puede tocar. Muse Spark 1.1 razona sobre imágenes, video, audio y PDFs en una sola ventana de contexto. Un agente de codificación de terminal no tiene uso para esa superficie ni forma de exponerla. Si tu carga de trabajo es una maqueta de diseño convertida en componentes, una llamada de soporte transcrita y clasificada, o una especificación de 400 páginas referenciada contra una implementación, lo más nuevo es lo menos capaz — y el posicionamiento de Meta para la generación 1.2 pasó de "investigación profunda multimodal sobre medios mixtos" a refactorizaciones de múltiples archivos y generación de repositorio completo, sin ningún resultado de video o audio publicado para 1.2 por parte de nadie.

La auténtica asimetría va en la otra dirección: es una propiedad de tiempo de ejecución, no una capacidad. Muse Code añade cada llamada de modelo, ejecución de herramienta, aprobación y edición a un registro de eventos local, lo que, según Meta, hace que una sesión sea exacta en la reproducción y segura ante reinicios: si se bloquea, el agente continúa donde se detuvo en lugar de volver a derivar su contexto. Sus agentes en segundo plano persisten durante toda la sesión en lugar de generarse y eliminarse por subtarea. La evidencia de Meta es un único caso de estudio: una ejecución de 24 horas con más de 1.000 llamadas a herramientas optimizando kernels de GPU en hardware NVIDIA Hopper. No se publicó ninguna cifra de aceleración, así que la duración es la afirmación. Si alguna vez has perdido una migración de nueve horas porque el harness olvidó lo que estaba haciendo en el paso 300, eso es algo que de verdad quieres tener, y ninguna cantidad de soporte MCP en el modelo te lo da.

El mismo precio de lista, hasta que leas el segundo nivel.

Debido a que el nivel estándar es idéntico en ambos lados, el argumento de precios en este enfrentamiento reside enteramente en el nivel que Meta introdujo junto con Muse Code. El nivel de colaborador cuesta $0.10 por millón de tokens de entrada, $0.002 por entrada en caché y $0.20 por salida — 12.5 veces más barato en entrada, 21 veces en salida, 75 veces en entrada en caché — a cambio de permiso explícito para usar tus indicaciones y completaciones para entrenar futuros modelos de Meta. El tráfico del nivel estándar, según Meta, no se usa de esa manera.

Ejecuta un paso de agente realista a través de ello — 60,000 tokens de contexto del repositorio entran, 3,000 tokens de plan-y-parche salen — y mil pasos cuestan $87.75 en el nivel estándar en frío, $21.75 con el contexto del repositorio tocando la caché, $6.60 en el nivel de contribuidor en frío, y $0.72 en el de contribuidor con caché cálida. La propia ejecución de kernel de 24 horas de Meta se acerca a los noventa dólares en el nivel que protege tu código y menos de un dólar en el nivel que no lo hace.

Eso no es una decisión de facturación. Los prompts de un agente de codificación son tu base de código — APIs internas, el comentario que explica por qué existe la solución alternativa, lo que sea que contengan tus fixtures. En un árbol de código abierto, el nivel de colaborador es casi dinero gratis. En un repositorio propietario, es una decisión de licenciamiento de datos disfrazada de descuento, y debe pasar por quien aprueba el manejo de datos, no por quien vigila la factura de la nube. Meta fijó el descuento en 12x porque los datos valen al menos eso para Meta.

Mantenerse en Muse Spark 1.1 evita la pregunta por completo, y vale la pena saber exactamente qué cuesta y dónde. Muse Spark 1.1 está en el catálogo de OrcaRouter a $1.25 y $4.25 — el precio de lista de Meta al céntimo, porque añadimos un margen del 0% y trasladamos el precio del proveedor directamente, que es también la razón por la que un cambio de tarifa de Meta aparece en nuestro lado el día en que Meta lo hace en lugar de después de un ciclo de contrato. Nuestra telemetría de producción de siete días muestra un p50 de tiempo hasta el primer token de 1.84 segundos y un p95 de 6.00 segundos, una expectativa mucho más útil que la que cualquier banco de pruebas te dará. Muse Spark 1.2 no está en nuestro catálogo; Meta lo sirve directamente y en ningún otro lugar, así que la mitad más nueva de esta comparación tiene actualmente exactamente un proveedor y ninguna ruta de conmutación por error por construcción. Si lo estás evaluando, esa exposición a un único proveedor es parte de lo que estás evaluando.

La compensación de latencia que nadie menciona en la cobertura del lanzamiento

Artificial Analysis, que mide de forma independiente bajo el máximo esfuerzo de razonamiento de cada modelo, registró el tiempo hasta el primer token de Muse Spark 1.1 en 2.90 segundos y el de Muse Spark 1.2 en 26.12 segundos. La velocidad de salida cayó de 213.5 a 165 tokens por segundo. La mejora fue de tres puntos en el Intelligence Index, de 51 a 54, y un salto del puesto #22 al #13 entre 185 modelos.

Leído como un lanzamiento de modelo de propósito general, es un mal negocio: nueve veces la espera por tres puntos. Leído como el motor de un agente de codificación, es obviamente el correcto, porque nadie que espera una refactorización de doce archivos nota veintiséis segundos de planificación, y todos los que esperan una finalización de chat lo notan todo. Esa es la declaración más clara de para quién es cada lado de esta comparación, y fue medida por un tercero en lugar de afirmada por Meta.

También significa que el cambio no es gratuito incluso si solo te importa el código. Cualquier cosa interactiva que tenías apuntando a Muse Spark 1.1 — autocompletado en línea, un bot de revisión, una interfaz de chat sobre tus documentos — empeora materialmente si la mueves a la generación 1.2 con gran esfuerzo. La actualización está dirigida, y dirigir tiene una dirección.

Cuál deberías estar ejecutando realmente

Quédate con Muse Spark 1.1 si tu trabajo no es un repositorio. Canalizaciones multimodales, análisis de contexto largo, investigación de medios mixtos, cualquier cosa interactiva, cualquier cosa en Windows, cualquier cosa ya conectada a través de MCP y que funcione. Nada en el lanzamiento de Muse Code mejora esos casos, y la medición de latencia empeora al menos uno de ellos.

Prueba Muse Code si tu modo de fallo es la duración. Migraciones de monorepos, actualizaciones de dependencias, refactorizaciones de una semana: trabajos que actualmente supervisas porque el agente pierde el hilo. El registro de eventos y los agentes persistentes en segundo plano apuntan exactamente a eso, y un déficit de unos pocos puntos en el benchmark importa menos precisamente cuando la ejecución es más larga. Beta, sobre un clon de prueba, en un repositorio que no te importaría perder.

Haz el experimento honesto si intentas decidirte por el modelo. Mantén tu harness constante y cambia Muse Spark 1.1 por Muse Spark 1.2 debajo de él. Eso aísla la única variable que el gráfico de Meta agrupa, y es la única manera de averiguar si la prima de co-entrenamiento es real o si 1.2 es simplemente un modelo de codificación competente dondequiera que lo pongas. Una sola puerta de enlace convierte esto en un cambio de cadena en lugar de un ejercicio de adquisición: Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5 y Claude Fable 5 están todos detrás de una clave de OrcaRouter al precio de lista con conmutación automática entre proveedores, por lo que mantener activo el conjunto de comparación no te cuesta nada. Muse Spark 1.2 es la excepción y tiene que venir de Meta.

Preguntas que vale la pena hacer antes de instalar cualquier cosa

¿Puedo apuntar Muse Code a Muse Spark 1.1 en lugar de 1.2?

El material de lanzamiento de Meta no dice nada al respecto, y los dos se distribuyeron como un par co-entrenado, lo cual es un argumento en contra de que sea compatible o útil. Sin embargo, la dirección inversa está bien documentada: Muse Spark 1.1 funciona en cualquier agente que acepte un endpoint personalizado, que es como la mayoría de la gente lo está ejecutando como agente hoy en día. Si tu objetivo es una comparación controlada, ejecuta 1.1 y 1.2 en tu banco de pruebas en lugar de intentar forzar el de Meta.

¿Se aplica el nivel de contribuidor también a Muse Spark 1.1?

Meta introdujo la estructura de dos niveles con el lanzamiento de Muse Code y Muse Spark 1.2, y su tarifa publicada vincula el precio de contribución a esa versión. Supongamos que el descuento de 12x es una oferta de la generación 1.2 hasta que Meta diga lo contrario, y fijemos cualquier carga de trabajo 1.1 en $1.25 y $4.25. Si estás en OrcaRouter, estás al precio de lista por definición, por lo que no hay un nivel de intercambio de datos al que acogerse o del que excluirse.

Entonces, ¿es incorrecta la afirmación de 6.7 puntos?

No — no está auditado y está insuficientemente especificado, lo cual es diferente. Meta bien podría haber ejecutado su línea base 1.1 en un entorno comparable al de Muse Code, en cuyo caso la ganancia es un resultado limpio de modelo sobre modelo. Pero no se publicó metodología alguna, la línea base implícita aterriza precisamente en la puntuación de un scaffold mínimo de terceros, y el mismo benchmark produce tres escalas diferentes según quién lo ejecute. Trata el +6.7 como indicativo y obtén tu propio número antes de planificar en torno a él.

¿Qué resolvería esto?

Un solo envío. Si Meta pone a Muse Code en la clasificación pública de Terminal-Bench 2.1 bajo las mismas reglas con las que todos los demás enviaron — sin tiempos de espera ni recursos modificados, columna de costos completada, deducciones por trampas aplicadas — el 82,9% se vuelve comparable al 76,2% que aparece junto al nombre de Muse Spark 1.1 y al 83,8% en la cima, y todo este argumento se resuelve en una tarde. Hasta entonces, el único número verificado de forma independiente en el enfrentamiento pertenece al modelo más antiguo, y dice que Muse Spark 1.1 resolvió tres cuartas partes de Terminal-Bench 2.1 dentro de un andamiaje lo bastante pequeño como para leerse de una sentada, por menos de doscientos dólares.

Lo segundo que vale la pena observar es más específico y llega antes: si Artificial Analysis publica las subpuntuaciones de codificación y agénticas para la generación 1.2, que ya publica para la 1.1. El rendimiento agéntico fue la dimensión publicada más débil de 1.1 por un amplio margen. Es precisamente el número que Meta afirma haber corregido, y precisamente el que nadie fuera de Meta ha medido todavía.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube