Muse Code
Guides & Insights

Muse Code: Meta lanzó un agente de codificación que pierde en su propio benchmark

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los proveedores no suelen publicar la gráfica en la que quedan segundos. Meta publicó tres de ellas. En la presentación de lanzamiento de Muse Code — el agente de codificación de terminal que Meta Superintelligence Labs lanzó el 5 de agosto de 2026, que se ejecuta en el modelo lanzado el mismo día, Muse Spark 1.2Claude Opus 5 va por delante en todas las tablas que Meta eligió mostrar, incluida la que Meta construyó y controla. En Terminal-Bench 2.1 la diferencia es de 3.8 puntos. En DeepSWE 1.1 es de 5.7, con GPT-5.6 Terra también por delante. En el benchmark interno propio de Meta es de 8.8. La versión viral de este lanzamiento — "59% en DeepSWE 1.1, superando a Grok 4.5 y Gemini 3.6 Flash" — es cierta, y es la afirmación verdadera más comedida que existe.

Lo que hace el lanzamiento más interesante, no menos. Meta publicó un cuadro de benchmarks que no gana y lo publicó de todos modos, porque la puntuación no es lo que está vendiendo. Lo que está vendiendo es un runtime que sobrevive a un trabajo de 24 horas, y un precio que subcota al resto por más de un orden de magnitud — siempre que estés dispuesto a dejar que Meta lea tu repositorio. Cada cifra de benchmark a continuación proviene de los propios gráficos de Meta, que se publicaron sin metodología; donde existe una medición independiente, la frase lo indica.

Lo que Meta realmente lanzó

Dos cosas el mismo día, deliberadamente acopladas.

Muse Code — un agente de programación para terminal, en beta pública, instalado con una línea: curl -fsSL https://dev.meta.ai/install.sh | bash. Solo macOS y Linux; no hay una compilación nativa para Windows, ni GUI ni extensión de IDE. Meta describe su trabajo como abordar ingeniería de software compleja en repositorios grandes — planificar cambios, escribir código y validar resultados.

Muse Spark 1.2 — una revisión centrada en la codificación del modelo de razonamiento de Meta, con un contexto de 1,048,576 tokens, disponible dentro de Muse Code y a través de la API Meta Model en vista previa pública. Meta afirma que escaló el cómputo de entrenamiento en tareas de codificación y amplió la diversidad de los entornos de entrenamiento, con el objetivo de abordar trabajos de largo horizonte: generación de repositorios completos, refactorizaciones de múltiples archivos, depuración extendida.

El acoplamiento es la afirmación. Meta afirma que ambos fueron entrenados conjuntamente y que, por lo tanto, la combinación produce «un mejor uso de herramientas, menos reintentos y resultados de mayor calidad que un envoltorio genérico alrededor de un modelo externo». Esa es la redacción de Meta y la afirmación de Meta; ningún tercero ha probado el modelo dentro de un entorno rival para comprobar si la prima del entrenamiento conjunto es real o si Muse Spark 1.2 simplemente se comporta como un modelo de codificación competente en cualquier lugar donde se ponga.

Tres habilidades vienen incluidas con el agente, y describen el estilo de trabajo previsto mejor que el texto de marketing: /plan produce un plan sujeto a aprobación antes de escribir nada, /grill somete ese plan a pruebas de estrés, y /goal impulsa hacia la consecución de un objetivo declarado. Planifica, ataca el plan y luego ejecuta — que es el patrón al que convergieron manualmente los usuarios experimentados de Claude Code y Codex, ahora incluido como comandos de primera clase.

La baraja de referencia, leída honestamente.

Muse Code

Meta publicó comparaciones en Terminal-Bench 2.1, DeepSWE 1.1, su propio Meta Internal Coding Bench y GDPval. Los números, según lo reportado por Meta:

Terminal-Bench 2.1 — Claude Opus 5 con máximo esfuerzo en Claude Code 86.7%, Muse Spark 1.2 en Muse Code 82.9%, GPT-5.6 Terra en Codex 81.8%, Grok 4.5 en Grok Build 81.6%. Segundo lugar, y del segundo al cuarto están separados por 1.3 puntos.

DeepSWE 1.1 — Claude Opus 5 65,0 %, GPT-5.6 Terra 64,8 %, Muse Spark 1.2 59,3 %. Tercer puesto, y la única tabla donde la brecha es decisiva en lugar de cosmética.

Meta Internal Coding Bench — Claude Opus 5: 79,4%, Muse Spark 1.2: 70,6%. La cancha de Meta, y su derrota más amplia.

Generación tras generación — Meta reporta +6.7 puntos en Terminal-Bench y +6.3 en DeepSWE frente a Muse Spark 1.1. Esos son los números más grandes de la presentación, y son los que un usuario de Muse Spark 1.1 realmente debería tener en cuenta.

Un escollo aritmético merece mencionarse, porque es la razón para tratar todo lo anterior como direccional. Si se descuenta el +6.7 de Meta, Muse Spark 1.1 se sitúa cerca del 76% en Terminal-Bench 2.1 — pero la tabla pública de tbench.ai ha mantenido un 80.0% verificado para Muse Spark 1.1 desde finales de julio. Ambas cifras pueden ser honestas y aun así discrepar, porque una fila de Terminal-Bench no es una puntuación de modelo. Es una puntuación para un entorno de pruebas más un modelo más una configuración de esfuerzo, y el entorno interno de Meta para 1.1 no era el que usó tbench. Ese solo hecho daña más la comparación de benchmarks entre proveedores que cualquier cifra individual discutida, y conduce directamente a la siguiente sección.

El runtime es el producto

Muse Code

Elimina las puntuaciones y lo que queda es un discurso de ingeniería sobre no morir. Dos mecanismos lo sustentan.

El primero es el registro de eventos. Muse Code añade cada llamada al modelo, cada ejecución de herramienta, cada aprobación y cada edición a un registro local, que Meta describe como algo que hace que la sesión sea exactamente reproducible y segura ante reinicios: mátalo, haz que se bloquee, pierde la máquina, y el agente retoma el trabajo exactamente donde se detuvo, en lugar de volver a derivar su contexto desde cero. Los competidores tienen una recuperación ante fallos de calidad variable; ninguno de ellos lo ha convertido en el titular. También es, incidentalmente, un artefacto de auditoría: un registro local completo de lo que un proceso autónomo le hizo a tu árbol de trabajo, que es exactamente el documento que pide una revisión de seguridad y que la mayoría de las CLI de agentes no pueden producir.

Lo segundo es lo que Meta llama agentes de fondo asíncronos. La diferencia con los subagentes ordinarios es que no se crean y destruyen por cada subtarea; permanecen activos durante toda la sesión, ejecutan los siguientes pasos por sí mismos y deciden cuándo informar al bucle principal. El beneficio declarado es una latencia menor, porque el orquestador no paga el costo de iniciar el agente cada vez que delega.

La evidencia de respaldo de Meta es un caso de estudio: Muse Code ejecutándose durante 24 horas a lo largo de más de 1000 llamadas a herramientas, optimizando autónomamente kernels de GPU en hardware NVIDIA Hopper, con lo que Meta denomina mejoras sustanciales sobre la implementación inicial proporcionada. No se publicó ninguna cifra de aceleración, por lo que la cantidad interesante no es el resultado sino la duración. Mil llamadas a herramientas sin rescate humano representan una superficie de fallo diferente a la de una refactorización de cincuenta llamadas, y es una carga de trabajo donde un déficit de 3,8 puntos en el benchmark importa mucho menos que si el proceso sigue vivo a la novena hora.

El precio es el arma — y parte de él se paga en código fuente

No hay suscripción a Muse Code. El cobro es por tokens, en uno de dos niveles, y la brecha entre ellos es lo más agresivo de este lanzamiento:

Estándar — $1.25 por millón de tokens de entrada, $0.15 por millón de entrada en caché, $4.25 por millón de tokens de salida. Los prompts de este nivel no se utilizan para mejorar los productos de Meta.

Colaborador — $0.10 por millón de entrada, $0.002 por millón de entrada en caché, $0.20 por millón de salida. A cambio, Meta puede utilizar los datos para mejorar sus modelos.

Eso es 12.5 veces más barato en entrada, 21 veces más barato en salida y 75 veces más barato en entrada en caché. Sométalo a un paso de agente realista — 60,000 tokens de contexto de repositorio de entrada, 3,000 tokens de plan y parche de salida — y las cuatro esquinas de la cuadrícula de precios son asombrosas. Nivel estándar con prompt en frío: 8.8 centavos por paso, $87.75 por mil pasos. Nivel estándar con el contexto del repositorio en caché: 2.2 centavos, $21.75 por mil. Nivel de colaborador en frío: 0.66 centavos, $6.60 por mil. Nivel de colaborador con caché caliente: $0.72 por los mismos mil pasos.

El mismo trabajo, a 122 veces el costo o 1/122 de él, dependiendo de dos decisiones. La propia ejecución del kernel de Meta de 24 horas y 1,000 llamadas cuesta aproximadamente noventa dólares en tokens en el nivel que protege tus datos, y menos de un dólar en el nivel que no lo hace.

¿Cuál es la decisión real que este lanzamiento pone frente a los equipos? No es una decisión de precios. Un agente de codificación de terminal lee tu código base —esa es toda su función—, así que las indicaciones en el nivel Contributor contienen tu código fuente, tus APIs internas, tus comentarios sobre por qué existe el workaround, y los fixtures de prueba que tu repositorio tenga. Para un proyecto secundario o un árbol de código abierto, el nivel Contributor es casi dinero gratis. Para un código base propietario, o cualquier repositorio que tenga acceso a datos de clientes, es una decisión de licenciamiento disfrazada de descuento, y le corresponde a quien aprueba el manejo de datos, no a quien supervisa la factura de la nube. Meta lo fijó con un descuento de 12x porque los datos valen al menos eso para Meta.

Lo que no puedes obtener a través de la API

Muse Code

El 82,9% corresponde a Muse Spark 1.2 dentro de Muse Code. Si llamas al modelo desde tu propio framework de agentes, has comprado la mitad de ese emparejamiento que corresponde al modelo y ninguna de la que corresponde al arnés — sin registro de eventos, sin agentes persistentes en segundo plano y, si la afirmación de coentrenamiento de Meta significa algo, tampoco el comportamiento de uso de herramientas ajustado. Así que hay dos evaluaciones separadas aquí y confundirlas es el error más fácil de cometer esta semana: ¿supera Muse Code al agente que ya ejecutas, y es Muse Spark 1.2 un mejor modelo que el que llamas actualmente?

La segunda pregunta es la más barata de responder, porque solo requiere mantener tu banco de pruebas constante y cambiar el modelo que hay debajo. Vale la pena ser precisos sobre la disponibilidad: Muse Spark 1.2 es servido directamente por Meta y no está en el catálogo de OrcaRouter. Muse Spark 1.1 está a $1.25 y $4.25 — exactamente el precio de lista de Meta, porque OrcaRouter añade un margen del 0% y traslada el precio del proveedor directamente, que es también la razón por la que un cambio de precio del proveedor aparece en nuestro lado el mismo día en que ocurre en lugar de después de un ciclo de contrato. Nuestra telemetría de producción de siete días para 1.1 muestra un p50 de tiempo hasta el primer token de 1.84 segundos y un p95 de 6.00 segundos, lo cual es una expectativa de latencia más útil que la que te dará cualquier banco de pruebas.

El valor práctico de una única puerta de enlace en una semana como esta es que el conjunto de comparación — Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash y Muse Spark 1.1 — está detrás de una sola clave al precio de lista, por lo que una prueba A/B es un cambio de cadena en lugar de un ejercicio de aprovisionamiento. También cubre el riesgo estructural de la oferta de Meta: Muse Spark 1.2 tiene exactamente un proveedor, lo que lo convierte en un punto único de fallo por construcción. La conmutación automática por error entre proveedores es la diferencia entre que una mala tarde para Meta sea una mala tarde para tu agente, o no.

Esta es también la razón por la que la 1.2 se lanzó en silencio y lentamente.

Muse Spark 1.2 apareció en la API de Meta el 5 de agosto sin anuncio y sin números cambiados: mismo contexto de 1M, mismos $1.25 y $4.25, mismo dial de razonamiento de cinco niveles que Muse Spark 1.1. Lo único que se movió se midió desde fuera: Artificial Analysis cronometró el tiempo hasta el primer token en 26.12 segundos frente a los 2.90 segundos de la 1.1 con esfuerzo de razonamiento máximo, comprando tres puntos del Índice de Inteligencia, de 51 a 54. Leído como lanzamiento de modelo de propósito general, es un intercambio extraño: nueve veces la espera por tres puntos.

Leído como la mitad modelo de un agente co-entrenado, es el intercambio obvio. Nadie que espera una refactorización de doce archivos nota veintiséis segundos de planificación; la persona que espera una finalización de chat lo nota todo. Meta no estaba lanzando un modelo de chat en silencio con la esperanza de que nadie midiera la latencia. Estaba enviando el motor antes que el coche, y el anuncio llegó cuando llegó el coche. La página para desarrolladores de Muse Spark de Meta ahora también indica 1.2.

El corolario es una advertencia para cualquiera que haya adoptado esta familia por su amplitud. Muse Spark 1.1 se vendió como un modelo de razonamiento multimodal — texto, imágenes, video, audio y PDFs, bueno para la investigación multimedia mixta. El posicionamiento de la versión 1.2 es el trabajo de software, y su material de lanzamiento es un agente de codificación. La superficie multimodal no se ha eliminado, pero ya no es lo que Meta está optimizando o publicitando, y nadie fuera de Meta ha publicado un resultado de video o audio para 1.2.

Donde Muse Code todavía es escaso

Es beta, y está etiquetado como tal. Nada sobre la garantía del registro de eventos ha sido verificado por nadie fuera de Meta.

Solo macOS y Linux. Los desarrolladores de Windows usan WSL o nada, lo cual es una limitación real para flotas empresariales, no solo una molestia.

Solo terminal. Sin GUI, sin integración con IDE y sin agentes paralelos alojados en la nube del tipo que Codex ya ofrece. El material de lanzamiento de Meta no menciona soporte para MCP.

Sin metodología publicada detrás de ninguno de los gráficos de referencia, y aún no hay evaluación independiente ni del agente ni de las subpuntuaciones de codificación de Muse Spark 1.2. Artificial Analysis tiene un índice compuesto para 1.2, pero no el desglose por benchmark de codificación y agente que publica para 1.1 — y la puntuación de agente de 1.1 fue su dimensión más débil por un amplio margen, lo que la convierte precisamente en el número que zanjaría esta versión.

Meta llega tarde.Claude Code y Codex tienen un año de hábito, ecosistemas de plugins y flujos de trabajo de equipo construidos a su alrededor. Un registro de eventos a prueba de fallos es una buena razón para probar algo; no es por sí solo una razón para mover a un equipo.

Preguntas que la gente realmente está haciendo

¿Es Muse Code gratis?

No, pero tampoco hay suscripción — a diferencia de los planes de Claude Code y Codex con los que compite, Muse Code factura puramente por token a través de la API del Meta Model. Por lo tanto, el coste escala con la cantidad de contexto del repositorio que tus sesiones envían, no con el número de usuarios, lo que favorece a los usuarios ocasionales con uso intensivo y penaliza a los agentes siempre activos. El nivel de colaborador está lo bastante cerca de ser gratuito como para que el precio no sea una barrera real para probarlo.

¿El nivel de contribuidor entrena con mi código privado?

Los términos de Meta para ese nivel establecen que los datos pueden utilizarse para mejorar sus modelos, y las indicaciones de un agente de codificación contienen tu código. Meta afirma que las indicaciones de nivel estándar no se utilizan para mejorar sus productos; ese es el nivel que se debe usar para cualquier cosa propietaria. Trata la elección como una decisión de manejo de datos con un descuento adjunto, no como una preferencia de facturación — y ten en cuenta que el descuento se aplica por token, por lo que el incentivo para degradar silenciosamente crece exactamente a la par que tu uso.

¿Puedo usar Muse Spark 1.2 con Claude Code o con mi propio agente?

El modelo está disponible a través de la API de Meta Model de forma independiente de Muse Code, así que sí, para cualquier cosa que acepte un endpoint personalizado. Lo que no obtendrás es el emparejamiento co-entrenado que Meta acredita por sus resultados de referencia, y la expectativa honesta es que un modelo ejecutado fuera del entorno con el que fue ajustado obtiene puntuaciones por debajo del número en la tabla. Si el objetivo es evaluar el modelo en lugar del agente, ejecútalo contra Claude Opus 5 y GPT-5.6 Terra en tu propio entorno e ignora el deck por completo.

Quién debería instalarlo esta semana

Si ejecutas trabajos autónomos de larga duración — migraciones, actualizaciones de dependencias en un monorepo, cualquier cosa que hoy tendrías que supervisar porque el agente pierde el hilo — Muse Code merece una tarde en un clon de prueba. El registro de eventos y los agentes de fondo persistentes apuntan exactamente a ese modo de fallo, y el déficit en los benchmarks es menor cuanto más larga es la tarea.

Si trabajas sobre una base de código de código abierto o no sensible y el costo es tu restricción principal, el nivel de colaborador es el número más interesante en el mercado de agentes de codificación en este momento, y 0.66 centavos por paso no es un error tipográfico.

Si estás dirigiendo un equipo en Claude Code o Codex sobre un repositorio propietario, todavía no hay nada aquí que fuerce un cambio. Muse Code es segundo o tercero en cada tabla que su propio proveedor seleccionó, los precios del nivel estándar están a la par con la competencia en lugar de por debajo, y el diferenciador es una propiedad de fiabilidad que nadie fuera de Meta ha probado. Lo que hay que vigilar no es el próximo benchmark. Es si el registro de eventos aguanta cuando alguien que no trabaja en Meta ejecuta mil llamadas a herramientas a través de él.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube