
El razonamiento de Muse Spark 1.3 Max ya está disponible: la configuración que hay detrás de las mejores puntuaciones de Meta ahora se lanza para todos
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Muse Spark 1.3 — el modelo de razonamiento de frontera que Meta Superintelligence Labs lanzó el 2 de septiembre — acaba de adquirir el modo sobre el cual se construyó su propia tabla de clasificación. El 4 de septiembre, después de dos días de pruebas de seguridad adicionales, Meta abrió a los desarrolladores el ajuste de razonamiento "max", el que requiere más cómputo, en la API de Meta Model y en Muse Code, su agente de codificación de terminal. El director de IA, Alexandr Wang, anunció el lanzamiento en X y la cuenta @AIatMeta de la empresa lo confirmó; lo que era una configuración limitada a Meta y a una vista previa para socios en el lanzamiento ahora es un nivel de razonamiento que cualquier desarrollador puede seleccionar.
Esa secuencia importa porque varios de los números que dominaron la cobertura del lanzamiento de Muse Spark 1.3 —75,4 en DeepSWE v1.1, 66,9 en OSWorld 2.0 y 1.754 en GDPval-AA v2— procedían de la configuración max, mientras que el modelo al que los desarrolladores sí podían llamar se lanzó con el esfuerzo de razonamiento limitado a “xhigh”. Meta dejó claro en el lanzamiento que la configuración max todavía estaba en pruebas de seguridad, pero esa división implicó que la tabla de clasificación principal y el modelo invocable fueran dos cosas distintas durante dos días. El lanzamiento del jueves cierra esa brecha, y lo hace sin tocar el precio por token. Las cifras de referencia de esa lista son de la propia Meta y siguen sin haber sido reproducidas por un banco de pruebas independiente; todo lo reportado por el proveedor en este artículo está etiquetado como tal.
Lo que se retuvo — y lo que cambió el 4 de septiembre
La escalera de razonamiento de Muse Spark 1.3 ha tenido la misma forma desde que se abrió la API de pago de la familia: el razonamiento está siempre activado, y el parámetro de esfuerzo del modelo en la API de Meta Model acepta los valores minimal, low, medium, high y xhigh, de modo que el modelo gasta más de su presupuesto de salida en pensar a medida que sube el nivel. Max se sitúa por encima de xhigh — más cómputo, más tokens de razonamiento y, según Meta, sensiblemente más fuerte en trabajos agénticos de horizonte largo. En el lanzamiento del 2 de septiembre, Meta incluyó todos los niveles hasta xhigh, pero mantuvo max fuera de la API pública a la espera de lo que denominó pruebas de seguridad adicionales, compartiéndolo solo con un conjunto limitado de socios: suficiente para que una evaluación independiente pudiera ejecutarse, pero no suficiente para una carga de trabajo de producción.
El 4 de septiembre, Wang dijo que las pruebas habían concluido. Max ahora es un ajuste seleccionable en Muse Code — el script de instalación está en dev.meta.ai/install.sh — y en el ID de modelo muse-spark-1.3 a través de la Meta Model API, donde el parámetro effort ahora acepta max. Wang describió el escalonamiento de dos días como la forma de Meta de limitar el acceso «a nivel de configuración», y le dijo a Axios que Meta no ha tenido que pausar su trabajo más amplio por preocupaciones de seguridad. La ventana fue corta, pero es un precedente real: Meta ahora está dispuesta a mantener un modo de razonamiento específico detrás de una revisión de seguridad mientras lanza el resto de un checkpoint de inmediato.
Una advertencia práctica para cualquiera que llame al modelo a través de una puerta de enlace en lugar del endpoint propio de Meta: varias páginas de documentación de terceros y listados de agregadores se escribieron el día del lanzamiento y todavía enumeran el esfuerzo de razonamiento solo hasta xhigh. El valor máximo es un despliegue del lado de Meta, así que comprueba que la ruta por la que llamas haya actualizado sus parámetros aceptados antes de asumir que max es alcanzable — un proxy que validó sus valores aceptados el 2 de septiembre puede rechazar «max» hasta que sus mantenedores se pongan al día.
Lo que realmente obtienes con max — y dónde no ayuda
Los materiales del jueves de Meta incluyen una división explícita entre max y xhigh en los benchmarks que ejecuta, y esto es lo más útil que ha publicado sobre el modelo hasta ahora. Todo es reportado por el proveedor, producido dentro del propio harness Muse Code de Meta, y Meta dice que sus comparaciones contra Claude Opus 5 y GPT-5.6 Sol fueron ejecuciones de "mejor esfuerzo" en los ajustes máximos de esos rivales que "pueden no reflejar el rendimiento optimizado por el proveedor". Con esa salvedad, la división cuenta una historia direccional clara:
• OSWorld 2.0 (tareas de agentes de uso de computadora) — 66,9 al máximo frente a 57,2 en xhigh
• GDPval-AA v2 (agente Elo de trabajo de conocimiento) — 1,754 al máximo frente a 1,709 en xhigh
• JobBench (tareas profesionales de largo horizonte) — 64.9 en max vs 61.2 en xhigh
• DeepSearchQA — un empate en 89.4
• Terminal-Bench 2.1 (codificación con agente de terminal) — 89.2 en xhigh frente a 88.8 en max, la única suite donde gana la configuración publicada el 2 de septiembre.

El patrón merece una lectura cuidadosa. Max ayuda más cuando la tarea es un largo bucle agéntico — operar una computadora, elaborar un brief de trabajo de conocimiento, mantener una agenda de subtareas como hace JobBench. En un benchmark de terminal de un solo turno no añadió nada y costó un poco: Terminal-Bench es el recordatorio de que «más razonamiento» no es una mejora monotónica, y es la razón para hacer una prueba A/B de max contra xhigh en tu propia carga de trabajo en lugar de asumir que el ajuste más alto es mejor en todas partes. Meta también señala el resultado de 75.4 en DeepSWE v1.1 — el titular del primer día, por encima del 59.3 que Meta reportó para Muse Spark 1.2 seis semanas antes — como una cifra de configuración max. Esa es la cifra que los evaluadores independientes volverán a ejecutar primero.
La lectura independiente está empezando a ponerse al día.
Lo que faltaba en el lanzamiento era cualquier medición independiente, y esa brecha se está cerrando en un calendario que coincide con el despliegue de max. El Coding Agent Index de Artificial Analysis — que puntúa cada modelo dentro de su harness nativo de agente de codificación y combina las tareas de DeepSWE, Terminal-Bench y SWE-Atlas — situó a Muse Spark 1.3 (max) en el harness Muse Code en 68 esta semana, segundo en la tabla por detrás de Claude Opus 5 (xhigh) en Claude Code y por delante de Claude Fable 5 (max) con 67 y GPT-5.6 Sol (max) con 65. La misma tabla puntúa la configuración xhigh comercializada con 64 en el mismo harness Muse Code, que es la lectura comparable más limpia hasta ahora de lo que aporta max — aproximadamente cuatro puntos de índice — en un conjunto de tareas independiente. Esa fila de la tabla se publicó mientras max estaba todavía en vista previa de socios; la configuración que describe es la que estuvo disponible de forma general el 4 de septiembre.
Artificial Analysis también ha actualizado su propia tarjeta de modelo para la configuración máxima desde el lanzamiento. Durante el período de vista previa, la tarjeta no indicaba proveedor ni precio; la tarjeta en vivo ahora lista a Meta al precio estándar de $1.25 por millón de tokens de entrada y $4.25 por millón de tokens de salida — el mismo precio de lista que Muse Spark 1.2 — al tiempo que añade una advertencia sobre la verbosidad: la ejecución de evaluación de AA consumió aproximadamente 130 millones de tokens frente a una mediana de 79 millones, costó alrededor de $1,335 en total, y se sitúa cerca de $0.95 por tarea según la estimación por tarea de AA, a aproximadamente 190 tokens de salida por segundo.
Una cifra de la cobertura anterior merece una verificación de versión. Artificial Analysis actualizó su Índice de Inteligencia a la v4.2 esta semana — la misma semana en que se lanzó max — volviendo a puntuar el campo y desplazando las medianas. En la ficha actual, la configuración max obtiene 53 frente a una mediana de 29 entre los modelos comparables; el 62 que circuló en la cobertura de la semana de lanzamiento se midió con la versión anterior del índice, y no son comparables. La propia división xhigh-versus-max de Meta arriba es independiente del índice de AA y no se ve afectada por la actualización.

Lo que más cuesta — la factura está en los tokens, no en la lista de precios.
Meta no publica un precio separado para la configuración máxima, ni tampoco un análisis de latencia dedicado. El precio por token es idéntico al de Muse Spark 1.2 y al de cualquier otro nivel de esfuerzo en Muse Spark 1.3: $1.25 por millón de tokens de entrada, $4.25 por millón de tokens de salida y $0.15 por entrada en caché en el nivel estándar. Los tokens de razonamiento se facturan como tokens de salida y cuentan contra el presupuesto de salida, por lo que elegir el nivel máximo no es un aumento de precio en una partida concreta: es una promesa de gastar más de ese presupuesto pensando antes de responder.
Eso convierte la verdadera cuestión de costo en una de volumen de tokens, y los primeros datos indican que max es caro justo donde xhigh es eficiente. La ejecución instrumentada de AA consumió alrededor de 130 millones de tokens en una única evaluación de la configuración. Para un desarrollador que ya ejecuta largos bucles agénticos con xhigh, la prueba A/B que importa no es "¿max pasa más tareas?" sino "¿max pasa suficientes tareas adicionales como para pagar una factura de tokens materialmente mayor en la misma carga de trabajo?"
El nivel Contributor de Meta — $0.10 de entrada y $0.20 de salida por millón de tokens a cambio de permitir que Meta entrene con tus prompts y completions — se aplica al mismo checkpoint, y Meta afirma que un porcentaje significativo de dos dígitos de desarrolladores lo elige. Los términos de Contributor hacen que cada envío sea dato de entrenamiento y sus límites de tasa son estrictos, por lo que es una mala opción por defecto para el fan-out en producción, pero una forma legítima de ejecutar experimentos máximos costosos de manera económica si el intercambio de datos te resulta aceptable.
El ancla de precios de todo esto es fácil de comprobar sin tener que fiarse de la palabra de Meta, porque el checkpoint Muse Spark 1.3 tiene un precio idéntico al que ya aparece en OrcaRouter a precio de lista de la propia Meta: Muse Spark 1.2 está en OrcaRouter a $1.25 de entrada y $4.25 de salida por millón de tokens sin margen, así que esa afirmación de «precio sin cambios» se puede comprobar en una página en vivo que muestra exactamente esos números. El propio Muse Spark 1.3 todavía no está en OrcaRouter. Cuando un proveedor de los que ofrecemos empiece a servirlo con max, el precio que se muestre en nuestro lado será el precio de lista de Meta traspasado directamente —no añadimos márgenes a los precios de los proveedores— y cualquier recorte de precio del proveedor entrará en vigor el mismo día en que Meta lo haga. Para un lanzamiento como este, donde lo interesante desde el punto de vista económico está en el volumen de tokens, no en el precio anunciado, ese traspaso directo es lo que hace que el importe que realmente se te factura sea igual al que publica Meta.

¿Quién debería cambiar al máximo?
La decisión se divide limpiamente:
• Cambio para cargas de trabajo agénticas de horizonte largo — uso de computadora, briefs de trabajo de conocimiento, bucles de herramientas de varios pasos en Muse Code — donde tanto la propia división de Meta como el ranking de agentes de codificación de AA muestran las mayores ganancias máximas. Hazle una prueba A/B contra xhigh con una muestra de tus tareas reales primero, porque la verbosidad es real.
• Mantente en xhigh para llamadas de alto volumen, sensibles a la latencia o de un solo turno de corta duración, donde max principalmente añade tokens. Terminal-Bench es la prueba de que no siempre añade capacidad.
Vigila tres cosas desde aquí: el lanzamiento de pesos abiertos que Zuckerberg ha prometido sin fecha, el despliegue para consumidores de Muse Spark 1.3 en Instagram, Facebook y Meta AI en las próximas semanas, y si el panel de agentes de codificación de Artificial Analysis comienza a fijar el precio de la fila máxima ahora que la configuración está disponible de manera general.
La espera de dos días resultó breve, pero sirvió para demostrar algo que perdura más allá del propio lanzamiento: los números más fuertes de Muse Spark 1.3 de Meta nunca fueron un espejismo: solo estaban esperando una revisión de seguridad. A partir del 4 de septiembre, el modelo que un desarrollador puede invocar y el modelo en la tabla de clasificación son, por fin, el mismo modelo. Que max se gane sus tokens es ahora una cuestión empírica que cualquier desarrollador puede responder, en la API de Meta o en cualquier otra ruta que ya utilice para llegar a la familia Muse Spark.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
