
Análisis del Meta Muse Spark 1.1: Sigue siendo el rápido, pero ya no el barato
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Durante cuatro semanas, el argumento a favor de Meta Muse Spark 1.1 fue aritmético. $1.25 por millón de tokens de entrada, $4.25 de salida, para un modelo nativamente multimodal que ejecutaba herramientas mejor que casi cualquier otro cerca de su precio. Luego, el 5 de agosto de 2026, Meta lanzó Muse Spark 1.2 junto con Muse Code —su primer agente de codificación para terminal— y le adjuntó al nuevo modelo algo que 1.1 nunca tuvo: un nivel de contribuidor a $0.10 de entrada y $0.20 de salida. Doce veces más barato en entrada, veintiuna veces más barato en salida, a cambio de permitir que Meta entrene con tus indicaciones. El precio de Muse Spark 1.1 no se movió ni un centavo. Su posición sí.
Ese es el marco honesto para reseñar este modelo ahora. Muse Spark 1.1 no ha sido deprecado, no ha cambiado de precio y sigue siendo el más rápido y mejor documentado de los dos checkpoints de razonamiento de Meta — pero ya no es la forma más barata de alquilar un modelo de Meta, y el agente que Meta está impulsando con más fuerza no se ejecuta en él. Esta reseña cubre qué es 1.1, en qué es mediblemente bueno, qué cambió el lanzamiento de agosto y el conjunto más reducido de tareas donde sigue siendo la opción correcta. Cuando un número proviene de las evaluaciones propias de Meta, la frase lo dice; cuando proviene de Artificial Analysis o del tráfico de producción, también lo dice.
Veredicto rápido
• Qué es — un modelo de razonamiento nativamente multimodal (entrada de texto, imagen, video, PDF y audio; salida de texto) con esfuerzo de razonamiento configurable, diseñado para ejecutar herramientas y operar una computadora. Pesos cerrados, servido por Meta.
• Precio — $1.25 de entrada / $4.25 de salida por millón de tokens, $0.15 en un acierto de caché. No ha cambiado desde su lanzamiento, y sigue siendo aproximadamente una cuarta parte del precio de salida de GPT-5.6 Sol ($5/$30) y una sexta parte del de Claude Opus 4.8 ($5/$25).
• Inteligencia — 51 en el Índice de Inteligencia de Artificial Analysis, puesto #22 de 185 en su clase frente a una mediana de clase de 32. Una medición independiente, no una afirmación de Meta.
• Fortaleza — uso de herramientas y razonamiento agéntico, además de una velocidad real: 213.5 tokens de salida por segundo, que Artificial Analysis clasifica en el #2 de 185.
• Debilidad — el razonamiento puro y la codificación directa están en la media, la recuperación de contexto largo no es de vanguardia, y es verboso: 94M tokens de salida para completar el Intelligence Index frente a una mediana de 65M.
• La nueva advertencia — Muse Spark 1.2 ahora obtiene tres puntos más y, en su nivel de colaborador, cuesta una vigésima parte. La ventaja restante de 1.1 es la latencia, y es una gran ventaja.
Lo que Meta publicó el 5 de agosto — y lo que le hizo a la 1.1
Muse Code es un agente de codificación para terminal, actualmente en beta, que se instala desde un script de shell de una línea en macOS y Linux (sin versión para Windows) y se ejecuta como el binario muse. Acepta tareas completas de ingeniería de software en repositorios grandes: planificar el cambio, escribir el código, validar el resultado. La propuesta de Meta es la cohesión arquitectónica — el agente y el modelo fueron entrenados juntos en lugar de estar acoplados — y la lista de funciones está dirigida directamente a Claude Code y Codex: agentes en segundo plano que siguen trabajando después de cerrar la terminal, reanudación mediante el registro de eventos, árboles de trabajo paralelos para subagentes, y una sandbox del sistema operativo con aprobaciones habilitadas por defecto. La demo que Meta publicó es un bucle de optimización de kernels de GPU que ejecuta más de 1.000 llamadas a herramientas durante hasta 24 horas en hardware NVIDIA Hopper.
Muse Code ejecuta Muse Spark 1.2, no 1.1. Esa es la primera consecuencia práctica para cualquiera que lea esta reseña: si quieres el agente de Meta, estás en el nuevo checkpoint.
La segunda consecuencia es la fijación de precios, y es la más interesante. Meta lanzó la versión 1.2 con dos ID de modelo distintos en lugar de uno:
• Standard (muse-spark-1.2) — $1.25 de entrada, $0.15 de entrada en caché, $4.25 de salida por millón de tokens. Idéntico a Muse Spark 1.1. Meta se compromete a que las indicaciones y las respuestas completas en este nivel no se utilizan para mejorar sus productos.
• Colaborador (muse-spark-1.2-contributor) — $0.10 de entrada, $0.002 de entrada en caché, $0.20 de salida. A cambio, otorgas a Meta permiso para entrenar modelos futuros con tus prompts y completaciones.
• Muse Spark 1.1 — no existe ningún nivel de colaborador. Se mantiene en el precio estándar y Meta no anunció ninguna descontinuación.
El propio planteamiento de Meta para el nivel de colaborador es que es "más de 10 veces más barato que incluso el nivel de pago por uso", lo cual se queda corto: los múltiplos reales son 12.5× en entrada y 21.25× en salida, con entrada en caché a un precio casi gratuito de $0.002. Ese es el titular de "precio bajo" que generó el lanzamiento, y pertenece solo a 1.2.

La historia del precio, reescrita
Antes de que reescribas tu presupuesto en torno a los $0.20 por tokens de salida, lee el resto de los términos del nivel de colaborador, porque son ellos los que lo hacen barato. Los límites de velocidad caen de las 3,000 solicitudes por minuto documentadas en el nivel estándar a 60 en el nivel de colaborador —un tope que permite a un desarrollador experimentar en una laptop y prohíbe una flota de agentes en producción. Y el trueque de datos no es una formalidad: tus prompts y las completaciones de tu modelo se convierten en material de entrenamiento. Para cualquiera que maneje datos de clientes, código propietario o cualquier cosa bajo una obligación de confidencialidad, el nivel de colaborador no es una versión más barata del mismo producto; es un producto diferente. Meta reconoció este hecho en el mismo lanzamiento al añadir una opción de retención de datos cero para clientes empresariales en la vía de pago.
Entonces, la comparación honesta no es «1.1 a $4.25 versus 1.2 a $0.20». Es: con el precio estándar, los dos modelos cuestan exactamente lo mismo, y 1.2 es el que obtiene mejor puntuación. El nivel de $0.20 es una oferta real y agresiva, pero está dirigido a individuos y experimentos, y solo está disponible en el modelo más nuevo.
Lo que realmente impulsa la factura en cualquiera de los dos modelos es el almacenamiento en caché, no la tarifa nominal. Tomemos un paso de agente representativo: 60,000 tokens de contexto de repositorio o documento de entrada, 3,000 tokens de plan-y-respuesta de salida. En frío, eso son $0.075 de entrada más $0.013 de salida — alrededor de 8.8 centavos, o $88 en mil pasos. Mantén el prefijo de contexto estable para que alcance la caché a $0.15 por millón y la entrada se reduzca a $0.009, situando el paso en aproximadamente 2.2 centavos y la ejecución de mil pasos en $22. Una variación del 75%, controlada enteramente por si tu framework de agente reutiliza un prefijo estable o reconstruye el prompt en cada turno. Si hay una acción de ingeniería que tomas después de leer esta reseña, que sea la estabilidad de la clave de caché en lugar de la selección del modelo.
Una nota estructural sobre dónde lo alquilas. Muse Spark 1.1 está en el catálogo de OrcaRouter a $1.25 y $4.25 con una lectura de caché de $0.15 — los mismos números que cobra Meta, porque OrcaRouter aplica un margen del 0% y transmite directamente el precio de lista del proveedor, así que un cambio de precio del proveedor llega aquí el mismo día que llega allí. Muse Spark 1.2 aún no está en el catálogo y Meta lo sirve directamente. Eso importa para la comparación que probablemente estás a punto de ejecutar: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 y Gemini 3.1 Pro están todos detrás de una sola clave al precio de lista, así que puedes compararlos con Muse Spark 1.1 en un único conjunto de evaluación sin un segundo contrato, y el número en tu hoja de cálculo es el número en la factura.
Lo que Muse Spark 1.1 realmente es
Muse Spark es la línea insignia de razonamiento de Meta Superintelligence Labs, el grupo que Mark Zuckerberg creó bajo Alexandr Wang. Marca un giro estratégico: mientras que los modelos Llama de Meta eran de pesos abiertos, la familia Muse — Spark, junto con los generadores de Imagen y Video — es cerrada y se entrega como producto y como API. Spark 1.0 llegó el 8 de abril de 2026; la 1.1 siguió el 9 de julio, junto con la vista previa pública de la API de Meta Model. El cambio práctico para los desarrolladores es que Meta ahora es un proveedor de API de primera parte que compite directamente con los dos proveedores de API establecidos, no solo un publicador de pesos — y el lanzamiento del 5 de agosto de un agente de codificación es la confirmación más clara de ello hasta ahora.
La versión 1.1 fue un paso sustancial más que una actualización menor. En Artificial Analysis ganó ocho puntos en el Índice de Inteligencia en tres meses, de 43 a 51. Su índice de codificación subió 12 puntos, hasta 71; SciCode mejoró al 58 %, y el Humanity's Last Exam subió al 45 %. Meta afirmó que las mayores mejoras se dieron en el uso de herramientas, el uso de computadoras, la codificación y la comprensión multimodal, algo coherente con un modelo perfeccionado para actuar, no solo para responder.
En cuanto al contexto, la confusión anterior se ha resuelto: tanto Artificial Analysis como OrcaRouter sitúan la ventana en 1.048.576 tokens, y Meta describe una ventana que el modelo compacta activamente. Sin embargo, mantener un millón de tokens no es lo mismo que recuperarlos, y la puntuación de recuperación de contexto largo de 1.1, de aproximadamente 54,1, indica que la recuperación es corriente. Trata la ventana como una capacidad, no como una garantía.
Esfuerzo de razonamiento: Instant, Contemplating y el dial de debajo
En la superficie de consumo de Meta, Muse Spark expone dos modos con nombre: Instant responde de inmediato sin razonamiento extendido, como un turno de chat estándar; Contemplating ejecuta múltiples agentes en paralelo mediante una técnica de «compresión de pensamiento» tomada del aprendizaje por refuerzo, y Meta lo posiciona frente a DeepMind Deep Think y GPT-5.4 Pro en tareas científicas y analíticas exigentes. A través de la API, la misma capacidad aparece como un parámetro configurable de esfuerzo de razonamiento — Artificial Analysis publica sus puntuaciones en el ajuste xhigh del modelo, el más caro que expone.
Trata ese dial como una palanca de costes, no como un deslizador de calidad. El razonamiento con agentes paralelos consume muchos más tokens que una sola pasada, y los números de referencia que has visto se generaron con el máximo esfuerzo. Pon el extremo inferior por defecto para las llamadas rutinarias y reserva el esfuerzo alto para los casos en los que una primera respuesta equivocada sea costosa.
Cómo puntúa: fuerte con herramientas, medio sin ellas.
La forma más clara de leer Muse Spark 1.1 es con herramientas frente a sin herramientas. Con herramientas, lidera las pruebas de agentes: MCP Atlas 88.1 frente a los 82.2 de Claude Opus 4.8, JobBench 54.7 frente a 48.4, Legal Agent Bench 20.0 frente a los 12.9 de Grok 4.5, y Humanity's Last Exam con herramientas 62.1 frente a 57.9. Sin herramientas es ordinario: el Humanity's Last Exam normal se sitúa alrededor de 45, muy por detrás de los aproximadamente 77 de Gemini 3.1 Pro en la misma prueba.
En cuanto a precisión de ejecución, también va por detrás de los líderes: uso de computadora en OSWorld-Verified, 80,8 frente a los 83,4 de Opus 4.8; codificación en SWE-Bench Pro, 61,5 frente a 69,2; codificación de horizonte largo en DeepSWE 1.1, 53,3 frente a los 67,0 de GPT-5.5; y razonamiento visual en BabyVision, 76,3 frente a 83,6. Muchas de estas cifras las comunican los propios proveedores, varias proceden de las evaluaciones de Meta, y se ejecutan en entornos distintos — considérelas orientativas y vuelva a probarlas en sus propias tareas.

La imagen independiente de Artificial Analysis es más compacta y más útil. Índice de Inteligencia 51, puesto #22 de 185, frente a una mediana de clase de 32. Velocidad: 213,5 tokens de salida por segundo, puesto #2 de 185: es un modelo realmente rápido. Precio: puesto #31, precio con acierto de caché de $0,15, un 88 % de descuento. Verbosidad: 94M tokens de salida para recorrer el índice, frente a una mediana de 65M, que es de donde sale una buena parte de la factura real. Gasto total para evaluarlo en todo el conjunto: $548,07.
Una advertencia que vale la pena tener en cuenta: Meta promociona entrada de texto, imagen, video, audio y PDF, pero la ficha de especificaciones técnicas de Artificial Analysis para 1.1 solo registra texto e imagen como evaluados. Ambas cosas pueden ser ciertas: la API acepta más de lo que el banco de pruebas ejercitó, pero nadie fuera de Meta ha publicado resultados en una carga de trabajo de video o audio. Si el análisis de medios mixtos es la razón por la que estás aquí, reserva tiempo para verificarlo tú mismo.
¿Deberías migrar a 1.2? La respuesta sobre la latencia.
En cuanto a codificación, Meta dice que sí, y sus números son internamente consistentes: Terminal-Bench 2.1 subiendo del 76.2% al 82.9%, DeepSWE v1.1 del 53.0% al 59.3%, y su benchmark interno de codificación del 68.3% al 70.6%. Estas son evaluaciones realizadas por Meta, con puntuación pass@1 en cinco intentos en el propio harness de Meta — se aplica la advertencia estándar: los modelos rivales en el harness de un proveedor suelen estar mal ajustados. De forma independiente, Artificial Analysis movió Muse Spark 1.2 a 54 en el Intelligence Index, puesto #13 de 185, tres puntos por encima de 1.1.
Lo que Meta utilizó para conseguir esos puntos fue la deliberación, y eso se refleja en cada medición de tiempo. Artificial Analysis mide el tiempo hasta el primer token en 26,12 segundos para 1.2 frente a 2,90 segundos para 1.1, ambos con el máximo esfuerzo de razonamiento de cada modelo. La velocidad de salida bajó de 213,5 a 165 tokens por segundo. La verbosidad aumentó ligeramente: 95M frente a 94M tokens, y el coste de ejecutar el mismo conjunto de pruebas de referencia subió de 548,07 $ a 637,85 $ con el mismo precio por token. Esa última cifra es la expresión más clara del equilibrio: misma lista de precios, un 16 % más de tokens consumidos y tres puntos de índice más.
Lee la figura de los 26 segundos con atención, porque es fácil de malinterpretar. Es una medición de referencia con esfuerzo máximo, y la API tiene por defecto un ajuste intermedio. Como punto de referencia de tráfico real, Muse Spark 1.1 en OrcaRouter — sirviendo cualquier nivel de esfuerzo que los llamadores soliciten realmente — muestra un p50 de tiempo hasta el primer token de 1,84 segundos y un p95 de 6,00 segundos a lo largo de una semana de tráfico de producción, con una tasa de error de cero. La latencia de referencia con esfuerzo máximo y la latencia de producción con esfuerzo predeterminado son cantidades distintas, y la brecha entre ellas suele ser de más de un orden de magnitud.
Así que la decisión se resuelve claramente según la forma de la carga de trabajo. Si estás ejecutando agentes de codificación de horizonte largo que mantienen un repositorio en contexto y trabajan durante minutos a la vez, 1.2 es el mejor modelo y la penalización de latencia se amortiza en una tarea que nunca iba a sentirse instantánea. Si estás sirviendo cualquier cosa interactiva — una interfaz de chat, un bucle de llamada a herramientas con un humano esperando, un SLO de latencia medido en segundos — Muse Spark 1.1 sigue siendo el modelo mejor perfilado de la familia, y su clasificación de velocidad no es un error de redondeo. Nada del lanzamiento de agosto cambia eso.
Experiencia del desarrollador y límites
La API del modelo Meta sigue en vista previa pública, aunque el lanzamiento de agosto amplió el acceso global y añadió la opción empresarial de retención cero de datos. Meta ofrece una interfaz de estilo OpenAI y acceso al SDK, y Spark ya está disponible para los consumidores en el modo "Thinking" de Meta AI. Los límites de velocidad ahora se publican en lugar de adivinarse: 3,000 solicitudes por minuto documentadas para el nivel estándar — pero el estado de vista previa sigue siendo estado de vista previa, así que mantén una ruta de respaldo para los días en que la capacidad esté limitada. La conmutación automática por error entre proveedores es exactamente el tipo de infraestructura que un endpoint de nivel de vista previa requiere, y es la razón por la que enrutar un modelo de vista previa a través de una puerta de enlace no cuesta nada y te compra un segundo camino.

A través de OrcaRouter, el ID del modelo es meta/muse-spark-1.1 y tanto /v1/chat/completions como /v1/responses están disponibles, por lo que un cliente compatible con OpenAI existente solo necesita una URL base y una cadena de modelo, y nada más:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Planifica y ejecuta las herramientas para solucionar este problema."}])
print(response.choices[0].message.content)
Donde encaja — y donde no
Adecuado para: automatización de la ejecución de herramientas y del uso de computadoras donde el tiempo de respuesta es visible para una persona; razonamiento a escala sensible a los costos sobre datos que no puedes entregar a un conjunto de entrenamiento; flujos de trabajo que mezclan texto con imágenes, video, PDFs o audio, con tu propia verificación en la ruta de medios; y equipos que quieren una opción predeterminada rápida y económica, con un modelo premium en reserva para los pasos más difíciles.
Ajuste débil: precisión de codificación de primer nivel en los rankings y la ingeniería greenfield más difícil, que siguen perteneciendo a Claude Opus 4.8 y GPT-5.6 Sol; problemas de razonamiento puro sin herramientas; tareas de precisión visual donde Gemini 3.1 Pro lidera; trabajo de repositorio de horizonte largo, que ahora es explícitamente el trabajo de 1.2 y Muse Code; y cualquier cosa donde necesites el token más barato posible de Meta, porque ese nivel no existe en este modelo.
Preguntas frecuentes
¿Sigue disponible Muse Spark 1.1 ahora que se ha lanzado 1.2?
Sí. Meta anunció que no habrá descontinuación ni cambios de precios en el lanzamiento del 5 de agosto: 1.1 permanece en la Meta Model API a $1.25 y $4.25 por millón de tokens, y está en el catálogo de OrcaRouter con los mismos números. La cobertura del lanzamiento lo describe constantemente como continuando con los precios existentes de la API. Dicho esto, la atención de ingeniería de Meta se ha movido visiblemente: el agente de codificación, los nuevos puntos de referencia y el nivel económico se adjuntan todos a 1.2.
¿Puedo obtener Muse Spark 1.1 en el nivel de colaborador de $0.10?
No. El nivel de contribuidor es un ID de modelo separado en el checkpoint más reciente, muse-spark-1.2-contributor. No hay equivalente de 1.1, así que los tokens de razonamiento de Meta más baratos requieren cambiar de versión — y aceptar un límite de 60 solicitudes por minuto, además del permiso para que Meta entrene con tus prompts y completaciones.
¿Debería actualizar a Muse Spark 1.2?
Si tu carga de trabajo es codificación de larga duración o trabajo de agente a escala de repositorio, sí: obtiene puntuaciones más altas tanto en las evaluaciones de codificación propias de Meta como en el índice independiente de Artificial Analysis, al mismo precio estándar. Si tu carga de trabajo es interactiva o sensible a la latencia, no: 1.2 intercambia aproximadamente nueve veces el tiempo hasta el primer token y el 23 % de la velocidad de salida por tres puntos de índice, y su razonamiento no se puede desactivar. Ambos están en la misma API, por lo que el cambio es una cadena de modelo en cualquier caso, lo que constituye la prueba A/B más económica posible y vale la pena ejecutarla en tu propio tráfico antes de decidir.
¿Es Muse Spark 1.1 de código abierto?
No, y ese es el punto de la línea. A diferencia de los modelos Llama de Meta, la familia Muse es de pesos cerrados y se entrega como producto y API. No hay pesos en Hugging Face, no hay ruta de autoalojamiento y no hay proveedores externos: Meta es la única parte que sirve este modelo, lo que convierte a una capa de enrutamiento con conmutación por error en la respuesta práctica al riesgo de un único proveedor, en lugar de un segundo proveedor.
El veredicto, una versión después.
Muse Spark 1.1 es un modelo agéntico rápido, barato y verdaderamente multimodal que destaca en el uso de herramientas y, siendo honestos, se queda a mitad de tabla en codificación y razonamiento puros. Nada de lo medido empeoró en agosto. Lo que cambió es la forma de la familia que lo rodea: Meta ahora tiene un modelo con mejor puntuación al mismo precio estándar, una gama drásticamente más barata para desarrolladores dispuestos a intercambiar sus datos, y un producto de agente que no se ejecuta ni en 1.1 ni en nada que puedas apuntar a 1.1.
Lo que queda es una recomendación más acotada pero real. Si necesitas la calidad de razonamiento de Meta a una velocidad perceptible para el ser humano — un segundo hasta el primer token en producción, 213 tokens por segundo después de eso — 1.1 sigue siendo la versión a la que recurrir, y los tres puntos de índice que añade 1.2 no justifican una espera nueve veces mayor. Si no necesitas esa velocidad, ya no hay mucho motivo para quedarse. De cualquier manera, es una sola cadena de modelo, así que el consejo honesto es ejecutar ambos en tu propio conjunto de evaluación durante un día y dejar que tu presupuesto de latencia decida.
Comparados en este artículo4
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
