Muse Spark 1.2 vs DeepSeek V4 Flash: Cuatro puntos de índice para nueve veces la factura
Guides & Insights

Muse Spark 1.2 vs DeepSeek V4 Flash: Cuatro puntos de índice para nueve veces la factura

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

72,02 $ y 637,85 $. Esas son las cantidades que Artificial Analysis gastó en ejecutar DeepSeek V4 Flash y Muse Spark 1.2 en las mismas nueve pruebas de referencia, y los modelos quedaron a cuatro puntos de diferencia — 50 frente a 54 en el Intelligence Index. El modelo de Meta es mejor. También cuesta 8,9 veces más someterlo a un trabajo idéntico, es de pesos cerrados, lo sirve un único proveedor y es cinco días más joven que DeepSeek V4 Flash. Si cuatro puntos valen la pena depende por completo de lo que estés construyendo, y esta comparación consiste sobre todo en hacer que esa pregunta se pueda responder.

Ambos modelos llegaron con una semana de diferencia — DeepSeek V4 Flash (build 0731) el 31 de julio de 2026, y Muse Spark 1.2 el 5 de agosto — y ambos se comercializan para el trabajo de agentes de largo horizonte. Cada puntuación de índice, cifra de latencia y coste de evaluación que aparece a continuación proviene de Artificial Analysis, que ejecuta los propios puntos de referencia y publica la factura. Cuando una cifra proviene de Meta o de la documentación del propio proveedor en lugar de una ejecución independiente, la frase así lo indica.

Los cuatro números que deciden esto

Índice de Inteligencia — Muse Spark 1.2 54 (#13 de 185), DeepSeek V4 Flash 50 (#3 de 101 en su clase, frente a una mediana de clase de 25).

Precio combinado por millón de tokens — $0.78 frente a $0.06. Trece veces.

Costo de la misma suite de nueve benchmarks — $637.85 vs $72.02.

Dónde puedes ejecutarlo — un proveedor, pesos cerrados frente a seis proveedores de API más pesos con licencia MIT que puedes alojar tú mismo.

La misma suite, dos facturas muy diferentes

La columna de costo de evaluación es la comparación de costos más honesta disponible para dos modelos, porque es el mismo trabajo, valorado según las tarifas de cada modelo, con cada modelo gastando tantos tokens como decida gastar. Muse Spark 1.2 necesitó $637.85 para completar el Intelligence Index. DeepSeek V4 Flash necesitó $72.02 — más barato que cualquier otro modelo conocido que Artificial Analysis haya medido, un hallazgo que tuvo su propio ciclo de prensa a principios de agosto.

Lo que hace interesante esa brecha es que ocurre a pesar de ser el modelo DeepSeek V4 Flash el más verboso, no por ello. Al ejecutar la suite, DeepSeek V4 Flash emitió 210 millones de tokens de salida frente a los 95 millones de Muse Spark 1.2 — más del doble. El modelo de Meta es significativamente más eficiente en tokens para la misma tarea, y eso no importa en absoluto, porque DeepSeek V4 Flash cobra $0.28 por millón de tokens de salida frente a los $4.25 de Meta. Una ventaja de precio de 15× se traga una desventaja de verbosidad de 2.2× sin darse cuenta.

Esto es lo que hay que llevar a tu propio modelo de costes. La eficiencia de tokens es una propiedad real y los modelos de razonamiento difieren en ella por grandes factores, pero a los diferenciales de mercado actuales es un término de segundo orden. La tarifa decide, y solo se inclina cuando dos modelos están dentro de aproximadamente 3× de precio entre sí.

Dónde se encuentran los cuatro puntos — y lo que nadie ha publicado

Esta es la parte incómoda de este enfrentamiento: el Intelligence Index es un compuesto de nueve evaluaciones en agentes, codificación, capacidad general y razonamiento científico, y Artificial Analysis aún no ha publicado el desglose por benchmark para Muse Spark 1.2. Así que «54 versus 50» es actualmente un titular sin descomposición. Cuatro puntos podrían ser una brecha de codificación, una brecha de contexto largo, una brecha de resistencia a alucinaciones, o cuatro brechas pequeñas que se cancelan hasta no ser nada en tu carga de trabajo.

Los números propios de cada proveedor llenan parte del vacío, y ninguno puede contrastarse con el otro. Meta reporta Terminal-Bench 2.1 en 82.9% para Muse Spark 1.2 (frente al 76.2% de la 1.1) y DeepSWE v1.1 en 59.3% (frente al 53.0%) — ejecutado en el banco de pruebas de Meta, pass@1 en cinco intentos, con cada modelo competidor emparejado con su propio producto agente. El lanzamiento de V4 Flash posicionó al modelo como una actualización de post-entrenamiento ajustada para trabajo de agente y terminal en una mezcla de expertos de 284B totales / 13B activos. No hay ningún benchmark en el que ambos laboratorios hayan publicado una cifra comparable, y ningún tercero ha reproducido ninguno de los dos conjuntos.

Lo que se ha establecido de forma independiente es limitado y vale la pena decirlo claramente: en un índice compuesto, llevado a cabo por un evaluador, Muse Spark 1.2 terminó cuatro puntos por delante, con un coste 8,9 veces superior. Todo lo que sea más detallado que eso sigue siendo material del proveedor.

Tres formas de pagar por Muse Spark 1.2, una y media para DeepSeek

Las comparaciones de precios aquí son inusualmente escurridizas, porque Meta envía dos tarifarios y el proveedor envía los pesos él mismo.

Nivel estándar de Meta — $1.25 de entrada, $0.15 de entrada en caché, $4.25 de salida por millón, con un límite de alrededor de 3.000 solicitudes por minuto.

Nivel de contribuidor de Meta — $0.10 de entrada, $0.002 de entrada en caché, $0.20 de salida, a cambio del permiso para entrenar futuros modelos de Meta con tu tráfico, con un límite de 60 solicitudes por minuto.

Lista de DeepSeek V4 Flash — $0.14 de entrada, $0.28 de salida, $0.003 en acierto de caché (un 98 % de descuento, la tarifa de caché más agresiva de cualquier modelo en esta categoría), de seis proveedores de API competidores.

DeepSeek V4 Flash autohospedado — pesos abiertos con licencia MIT, por lo que el precio es tu propio hardware y el techo es tu propia capacidad.

Lee la segunda y tercera línea juntas y la clasificación se invierte: en el nivel de colaborador, Muse Spark 1.2 es más barato por token que DeepSeek V4 Flash, a $0.10/$0.20 frente a $0.14/$0.28, mientras obtiene cuatro puntos más. Ese es el precio más agresivo en toda esta comparación y casi nadie podrá usarlo, porque 60 solicitudes por minuto es el 2% del presupuesto estándar y descarta esencialmente cualquier fan-out de producción. Está pensado para evaluación y trabajo en equipos pequeños, y la moneda son tus prompts. Si ese intercambio está disponible para ti es una decisión de gobernanza de datos que corresponde a legal, no una partida que cambias en un archivo de configuración.

El lado de los pesos abiertos funciona al revés. Los pesos con licencia MIT significan que el precio mínimo no lo fija el proveedor en absoluto: si tu volumen justifica las GPU, nadie puede subirte la tarifa, deprecar tu modelo ni cambiar las condiciones. Esa opcionalidad no tiene equivalente en el lado de Meta en ningún nivel.

Un proveedor contra seis

Muse Spark 1.2 se sirve a través de la API de Modelos de Meta y en ningún otro lugar. Sin hosts de terceros, sin opción de cuantización, sin ruta de respaldo y — al momento de escribir esto — sin listado en OpenRouter, sin repositorio en Hugging Face y sin entrada en el catálogo de OrcaRouter. Un modelo cerrado de un solo proveedor es un punto único de fallo por construcción, y para un modelo de cinco días no hay historial de disponibilidad que te tranquilice.

DeepSeek V4 Flash es el caso opuesto. Seis proveedores de API lo sirven hoy, los pesos son MIT, y está en el catálogo de OrcaRouter a $0.15 de entrada y $0.29 de salida — precio de lista del proveedor, transmitido con un margen del 0% — con conmutación automática por error entre proveedores, de modo que la degradación de un solo host no detiene la carga de trabajo con él. Ese es el argumento práctico para el modelo más barato que no tiene nada que ver con su puntaje: puedes moverlo, duplicarlo o irte por completo, y ninguna de esas opciones requiere una nueva integración.

Para Muse Spark 1.2 hoy, una evaluación significa un segundo contrato, una segunda factura y una segunda ruta de SDK. El modelo de Meta merece ser probado por sus méritos, pero ten claro que el costo operativo de ejecutarlo no es solo el precio del token.

Latencia, medida en tráfico real

En el banco de pruebas, Artificial Analysis registra un tiempo hasta el primer token de 1,33 segundos para DeepSeek V4 Flash y 26,12 segundos para Muse Spark 1.2 en su configuración de razonamiento xhigh, con velocidades de salida de 103,3 y 165,0 tokens por segundo, respectivamente. El modelo de Meta genera más rápido una vez que comienza y tarda mucho tiempo en arrancar, que es exactamente lo que parece una deliberación obligatoria al máximo esfuerzo.

Las cifras de producción cuentan una versión más suave de la misma historia. A lo largo de siete días de enrutamiento en vivo en OrcaRouter, DeepSeek V4 Flash muestra un p50 de tiempo hasta el primer token de 439 milisegundos y un p95 de 1,96 segundos, a 111 tokens por segundo con una tasa de error del 1,6 %. No existe una cifra de producción equivalente para Muse Spark 1.2 porque aún no se enruta en ninguna parte; Muse Spark 1.1, el proxy disponible más cercano, presenta un p50 de 1,84 segundos y un p95 de 6,00 segundos. La respuesta mediana en menos de un segundo es una categoría en la que DeepSeek V4 Flash se encuentra y en la que ninguna versión de Muse Spark ha entrado.

Ambos modelos declaran aproximadamente un millón de tokens de contexto — 1.048.576 para ambos, con DeepSeek V4 Flash limitando las finalizaciones a 384.000 tokens y el endpoint de Muse Spark sin declarar ningún límite de finalización. En cuanto al contexto, este enfrentamiento es un empate sobre el papel y sin verificar en la práctica para ambos.

Tres preguntas que vale la pena hacerse antes de cambiarte

¿Es realmente más barato auto-alojar DeepSeek V4 Flash que $0.15 por millón?

Por lo general, no, y ese es el punto. Una mezcla de expertos con 284B de parámetros y 13B activos necesita una capacidad multi-GPU considerable para servir con una latencia razonable, y a 0,15 $ por millón de tokens de entrada, la tarifa del servicio alojado es difícil de superar salvo con un volumen muy alto y muy constante. El valor de la licencia MIT para la mayoría de los equipos no es que vayan a autoalojarlo — es que podrían hacerlo de forma creíble, lo que pone un tope a lo que cualquier proveedor puede cobrar y elimina el riesgo de descontinuación. Trátalo como un seguro y compra los tokens del servicio alojado.

¿El nivel de contribuidor hace que Muse Spark 1.2 sea el modelo más barato?

En la tarifa oficial, sí; en la práctica, solo para cargas de trabajo de menos de 60 solicitudes por minuto cuyos datos tenga permitido donar. Si se cumplen ambas condiciones —un pico de investigación, una herramienta interna, un banco de pruebas con datos sintéticos—, entonces un modelo cuatro puntos porcentuales por delante a un precio por token más bajo es genuinamente la mejor compra y debería elegirlo. Si alguna de las dos falla, el nivel estándar es el precio real, y el nivel estándar equivale a 13 veces la tarifa combinada del modelo V4 Flash.

Cuatro puntos de índice parecen pocos. ¿Cuándo importa?

Cuando los errores se acumulan. En una llamada de clasificación o resumen de una sola vez, una brecha compuesta de cuatro puntos suele ser invisible, y pagar 9× por ello es indefendible. En un bucle de agente de cincuenta pasos, una diferencia de éxito por paso que parece pequeña se multiplica hasta convertirse en una gran diferencia en la frecuencia con la que hay que reiniciar toda la ejecución — y un reinicio cuesta toda la trayectoria, no un solo paso. Ese es el caso en el que el precio de Meta es discutible. También es el caso en el que deberías medir en tu propia tarea en lugar de confiar en un compuesto, porque nadie ha publicado el subíndice agéntico que lo resolvería para 1.2.

El veredicto, y la condición que lo acompaña.

Para casi cualquier carga de trabajo donde el costo es una restricción real, DeepSeek V4 Flash es la opción predeterminada correcta: cuatro puntos por detrás en un índice compuesto, trece veces más barato en conjunto, latencia media inferior a un segundo en producción, seis proveedores, pesos MIT y ningún proveedor capaz de cambiarte las condiciones. Actualmente es el modelo conocido más barato para ejecutar una suite completa de benchmarks, y no llegó ahí por ser malo.

Muse Spark 1.2 justifica su precio en un tipo específico de trabajo: codificación agéntica de horizonte largo, donde una trayectoria fallida es costosa, donde la deliberación adicional se amortiza en minutos de trabajo en lugar de sentirla un usuario que espera, y donde puedes vivir con un solo proveedor y sin un desglose independiente de qué están hechos los cuatro puntos. Meta ha lanzado tres modelos en cuatro meses y ha movido once puntos de índice en ese tiempo, por lo que el caso puede fortalecerse rápidamente — pero hoy se basa en benchmarks de codificación ejecutados por el proveedor y en una puntuación compuesta.

Si estás eligiendo esta semana, ejecuta ambos en cincuenta pasos de tu propio bucle de agente y compara las trayectorias completadas por dólar en lugar de tokens por dólar. Esa única medición responde a esta comparación mejor que cualquier benchmark publicado.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube