
Muse Spark 1.2 vs Gemini 3.5 Flash-Lite: Dos laboratorios, dos definiciones de subagente
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxNUEVOMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
Con dos semanas de diferencia, dos laboratorios lanzaron un modelo y lo describieron con la misma palabra. Según su propia ficha de modelo, Gemini 3.5 Flash-Lite es "adecuado para subagentes que ejecutan tareas enfocadas dentro de flujos de trabajo multiagente complejos". Meta dice que Muse Spark 1.2 puede servir "como agente principal para planificación y delegación o como subagente que se ejecuta en paralelo". Mismo vocabulario, y Artificial Analysis tuvo que pasar ambos por su Intelligence Index para mostrar cuán distinto lo entienden: Flash-Lite completó la suite en 43 millones de tokens de salida; Muse Spark 1.2 necesitó 95 millones. Uno de estos modelos piensa brevemente y con frecuencia; el otro piensa intensamente y durante mucho tiempo. Ambos llaman subagente al resultado.
Esa proporción de tokens es el número más decisivo en la comparación, porque un nivel de subagente es algo que se despliega en abanico — veinte a la vez, cien a la vez — y ese despliegue en abanico multiplica los hábitos por llamada que tenga el modelo. Lo que sigue analiza qué construyó realmente cada laboratorio, cómo se ve la aritmética del despliegue en abanico a precios reales, y dónde el barato resulta ser la opción cara.
Lo que cada laboratorio quiere decir con la palabra
La versión Flash-Lite es una definición de rol por tamaño. Gemini 3.5 Flash-Lite es el nivel más económico de su familia, y ese posicionamiento es notable por vincular los niveles de razonamiento directamente con cargas de trabajo de subagentes de múltiples pasos — la primera vez que un nivel de esa familia se describe por el rol de agente en lugar de por el tamaño o la velocidad. El razonamiento es obligatorio, pero el esfuerzo predeterminado es mínimo, el dial llega como máximo a alto, y el modelo está diseñado para instanciarse en masa y responder rápido. El proveedor reporta un 54.2% en SWE-Bench Pro frente al 49.6% de Gemini 3 Flash, y un 74.0% en OSWorld-Verified frente al 65.1% — ambas cifras reportadas por el proveedor, no reproducidas de forma independiente, y ambas presentadas como ganancias de agencia en lugar de ganancias de inteligencia bruta.
La versión de Meta es una definición de roles por topología. La descripción de producto de Muse Spark 1.2 describe un modelo que puede recopilar contexto, elaborar un plan y delegar la ejecución en subagentes paralelos — o ser él mismo uno de esos subagentes. Su selector de razonamiento va desde mínimo hasta xhigh con un valor predeterminado de medium, y Meta menciona explícitamente las cargas de trabajo objetivo: refactorizaciones de múltiples archivos, sesiones de depuración prolongadas, generación de repositorios completos. Este es un modelo diseñado para ser el orquestador que también puede hacer el trabajo, lo cual es un producto diferente de un modelo diseñado para ser instanciado veinte a la vez.
Ningún laboratorio publicó un benchmark para la afirmación específica. Meta lanzó la versión 1.2 el 5 de agosto sin ninguna publicación de lanzamiento — su página de anuncio de Muse Spark 1.1 todavía describe la versión anterior.
La brecha que el índice realmente mide

Puntuaciones independientes de Artificial Analysis, que ejecuta el mismo compuesto de nueve evaluaciones en ambos:
• Índice de Inteligencia — Muse Spark 1.2 (xhigh) 54, puesto #13 de 185. Gemini 3.5 Flash-Lite 36, puesto #20 de 163. Dieciocho puntos, frente a una mediana de clase de 32.
• Velocidad de salida — 165.0 tokens por segundo frente a 343.6. Flash-Lite transmite más del doble de rápido.
• Tiempo hasta el primer token — 26.12 segundos frente a 10.30, ambos a máximo esfuerzo. Artificial Analysis señala que los 10.30s de Flash-Lite ya están en el extremo superior para modelos de razonamiento en su categoría de precio.
• Verbosidad — 95M tokens de salida frente a 43M para la misma suite, con una mediana de 65M en todos los modelos. Muse Spark 1.2 está un 46% por encima de la mediana; Flash-Lite está un 34% por debajo.
• Costo de ejecutar el índice — $637.85 frente a $153.08.
• Por dimensión — Los subíndices de Artificial Analysis sitúan a Gemini 3.5 Flash-Lite en 49.3 en codificación y 26.8 en agente. Aún no hay un desglose publicado para Muse Spark 1.2; su predecesor obtuvo 71.3 y 37.5.
Dieciocho puntos de índice no es una diferencia de redondeo. No son dos candidatos para el mismo puesto.
La aritmética del fan-out
{{1}}El precio por token es la óptica equivocada para un nivel de subagentes{{/1}}, {{2}}porque la razón de ser del nivel es que ejecutas muchos de ellos{{/2}}. {{3}}Haz un ejemplo con los precios de lista{{/3}} — {{4}}$0.30 de entrada y $2.50 de salida para Gemini 3.5 Flash-Lite{{/4}}, {{5}}$1.25 de entrada y $4.25 de salida para Muse Spark 1.2{{/5}}.
Un orquestador despacha veinte subagentes. Cada uno lee 25.000 tokens de contexto acotado y devuelve 1.500 tokens.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = aproximadamente 22.5 centavos por fan-out.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = aproximadamente 75 centavos por fan-out.
Tres veces y un tercio, lo que suena manejable. Ahora apliquemos la diferencia de verbosidad medida. Si Muse Spark 1.2 escribe proporcionalmente más que Flash-Lite como lo hizo en el índice — aproximadamente 2,2 veces más tokens de salida para un trabajo idéntico — esas respuestas de 1.500 tokens se convierten en unas 3.300, y el fan-out sube a aproximadamente 91 centavos. Cuatro veces, no tres. Con cien fan-outs por hora en un sistema de agentes muy activo, esa es la diferencia entre $22 y $91 por hora, o aproximadamente $600.000 al año de diferencia con carga continua.
Dos detalles de precios amplían aún más la brecha real en una dirección y la estrechan en la otra:
• Flash-Lite factura el razonamiento interno a la tarifa de salida. Su precio de lista para los tokens de razonamiento interno es de $2.50 por millón, el mismo que la salida visible. Pensar no es gratis, simplemente es invisible en la respuesta. Si un subagente delibera 2,000 tokens antes de responder, agrega medio centavo por llamada, o 10 centavos en el abanico de llamadas.
• El almacenamiento en caché favorece a Muse Spark 1.2 en términos de proporción. Las lecturas de entrada en caché cuestan $0.15 por millón frente a una lista de $1.25, un descuento del 88 %. Flash-Lite lee la entrada en caché a $0.03 frente a $0.30, un descuento del 90 %, pero además cobra alrededor de $0.083 por millón por escribir la caché, mientras que Muse Spark 1.2 no publica una tarifa separada por escritura de caché. Para un fan-out donde cada subagente comparte el mismo prefijo grande, la brecha se reduce considerablemente.

La latencia de producción es donde Flash-Lite más se distancia, y las cifras de los benchmarks lo ocultan. En OrcaRouter, a lo largo de una semana móvil de tráfico real, Gemini 3.5 Flash-Lite muestra un p50 de tiempo hasta el primer token de 816 milisegundos y un p95 de 4.57 segundos. Muse Spark 1.1 — el proxy más cercano disponible, ya que 1.2 aún no tiene telemetría — muestra un p50 de 1.84 segundos y un p95 de 6.00 segundos. Cuando veinte subagentes se ejecutan en paralelo, el más lento fija el tiempo de pared, por lo que el p95 es el número que rige tu latencia de fan-out, no el p50.
Donde lo barato es la decisión equivocada
Cuatro limitaciones de Gemini 3.5 Flash-Lite que no aparecen en una comparación de precios y que aparecerán en una revisión de incidentes.
• Un límite de salida de 65,536 tokens. La mitad de lo que permiten la mayoría de los modelos de esta clase, y un muro infranqueable para un subagente al que se le pide generar un archivo grande o devolver un documento estructurado largo. El endpoint de Muse Spark 1.2 no declara ninguna longitud máxima de finalización — lo cual es lo bastante inusual como para ponerlo a prueba en lugar de confiar en ello, pero no es un límite documentado.
• Es un endpoint sin moderar. El listado de Flash-Lite no lleva ninguna marca de moderación; el de Meta para Muse Spark 1.2 sí. Eso es una ventaja real para algunas cargas de trabajo y un problema de cumplimiento para otras, y debería ser una elección deliberada en lugar de un descubrimiento.
• Búsqueda integrada costosa. La herramienta de búsqueda web de Flash-Lite tiene un precio de aproximadamente $14 por mil llamadas, frente a los $2.50 de Muse Spark 1.2. Si tus subagentes investigan en lugar de solo leer, el modelo barato se convierte en el caro — cinco veces y media más — y el volumen de búsqueda en una arquitectura de fan-out escala con el fan-out.
• Su precio subió, no bajó. Gemini 3.5 Flash-Lite se lista en $0.30 y $2.50, mientras que el anterior Gemini 3.1 Flash-Lite costaba $0.25 y $1.50. La salida es un 67% más cara que el nivel que reemplaza. Si ajustaste un presupuesto de subagente según el modelo anterior, redimensiona ese presupuesto.

Una asimetría más que vale la pena expresar con claridad: Muse Spark 1.2 es servido por exactamente un único proveedor — Meta — sin hosts de terceros ni respaldo. Gemini 3.5 Flash-Lite cuenta con la huella de servicio multirregional de primera parte habitual. Para un orquestador, es un punto único de fallo para todo tu árbol de agentes; para una capa de workers, es un punto único de fallo para el fan-out.
El emparejamiento que la mayoría de los equipos terminará usando
Leídos en comparación, estos dos modelos no son tanto competidores como las dos mitades de una sola arquitectura, y el propio texto de producto de Meta dice lo mismo cuando describe el rol de agente principal por separado del rol de subagente.
La forma que se desprende de los números: Muse Spark 1.2 como orquestador, Gemini 3.5 Flash-Lite como trabajadores. Una llamada costosa y deliberada que lee el repositorio, mantiene el plan y decide qué delegar — donde 26 segundos de razonamiento y una verbosidad a escala de 95M tokens te dan un plan digno de ejecutar — seguida de veinte llamadas baratas, rápidas y específicas, cada una de las cuales hace una cosa acotada y responde en menos de un segundo en p50. Pagas tarifas cercanas a la frontera una vez por tarea y tarifas de presupuesto por unidad de trabajo, que es exactamente la curva de costos que una arquitectura de abanico (fan-out) quiere.
Inviértelo y la economía colapsa. Veinte subagentes Muse Spark 1.2 a 91 centavos por fan-out multiplican por cuatro la factura de un trabajo que un modelo 18 puntos más débil completa en un tercio del tiempo, y un orquestador Flash-Lite en el índice 36 producirá planes que los trabajadores no pueden rescatar.
Esa construcción repartida entre dos proveedores solía ser la parte incómoda. Gemini 3.5 Flash-Lite está en el catálogo de OrcaRouter a $0.30 y $2.50 — precio de lista del proveedor, trasladado con un margen del 0%, de modo que un cambio de precio llega a nuestro lado el mismo día en lugar de después de un ciclo de contrato — y Muse Spark 1.1 está allí a $1.25 y $4.25 sobre la misma base, ambos detrás de un único endpoint compatible con OpenAI. Eso significa que el patrón de orquestador y trabajadores consiste en dos cadenas de modelo en un solo código base en lugar de dos SDK, dos claves y dos facturas, y la conmutación automática por error cubre el caso en que un proveedor tiene una mala tarde en medio de un fan-out. Para ser exactos sobre lo que está disponible: Muse Spark 1.2 en sí todavía no está en el catálogo — Meta lo ofrece directamente como su único proveedor — así que hoy la versión más cercana de esta pila ejecuta la 1.1 en el rol de orquestador.
Elige por rol, no por puntuación
Si estás eligiendo un nivel de trabajador — análisis de documentos, extracción de datos, ediciones de archivos limitadas, clasificación, el estrecho y repetitivo medio de un árbol de agentes — Gemini 3.5 Flash-Lite es el mejor instrumento, y el déficit de 18 puntos en el índice es en gran medida irrelevante porque no le estás pidiendo que razone. Observa el techo de salida y el precio de búsqueda.
Si estás eligiendo el modelo que decide qué hacen los trabajadores, Muse Spark 1.2 es el candidato más fuerte de los dos, con las salvedades de que no tiene una puntuación agéntica independiente por dimensión, ningún registro de arena de ningún tipo, sin telemetría de producción y un solo proveedor. Esas son las brechas que deben cerrarse antes de que tenga un plan de producción.
Y si esperabas que un solo modelo pudiera hacer ambas tareas, la respuesta honesta de las mediciones es que ninguno lo hace. Flash-Lite no puede planificar en el índice 36; Muse Spark 1.2 no puede generarse veinte a la vez a 91 centavos por fan-out. La palabra "subagente" que aparece en ambas descripciones de producto es una coincidencia de marketing, no una señal de que pertenezcan al mismo espacio.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
