
Muse Spark 1.2 vs GPT-5.6 Luna: Tres puntos de índice por 4.6x el precio del token
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Artificial Analysis ejecutó la misma suite de nueve pruebas de referencia en ambos modelos y conservó los recibos. Hacer pasar Muse Spark 1.2 por ella costó $637.85. Hacer pasar GPT-5.6 Luna por ella costó $174.06. Por esa diferencia de gasto de 3,7 veces, el modelo de Meta quedó tres puntos por delante — 54 frente a 51 en el Índice de Inteligencia. Si ese es un buen intercambio es toda la cuestión, y la respuesta depende mucho menos de la prueba de referencia que de dos cosas sobre las que casi nadie escribe: cómo gestiona tu framework de agentes el caché de prompts, y si tu carga de trabajo alguna vez necesita escuchar o ver algo.
Cada figura a continuación es ya sea una medición independiente de Artificial Analysis, una lista de API en vivo, o la telemetría de producción propia de OrcaRouter — siendo esta última digna de señalarse de antemano porque contradice los números de referencia de manera instructiva. Nada aquí es una afirmación de proveedor disfrazada de resultado; cuando el proveedor es la única fuente, la oración lo dice.
El marcador está más cerca de lo que sugiere la etiqueta de precio.
Muse Spark 1.2 obtiene 54 en el Artificial Analysis Intelligence Index en su configuración de razonamiento xhigh, ocupando el puesto #13 de 185 modelos frente a una mediana de clase de 32. GPT-5.6 Luna obtiene 51 con el máximo esfuerzo. Tres puntos en un compuesto de GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR.
Tres puntos son reales pero pequeños, y las subpuntuaciones que existen de la generación anterior sugieren de dónde provienen. Las cifras por dimensión de Artificial Analysis colocan a Muse Spark 1.1 con un índice de codificación de 71.3 y un índice agéntico de 37.5; GPT-5.6 Luna se sitúa en 71.4 y 45.6. La codificación fue un empate técnico, y Luna estaba ocho puntos por delante en trabajo agéntico, la dimensión exacta que Meta reescribió en la descripción del producto de la 1.2 para reclamar. El índice compuesto se movió tres puntos a favor de Meta. Nadie ha publicado todavía un desglose por dimensión para la 1.2, así que si la brecha agéntica realmente se cerró no está verificado.

En el precio de token combinado, la brecha no es sutil. La tarifa combinada de Artificial Analysis sitúa a Muse Spark 1.2 en $0.78 por millón de tokens y a GPT-5.6 Luna en $0.17. Precios de lista: $1.25 de entrada y $4.25 de salida para Muse Spark 1.2, $0.20 de entrada y $1.20 de salida para Luna.
Se cobra por unidad de trabajo en lugar de por token: un solo paso de agente de codificación que lee 60,000 tokens de contexto y escribe 3,000 tokens de salida cuesta unos 8.8 centavos en Muse Spark 1.2 y unos 1.6 centavos en GPT-5.6 Luna. A lo largo de mil pasos al día, eso son $88 frente a $16: una diferencia de aproximadamente $26,000 al año para un solo bucle de agente.
El almacenamiento en caché es donde la brecha se cierra o se duplica.
Ambos modelos venden tarifas agresivas de entrada en caché, y la proporción entre ellas no es la misma que la proporción entre sus precios de lista. Muse Spark 1.2 lee entrada en caché a $0.15 por millón, un 88% de descuento sobre su tarifa de $1.25. GPT-5.6 Luna lee entrada en caché a $0.01 por millón, un 95% de descuento sobre $0.20.
Repite el mismo paso del agente con el prefijo de 60,000 tokens servido en caliente: Muse Spark 1.2 baja de 8.8 centavos a aproximadamente 2.2 centavos. Luna baja de 1.6 centavos a aproximadamente 0.4 centavos. La brecha absoluta se reduce de 7.2 centavos a 1.8 centavos por paso, pero el múltiplo se mantiene aproximadamente igual: el almacenamiento en caché no rescata al modelo más caro, solo abarata ambos por factores similares. Lo que sí cambia es qué partida domina: con caché, el costo de Muse Spark 1.2 corresponde a 59% de tokens de salida en lugar de 85% de tokens de entrada, por lo que la verbosidad del modelo empieza a importar más que el tamaño de su contexto.
Eso no es una preocupación hipotética aquí. Muse Spark 1.2 generó 95M de tokens de salida al pasar por el Intelligence Index, frente a una mediana de 65M. El propio resumen de Artificial Analysis lo califica de "algo verboso". Luna consumió 130M, lo cual suena peor hasta que multiplicas por $1.20 en lugar de $4.25.
El texto promocional de Meta afirma que el almacenamiento en caché de indicaciones puede reducir el costo efectivo entre un 60 y un 80 %, según cuánto contexto se repita. Eso es una estimación del proveedor, no una medición, pero la aritmética anterior se sitúa dentro del rango.
Latencia: el eje donde el benchmark invierte la verdad
Con solo leer las cifras de latencia de Artificial Analysis, concluirías que {{1}}Muse Spark 1.2{{/1}} es el que responde más rápido. Tiempo hasta el primer token: 26,12 segundos para {{2}}Muse Spark 1.2{{/2}}, 126,99 segundos para GPT-5.6 Luna. Casi cinco veces más rápido.
Ambos valores se miden en el ajuste de razonamiento más caro de cada modelo — xhigh para Muse Spark, max para Luna. Ninguno de los dos es lo que verás. En OrcaRouter, durante una semana de tráfico real con el nivel de esfuerzo que los llamantes realmente soliciten, GPT-5.6 Luna muestra un p50 de tiempo hasta el primer token de 1,84 segundos y un p95 de 9,68 segundos. Muse Spark 1.1 muestra un p50 idéntico de 1,84 segundos con un p95 más ajustado de 6,00 segundos. Aún no hay telemetría de producción para 1.2 porque es demasiado nuevo.

La diferencia estructural es más útil que cualquiera de los dos números. El razonamiento de GPT-5.6 Luna es opcional: el dial de esfuerzo va desde ninguno hasta bajo, medio, alto, muy alto y máximo, y puedes realmente apagar el pensamiento para clasificación, enrutamiento o extracción. El razonamiento de Muse Spark 1.2 es obligatorio. El dial no baja de mínimo, y no hay ninguna configuración que te dé los pesos sin pagar por la deliberación. Para cualquier cosa de alto volumen y sensible a la latencia, eso es una restricción de diseño, no un parámetro de ajuste.
El rendimiento sostenido es parejo: 165.0 tokens por segundo para Muse Spark 1.2 frente a 177.9 para Luna, ambos muy por encima de la mediana de la clase de 71.
La nota al pie sobre precios con la que todos tropezarán
El precio de GPT-5.6 Luna está actualmente listado de manera diferente en distintos lugares, y si estás construyendo un modelo de costos, deberías saberlo antes de citar una cifra. El catálogo de Artificial Analysis y el de OrcaRouter muestran ambos $0.20 por millón de entrada y $1.20 por millón de salida: la tarifa que siguió al recorte de precios de GPT-5.6 de julio, y la tarifa que Artificial Analysis usó para calcular la factura de evaluación de $174.06 mencionada arriba. Algunos listados de marketplace muestran actualmente $0.10 y $0.60 con un nivel superior separado que se activa por encima de 272,000 tokens de prompt. Lo más seguro es verificar el precio en el endpoint que realmente estás llamando, en lugar del que aparece en el artículo de comparación.
El detalle de los niveles es real independientemente de qué tarifa base se aplique, y está genuinamente poco cubierto: El precio de Luna aumenta cuando una sola solicitud supera aproximadamente 272.000 tokens de prompt. La entrada se duplica aproximadamente, la salida aumenta en un 50%, y las lecturas en caché escalan con ello. Si tu razón para considerar Luna es su ventana de contexto de 1,05M tokens, ten en cuenta que dejas la tarifa anunciada a aproximadamente una cuarta parte del camino. Muse Spark 1.2 tiene una tarifa plana en la totalidad de sus 1.048.576 tokens sin recargo por contexto largo — para solicitudes individuales genuinamente largas, la brecha efectiva entre los dos se reduce considerablemente.
Lo que Luna no puede hacer a ningún precio
La diferencia de modalidad es la razón más clara para elegir uno sobre el otro, y no aparece en ninguna tabla de clasificación.
• Entradas — Muse Spark 1.2 acepta texto, imágenes, vídeo, audio y documentos PDF según el listado de Meta. GPT-5.6 Luna acepta texto, imágenes y archivos. Ni audio, ni vídeo. Si tu pipeline involucra grabaciones o material de vídeo, Luna no es candidata en absoluto.
• Salida máxima — Luna declara un tope de finalización de 128,000 tokens. El endpoint de Muse Spark 1.2 no declara una longitud máxima de finalización, lo cual es tan inusual que deberías probarlo en lugar de planificar en base a ello.
• Corte de conocimiento — El de Luna está publicado como el 16 de febrero de 2026. Meta no publica ningún corte para Muse Spark 1.2, así que presupuesta la recuperación en cualquier caso.
• Disponibilidad — Luna está generalmente disponible en todo el mundo a través de múltiples rutas. Muse Spark 1.2 cuenta con exactamente un proveedor: Meta. Un endpoint, una política regional, una sola cosa que puede caerse.
• Moderación — ambos son endpoints moderados.
Una advertencia honesta sobre la ventaja multimodal: la ficha de especificaciones técnicas de Artificial Analysis para Muse Spark 1.2 enumera la entrada de texto e imagen como lo que evaluó, no la superficie completa de cinco modalidades que Meta promociona. La API acepta más de lo que cualquier persona independiente ha probado.

Adopción, ya que resulta ser medible.
Los benchmarks te dicen de qué es capaz un modelo; el tráfico te dice en qué lo confía la gente. Durante una semana móvil en OrcaRouter, GPT-5.6 Luna movió 4,679.4 millones de tokens. Muse Spark 1.1 — mismo contexto de 1M, puntuación de índice comparable, cuatro semanas más antiguo en el catálogo — movió 4.4 millones. Eso es un factor de aproximadamente mil.
Parte de eso es distribución: Luna es una opción predeterminada en más herramientas y lleva más tiempo en disponibilidad general (GA) a nivel mundial, mientras que la familia Muse Spark se lanzó solo en EE. UU. Pero una brecha de mil a uno en un router donde ambos están separados por una sola string de modelo no es puramente una cuestión de distribución. Es la razón práctica por la que Luna es la opción predeterminada más segura y Muse Spark 1.2 es lo que se evalúa deliberadamente.
Vale la pena señalar qué se puede y qué no se puede alquilar hoy: GPT-5.6 Luna está en el catálogo de OrcaRouter a $0.20 y $1.20, las mismas cifras de la lista de precios del propio proveedor, porque aplicamos un margen del 0% y trasladamos el precio de lista del proveedor directamente. Muse Spark 1.1 está allí a $1.25 y $4.25 sobre la misma base. Muse Spark 1.2 aún no está en el catálogo — lo sirve Meta directamente. Por lo tanto, la forma más económica de hacer esta comparación de manera honesta hoy es usar Luna contra Muse Spark 1.1 con una sola clave, cambiando una cadena entre ejecuciones, y luego volver a probar contra 1.2 cuando esté disponible.
Por favor, proporciona el texto que deseas traducir al español.
Usa GPT-5.6 Luna si la carga de trabajo es de gran volumen y de tipo texto: chat, clasificación, extracción, enrutamiento, uso ligero de herramientas. Cuesta una cuarta parte del precio combinado, te permite desactivar el razonamiento por completo, su p50 de 1,84 segundos es una cifra real medida en producción, no un artefacto de benchmark, y es el modelo respaldado por mil veces más tráfico real. Tres puntos de índice no sobreviven a esa aritmética.
Opta por Muse Spark 1.2 si la carga de trabajo es codificación agéntica de horizonte largo — refactorizaciones multiarchivo, depuración extendida, trabajo en todo el repositorio — o si implica entrada de audio o video, donde Luna simplemente no puede competir. También es la mejor opción para solicitudes individuales genuinamente enormes, ya que su tarifa es plana en todo el millón de tokens, mientras que la de Luna aumenta más allá de 272K.
Toma ambos si eres honesto sobre cómo se construyen realmente los sistemas de agentes. El patrón que sigue ganando es un modelo barato que maneja la mayoría rutinaria de las llamadas y uno caro reservado para los pasos donde la calidad se paga por sí sola. Ambos modelos se encuentran detrás de un único endpoint compatible con OpenAI, de modo que esa división es una regla de enrutamiento más que una segunda relación con un proveedor — y si el brazo caro se cae a mitad de ejecución, la conmutación por error automática significa que tu evaluación no se envenena silenciosamente con la mitad de un conjunto de datos.
The thing to watch over the next month is the per-dimension breakdown. Muse Spark 1.2's whole pitch is agentic capability, and on the previous generation that was the dimension where Luna led by eight points. Until someone publishes an agentic index for 1.2, the three-point composite gain is the only evidence there is that Meta closed it.
