
Muse Spark 1.2 vs Claude Haiku 4.5: Precio combinado idéntico, ideas opuestas sobre el pensamiento
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 477 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 186 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Artificial Analysis fija el precio de Muse Spark 1.2 en $0.78 por millón de tokens combinados y Claude Haiku 4.5 en $0.77. A un centavo de distancia, de dos laboratorios que no coincidían en nada más. El modelo de Meta no puede dejar de razonar; Claude Haiku 4.5 solo razona cuando se lo pides. Meta te da 1,048,576 tokens de contexto; Claude Haiku 4.5 te da 200,000. Meta lanzó este el 5 de agosto de 2026 como modelo de codificación con un agente de terminal adjunto; Claude Haiku 4.5 se lanzó en octubre de 2025 como el trabajador rápido y barato al que un modelo más grande le dice qué hacer. Mismo precio por token, máquinas completamente diferentes.
Esa coincidencia es el punto útil para comenzar una comparación, porque elimina la variable sobre la que la gente suele decidir y obliga a que la cuestión sea sobre la forma. Lo que sigue utiliza números independientes donde existen — Artificial Analysis para los puntajes de índice y la latencia de laboratorio, la telemetría de producción de siete días del propio OrcaRouter para la latencia de tráfico real — y marca las cifras reportadas por el proveedor como tales, incluido un titular de referencia del proveedor que no tiene contraparte de terceros.
El contraste de especificaciones, una dimensión a la vez
• Precio — Muse Spark 1.2 a $1.25 entrada / $4.25 salida por millón; Claude Haiku 4.5 a $1.00 entrada / $5.00 salida. Meta es más barato en entrada, Claude Haiku 4.5 en salida.
• Caché — $0.15 por millón en un acierto de caché de Muse Spark 1.2, un 88 % de descuento; $0.10 por millón en una lectura de caché de Claude Haiku 4.5, un 90 % de descuento, con escrituras de caché facturadas a $1.25.
• Contexto — 1,048,576 tokens frente a 200,000. Una diferencia de 5.2×, y la mayor brecha entre ambos.
• Salida máxima — Claude Haiku 4.5 declara un límite de 64 000 tokens; el endpoint de Muse Spark 1.2 no declara ninguna longitud máxima de finalización, lo cual es lo bastante inusual como para probarlo en lugar de asumirlo.
• Razonamiento — obligatorio en Muse Spark 1.2, con cinco niveles de esfuerzo desde mínimo hasta xhigh y un valor predeterminado de medio; opcional en Claude Haiku 4.5, que es un modelo sin razonamiento hasta que actives el pensamiento extendido y le asignes un presupuesto de pensamiento.
• Entradas — Meta admite texto, imágenes, video, audio y PDF; Claude Haiku 4.5 acepta texto e imágenes. Ambos devuelven texto.
• Pesos y proveedores — ambos cerrados. Muse Spark 1.2 se sirve únicamente a través de la API de modelos propia de Meta; Claude Haiku 4.5 está disponible a través del proveedor y de los habituales revendedores y agregadores de la nube.
• Edad — Muse Spark 1.2 tiene apenas unos días. Claude Haiku 4.5 lleva en producción desde el 15 de octubre de 2025, con un corte de conocimiento de julio de 2025 y nueve meses de experiencia de campo acumulada a sus espaldas.
La brecha del índice es real. El número que todos citarán no lo es.

Artificial Analysis puntúa a Muse Spark 1.2 con 54 en su Índice de Inteligencia, puesto #13 de 185. Su entrada actual para Claude Haiku 4.5 es 24. Ponlos uno al lado del otro y tienes un titular; mira lo que son realmente las entradas y el titular se desmorona.
El 54 es Muse Spark 1.2 evaluado en xhigh, su configuración de razonamiento más costosa. El 24 es Claude Haiku 4.5 evaluado como un modelo sin razonamiento — con el pensamiento desactivado — y Artificial Analysis lo señala como una estimación en lugar de una ejecución completada. En una versión anterior del mismo índice, antes del reajuste v4.1, Artificial Analysis situaba a Claude Haiku 4.5 en 55 con razonamiento habilitado y en 42 sin él. Esas cifras antiguas tampoco pueden compararse con 54, porque las versiones del índice se reescalan y una puntuación de la era v3 no es una puntuación v4.1.
Así que la declaración honesta es más limitada de lo que la tabla de clasificación aparenta: Muse Spark 1.2 con el máximo esfuerzo obtiene 54 en el índice actual; no hay una puntuación v4.1 publicada para Claude Haiku 4.5 con el pensamiento extendido activado, por lo que aún no existe una comparación en igualdad de condiciones de estos dos a máximo esfuerzo. Cualquiera que te muestre 54 frente a 24 está comparando un modelo con deliberación completa contra un modelo al que se le dijo que no deliberara.
Cuando el proveedor ha publicado una cifra, esta es específica: Claude Haiku 4.5 obtiene un 73,3 % en SWE-bench Verified, promediado sobre 50 pruebas con un presupuesto de razonamiento de 128K. Es una cifra del proveedor, y el presupuesto de razonamiento que contiene es enorme para un modelo comercializado por su velocidad — pero es la misma evaluación que la industria cita para los modelos frontera, y sitúa a Haiku en una categoría que su precio no sugiere. Las afirmaciones homólogas de Meta para Muse Spark 1.2 son Terminal-Bench 2.1 con un 82,9 % y DeepSWE v1.1 con un 59,3 %, también ejecutadas por el proveedor, en el banco de pruebas propio de Meta, con cada competidor emparejado con su propio producto de agente. Dos proveedores, dos bancos de pruebas, sin solapamiento. Actualmente no existe una única evaluación en la que ambos modelos tengan una puntuación publicada por el mismo evaluador.
Cuatro números de latencia, dos historias diferentes

La latencia es donde el planteamiento de "mismo precio" deja de ser una curiosidad y se convierte en una decisión, y es también donde la fuente de medición importa más.
En el banco de pruebas, Artificial Analysis registra un tiempo hasta el primer token de 26.12 segundos para Muse Spark 1.2 en xhigh, y 1.00 segundo para Claude Haiku 4.5. Una brecha de 26×, y si eso fuera todo el panorama, la comparación terminaría ahí.
En producción, se invierte. A lo largo de siete días de tráfico real en OrcaRouter — los llamantes usando el esfuerzo que realmente quieren — Claude Haiku 4.5 muestra un tiempo p50 hasta el primer token de 3.84 segundos y un p95 de 10.00 segundos, a 214 tokens por segundo y una tasa de error del 1.0%. Muse Spark 1.1, la versión del modelo de Meta que está en el catálogo, muestra un p50 de 1.84 segundos y un p95 de 6.00 segundos, a 519 tokens por segundo sin errores registrados. En tráfico en vivo, el modelo de Meta es el más rápido.
Ambos conjuntos de números son verdaderos y miden cosas distintas. La cifra de laboratorio corresponde a cada modelo con deliberación máxima y caché fría, lo que es una prueba justa del techo y una mala prueba para un chat. La cifra de producción incluye aciertos de caché, indicaciones cortas, niveles de esfuerzo bajos y todo lo demás que hacen las aplicaciones reales, lo que es una prueba justa de la mediana y ninguna prueba en absoluto del peor caso. La trampa está en citar una y razonar sobre la otra. Si estás dimensionando un tiempo de espera orientado al usuario, el p95 es tu número. Si te preguntas cuánto cuesta un paso agéntico profundo en tiempo de reloj, la cifra del benchmark se acerca más a la verdad — y la advertencia honesta es que todavía no existe tal cifra de producción para Muse Spark 1.2 en sí, porque es demasiado nuevo y no está ampliamente enrutado.
Ambos laboratorios te vendieron un subagente. Querían decir cosas diferentes.
La propuesta del proveedor para Claude Haiku 4.5 fue explícita sobre la jerarquía: los modelos de clase Sonnet planifican y orquestan, y las instancias Haiku ejecutan en paralelo debajo. Baratos, rápidos, desechables, muchos a la vez. El diseño del producto sigue esa línea: una ventana de 200K es suficiente para una subtarea acotada y deliberadamente insuficiente para un repositorio completo; el razonamiento está desactivado por defecto porque un trabajador que delibera es un trabajador que cuesta dinero al orquestador, y el propio marketing del proveedor señala el chat en tiempo real, el servicio al cliente y la programación en pareja como objetivo.
El discurso de Meta para Muse Spark 1.2 reclama ambos extremos de la misma jerarquía. El texto de Meta dice que el modelo puede ser el agente principal que recopila contexto, planea y delega, o un subagente que se ejecuta en paralelo bajo uno. Muse Code, el agente terminal que se lanzó junto con este, coordina múltiples subagentes persistentes por tarea en árboles de trabajo aislados, sobre un runtime de registro de eventos con reproducción exacta. La ventana de un millón de tokens y el razonamiento siempre activo son lo que un planificador necesita; son exactamente lo que no elegirías para un trabajador de abanico, porque cada instancia paralela está pagando por una deliberación que no pediste.
Leído como arquitectura en lugar de marketing, esa es la diferencia real: el proveedor construyó un trabajador y espera que traigas un orquestador; Meta construyó un orquestador y afirma que también puede funcionar. Si ya gestionas una jerarquía, el experimento interesante no es elegir entre ellos, sino que Muse Spark 1.2 planifique y Claude Haiku 4.5 ejecute, una configuración que ningún proveedor te venderá como paquete.
Lo que cuesta un paso real en cada
Las tarifas por millón no deciden nada en los modelos de razonamiento, porque el modelo elige cuántos tokens gastar. Mejor, ponle precio al paso.
Tomemos una tarea de código acotada: 60,000 tokens de contexto del repositorio de entrada, 3,000 tokens de parche de salida. En frío, Claude Haiku 4.5 cuesta $0.060 de entrada más $0.015 de salida — 7.5 centavos. Muse Spark 1.2 cuesta $0.075 más $0.013 — 8.8 centavos. Lo suficientemente cerca como para ser ruido, exactamente como prometía la tarifa combinada.
Ahora añade lo que la tarifa combinada oculta. Muse Spark 1.2 no puede desactivar el razonamiento y, en su configuración media predeterminada, un paso como este probablemente emite unos miles de tokens de razonamiento antes del parche: se facturan como salida. Añade 3,000 y el mismo paso es $0.075 + $0.026 = 10.1 centavos, aproximadamente un 35% por encima de Haiku con entradas idénticas. Claude Haiku 4.5 con el razonamiento desactivado no paga nada por la deliberación y se mantiene en 7.5 centavos; con un presupuesto de razonamiento amplio superará a Muse Spark 1.2, porque Claude Haiku 4.5 cobra $5.00 por millón de salida frente a los $4.25 de Meta.
El caché invierte el énfasis de nuevo. Mantén estable el contexto del repositorio para que acierte en la caché y la entrada de Haiku se reduzca a $0.006 y la de Muse Spark 1.2 a $0.009 — el lado de la entrada deja de importar por completo y toda la comparación se convierte en una lucha por los tokens de salida, que es una lucha sobre cuánto piensa cada modelo. En una carga de trabajo que repite contexto, la estabilidad de la clave de caché vale más que la elección del modelo, y eso es cierto para ambos modelos.
La ventana de 1M es el único lugar donde la aritmética no cuadra. Cualquier cosa que genuinamente necesite más de 200 000 tokens en una sola llamada no puede ejecutarse en Claude Haiku 4.5 a ningún precio. O bien divides en fragmentos y orquestas — que es lo que el proveedor pretende — o usas un modelo con el espacio suficiente.
Probar ambos sin un segundo contrato.

Claude Haiku 4.5 está en el catálogo de OrcaRouter a $1.00 y $5.00 — el precio de lista del proveedor, porque OrcaRouter opera con un margen del 0% y transmite los precios de los proveedores sin modificarlos, lo que también significa que un cambio de precio del proveedor se refleja en nuestro lado el mismo día en lugar de en el siguiente ciclo de contrato. Las cifras de latencia de producción anteriores provienen de esa misma capa de enrutamiento.
Muse Spark 1.2 no está en el catálogo. La Model API de Meta es actualmente el único lugar donde se puede invocar, por lo que una verdadera comparación directa hoy implica una integración a través de nosotros y una directa con Meta. Muse Spark 1.1 está alojado, a los mismos $1.25 y $4.25 que Meta cobra por 1.2, lo que lo convierte en un sustituto razonable para el perfil de costo y latencia de la familia, pero no para las mejoras de codificación con las que se vende 1.2. Cuando 1.2 se pueda enrutar, la comparación se convierte en un cambio de una línea en la cadena del modelo con la misma clave — y para el experimento de orquestador más worker descrito anteriormente, el DSL de enrutamiento es cómo conectas un planificador y un worker de fan-out en una sola llamada en lugar de construir el traspaso tú mismo.
Elige según la forma de la obra, no según la puntuación.
Elige Claude Haiku 4.5 cuando el trabajo esté acotado y el usuario esté esperando. Agentes de soporte, clasificación, extracción, chat, autocompletados de programación en pareja y el nivel de trabajadores paralelos de una jerarquía de agentes. Es una opción conocida con nueve meses de historial en el campo, el razonamiento es opcional, por lo que solo pagas por la deliberación cuando quieres, y 200K es suficiente para casi cualquier subtarea acotada. Su resultado publicado en SWE-bench Verified dice que es mucho más capaz de lo que el precio implica, siempre que estés dispuesto a gastar el presupuesto de razonamiento que ese resultado usó.
Elige Muse Spark 1.2 cuando la unidad de trabajo es un repositorio y no una solicitud. Las refactorizaciones de múltiples archivos, la depuración prolongada, la generación de todo el proyecto, los bucles de agente de largo horizonte donde nadie está mirando un indicador de progreso. La ventana de un millón de tokens elimina un problema de fragmentación que Haiku no puede resolver a ningún precio, y el razonamiento obligatorio que lo arruina para el chat es el valor predeterminado correcto cuando un plan equivocado cuesta más que uno lento.
Lo que debería decidirlo no es el número de índice. Hazte dos preguntas en su lugar: ¿alguna vez una sola llamada necesita ver más de 200.000 tokens, y hay un humano esperando el primer token? Sí a la primera apunta a Meta. Sí a la segunda apunta al proveedor. Sí a ambas significa que quieres dos modelos, que es la respuesta honesta más a menudo de lo que admite el marketing de cualquiera de los dos proveedores.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
