
Muse Spark 1.2 vs Claude Haiku 4.5: Precio combinado idéntico, ideas opuestas sobre el pensamiento
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 1604 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencia69Código60Matemáticas
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
El contraste de especificaciones, una dimensión a la vez
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• Caché — $0.15 por millón en un acierto de caché de Muse Spark 1.2, un 88 % de descuento; $0.10 por millón en una lectura de caché de Claude Haiku 4.5, un 90 % de descuento, con escrituras de caché facturadas a $1.25.
• Contexto — 1,048,576 tokens frente a 200,000. Una diferencia de 5.2×, y la mayor brecha entre ambos.
• Salida máxima — Claude Haiku 4.5 declara un límite de 64 000 tokens; el endpoint de Muse Spark 1.2 no declara ninguna longitud máxima de finalización, lo cual es lo bastante inusual como para probarlo en lugar de asumirlo.
• Razonamiento — obligatorio en Muse Spark 1.2, con cinco niveles de esfuerzo desde mínimo hasta xhigh y un valor predeterminado de medio; opcional en Claude Haiku 4.5, que es un modelo sin razonamiento hasta que actives el pensamiento extendido y le asignes un presupuesto de pensamiento.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• Edad — Muse Spark 1.2 tiene apenas unos días. Claude Haiku 4.5 lleva en producción desde el 15 de octubre de 2025, con un corte de conocimiento de julio de 2025 y nueve meses de experiencia de campo acumulada a sus espaldas.
La brecha del índice es real. El número que todos citarán no lo es.

Artificial Analysis puntúa a Muse Spark 1.2 con 54 en su Índice de Inteligencia, puesto #13 de 185. Su entrada actual para Claude Haiku 4.5 es 24. Ponlos uno al lado del otro y tienes un titular; mira lo que son realmente las entradas y el titular se desmorona.
El 54 es Muse Spark 1.2 evaluado en xhigh, su configuración de razonamiento más costosa. El 24 es Claude Haiku 4.5 evaluado como un modelo sin razonamiento — con el pensamiento desactivado — y Artificial Analysis lo señala como una estimación en lugar de una ejecución completada. En una versión anterior del mismo índice, antes del reajuste v4.1, Artificial Analysis situaba a Claude Haiku 4.5 en 55 con razonamiento habilitado y en 42 sin él. Esas cifras antiguas tampoco pueden compararse con 54, porque las versiones del índice se reescalan y una puntuación de la era v3 no es una puntuación v4.1.
Así que la declaración honesta es más limitada de lo que la tabla de clasificación aparenta: Muse Spark 1.2 con el máximo esfuerzo obtiene 54 en el índice actual; no hay una puntuación v4.1 publicada para Claude Haiku 4.5 con el pensamiento extendido activado, por lo que aún no existe una comparación en igualdad de condiciones de estos dos a máximo esfuerzo. Cualquiera que te muestre 54 frente a 24 está comparando un modelo con deliberación completa contra un modelo al que se le dijo que no deliberara.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
Cuatro números de latencia, dos historias diferentes

La latencia es donde el planteamiento de "mismo precio" deja de ser una curiosidad y se convierte en una decisión, y es también donde la fuente de medición importa más.
En el banco de pruebas, Artificial Analysis registra un tiempo hasta el primer token de 26.12 segundos para Muse Spark 1.2 en xhigh, y 1.00 segundo para Claude Haiku 4.5. Una brecha de 26×, y si eso fuera todo el panorama, la comparación terminaría ahí.
En producción, se invierte. A lo largo de siete días de tráfico real en OrcaRouter — los llamantes usando el esfuerzo que realmente quieren — Claude Haiku 4.5 muestra un tiempo p50 hasta el primer token de 3.84 segundos y un p95 de 10.00 segundos, a 214 tokens por segundo y una tasa de error del 1.0%. Muse Spark 1.1, la versión del modelo de Meta que está en el catálogo, muestra un p50 de 1.84 segundos y un p95 de 6.00 segundos, a 519 tokens por segundo sin errores registrados. En tráfico en vivo, el modelo de Meta es el más rápido.
Ambos conjuntos de números son verdaderos y miden cosas distintas. La cifra de laboratorio corresponde a cada modelo con deliberación máxima y caché fría, lo que es una prueba justa del techo y una mala prueba para un chat. La cifra de producción incluye aciertos de caché, indicaciones cortas, niveles de esfuerzo bajos y todo lo demás que hacen las aplicaciones reales, lo que es una prueba justa de la mediana y ninguna prueba en absoluto del peor caso. La trampa está en citar una y razonar sobre la otra. Si estás dimensionando un tiempo de espera orientado al usuario, el p95 es tu número. Si te preguntas cuánto cuesta un paso agéntico profundo en tiempo de reloj, la cifra del benchmark se acerca más a la verdad — y la advertencia honesta es que todavía no existe tal cifra de producción para Muse Spark 1.2 en sí, porque es demasiado nuevo y no está ampliamente enrutado.
Ambos laboratorios te vendieron un subagente. Querían decir cosas diferentes.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
El discurso de Meta para Muse Spark 1.2 reclama ambos extremos de la misma jerarquía. El texto de Meta dice que el modelo puede ser el agente principal que recopila contexto, planea y delega, o un subagente que se ejecuta en paralelo bajo uno. Muse Code, el agente terminal que se lanzó junto con este, coordina múltiples subagentes persistentes por tarea en árboles de trabajo aislados, sobre un runtime de registro de eventos con reproducción exacta. La ventana de un millón de tokens y el razonamiento siempre activo son lo que un planificador necesita; son exactamente lo que no elegirías para un trabajador de abanico, porque cada instancia paralela está pagando por una deliberación que no pediste.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
Lo que cuesta un paso real en cada
Las tarifas por millón no deciden nada en los modelos de razonamiento, porque el modelo elige cuántos tokens gastar. Mejor, ponle precio al paso.
Tomemos una tarea de código acotada: 60,000 tokens de contexto del repositorio de entrada, 3,000 tokens de parche de salida. En frío, Claude Haiku 4.5 cuesta $0.060 de entrada más $0.015 de salida — 7.5 centavos. Muse Spark 1.2 cuesta $0.075 más $0.013 — 8.8 centavos. Lo suficientemente cerca como para ser ruido, exactamente como prometía la tarifa combinada.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
El caché invierte el énfasis de nuevo. Mantén estable el contexto del repositorio para que acierte en la caché y la entrada de Haiku se reduzca a $0.006 y la de Muse Spark 1.2 a $0.009 — el lado de la entrada deja de importar por completo y toda la comparación se convierte en una lucha por los tokens de salida, que es una lucha sobre cuánto piensa cada modelo. En una carga de trabajo que repite contexto, la estabilidad de la clave de caché vale más que la elección del modelo, y eso es cierto para ambos modelos.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
Probar ambos sin un segundo contrato.

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2 no está en el catálogo. La Model API de Meta es actualmente el único lugar donde se puede invocar, por lo que una verdadera comparación directa hoy implica una integración a través de nosotros y una directa con Meta. Muse Spark 1.1 está alojado, a los mismos $1.25 y $4.25 que Meta cobra por 1.2, lo que lo convierte en un sustituto razonable para el perfil de costo y latencia de la familia, pero no para las mejoras de codificación con las que se vende 1.2. Cuando 1.2 se pueda enrutar, la comparación se convierte en un cambio de una línea en la cadena del modelo con la misma clave — y para el experimento de orquestador más worker descrito anteriormente, el DSL de enrutamiento es cómo conectas un planificador y un worker de fan-out en una sola llamada en lugar de construir el traspaso tú mismo.
Elige según la forma de la obra, no según la puntuación.
Elige Claude Haiku 4.5 cuando el trabajo esté acotado y el usuario esté esperando. Agentes de soporte, clasificación, extracción, chat, autocompletados de programación en pareja y el nivel de trabajadores paralelos de una jerarquía de agentes. Es una opción conocida con nueve meses de historial en el campo, el razonamiento es opcional, por lo que solo pagas por la deliberación cuando quieres, y 200K es suficiente para casi cualquier subtarea acotada. Su resultado publicado en SWE-bench Verified dice que es mucho más capaz de lo que el precio implica, siempre que estés dispuesto a gastar el presupuesto de razonamiento que ese resultado usó.
Elige Muse Spark 1.2 cuando la unidad de trabajo es un repositorio y no una solicitud. Las refactorizaciones de múltiples archivos, la depuración prolongada, la generación de todo el proyecto, los bucles de agente de largo horizonte donde nadie está mirando un indicador de progreso. La ventana de un millón de tokens elimina un problema de fragmentación que Haiku no puede resolver a ningún precio, y el razonamiento obligatorio que lo arruina para el chat es el valor predeterminado correcto cuando un plan equivocado cuesta más que uno lento.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
