
Muse Spark 1.2 vs Claude Haiku 4.5 : même prix mixte, conceptions opposées de la pensée
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 1604 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1653Intelligence69Code60Maths
Artificial Analysis tarifie Muse Spark 1.2 à 0,78 $ par million de jetons (tarif mixte) et Claude Haiku 4.5 à 0,77 $. Un centime d’écart, de deux laboratoires qui n’étaient d’accord sur rien d’autre. Le modèle de Meta ne peut pas s’arrêter de raisonner ; Claude Haiku 4.5 ne raisonne que lorsqu’on le lui demande. Meta vous donne 1 048 576 jetons de contexte ; Claude Haiku 4.5 vous en donne 200 000. Meta a publié celui-ci le 5 août 2026 comme modèle de codage avec un agent de terminal intégré ; Claude Haiku 4.5 est sorti en octobre 2025 comme le travailleur rapide et bon marché à qui un plus grand modèle dit quoi faire. Même prix par jeton, machines entièrement différentes.
Cette coïncidence est le point de départ utile pour une comparaison, car elle élimine la variable sur laquelle on se décide habituellement et force la question à porter sur la forme à la place. Ce qui suit utilise des chiffres indépendants là où ils existent — Artificial Analysis pour les scores d’indice et la latence en laboratoire, la propre télémétrie de production sur sept jours d’OrcaRouter pour la latence du trafic réel — et signale comme tels les chiffres déclarés par les fournisseurs, y compris un résultat de référence du fournisseur qui n’a pas d’équivalent tiers.
Le contraste des spécifications, une dimension à la fois
• Prix — Muse Spark 1.2 à 1,25 $ en entrée / 4,25 $ en sortie par million ; Claude Haiku 4.5 à 1,00 $ en entrée / 5,00 $ en sortie. Meta est moins cher en entrée, Claude Haiku 4.5 en sortie.
• Cache — $0.15 par million pour un succès de cache Muse Spark 1.2, soit une remise de 88 % ; $0.10 par million pour une lecture de cache Claude Haiku 4.5, soit une remise de 90 %, avec les écritures de cache facturées à $1.25.
• Contexte — 1 048 576 tokens contre 200 000. Une différence de 5,2×, et le plus grand écart entre les deux.
• Sortie maximale — Claude Haiku 4.5 déclare un plafond de 64 000 jetons ; le point de terminaison Muse Spark 1.2 ne déclare aucune longueur maximale de complétion, ce qui est assez inhabituel pour mériter d'être testé plutôt que supposé.
• Raisonnement — obligatoire sur Muse Spark 1.2, avec cinq niveaux d’effort, de minimal à xhigh, et une valeur par défaut de medium ; optionnel sur Claude Haiku 4.5, qui est un modèle non-raisonnant jusqu’à ce que vous activiez la réflexion étendue et lui attribuiez un budget de raisonnement.
• Entrées — Meta prend en charge le texte, les images, la vidéo, l'audio et les PDF ; Claude Haiku 4.5 accepte le texte et les images. Les deux renvoient du texte.
• Poids et fournisseurs — tous deux fermés. Muse Spark 1.2 n'est servi que par la propre API Model de Meta ; Claude Haiku 4.5 est disponible auprès du fournisseur et via les revendeurs et agrégateurs cloud habituels.
• Âge — Muse Spark 1.2 n'a que quelques jours. Claude Haiku 4.5 est en production depuis le 15 octobre 2025, avec une date de coupure des connaissances de juillet 2025 et neuf mois d'expérience de terrain derrière lui.
L'écart de l'indice est réel. Le chiffre que tout le monde citera ne l'est pas.

Artificial Analysis attribue à Muse Spark 1.2 un score de 54 sur son Intelligence Index, soit un rang #13 sur 185. Son score actuel pour Claude Haiku 4.5 est de 24. Mettez-les côte à côte et vous obtenez un titre ; mais regardez ce que ces entrées sont réellement, et le titre s'effondre.
Le 54 est le score de Muse Spark 1.2 évalué au réglage xhigh, son réglage de raisonnement le plus coûteux. Le 24 est le score de Claude Haiku 4.5 évalué comme modèle sans raisonnement — réflexion désactivée — et Artificial Analysis le signale comme une estimation plutôt qu’une exécution terminée. Sur une version antérieure du même indice, avant la repondération v4.1, Artificial Analysis attribuait un score de 55 à Claude Haiku 4.5 avec le raisonnement activé et un score de 42 sans. Ces chiffres plus anciens ne peuvent pas non plus être comparés à 54, car les versions de l’indice sont rééchelonnées et un score de l’ère v3 n’est pas un score v4.1.
Donc l'affirmation honnête est plus restreinte que ce que le classement laisse paraître : Muse Spark 1.2 à effort maximal obtient un score de 54 sur l'indice actuel ; il n'existe aucun score v4.1 publié pour Claude Haiku 4.5 avec la réflexion étendue activée, donc aucune comparaison en conditions équivalentes de ces deux modèles à pleine puissance n'existe encore. Quiconque vous montre 54 contre 24 compare un modèle en pleine délibération à un modèle à qui l'on a dit de ne pas délibérer.
Lorsque le fournisseur a publié un chiffre, celui-ci est précis : Claude Haiku 4.5 obtient 73,3 % sur SWE-bench Verified, en moyenne sur 50 essais avec un budget de réflexion de 128K. C’est un chiffre du fournisseur, et le budget de réflexion qu’il contient est énorme pour un modèle commercialisé sur la rapidité — mais c’est la même évaluation que l’industrie cite pour les modèles de pointe, et cela place Haiku dans une catégorie que son prix ne laisse pas suggérer. Les revendications équivalentes de Meta pour Muse Spark 1.2 sont Terminal-Bench 2.1 à 82,9 % et DeepSWE v1.1 à 59,3 %, également réalisées par le fournisseur, sur le propre banc d’essai de Meta, chaque concurrent étant associé à son propre produit agent. Deux fournisseurs, deux références, aucun chevauchement. Il n’existe actuellement aucune évaluation unique sur laquelle ces deux modèles ont un score publié par le même évaluateur.
Quatre chiffres de latence, deux histoires différentes

La latence est là où le cadrage « même prix » cesse d'être une curiosité et devient une décision, et c'est aussi là où la source de mesure importe le plus.
Dans le banc de test, Artificial Analysis enregistre un temps jusqu'au premier token de 26,12 secondes pour Muse Spark 1.2 en xhigh, et de 1,00 seconde pour Claude Haiku 4.5. Un écart de 26×, et si c'était là tout le tableau, la comparaison serait déjà terminée.
En production, c'est l'inverse. Sur sept jours de trafic réel sur OrcaRouter — des appelants utilisant l'effort qu'ils veulent réellement — Claude Haiku 4.5 affiche un délai p50 jusqu'au premier token de 3,84 secondes et un p95 de 10,00 secondes, à 214 tokens par seconde et un taux d'erreur de 1,0 %. Muse Spark 1.1, la version du modèle de Meta présente dans le catalogue, affiche un p50 de 1,84 seconde et un p95 de 6,00 secondes, à 519 tokens par seconde sans erreur enregistrée. Sur le trafic en direct, le modèle de Meta est le plus rapide.
Les deux ensembles de chiffres sont vrais et ils mesurent des choses différentes. Le chiffre de laboratoire correspond à chaque modèle en délibération maximale avec un cache froid, ce qui est un test équitable du plafond et un mauvais test pour un chat. Le chiffre de production inclut les succès de cache, les prompts courts, les faibles niveaux d'effort et tout ce que font les applications réelles, ce qui est un test équitable de la médiane et aucun test du pire cas. Le piège consiste à citer l'un et à raisonner sur l'autre. Si vous dimensionnez un délai d'attente côté utilisateur, le p95 est votre chiffre. Si vous vous demandez ce qu'une étape agentique profonde coûte en temps d'horloge, le chiffre de référence est plus proche de la vérité — et l'avertissement honnête est qu'aucun chiffre de production de ce type n'existe encore pour Muse Spark 1.2 lui-même, car il est trop récent et pas encore largement routé.
Les deux laboratoires vous ont vendu un sous-agent. Ils voulaient dire des choses différentes.
Le discours du fournisseur sur Claude Haiku 4.5 était explicite concernant la hiérarchie : les modèles de classe Sonnet planifient et orchestrent, tandis que les instances Haiku exécutent en parallèle en dessous. Bon marché, rapides, jetables, nombreuses à la fois. La conception du produit suit cette logique — une fenêtre de 200K est largement suffisante pour une sous-tâche délimitée et délibérément insuffisante pour un dépôt entier, la réflexion étant désactivée par défaut, car un travailleur qui délibère est un travailleur qui coûte de l'argent à l'orchestrateur, et le marketing du fournisseur lui-même désigne le chat en temps réel, le service client et la programmation en binôme comme cibles.
Le discours de Meta pour Muse Spark 1.2 revendique les deux extrémités de la même hiérarchie. Le texte de Meta affirme que le modèle peut être l'agent principal qui rassemble le contexte, planifie et délègue, ou un sous-agent s'exécutant en parallèle sous un agent principal. Muse Code, l'agent terminal lancé en même temps, coordonne plusieurs sous-agents persistants par tâche dans des worktrees isolés, sur un runtime à journal d'événements rejouable à l'identique. La fenêtre d'un million de tokens et le raisonnement en continu sont ce dont un planificateur a besoin ; ce sont exactement ce que l'on ne choisirait pas pour un worker en éventail, car chaque instance parallèle paie pour une délibération que vous n'avez pas demandée.
Si on lit cela comme de l’architecture plutôt que comme du marketing, la vraie différence est la suivante : le fournisseur a construit un travailleur et s’attend à ce que vous apportiez un orchestrateur ; Meta a construit un orchestrateur et prétend qu’il peut aussi faire office d’exécutant. Si vous avez déjà une hiérarchie, l’expérience intéressante ne consiste pas à choisir entre les deux — mais à utiliser Muse Spark 1.2 pour la planification et Claude Haiku 4.5 pour l’exécution, une configuration qu’aucun des deux fournisseurs ne vous vendra comme un package.
Ce que coûte une véritable étape sur chacun.
Les tarifs par million ne décident rien sur les modèles de raisonnement, car le modèle choisit combien de jetons dépenser. Facturez plutôt l'étape.
Prenons une tâche de code ciblée : 60 000 jetons de contexte de dépôt en entrée, 3 000 jetons de patch en sortie. À froid, Claude Haiku 4.5 coûte 0,060 $ en entrée plus 0,015 $ en sortie — 7,5 cents. Muse Spark 1.2 coûte 0,075 $ plus 0,013 $ — 8,8 cents. Assez proche pour être du bruit, exactement comme le taux mixte promis.
Ajoutez maintenant ce que le taux mixte masque. Muse Spark 1.2 ne peut pas désactiver le raisonnement, et à son réglage moyen par défaut, une étape comme celle-ci émet plausiblement quelques milliers de jetons de raisonnement avant le correctif — ils sont facturés comme sortie. Ajoutez 3 000 et la même étape revient à 0,075 $ + 0,026 $ = 10,1 cents, soit environ 35 % de plus que Haiku sur des entrées identiques. Claude Haiku 4.5 avec le raisonnement désactivé ne paie rien pour la délibération et reste à 7,5 cents ; avec un budget de raisonnement important, il dépassera Muse Spark 1.2, car Claude Haiku 4.5 facture 5,00 $ par million de jetons de sortie contre 4,25 $ pour Meta.
Le caching change encore la donne. Gardez le contexte du référentiel stable pour qu'il touche le cache et que l'entrée de Haiku tombe à 0,006 $ et celle de Muse Spark 1.2 à 0,009 $ — le côté entrée cesse complètement de compter et toute la comparaison devient une bataille autour des jetons de sortie, c'est-à-dire une bataille autour de la quantité de réflexion de chaque modèle. Sur une charge de travail qui répète le contexte, la stabilité de la clé de cache vaut plus que le choix du modèle, et cela est vrai pour ces deux modèles.
La fenêtre de 1M est le seul endroit où le calcul ne tient pas. Tout ce qui nécessite réellement plus de 200 000 tokens en un seul appel ne peut pas être exécuté sur Claude Haiku 4.5, quel qu'en soit le prix. Soit vous découpez et orchestrez — c'est ce que le fournisseur prévoit — soit vous utilisez un modèle avec la place nécessaire.
Essayer les deux sans deuxième contrat.

Claude Haiku 4.5 figure dans le catalogue OrcaRouter à 1,00 $ et 5,00 $ — le prix catalogue du fournisseur, car OrcaRouter applique une marge de 0 % et transmet les prix des fournisseurs sans modification, ce qui signifie également qu'un changement de prix du fournisseur est en vigueur chez nous le jour même plutôt qu'au prochain cycle contractuel. Les chiffres de latence en production ci-dessus proviennent de cette même couche de routage.
Muse Spark 1.2 ne figure pas dans le catalogue. L'API Model de Meta est actuellement le seul endroit où l'appeler, donc une véritable comparaison directe aujourd'hui implique une intégration via nous et une intégration directe avec Meta. Muse Spark 1.1 est hébergé, aux mêmes 1,25 $ et 4,25 $ que Meta facture pour la 1.2, ce qui en fait un substitut raisonnable pour le profil de coûts et de latence de la famille, mais pas pour les gains de codage que la 1.2 est censée apporter. Lorsque la 1.2 deviendra routable, la comparaison se réduira à un changement de chaîne de modèle sur une ligne avec la même clé — et pour l'expérience orchestrateur-plus-worker décrite plus haut, le DSL de routage permet de relier un planificateur et un worker fan-out en un seul appel plutôt que de construire le transfert vous-même.
Choisissez selon la forme du travail, pas le score.
Choisissez Claude Haiku 4.5 lorsque le travail est délimité et que l'utilisateur attend. Agents de support, classification, extraction, chat, complétions de programmation en binôme et le niveau de travailleurs parallèles d'une hiérarchie d'agents. C'est une valeur connue avec neuf mois de recul sur le terrain, la réflexion est facultative, donc vous ne payez pour la délibération que lorsque vous le souhaitez, et 200K suffit pour presque toute sous-tâche délimitée. Son résultat publié SWE-bench Verified indique qu'il est bien plus capable que le prix ne le laisse supposer, à condition que vous soyez prêt à dépenser le budget de réflexion qu'a utilisé ce résultat.
Choisissez Muse Spark 1.2 lorsque l'unité de travail est un dépôt plutôt qu'une requête. Refactorisations multi-fichiers, débogage étendu, génération de projet entier, boucles d'agents à long horizon où personne ne surveille un indicateur de chargement. La fenêtre d'un million de jetons élimine un problème de découpage que Haiku ne peut résoudre à aucun prix, et le raisonnement obligatoire qui le ruine pour la conversation est le bon défaut lorsqu'un mauvais plan coûte plus cher qu'un plan lent.
Ce qui devrait décider, ce n'est pas le numéro d'index. Posez plutôt deux questions : un seul appel a-t-il jamais besoin de voir plus de 200 000 jetons, et y a-t-il un humain qui attend le premier jeton ? Oui à la première pointe vers Meta. Oui à la seconde pointe vers le fournisseur. Oui aux deux signifie que vous voulez deux modèles, ce qui est la réponse honnête plus souvent que le marketing de l'un ou l'autre fournisseur ne l'admet.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
