
Muse Spark 1.2 vs Claude Fable 5 : ce que coûtent réellement six points d'indice
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 197 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1653Intelligence69Code60Maths
Artificial Analysis publie ce que la plupart des tableaux de référence omettent : ce qu'elle a dépensé. L'exécution de son Intelligence Index à neuf évaluations a coûté $637.85 sur Muse Spark 1.2 et $5,630.52 sur Claude Fable 5. Suite de référence identique, harnais identique, une facture 8,8 fois supérieure à l'autre. Fable 5 a obtenu 60 contre 54 pour Muse Spark 1.2.
Divisez la différence et vous obtenez le nombre qui est vraiment au cœur de cette comparaison : sur cette charge de travail, les six derniers points d'intelligence coûtent environ $832 par point. La question de savoir si vous devriez payer n'est pas une question de benchmark. C'est une question de savoir quelle part de votre trafic a réellement besoin de ces points, et la réponse pour la plupart des équipes est une fraction petite et identifiable.
Le point d'indice marginal a un prix, et il est élevé.
Les deux chiffres proviennent du même évaluateur indépendant exécutant le même composite — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR. Aucun n'est une affirmation du fournisseur. Fable 5 se classe au rang #3 sur 185 modèles ; Muse Spark 1.2 au #13, contre une médiane de classe de 32. Les deux sont bien au-dessus de la moyenne ; un seul est à la frontière.

Les prix catalogue expliquent l'essentiel de l'écart et sous-estiment le reste :
• Entrée — Muse Spark 1.2 1,25 $ par million, Claude Fable 5 10,00 $. Huit fois.
• Résultat — 4,25 $ contre 50,00 $. Près de douze fois.
• Entrée en cache — $0.15 contre $1.00. Environ sept fois plus, et Fable 5 facture également $12.50 par million pour écrire le cache, ou $20.00 pour une TTL d'une heure, tandis que Muse Spark 1.2 ne publie aucun frais distinct d'écriture de cache.
• Tarif mixte — Artificial Analysis évalue Muse Spark 1.2 à 0,78 $ par million de tokens et Fable 5 à 7,70 $. À peine moins de dix fois.
Fable 5 était le modèle le plus cher qu'Artificial Analysis ait jamais évalué lors de son lancement, et il a conservé ce titre. Il vaut la peine d'être précis sur la raison : le modèle a consommé moins de jetons de sortie que Muse Spark 1.2 pour traverser l'index — 87M contre 95M — donc toute la différence de coût vient du tarif, pas de la verbosité. Fable 5 n'est pas gaspilleur. Il est simplement tarifé comme un produit de pointe.
Traduit en une étape d'agent lisant 60 000 jetons de contexte de dépôt et écrivant 3 000 jetons de correctif : environ 8,8 centimes sur Muse Spark 1.2, environ 75 centimes sur Claude Fable 5. Mille étapes par jour, c'est 88 $ contre 750 $. Sur un an, 32 000 $ contre 274 000 $.
Là où Claude Fable 5 n'est pas remplaçable
L'argument des coûts serait unilatéral si les six points étaient toute la différence. Ce n'est pas le cas, et l'endroit où l'écart se creuse est précisément là où Meta a repositionné Muse Spark 1.2 pour concurrencer.
Fable 5 occupe la première place dans une large partie des classements en tête-à-tête de Design Arena : 1399 Elo et rang 1 en développement de jeux, 1367 et rang 1 en art ASCII, 1353 et rang 1 en génération SVG, plus rang 1 dans l’arène des agents pour le développement de jeux Godot (1344), Android natif (1318), développement de jeux par agents (1300) et diapositives HTML (1260), avec la deuxième place dans les applications web et le travail full-stack. Muse Spark 1.2 a aucune entrée Design Arena du tout — son prédécesseur a accumulé un respectable bilan de milieu de tableau (1334 en développement de jeux au rang 5, 1309 dans les catégories de code général au rang 9), mais la nouvelle version n’a pas été évaluée une seule fois.
Les indices par dimension vont dans le même sens. Artificial Analysis attribue à Claude Fable 5 un indice de codage de 76,5 et un indice agentique de 52,8. Muse Spark 1.1 se situait à 71,3 et 37,5 — cinq points de retard en codage et quinze en travail agentique. Aucune donnée par dimension n'a encore été publiée pour la 1.2, donc le constat honnête est que nous savons que l'écart composite s'est réduit de trois points et que nous ne savons pas quelle part de cela a porté sur l'axe agentique.

Le positionnement produit de Fable 5 affirme que l'avance se creuse avec la longueur et la complexité des tâches. C'est une affirmation du fournisseur, non vérifiée en l'état, mais elle est cohérente avec la forme des données indépendantes : les plus grandes marges de Fable 5 se situent dans le domaine des agents, où un modèle doit maintenir un plan cohérent sur de nombreux tours, plutôt que dans la génération en un seul passage.
Là où Muse Spark 1.2 est tout simplement la bonne réponse.
Trois choses en font le bon choix, indépendamment des six points.
• Entrée audio et vidéo.La fiche de Meta annonce du texte, des images, de la vidéo, de l’audio et du PDF en. Claude Fable 5 accepte le texte, les images et les fichiers — pas d’audio, pas de vidéo. Pour toute pipeline traitant des enregistrements ou des séquences vidéo, ce n’est pas un compromis, c’est un filtre strict. Une réserve honnête : la fiche de spécifications d’Artificial Analysis pour Muse Spark 1.2 n’enregistre que le texte et l’image comme évalués, de sorte que la surface plus large est annoncée plutôt que vérifiée indépendamment.
• Vitesse. 165,0 tokens par seconde contre 71,7. Muse Spark 1.2 diffuse la sortie bien plus de deux fois plus vite, et se classe 16e sur 185 en vitesse, alors que la médiane de la classe est de 71 — Fable 5 se situe à la médiane.
• Coût en volume. Tout dans la section précédente.
Ajoutez une quatrième option pour ceux dont les demandes sont véritablement énormes : les deux modèles annoncent environ un million de jetons de contexte — 1 048 576 pour Muse Spark 1.2, 1 000 000 pour Fable 5 — mais Muse Spark 1.2 facture un tarif fixe sur l'ensemble, tandis que la tarification de l'écriture en cache de Fable 5 signifie que conserver un large préfixe stable coûte de l'argent réel au départ avant de commencer à vous en faire économiser.
Ni l'un ni l'autre de ces modèles n'est un modèle rapide.
C'est la section que la plupart des comparatifs sautent, et elle change l'architecture plutôt que la facture.
Avec un effort de raisonnement maximal, Artificial Analysis mesure un temps jusqu'au premier token de 26,12 secondes pour Muse Spark 1.2 et de 141,26 secondes pour Claude Fable 5, avec un temps de réponse de bout en bout de 148,24 secondes pour Fable 5. Ni l'un ni l'autre ne devrait se trouver devant un utilisateur avec ces réglages.
Les chiffres de production sont bien plus cléments et méritent d'être connus. Sur OrcaRouter, Claude Fable 5 affiche un temps jusqu'au premier token (p50) de 7,04 secondes et un p95 de 10,00 secondes sur une semaine glissante — c'est du trafic réel, quel que soit l'effort demandé par les appelants, et non un benchmark au maximum. Muse Spark 1.1, à titre de référence, a un p50 de 1,84 seconde. Muse Spark 1.2 n'a pas encore de télémétrie de production.

Le point structurel : les deux modèles ont un raisonnement obligatoire. Le réglage d'effort de Fable 5 va de « low » à « max », avec « high » par défaut ; celui de Muse Spark 1.2 va de « minimal » à « xhigh », avec « medium » par défaut. Aucun des deux ne permet de désactiver le raisonnement. Si vous avez besoin de réponses en moins d'une seconde, toute cette comparaison est au mauvais rayon — c'est à cela que sert un modèle de classe Luna ou Flash-Lite.
La pile de deux modèles, avec son prix.
Présenter cela comme un choix où le gagnant rafle tout est l'erreur, car le trafic n'est pas homogène. Presque chaque agent de production a une longue traîne d'étapes routinières — lire un fichier, résumer un diff, formater un patch, décider quel outil appeler ensuite — et une courte tête d'étapes vraiment difficiles où une mauvaise réponse coûte une heure.
Prenez les mêmes mille étapes d'agent par jour. Tout sur Claude Fable 5 : environ 750 $. Tout sur Muse Spark 1.2 : environ 88 $. Répartissez 900 tâches routinières sur le modèle bon marché et 100 tâches difficiles sur le modèle coûteux : environ 79 $ plus 75 $, soit 154 $ par jour. Cela représente un cinquième de la facture tout-Fable tout en conservant les capacités de pointe pour le dixième des appels qui en ont réellement besoin — et cela fait environ 220 000 $ de différence par an sur une seule boucle d'agent.
La raison pour laquelle le split mérite d’être construit plutôt que simplement décrit est qu’il fallait auparavant deux relations fournisseurs, deux SDK et deux ensembles d’identifiants. Ce n’est plus le cas. Claude Fable 5 figure dans le catalogue OrcaRouter à 10,00 $ et 50,00 $ — prix catalogue du fournisseur, répercuté sans marge — et Muse Spark 1.1 y figure à 1,25 $ et 4,25 $ sur la même base, derrière le même point de terminaison compatible OpenAI. Le DSL de routage vous permet d’exprimer « modèle économique d’abord, escalade en cas de faible confiance ou d’échec d’une exécution de test » sous la forme d’un seul appel, plutôt que comme un code d’orchestration que vous maintenez, et la fusion de modèles vous permet d’envoyer les étapes véritablement ambiguës à un panel de modèles en même temps et de les comparer. Muse Spark 1.2 lui-même n’est pas encore dans le catalogue — Meta le fournit directement, en tant que son seul fournisseur — donc aujourd’hui, la chose la plus proche que vous puissiez construire de cette pile utilise la 1.1 sur le bras économique.
Ce détail de fournisseur unique mérite sa propre ligne dans une évaluation des risques. Claude Fable 5 dispose de plusieurs routes de service et d'un basculement automatique entre elles. Muse Spark 1.2 possède exactement un point de terminaison, exploité par Meta. S'il tombe en panne, il n'existe aucune solution de repli offrant le même modèle.
Un modèle de coût, pas un verdict
Le résultat utile de cette comparaison n'est pas « quel modèle gagne ». C'est un seuil que vous pouvez calculer pour votre propre charge de travail.
Estimez la proportion de vos appels où une réponse de classe Muse Spark 1.2 échoue alors qu'une réponse de classe Fable 5 réussit. Multipliez par ce que coûte un échec — minutes d'ingénieur, mauvais merge, boucle de réessai, client. Comparez cela aux 66 cents par étape, ce qui correspond au coût de la mise à niveau d'un seul appel de Muse Spark 1.2 vers Claude Fable 5 sur l'exemple 60K-in / 3K-out ci-dessus. Si la perte attendue d'une mauvaise réponse dépasse 66 cents, acheminez cette étape vers Fable 5. Dans le cas contraire, ne le faites pas.
Pour la plupart des équipes, ce calcul place Fable 5 sur la revue de code, la génération finale des correctifs, la planification architecturale et tout ce qui touche aux données de production, et place Muse Spark 1.2 sur tout le reste — lecture de fichiers, résumé, tri des tests, sélection d’outils, le milieu à haut volume d’une boucle d’agent où le coût est réel et les enjeux par appel ne le sont pas.
Une chose à surveiller : les classements de Design Arena et les indices par dimension pour Muse Spark 1.2, aucun des deux n’existe encore. Les preuves les plus solides de Fable 5 se trouvent précisément dans les arènes en tête-à-tête où le nouveau modèle de Meta n’a aucun antécédent. Lorsque cet antécédent apparaîtra, ce seuil évoluera — peut-être de beaucoup.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
