
Muse Code vs Muse Spark 1.1 : ce que la mise à niveau de 6,7 points de Meta mesure réellement
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 par million de tokens · 28 tok/s
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2770 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
Faites d'abord la soustraction. Le deck de lancement de Meta pour Muse Code, l'agent de codage en terminal qu'il a expédié le 5 août 2026, rapporte 82,9 % sur Terminal-Bench 2.1 et attribue cela à un gain de 6,7 points par rapport à Muse Spark 1.1, le modèle que la plupart des personnes qui lisent ceci paient déjà. Retirez 6,7 de 82,9 et vous obtenez 76,2 — ce n'est pas un chiffre que Meta a publié, mais c'est exactement le score figurant sur le classement public Terminal-Bench 2.1 pour Muse Spark 1.1 à l'effort xhigh, soumis en juillet, réalisé avec le harnais mini-SWE-agent de Princeton.
Cette coïncidence est le fait le plus utile de cette comparaison, car mini-SWE-agent est un échafaudage délibérément minimal — quelques centaines de lignes, pas de sous-agents persistants, pas de journal d’événements, pas de compétences de planification. Le 82.9% de Meta est Muse Spark 1.2 s’exécutant dans un agent spécialement conçu avec lequel Meta a co-entraîné le modèle. Si ces deux lignes représentent l’écart de 6.7 points, alors le gain générationnel principal est une mise à niveau du modèle et une mise à niveau de l’infrastructure regroupée en un seul chiffre, et Meta n’a rien publié qui les sépare.
Meta n'a pas précisé quel harnais elle a utilisé pour sa baseline 1.1, donc la comparaison est suggestive plutôt que prouvée. Mais cela recadre la décision devant quiconque appelle actuellement Muse Spark 1.1 via une API, ce qui est la version honnête de cette confrontation : vous ne choisissez pas entre deux modèles. Vous choisissez entre un modèle que vous pilotez vous-même et un agent qui pilote un modèle plus récent pour vous, et une seule de ces deux choses a été mesurée par quelqu'un d'autre que Meta.
Ce ne sont pas la même catégorie, et la fiche technique le dit.
La moitié de la confusion autour de cette association vient du fait de traiter Muse Code comme une version de modèle. Ce n'en est pas une. C'est une CLI, et c'est Muse Spark 1.2 qu'elle appelle.
• Ce que c'est — Muse Code est un agent de terminal installé avec une seule ligne (curl -fsSL https://dev.meta.ai/install.sh | bash) ; Muse Spark 1.1 est un point de terminaison de modèle que vous appelez depuis votre propre code, votre propre framework d'agents, ou toute CLI qui accepte une URL de base personnalisée.
• Modèle sous-jacentMuse Code exécute Muse Spark 1.2, co-entraîné avec l'agent ; Muse Spark 1.1 est la génération de juillet, toujours servi et toujours répertorié.
• Où il s'exécute — Muse Code est uniquement pour macOS et Linux, uniquement en terminal, sans interface graphique ni extension IDE ; Muse Spark 1.1 s'exécute partout où HTTPS fonctionne, y compris sur Windows.
• Entrées — Muse Code prend en entrée un dépôt et une invite ; Muse Spark 1.1 accepte du texte, des images, de la vidéo, de l'audio et des documents PDF dans un contexte unique de 1 048 576 jetons et renvoie du texte.
• Statut — Muse Code est en bêta publique et est étiqueté comme tel ; Muse Spark 1.1 est en disponibilité générale depuis juillet 2026 et transporte du trafic de production réel.
• Prix catalogue — les deux facturent via l’API Meta Model à 1,25 $ par million de tokens d’entrée, 0,15 $ pour l’entrée en cache et 4,25 $ pour la sortie sur le palier standard. La grille tarifaire est la même.
La dernière ligne est celle qui surprend les gens, et elle tue l'hypothèse évidente. Adopter Muse Code ne coûte pas plus par token que ce que vous exécutez déjà. Ce que cela coûte se mesure dans d'autres monnaies — le support des plateformes, la latence, la modalité et, sur le palier économique, votre code source. Ce sont les quatre axes sur lesquels il vaut la peine de débattre.
Le benchmark où ils divergent, lu avec le harnais attaché.

Meta a publié deux écarts générationnels par rapport à Muse Spark 1.1 : +6,7 points sur Terminal-Bench 2.1 et +6,3 sur DeepSWE 1.1. Les deux sont rapportés par le fournisseur, proviennent de graphiques publiés sous forme d’images sans note méthodologique, et aucun n’a été reproduit par un tiers. En les retranchant, les références implicites de Meta pour la 1.1 sont d’environ 76,2 % et 53,0 %.
Maintenant, placez les 82,9 % de Meta à côté du classement qu'elle n'a pas cité. Le classement public Terminal-Bench 2.1, au moment de la rédaction, présente Claude Code associé à Claude Fable 5 à 83,8 % ± 1,2 %, Codex avec GPT-5.5 à 83,1 % ± 1,1 %, Terminus 2 avec Claude Fable 5 à 80,4 %, Cursor CLI avec Grok 4.5 à 79,3 % et mini-SWE-agent avec Muse Spark 1.1 à 76,2 % en huitième position. Le score de 82,9 % auto-déclaré par Muse Code se classerait troisième — derrière deux paires agent-modèle qui n'apparaissent nulle part dans le deck de Meta, qui compare plutôt avec Claude Opus 5 à 86,7 %, GPT-5.6 Terra à 81,8 % et Grok 4.5 à 81,6 % dans des exécutions séparées à effort maximal.

Deux tableaux, un même benchmark, des chiffres qui ne concordent pas — et une troisième échelle, entièrement différente, si l'on regarde Artificial Analysis, dont {{1}}l'évaluation indépendante de Terminal-Bench v2.1 culmine à près de 89,5 % pour GPT-5.6 Sol, contre un plafond de 83,8 % sur le classement public{{/1}}. Aucune de ces parties ne ment. Une ligne de Terminal-Bench est un score pour un harnais, plus un modèle, plus un réglage d'effort, plus une allocation de calcul, et remplacer l'un de ces éléments fait varier le résultat d'une ampleur supérieure à l'écart total que Meta revendique comme une génération.
C'est pourquoi le chiffre intéressant sur le tableau public n'est pas la colonne de précision, mais la colonne de coût. Muse Spark 1.1 a terminé son exécution à 76,2 % pour 198,05 $. Claude Code avec Claude Fable 5 a obtenu ses 83,8 % pour 552,67 $, et Codex avec GPT-5.5 a payé 2 059,19 $ pour 83,1 %. Cela représente 7,6 points de précision pour 2,8 fois l'argent dans le premier cas et environ 10 fois dans le second — mesuré par le même opérateur, sur les mêmes tâches, selon les mêmes règles, ce qui est exactement une comparaison de pommes avec pommes que le graphique de Meta ne vous donne pas. Le tableau déduit également des points pour les tâches résolues en contournant l'environnement ; la soumission de Muse Spark 1.1 ne montre aucune déduction de ce type, tandis que l'exécution de Grok 4.5 de Cursor CLI porte une déduction de 9 points.
Meta n'a publié aucun chiffre de coût pour ses 82,9 %.
Ce que Muse Spark 1.1 fait déjà et que Muse Code ne peut pas faire
L'argument de Muse Code est qu'un agent co-entraîné bat « un wrapper générique autour d'un modèle externe » — c'est la formulation de Meta, l'affirmation de Meta, non testée par quiconque. C'est une affirmation raisonnable. Elle vise également une lacune que Muse Spark 1.1 a été spécifiquement conçu pour combler.
Muse Spark 1.1 parle nativement le Model Context Protocol, gère ses propres connexions MCP sans framework externe, orchestre en interne les rôles d’agent principal et de sous-agent, et généralise, en zero-shot, à de nouveaux outils et compétences personnalisées. Les chiffres de lancement de Meta pour ce modèle étaient des chiffres d’utilisation d’outils : 88,1 sur MCP Atlas pour une utilisation d’outils à grande échelle — devant le 82,2 qu’il a rapporté pour Claude Opus 4.8 et le 75,3 pour GPT-5.5 — et 54,7 sur JobBench. Tous rapportés par le fournisseur, tous datés de juillet, aucun reproduit indépendamment. Le point reste valable : 1.1 n’est pas un modèle conversationnel auquel quelqu’un a boulonné un agent. Glissez-le dans OpenCode, Cline ou n’importe quel CLI acceptant un endpoint personnalisé, et vous avez un agent dès aujourd’hui.
Et puis il y a tout ce que Muse Code ne peut structurellement pas toucher. Muse Spark 1.1 raisonne sur des images, des vidéos, de l'audio et des PDFs dans une même fenêtre de contexte. Un agent de codage en terminal n'a aucune utilité pour cette surface et aucun moyen de l'exposer. Si votre charge de travail est une maquette de design transformée en composants, un appel de support retranscrit et trié, ou un cahier des charges de 400 pages recoupé avec une implémentation, la chose la plus récente est la moins capable — et le positionnement de Meta pour la génération 1.2 est passé de « recherche profonde multimodale sur supports mixtes » à des refactorisations multi-fichiers et à la génération de dépôts entiers, sans aucun résultat vidéo ou audio publié pour 1.2 par quiconque.
La véritable asymétrie va dans l'autre sens, et c'est une propriété d'exécution plutôt qu'une capacité. Muse Code ajoute chaque appel de modèle, exécution d'outil, approbation et modification à un journal d'événements local, ce qui, selon Meta, rend une session rejouable à l'identique et sûre en cas de redémarrage : plantez-la et l'agent reprend là où il s'est arrêté au lieu de redériver son contexte. Ses agents d'arrière-plan persistent à travers la session plutôt que d'être créés puis détruits à chaque sous-tâche. La preuve de Meta est une seule étude de cas — une exécution de 24 heures avec plus de 1 000 appels d'outils optimisant des kernels GPU sur du matériel NVIDIA Hopper. Aucun chiffre d'accélération n'a été publié, donc la durée est la revendication. Si vous avez déjà perdu une migration de neuf heures parce que le harnais avait oublié ce qu'il faisait à l'étape 300, c'est une vraie chose à vouloir, et aucun support MCP dans le modèle ne vous la donne.
Même prix catalogue, jusqu'à ce que vous lisiez le deuxième palier

Étant donné que le palier standard est identique des deux côtés, l'argument tarifaire dans cette comparaison se joue entièrement sur le palier que Meta a introduit avec Muse Code. Le palier contributeur coûte 0,10 $ par million de tokens d'entrée, 0,002 $ pour l'entrée en cache et 0,20 $ pour la sortie — soit 12,5 fois moins cher à l'entrée, 21 fois en sortie, 75 fois pour l'entrée en cache — en échange d'une autorisation explicite d'utiliser vos invites et vos réponses pour entraîner les futurs modèles Meta. Le trafic du palier standard, affirme Meta, n'est pas utilisé de cette façon.
Exécutez une étape d'agent réaliste avec ce contexte — 60 000 jetons de contexte de dépôt en entrée, 3 000 jetons de plan et patch en sortie — et mille étapes coûtent 87,75 $ sur le niveau standard à froid, 21,75 $ avec le contexte de dépôt qui atteint le cache, 6,60 $ sur le niveau contributeur à froid, et 0,72 $ sur le niveau contributeur avec un cache chaud. L'exécution de noyau de 24 heures de Meta avoisine quatre-vingt-dix dollars sur le niveau qui protège votre code et moins d'un dollar sur celui qui ne le protège pas.
Ce n'est pas un choix de facturation. Les invites d'un agent de codage sont votre base de code — les API internes, le commentaire expliquant pourquoi le contournement existe, tout ce que vos fixtures peuvent contenir. Sur un dépôt open-source, le niveau contributeur est presque de l'argent gratuit. Sur un dépôt propriétaire, il s'agit d'une décision de licence de données déguisée en remise, et elle doit être présentée à la personne qui approuve le traitement des données, plutôt qu'à celle qui surveille la facture cloud. Meta a fixé la remise à 12x parce que les données valent au moins autant pour Meta.
Rester sur Muse Spark 1.1 contourne entièrement la question, et il vaut la peine de savoir exactement ce que cela coûte et où. Muse Spark 1.1 figure dans le catalogue OrcaRouter à $1.25 et $4.25 — le prix de liste de Meta au centime près, car nous n'ajoutons aucune marge et répercutons directement les tarifs du fournisseur, ce qui explique également pourquoi un changement de tarif de Meta apparaît de notre côté le jour même où Meta le fait, plutôt qu'après un cycle de contrat. Notre télémétrie de production sur sept jours indique pour ce modèle un p50 du temps de premier jeton (time-to-first-token) de 1.84 secondes et un p95 de 6.00 secondes, ce qui constitue une attente bien plus utile que ce que n'importe quel banc d'essai peut vous fournir. Muse Spark 1.2 n'est pas dans notre catalogue ; il est servi directement par Meta et nulle part ailleurs, de sorte que la moitié la plus récente de cette comparaison ne dispose actuellement que d'un seul fournisseur et d'aucun chemin de basculement par construction. Si vous l'évaluez, cette exposition à un fournisseur unique fait partie de ce que vous évaluez.
Le compromis de latence dont personne ne parle dans la couverture du lancement
Artificial Analysis, mesurant indépendamment à l’effort de raisonnement maximal de chaque modèle, a chronométré le temps jusqu’au premier jeton de Muse Spark 1.1 à 2,90 secondes et celui de Muse Spark 1.2 à 26,12 secondes. La vitesse de génération est passée de 213,5 à 165 jetons par seconde. Le gain était de trois points d’Intelligence Index, de 51 à 54, et un bond de la 22e à la 13e place parmi 185 modèles.
Lu comme une sortie de modèle généraliste, c'est un mauvais compromis — neuf fois l'attente pour trois points. Lu comme le moteur d'un agent de codage, c'est évidemment le bon choix, car personne qui attend un refactoring de douze fichiers ne remarque vingt-six secondes de planification, tandis que tout le monde qui attend une complétion de chat la remarque entièrement. C'est la déclaration la plus claire de à qui chaque côté de cette comparaison s'adresse, et elle a été mesurée par un tiers plutôt qu'affirmée par Meta.
Cela signifie aussi que la bascule n'est pas gratuite, même si seul le code vous intéresse. Tout élément interactif que vous aviez connecté à Muse Spark 1.1 — complétion en ligne, bot de revue, surface de chat sur vos documents — se dégrade nettement si vous le migrez vers la génération 1.2 au prix d'un effort important. La mise à niveau est ciblée, et le ciblage a une direction.
Laquelle vous devriez réellement exécuter
Restez sur Muse Spark 1.1 si votre travail n'est pas un dépôt. Les pipelines multimodaux, l'analyse de longs contextes, la recherche multimédia, tout ce qui est interactif, tout ce qui est sur Windows, tout ce qui est déjà connecté via MCP et fonctionne. Rien dans le lancement de Muse Code ne les améliore, et la mesure de latence en aggrave au moins un.
Essayez Muse Code si votre mode de défaillance est la durée. Migrations de monorepo, mises à niveau de dépendances, refactorisations d’une semaine — des tâches que vous supervisez actuellement parce que l'agent perd le fil. Le journal des événements et les agents d'arrière-plan persistants ciblent exactement cela, et un déficit de quelques points sur un benchmark est le moins important là où l'exécution est la plus longue. Bêta, sur un clone jetable, sur un dépôt que vous pouvez vous permettre de perdre.
Faites la véritable expérience si vous cherchez à vous décider sur le modèle. Maintenez votre harnais constant et remplacez Muse Spark 1.1 par Muse Spark 1.2 en dessous. Cela isole la seule variable que le graphique de Meta regroupe, et c'est la seule façon de savoir si la prime de co-entraînement est réelle ou si 1.2 est simplement un modèle de codage compétent où que vous le placiez. Une passerelle unique en fait un changement de chaîne plutôt qu'un exercice d'approvisionnement — Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5 et Claude Fable 5 se trouvent tous derrière une même clé OrcaRouter au prix catalogue avec basculement automatique entre les fournisseurs, donc l'ensemble de comparaison ne vous coûte rien à garder sous le coude. Muse Spark 1.2 est l'exception et doit provenir de Meta.
Questions à se poser avant d'installer quoi que ce soit
Puis-je pointer Muse Code vers Muse Spark 1.1 au lieu de 1.2 ?
La documentation de lancement de Meta ne le précise pas, et les deux ont été livrés comme une paire co-entraînée, ce qui plaide contre le fait que ce soit pris en charge ou utile. La direction inverse est cependant bien documentée : Muse Spark 1.1 fonctionne dans n'importe quel agent qui accepte un point de terminaison personnalisé, et c'est ainsi que la plupart des gens l'utilisent aujourd'hui comme agent. Si votre objectif est une comparaison contrôlée, exécutez 1.1 et 1.2 dans votre banc d'essai plutôt que d'essayer de plier celui de Meta.
Le palier contributeur s'applique-t-il également à Muse Spark 1.1 ?
Meta a introduit la structure à deux niveaux avec le lancement de Muse Code et Muse Spark 1.2, et sa grille tarifaire publiée associe la tarification des contributeurs à cette version. Partez du principe que la remise 12x est une offre de la génération 1.2 jusqu'à ce que Meta en dise autrement, et facturez toute charge de travail 1.1 à 1,25 $ et 4,25 $. Si vous êtes sur OrcaRouter, vous êtes par définition au prix catalogue, il n'y a donc aucun palier de partage de données auquel adhérer ou se retirer.
L'affirmation de 6,7 points est-elle donc fausse ?
Non — ce n'est pas audité et c'est sous-spécifié, ce qui est différent. Meta pourrait bien avoir exécuté sa référence 1.1 dans un banc d'essai comparable à celui de Muse Code, auquel cas le gain est un résultat net de modèle à modèle. Mais aucune méthodologie n'a été publiée, la référence implicite tombe précisément sur le score d'un échafaudage tiers minimal, et le même benchmark produit trois échelles différentes selon qui l'exécute. Considérez +6,7 comme simple indicateur et obtenez votre propre chiffre avant de planifier en conséquence.
Qu'est-ce qui réglerait cela ?
Une seule soumission. Si Meta place Muse Code sur le classement public de Terminal-Bench 2.1 selon les mêmes règles que tout le monde — sans délais ni ressources modifiés, colonne des coûts remplie, déductions pour triche appliquées — le 82.9% devient comparable au 76.2% à côté du nom de Muse Spark 1.1 et au 83.8% en tête, et tout ce débat se résout en un après-midi. En attendant, le seul chiffre vérifié de manière indépendante dans cette confrontation appartient au modèle plus ancien, et il indique que Muse Spark 1.1 a résolu les trois quarts de Terminal-Bench 2.1 dans un échafaudage assez petit pour être lu en une seule fois, pour moins de deux cents dollars.
La deuxième chose à surveiller est plus étroite et arrive plus tôt : savoir si Artificial Analysis publie les sous-scores de codage et d'agence pour la génération 1.2, comme elle le fait déjà pour 1.1. La performance agentique était la dimension publiée la plus faible de 1.1, et de loin. C'est précisément le chiffre que Meta prétend avoir corrigé, et précisément celui que personne en dehors de Meta n'a encore mesuré.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
