Muse Spark 1.2 et Muse Code-1
Guides & Insights

Muse Spark 1.2 et Muse Code : le troisième modèle de Meta en quatre mois s'offre un match nul avec Grok 4.5

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Meta a publié Muse Spark 1.2 le 5 août 2026, quatre semaines après Muse Spark 1.1 et environ quatre mois après le premier Muse Spark. Cette version est arrivée avec une chose que les deux précédentes n’avaient pas : un agent de codage propre à Meta, Muse Code, livré en version bêta et co-entraîné avec le modèle sur lequel il fonctionne. Et sur le seul classement que ni Meta ni ses rivaux ne contrôlent, cette sortie place Meta à égalité avec SpaceXAI — Muse Spark 1.2 et Grok 4.5 obtiennent désormais tous deux un score de 54 sur l’Artificial Analysis Intelligence Index. Cinq jours plus tard, un développement plus important est survenu : le 10 août, Meta a annoncé qu’il ouvrirait les poids de Muse Spark 1.2 — une annonce qui, si elle se concrétise, ferait du modèle le plus puissant rival américain actuel à poids ouvert face aux modèles chinois.

Deux choses méritent d'être distinguées avant que les chiffres ci-dessous aient un sens. Le score de l'Intelligence Index, les chiffres de latence et les décomptes de jetons proviennent d'Artificial Analysis, qui mène ses propres évaluations et publie la facture ; ces données sont indépendantes. Les résultats de codage que Meta a mis en avant dans son annonce — Terminal-Bench 2.1, DeepSWE v1.1 et un benchmark interne — ont été exécutés par Meta, sur le banc d'essai de Meta, chaque modèle concurrent étant apparié à son propre produit d'agent. Les deux types de chiffres sont utiles. Ils ne constituent pas le même genre de preuve, et cet article les tient séparés.

Ce que Meta a réellement livré

Muse Spark 1.2 and Muse Code-2

L'annonce, publiée sur le blog de recherche en IA de Meta et datée du 5 août, couvre deux produits à la fois.

Muse Spark 1.2 — une mise à jour de la famille Muse Spark centrée sur le codage. Meta indique avoir augmenté la puissance de calcul d'entraînement sur les tâches de codage et élargi la diversité des environnements d'entraînement, tout en conservant la capacité d'agent général qui servait d'argument de vente à la version 1.1. Les cibles d'entraînement annoncées sont à long horizon : génération de dépôts entiers, grands projets de bout en bout, et ce que Meta appelle « auto-research », avec planification pour séquencer le travail, conditionnement par objectif pour maintenir le cap sur de nombreuses étapes, et compaction du contexte pour préserver l'état pertinent lorsqu'une session se prolonge.

Muse Code — un agent de codage dans le terminal en version bêta, installé via un script shell d’une ligne provenant du domaine développeur de Meta. Il exécute des agents d’arrière-plan asynchrones persistants qui survivent au-delà d’une session, sur un runtime local à journal d’événements que Meta décrit comme rejouable à l’identique et sûr au redémarrage, et il coordonne plusieurs sous-agents par tâche dans des arbres de travail isolés. Il est fourni avec trois compétences intégrées : /plan pour la planification soumise à approbation, /grill pour mettre à l’épreuve le travail déjà effectué, et /goal pour mener une tâche à son terme.

L'association n'est pas fortuite. Meta affirme que les deux ont été co-entraînés — le modèle a été ajusté sur des trajectoires échantillonnées par rejet issues du harnais, avec des optimisations de recette pour les objectifs, la compaction et les sous-agents. C'est la même stratégie de co-entraînement qui a produit Claude Code et Codex, et cela a une conséquence pour quiconque lit les chiffres des benchmarks : les scores de codage phares du modèle ont été produits dans le harnais contre lequel il a été entraîné. Ce n'est pas de la triche, c'est ainsi que fonctionne désormais l'évaluation agentique. Cela signifie qu'un score de 1,2 obtenu via un autre échafaudage est une question ouverte plutôt qu'une hypothèse sûre.

Le reste de la spécification est inchangé par rapport à la 1.1, qui est elle-même informative. Le contexte reste à 1 048 576 jetons. Le raisonnement reste obligatoire à travers cinq niveaux d’effort — minimal, low, medium, high, xhigh — avec medium par défaut ; il n’existe aucune configuration où l’on obtient les poids sans payer une certaine délibération. Au lancement, les poids étaient fermés, sans dépôt Hugging Face, et l’API Model de Meta était le seul endroit propriétaire pour l’appeler. Cela doit maintenant changer : le 10 août, Meta a annoncé qu’il ouvrira les poids, renversant ainsi la politique de poids fermés qui a régi les trois premières versions de Muse Spark.

43, puis 51, puis 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis attribue à Muse Spark 1.2 un score de 54 sur son Intelligence Index avec le réglage de raisonnement xhigh, le classant 13e sur 185 modèles, contre une médiane de catégorie de 32. L'indice est un composite pondéré de neuf évaluations — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR — réparties équitablement entre agents, codage, capacité générale et raisonnement scientifique.

Lue comme une série plutôt que comme un instantané, la trajectoire de Meta est la véritable histoire. Le Muse Spark original a obtenu 43 en avril. Muse Spark 1.1 a atteint 51 le 9 juillet, soit un gain de huit points en un trimestre. Muse Spark 1.2 ajoute trois points de plus en moins d'un mois. Meta a progressé de 11 points d'indice en quatre mois et publie désormais plus vite que l'écosystème d'évaluation ne peut suivre — il n'y a toujours pas de détail publié par benchmark pour 1.2, et aucun record Design Arena pour lui, alors que 1.1 a les deux.

Cinquante-quatre points placent Meta au niveau de Grok 4.5, le modèle que SpaceXAI a publié un jour avant Muse Spark 1.1, et derrière un groupe de tête serré : Claude Opus 5 à 61, Claude Fable 5 à 60, GPT-5.6 Sol à 59. L'écart avec le sommet est de six ou sept points. L'écart par rapport au niveau où Meta a commencé l'année est de onze. Que cela se réduise dépend du maintien du rythme, et Meta suit actuellement un cycle de sortie de quatre semaines.

Une égalité sur un indice composite ne signifie pas pour autant une égalité sur un poste, et il vaut la peine de préciser ce que le 54 tranche et ne tranche pas. Il tranche que Muse Spark 1.2 se situe au même niveau que Grok 4.5 en termes de capacité agrégée. Il ne dit pas lequel écrit de meilleurs correctifs, car le sous-indice de codage qui permettrait de le déterminer n'a pas encore été publié pour la 1.2.

Les numéros de codage de Meta, lisez attentivement.

L'annonce de Meta est en tête sur trois graphiques. Sur ses propres exécutions, rapportées en pass@1 sur cinq tentatives, chaque modèle concurrent étant apparié à son propre produit d'agent :

Terminal-Bench 2.1 — 82,9 % pour Muse Spark 1.2, contre 76,2 % pour la 1.1. Claude Opus 5 est en tête avec 86,7 %.

DeepSWE v1.1 — 59,3 %, contre 53,0 %.

Le benchmark interne de codage de Meta — 70,6 %, en hausse par rapport à 68,3 %.

Les deltas sont la partie crédible. Des gains de 6,7 points sur Terminal-Bench et de 6,3 sur DeepSWE, mesurés de la même manière sur le même harnais par la même équipe à un mois d'intervalle, constituent une lecture raisonnable de l'ampleur de l'amélioration de 1.2 par rapport à 1.1 sur ce que Meta optimisait. Le classement inter-fournisseurs est la partie à prendre avec des pincettes : l'appariement des harnais est une variable libre majeure, et un laboratoire qui règle son propre harnais en parallèle de son propre modèle n'est pas en mesure de régler celui des autres aussi bien. Meta était deuxième sur sa propre diapositive, ce qui, à tout le moins, n'est pas la forme habituelle d'un benchmark de fournisseur, mais aucun tiers n'a reproduit ne serait-ce qu'une partie de ces résultats à l'heure où j'écris ces lignes.

La deuxième liste de prix

La chose la plus importante de cette version ne figure pas sur les graphiques de référence. Muse Spark 1.2 est livré avec deux grilles tarifaires.

Niveau standard — 1,25 $ par million de jetons d’entrée, 0,15 $ par million en cas de succès de cache, 4,25 $ par million de jetons de sortie. Inchangé par rapport à 1.1, au centime près. Limite de débit d’environ 3 000 requêtes par minute. Le grounding de recherche web est facturé séparément à 2,50 $ pour mille requêtes.

Palier contributeur — 0,10 $ en entrée, 0,002 $ en entrée en cache, 0,20 $ en sortie. C'est 12,5× moins cher en entrée et 21,25× moins cher en sortie. Le prix d'entrée est l'autorisation donnée à Meta d'entraîner ses futurs modèles sur votre trafic, ainsi qu'un plafond de 60 requêtes par minute — soit 2 % du budget standard.

À 0,10 $ et 0,20 $, Muse Spark 1.2 casserait les prix de presque tous les modèles proches de la frontière sur le marché, y compris le niveau économique à poids ouverts contre lequel il perd par ailleurs sur le prix. C'est le chiffre intéressant de ce lancement, et ce n'est pas vraiment une décision tarifaire. Soixante requêtes par minute excluent d'emblée la plupart des schémas de fan-out en production, ce niveau visant donc l'expérimentation et le travail en petite équipe plutôt que le service. Et « nous pouvons nous entraîner sur votre trafic » est une question pour celui qui valide la gouvernance des données dans votre organisation, pas pour celui qui choisit les modèles. Traitez-le comme une revue juridique avec une remise attachée, pas comme une SKU moins chère.

Ce que le 54 coûte à produire

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publie ce que coûtent ses propres évaluations, et c'est dans cette colonne que se dessine la forme de Muse Spark 1.2. Terminer la suite de neuf benchmarks a coûté 637,85 $ et consommé 95 millions de jetons de sortie, contre 548,07 $ et 94 millions pour Muse Spark 1.1 — avec une tarification par jeton identique. Les 16 % supplémentaires sont pure délibération.

Les chiffres de latence évoluent dans le même sens. Mesuré à xhigh, le temps jusqu'au premier jeton est de 26,12 secondes pour la 1.2 contre 2,90 secondes pour la 1.1, et la vitesse de sortie chute de 213,5 à 165,0 jetons par seconde. Meta a gagné trois points d'indice grâce au temps de réflexion, et la conception à raisonnement obligatoire fait qu'on ne peut pas refuser l'achat — seulement choisir la part qu'on en assume.

Ce chiffre de 26 secondes sera mal cité, alors voici la correction à l'avance : il s'agit d'une mesure au niveau d'effort le plus coûteux que le modèle expose, et l'API utilise par défaut le niveau moyen. À titre de référence issue du trafic réel plutôt que d'un banc d'essai, Muse Spark 1.1 servi via OrcaRouter — quel que soit l'effort réellement demandé par les appelants — affiche un p50 de 1,84 seconde pour le temps jusqu'au premier token sur 7 jours et un p95 de 6,00 secondes, à 519 tokens par seconde et avec un taux d'erreur nul. La latence de référence au niveau d'effort maximal et la latence de production au niveau d'effort par défaut sont des grandeurs différentes, et elles diffèrent généralement d'un ordre de grandeur. Lisez 26,12 s comme le plafond du raisonnement profond, et non comme ce que ressentira une requête.

Où vous pouvez l'appeler aujourd'hui

Muse Spark 1.2 est fourni par la propre API Model de Meta et, à l'heure actuelle, nulle part ailleurs — il n'y a toujours pas de dépôt Hugging Face et il n'est pas dans le catalogue OrcaRouter. C'est ce que l'annonce du 10 août devrait changer : Meta dit que les poids seront ouverts 'dans les semaines à venir', et une fois que ce sera le cas, la question de la disponibilité passe de « où est-ce servi ? » à « quels poids, sous quelle licence, et dans quels runtimes ». Muse Spark 1.1 figure dans le catalogue OrcaRouter, à 1,25 $ et 4,25 $ — les mêmes montants que Meta facture, car OrcaRouter applique une marge de 0 % et transmet directement le prix catalogue du fournisseur.

Cela importe plus pour la comparaison que pour le modèle lui-même. Si vous construisez un modèle de coût pour cette version, les modèles auxquels vous la compareriez — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — se trouvent derrière une seule clé au prix catalogue, de sorte que le chiffre dans votre feuille de calcul est le chiffre sur la facture, et qu’une baisse de prix du fournisseur s’applique le jour même plutôt qu’après un renouvellement. Pour Muse Spark 1.2 spécifiquement, aujourd’hui la réponse est le point de terminaison de Meta, un deuxième contrat, et une facture séparée — et une fois les poids publiés, une installation auto-hébergée devient une troisième option.

Qu'est-ce qui a changé le 10 août

Cinq jours après la sortie, la position de Meta vis-à-vis de son propre produit phare a fait volte-face. Dans une annonce datée du 10 août, Meta a déclaré qu'il ouvrirait les poids de Muse Spark 1.2 « dans les semaines à venir », ce qui en ferait la première version de Muse Spark qu'une équipe pourrait exécuter elle-même. Cette déclaration émane de la direction, mais rien n'a été livré : il n'y a pas encore de dépôt Hugging Face, et la date exacte, le nombre de paramètres ainsi que la licence ne sont pas confirmés.

Les enjeux sont la course aux poids de pointe. Muse Spark 1.2 obtient un score de 54 sur l’Artificial Analysis Intelligence Index — au-dessus de tous les modèles américains à poids ouverts actuellement téléchargeables — donc si les poids arrivent comme promis, ce serait le plus puissant rival américain à poids ouverts des laboratoires chinois, le cadre que Zuckerberg a longuement défendu le 10 août dans un essai de 6 500 mots accusant les restrictions américaines sur les données d’entraînement de céder la première place en matière de poids ouverts aux laboratoires étrangers. Ce pivot a déjà une première livraison : Muse Glimmer, un modèle de 30 milliards de paramètres publié le même jour sous licence Apache 2.0, distillé depuis Muse Spark et conçu pour des charges de travail agentiques locales. Les propres benchmarks de Meta le placent devant les Gemma4-31B de Google et Qwen3.6-27B sur les tâches agentiques ; ces chiffres émanent du fournisseur et n’ont pas encore été reproduits.

Ce à quoi l’annonce n’a pas répondu

Aucun indice de codage indépendant.Artificial Analysis publie un composite pour 1.2 mais pas encore les sous-indices de codage et d'agentique qu'elle a publiés pour 1.1 (71,3 et 37,5 respectivement). Puisque le travail agentique était de loin la dimension la plus faible de 1.1, et que le codage agentique est exactement ce que 1.2 prétend avoir corrigé, c'est ce chiffre qui trancherait la sortie.

Aucune reproduction des résultats du banc d'essai. Chaque chiffre de codage de l'annonce est issu de Meta. Personne n'a encore publié de scores Muse Spark 1.2 provenant d'un environnement neutre.

Aucune vérification multimodale.La fiche Muse Spark annonce des entrées texte, image, vidéo, audio et PDF. L'évaluation indépendante couvre le texte et l'image. La messagerie 1.2 de Meta est passée presque entièrement au travail logiciel, et le cas d'utilisation multimédia 1.1, explicitement commercialisé, n'a pour l'instant ni marketing ni mesure derrière lui.

Aucun historique de débit. Le volume sur le point de terminaison est encore trop faible pour que les statistiques de latence habituelles se remplissent.

Que regarder au cours des quatre prochaines semaines

Quatre éléments décideront si cette version est bien ce que Meta affirme. Le premier est un score agentique indépendant pour la 1.2 — si le sous-indice qui était à 37,5 sur la 1.1 a nettement évolué, l’argument du codage est réel. Le deuxième est de savoir si quelqu’un reproduit le résultat Terminal-Bench en dehors de Muse Code ; un modèle qui n’est performant que dans son propre environnement est un produit, pas une capacité. Le troisième est ce qu’il advient du palier contributeur : si le plafond de 60 requêtes se desserre, un modèle proche de la frontière à 0,10 $ en entrée et 0,20 $ en sortie change l’arithmétique du palier budgétaire d’une manière qu’un gain de trois points à l’indice ne ferait jamais. Le quatrième est la promesse des poids : Meta dit que les poids de Muse Spark 1.2 seront ouverts « dans les semaines à venir », et le fait que le dépôt arrive dans ce délai — sous quelle licence et à quelle vitesse les environnements d’exécution locaux l’adoptent — décidera si le virage vers des poids ouverts est réel.

Et si le rythme se maintient, Muse Spark 1.3 est attendue début septembre. Au vu de ces éléments, le chiffre à surveiller lors de sa sortie n'est pas le score de l'indice. C'est de savoir si Meta peut ajouter des capacités sans ajouter encore vingt secondes de réflexion au début de chaque requête. Le premier fruit de ce pivot est déjà là : Muse Glimmer, un modèle open-weight de 30 milliards de paramètres que Meta a publié le 10 août sous licence Apache 2.0, conçu pour exécuter des agents localement — l'aperçu le plus proche à ce jour de ce à quoi ressemble un Muse Spark 1.2 ouvert.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement