Muse Spark 1.2 et Muse Code-1
Guides & Insights

Muse Spark 1.2 et Muse Code : le troisième modèle de Meta en quatre mois s'offre un match nul avec Grok 4.5

Auteur

Jim Song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Meta a sorti Muse Spark 1.2 le 5 août 2026, quatre semaines après Muse Spark 1.1 et environ quatre mois après le premier Muse Spark. Cette version est arrivée avec quelque chose que les deux précédentes n'avaient pas : un agent de codage propre à Meta, Muse Code, proposé en version bêta et co-entraîné avec le modèle sur lequel il fonctionne. Et sur le seul classement que ni Meta ni ses rivaux ne contrôlent, cette sortie place Meta à égalité avec SpaceXAI — Muse Spark 1.2 et Grok 4.5 obtiennent désormais tous deux un score de 54 à l'Artificial Analysis Intelligence Index.

Deux choses méritent d'être distinguées avant que les chiffres ci-dessous aient un sens. Le score de l'Intelligence Index, les chiffres de latence et les décomptes de jetons proviennent d'Artificial Analysis, qui mène ses propres évaluations et publie la facture ; ces données sont indépendantes. Les résultats de codage que Meta a mis en avant dans son annonce — Terminal-Bench 2.1, DeepSWE v1.1 et un benchmark interne — ont été exécutés par Meta, sur le banc d'essai de Meta, chaque modèle concurrent étant apparié à son propre produit d'agent. Les deux types de chiffres sont utiles. Ils ne constituent pas le même genre de preuve, et cet article les tient séparés.

Ce que Meta a réellement livré

Muse Spark 1.2 and Muse Code-2

L'annonce, publiée sur le blog de recherche en IA de Meta et datée du 5 août, couvre deux produits à la fois.

Muse Spark 1.2 — une mise à jour de la famille Muse Spark centrée sur le codage. Meta indique avoir augmenté la puissance de calcul d'entraînement sur les tâches de codage et élargi la diversité des environnements d'entraînement, tout en conservant la capacité d'agent général qui servait d'argument de vente à la version 1.1. Les cibles d'entraînement annoncées sont à long horizon : génération de dépôts entiers, grands projets de bout en bout, et ce que Meta appelle « auto-research », avec planification pour séquencer le travail, conditionnement par objectif pour maintenir le cap sur de nombreuses étapes, et compaction du contexte pour préserver l'état pertinent lorsqu'une session se prolonge.

Muse Code — un agent de codage dans le terminal en version bêta, installé via un script shell d’une ligne provenant du domaine développeur de Meta. Il exécute des agents d’arrière-plan asynchrones persistants qui survivent au-delà d’une session, sur un runtime local à journal d’événements que Meta décrit comme rejouable à l’identique et sûr au redémarrage, et il coordonne plusieurs sous-agents par tâche dans des arbres de travail isolés. Il est fourni avec trois compétences intégrées : /plan pour la planification soumise à approbation, /grill pour mettre à l’épreuve le travail déjà effectué, et /goal pour mener une tâche à son terme.

L'association n'est pas fortuite. Meta affirme que les deux ont été co-entraînés — le modèle a été ajusté sur des trajectoires échantillonnées par rejet issues du harnais, avec des optimisations de recette pour les objectifs, la compaction et les sous-agents. C'est la même stratégie de co-entraînement qui a produit Claude Code et Codex, et cela a une conséquence pour quiconque lit les chiffres des benchmarks : les scores de codage phares du modèle ont été produits dans le harnais contre lequel il a été entraîné. Ce n'est pas de la triche, c'est ainsi que fonctionne désormais l'évaluation agentique. Cela signifie qu'un score de 1,2 obtenu via un autre échafaudage est une question ouverte plutôt qu'une hypothèse sûre.

Le reste de la spécification est inchangé par rapport à la version 1.1, qui est elle-même informative. Le contexte reste à 1 048 576 jetons. Le raisonnement reste obligatoire pour les cinq niveaux d'effort — minimal, faible, moyen, élevé, xhigh — avec moyen par défaut ; il n'existe aucune configuration où l'on obtient les poids sans une certaine délibération. Les poids sont fermés, sans dépôt Hugging Face, et la Model API de Meta reste le seul endroit first-party pour l'appeler.

43, puis 51, puis 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis attribue à Muse Spark 1.2 un score de 54 sur son Intelligence Index avec le réglage de raisonnement xhigh, le classant 13e sur 185 modèles, contre une médiane de catégorie de 32. L'indice est un composite pondéré de neuf évaluations — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR — réparties équitablement entre agents, codage, capacité générale et raisonnement scientifique.

Lue comme une série plutôt que comme un instantané, la trajectoire de Meta est la véritable histoire. Le Muse Spark original a obtenu 43 en avril. Muse Spark 1.1 a atteint 51 le 9 juillet, soit un gain de huit points en un trimestre. Muse Spark 1.2 ajoute trois points de plus en moins d'un mois. Meta a progressé de 11 points d'indice en quatre mois et publie désormais plus vite que l'écosystème d'évaluation ne peut suivre — il n'y a toujours pas de détail publié par benchmark pour 1.2, et aucun record Design Arena pour lui, alors que 1.1 a les deux.

Cinquante-quatre points placent Meta au niveau de Grok 4.5, le modèle que SpaceXAI a publié un jour avant Muse Spark 1.1, et derrière un groupe de tête serré : Claude Opus 5 à 61, Claude Fable 5 à 60, GPT-5.6 Sol à 59. L'écart avec le sommet est de six ou sept points. L'écart par rapport au niveau où Meta a commencé l'année est de onze. Que cela se réduise dépend du maintien du rythme, et Meta suit actuellement un cycle de sortie de quatre semaines.

Une égalité sur un indice composite ne signifie pas pour autant une égalité sur un poste, et il vaut la peine de préciser ce que le 54 tranche et ne tranche pas. Il tranche que Muse Spark 1.2 se situe au même niveau que Grok 4.5 en termes de capacité agrégée. Il ne dit pas lequel écrit de meilleurs correctifs, car le sous-indice de codage qui permettrait de le déterminer n'a pas encore été publié pour la 1.2.

Les numéros de codage de Meta, lisez attentivement.

L'annonce de Meta est en tête sur trois graphiques. Sur ses propres exécutions, rapportées en pass@1 sur cinq tentatives, chaque modèle concurrent étant apparié à son propre produit d'agent :

Terminal-Bench 2.1 — 82,9 % pour Muse Spark 1.2, contre 76,2 % pour la 1.1. Claude Opus 5 est en tête avec 86,7 %.

DeepSWE v1.1 — 59,3 %, contre 53,0 %.

Le benchmark interne de codage de Meta — 70,6 %, en hausse par rapport à 68,3 %.

Les deltas sont la partie crédible. Des gains de 6,7 points sur Terminal-Bench et de 6,3 sur DeepSWE, mesurés de la même manière sur le même harnais par la même équipe à un mois d'intervalle, constituent une lecture raisonnable de l'ampleur de l'amélioration de 1.2 par rapport à 1.1 sur ce que Meta optimisait. Le classement inter-fournisseurs est la partie à prendre avec des pincettes : l'appariement des harnais est une variable libre majeure, et un laboratoire qui règle son propre harnais en parallèle de son propre modèle n'est pas en mesure de régler celui des autres aussi bien. Meta était deuxième sur sa propre diapositive, ce qui, à tout le moins, n'est pas la forme habituelle d'un benchmark de fournisseur, mais aucun tiers n'a reproduit ne serait-ce qu'une partie de ces résultats à l'heure où j'écris ces lignes.

La deuxième liste de prix

La chose la plus importante de cette version ne figure pas sur les graphiques de référence. Muse Spark 1.2 est livré avec deux grilles tarifaires.

Niveau standard — 1,25 $ par million de jetons d’entrée, 0,15 $ par million en cas de succès de cache, 4,25 $ par million de jetons de sortie. Inchangé par rapport à 1.1, au centime près. Limite de débit d’environ 3 000 requêtes par minute. Le grounding de recherche web est facturé séparément à 2,50 $ pour mille requêtes.

Palier contributeur — 0,10 $ en entrée, 0,002 $ en entrée en cache, 0,20 $ en sortie. C'est 12,5× moins cher en entrée et 21,25× moins cher en sortie. Le prix d'entrée est l'autorisation donnée à Meta d'entraîner ses futurs modèles sur votre trafic, ainsi qu'un plafond de 60 requêtes par minute — soit 2 % du budget standard.

À 0,10 $ et 0,20 $, Muse Spark 1.2 casserait les prix de presque tous les modèles proches de la frontière sur le marché, y compris le niveau économique à poids ouverts contre lequel il perd par ailleurs sur le prix. C'est le chiffre intéressant de ce lancement, et ce n'est pas vraiment une décision tarifaire. Soixante requêtes par minute excluent d'emblée la plupart des schémas de fan-out en production, ce niveau visant donc l'expérimentation et le travail en petite équipe plutôt que le service. Et « nous pouvons nous entraîner sur votre trafic » est une question pour celui qui valide la gouvernance des données dans votre organisation, pas pour celui qui choisit les modèles. Traitez-le comme une revue juridique avec une remise attachée, pas comme une SKU moins chère.

Ce que le 54 coûte à produire

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publie ce que coûtent ses propres évaluations, et c'est dans cette colonne que se dessine la forme de Muse Spark 1.2. Terminer la suite de neuf benchmarks a coûté 637,85 $ et consommé 95 millions de jetons de sortie, contre 548,07 $ et 94 millions pour Muse Spark 1.1 — avec une tarification par jeton identique. Les 16 % supplémentaires sont pure délibération.

Les chiffres de latence évoluent dans le même sens. Mesuré à xhigh, le temps jusqu'au premier jeton est de 26,12 secondes pour la 1.2 contre 2,90 secondes pour la 1.1, et la vitesse de sortie chute de 213,5 à 165,0 jetons par seconde. Meta a gagné trois points d'indice grâce au temps de réflexion, et la conception à raisonnement obligatoire fait qu'on ne peut pas refuser l'achat — seulement choisir la part qu'on en assume.

Ce chiffre de 26 secondes sera mal cité, alors voici la correction à l'avance : il s'agit d'une mesure au niveau d'effort le plus coûteux que le modèle expose, et l'API utilise par défaut le niveau moyen. À titre de référence issue du trafic réel plutôt que d'un banc d'essai, Muse Spark 1.1 servi via OrcaRouter — quel que soit l'effort réellement demandé par les appelants — affiche un p50 de 1,84 seconde pour le temps jusqu'au premier token sur 7 jours et un p95 de 6,00 secondes, à 519 tokens par seconde et avec un taux d'erreur nul. La latence de référence au niveau d'effort maximal et la latence de production au niveau d'effort par défaut sont des grandeurs différentes, et elles diffèrent généralement d'un ordre de grandeur. Lisez 26,12 s comme le plafond du raisonnement profond, et non comme ce que ressentira une requête.

Où vous pouvez l'appeler aujourd'hui

Muse Spark 1.2 est servi par la propre API Model de Meta et, au moment de la rédaction, nulle part ailleurs — il n'a pas été routé sur OpenRouter au lancement, il n'y a pas de dépôt Hugging Face, et il ne figure pas dans le catalogue OrcaRouter. Muse Spark 1.1, lui, l'est, à 1,25 $ et 4,25 $ — les mêmes chiffres que Meta facture, car OrcaRouter prend 0 % de marge et transmet directement le prix catalogue du fournisseur.

Cela compte plus pour la comparaison que pour le modèle lui-même. Si vous construisez un modèle de coût pour cette version, les modèles auxquels vous le compareriez — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — se trouvent derrière une seule clé au prix catalogue, de sorte que le chiffre de votre feuille de calcul est celui de la facture, et qu'une baisse de prix d'un fournisseur s'applique le jour même plutôt qu'après un renouvellement. Pour Muse Spark 1.2 spécifiquement, la réponse est aujourd'hui l'endpoint de Meta, un second contrat et une facture séparée.

Ce à quoi l’annonce n’a pas répondu

Aucun indice de codage indépendant.Artificial Analysis publie un composite pour 1.2 mais pas encore les sous-indices de codage et d'agentique qu'elle a publiés pour 1.1 (71,3 et 37,5 respectivement). Puisque le travail agentique était de loin la dimension la plus faible de 1.1, et que le codage agentique est exactement ce que 1.2 prétend avoir corrigé, c'est ce chiffre qui trancherait la sortie.

Aucune reproduction des résultats du banc d'essai. Chaque chiffre de codage de l'annonce est issu de Meta. Personne n'a encore publié de scores Muse Spark 1.2 provenant d'un environnement neutre.

Aucune vérification multimodale.La fiche Muse Spark annonce des entrées texte, image, vidéo, audio et PDF. L'évaluation indépendante couvre le texte et l'image. La messagerie 1.2 de Meta est passée presque entièrement au travail logiciel, et le cas d'utilisation multimédia 1.1, explicitement commercialisé, n'a pour l'instant ni marketing ni mesure derrière lui.

Aucun historique de débit. Le volume sur le point de terminaison est encore trop faible pour que les statistiques de latence habituelles se remplissent.

Que regarder au cours des quatre prochaines semaines

Trois éléments décideront si cette version est bien ce que Meta en dit. Le premier est un score agentique indépendant pour la 1.2 — si le sous-indice qui était à 37,5 sur la 1.1 a substantiellement évolué, l'argument du codage est réel. Le deuxième est de savoir si quelqu'un reproduit le résultat Terminal-Bench en dehors de Muse Code ; un modèle qui ne performe que dans son propre harnais est un produit, pas une capacité. Le troisième est ce qu'il advient du palier contributeur : si le plafond de 60 requêtes s'assouplit, un modèle quasi-frontière à 0,10 $ en entrée et 0,20 $ en sortie change l'arithmétique du palier budgétaire d'une manière qu'un gain de trois points d'indice ne ferait jamais.

Et si le rythme se maintient, Muse Spark 1.3 est attendu pour début septembre. À en juger par ces éléments, le chiffre à surveiller lors de sa sortie n'est pas le score de l'indice. C'est de savoir si Meta peut ajouter des capacités sans ajouter encore vingt secondes de réflexion au début de chaque requête.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube