
Muse Spark 1.3 Max Reasoning est en ligne : le paramètre derrière les meilleurs scores de Meta est désormais déployé pour tous.
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Muse Spark 1.3 — le modèle de raisonnement de pointe que Meta Superintelligence Labs a publié le 2 septembre — vient d'acquérir le mode sur lequel son propre classement a été construit. Le 4 septembre, après deux jours de tests de sécurité supplémentaires, Meta a ouvert aux développeurs le réglage de raisonnement « max » le plus intensif en calcul du modèle, sur la Meta Model API et dans Muse Code, son agent de codage en terminal. Le directeur de l'IA Alexandr Wang a annoncé le déploiement sur X et le compte @AIatMeta de l'entreprise l'a confirmé; ce qui était une configuration limitée à Meta et à un aperçu réservé aux partenaires lors du lancement est désormais un niveau de raisonnement que tout développeur peut sélectionner.
Cette séquence est importante, car plusieurs des chiffres qui ont dominé la couverture du lancement de Muse Spark 1.3 — 75,4 sur DeepSWE v1.1, 66,9 sur OSWorld 2.0, 1 754 sur GDPval-AA v2 — provenaient de la configuration max, tandis que le modèle que les développeurs pouvaient réellement appeler était livré avec un effort de raisonnement plafonné à « xhigh ». Meta avait été explicite au lancement : la configuration max était encore en cours de tests de sécurité, mais cette scission impliquait que le classement mis en avant et le modèle appelable étaient deux choses différentes pendant deux jours. La sortie de jeudi comble cet écart, et ce sans toucher au prix par jeton. Les chiffres de référence de cette liste sont ceux de Meta et n'ont pas encore été reproduits par un banc d'essai indépendant ; tout ce qui est rapporté par le fournisseur dans cet article est étiqueté comme tel.
Ce qui a été retenu — et ce qui a changé le 4 septembre
L'échelle de raisonnement de Muse Spark 1.3 a conservé la même forme depuis l'ouverture de l'API payante de la famille : le raisonnement est toujours activé, et le paramètre d'effort du modèle sur l'API Meta Model prend les valeurs minimal, low, medium, high et xhigh, le modèle consacrant une plus grande part de son budget de sortie à la réflexion à mesure que le niveau augmente. Max se situe au-dessus de xhigh — plus de calcul, plus de jetons de raisonnement et, selon Meta, nettement plus performant sur les travaux d'agent à long terme. Lors du lancement du 2 septembre, Meta a livré tous les niveaux jusqu'à xhigh, mais a exclu max de l'API publique en attendant ce qu'elle a appelé des tests de sécurité supplémentaires, ne le partageant qu'avec un ensemble limité de partenaires — assez pour qu'une évaluation indépendante soit menée, pas assez pour une charge de travail en production.
Le 4 septembre, Wang a déclaré que les tests étaient terminés. Max est désormais un paramètre sélectionnable dans Muse Code — le script d'installation se trouve à l'adresse dev.meta.ai/install.sh — et sur l'identifiant de modèle muse-spark-1.3 via l'API Meta Model, où le paramètre effort accepte désormais max. Wang a décrit le décalage de deux jours comme la manière de Meta de contrôler l'accès « au niveau de la configuration », et a déclaré à Axios que Meta n'avait pas eu à suspendre ses travaux plus larges pour des raisons de sécurité. La fenêtre était courte, mais c'est un véritable précédent : Meta est désormais prêt à maintenir un mode de raisonnement spécifique derrière une revue de sécurité tout en publiant immédiatement le reste d'un point de contrôle.
Un avertissement pratique pour toute personne appelant le modèle via une passerelle plutôt que le point de terminaison de Meta : plusieurs pages de documentation tierces et listes d'agrégateurs ont été rédigées le jour du lancement et n'énumèrent toujours l'effort de raisonnement que jusqu'à xhigh. La valeur max est un déploiement côté Meta, donc vérifiez que la route par laquelle vous appelez a mis à jour sa surface de paramètres avant de supposer que max est accessible — un proxy qui a validé ses valeurs acceptées le 2 septembre peut rejeter « max » jusqu'à ce que ses mainteneurs rattrapent leur retard.
Ce que max achète réellement — et où cela n'aide pas.
Les documents publiés jeudi par Meta incluent une ventilation explicite max par rapport à xhigh sur les benchmarks qu'elle exécute, et c'est ce que l'entreprise a publié de plus utile sur le modèle à ce jour. Le tout provient de rapports du fournisseur, réalisés dans le harnais Muse Code de Meta, et Meta précise que ses comparaisons avec Claude Opus 5 et GPT-5.6 Sol étaient des exécutions « best-effort » aux paramètres maximaux de ces rivaux, qui « peuvent ne pas refléter les performances optimisées par le fournisseur ». Compte tenu de cette réserve, la ventilation montre une direction claire :
• OSWorld 2.0 (tâches d'agent d'utilisation d'ordinateur) — 66,9 à max vs 57,2 à xhigh
• GDPval-AA v2 (Elo d'agent de travail du savoir) — 1 754 à max vs 1 709 à xhigh
• JobBench (tâches professionnelles à long horizon) — 64.9 au maximum contre 61.2 en xhigh
• DeepSearchQA — une égalité à 89,4
• Terminal-Bench 2.1 (codage d’agent terminal) — 89,2 en xhigh contre 88,8 en max, la seule suite où la configuration expédiée le 2 septembre l’emporte.

Ce schéma mérite d’être lu attentivement. Max aide surtout lorsque la tâche est une longue boucle d’agent — piloter un ordinateur, traiter un brief de travail intellectuel, tenir un calendrier de sous-tâches comme le fait JobBench. Sur un benchmark terminal à tour unique, il n’a rien apporté et a coûté un peu : Terminal-Bench rappelle que « raisonner davantage » n’est pas une amélioration monotone, et c’est la raison pour laquelle il faut comparer max et xhigh par A/B sur votre propre charge de travail plutôt que de supposer que le réglage le plus élevé est meilleur partout. Meta signale également que le résultat DeepSWE v1.1 de 75,4 — le titre du premier jour, en hausse par rapport au 59,3 que Meta avait indiqué pour Muse Spark 1.2 six semaines plus tôt — est un chiffre de configuration max. C’est le chiffre que les évaluateurs indépendants relanceront en premier.
L'analyse indépendante commence à rattraper son retard.
Ce qui manquait au lancement, c'était toute mesure indépendante, et cet écart se comble selon un calendrier qui correspond par hasard au déploiement de max. L’indice d’agent de codage d’Artificial Analysis — qui évalue chaque modèle dans son environnement natif d’agent de codage et combine les tâches DeepSWE, Terminal-Bench et SWE-Atlas — a classé Muse Spark 1.3 (max) dans l’environnement Muse Code à 68 cette semaine, deuxième au classement derrière Claude Opus 5 (xhigh) dans Claude Code et devant Claude Fable 5 (max) à 67 et GPT-5.6 Sol (max) à 65. Le même classement attribue à la configuration xhigh expédiée une note de 64 dans le même environnement Muse Code, ce qui constitue la lecture la plus nette à ce jour de ce que max apporte — environ quatre points d’indice — sur un ensemble de tâches indépendant. Cette ligne du classement a été publiée alors que max était encore en aperçu partenaire ; la configuration qu’elle décrit est celle qui est devenue généralement disponible le 4 septembre.
Artificial Analysis a également mis à jour sa propre fiche modèle pour la configuration maximale depuis le déploiement. Pendant la période d'aperçu, la fiche n'indiquait ni fournisseur ni prix ; la fiche en ligne indique désormais Meta au prix catalogue standard de 1,25 $ par million de jetons d'entrée et 4,25 $ par million de jetons de sortie — le même prix catalogue que Muse Spark 1.2 — tout en ajoutant une réserve sur la verbosité : la campagne d'évaluation d'AA a consommé environ 130 millions de jetons contre une médiane de 79 millions, a coûté environ 1 335 $ au total, et aboutit à environ 0,95 $ par tâche selon l'estimation par tâche d'AA, à environ 190 jetons de sortie par seconde.
Un chiffre issu d'une couverture précédente mérite une vérification de version. Artificial Analysis a actualisé son Intelligence Index en version 4.2 cette semaine — la même semaine où max a été lancé — réévaluant les modèles et déplaçant les médianes. Sur la fiche actuelle, la configuration max affiche 53, contre une médiane de 29 pour les modèles comparables ; le 62 qui circulait dans la couverture de la semaine de lancement a été mesuré sur la version précédente de l'indice, et les deux ne sont pas comparables. La répartition xhigh-versus-max de Meta ci-dessus est indépendante de l'indice d'AA et n'est pas affectée par cette actualisation.

Ce que coûte le max — la facture est en tokens, pas au tarif
Meta ne publie pas de prix séparé pour la configuration maximale, ni d’analyse de latence dédiée. Le prix par jeton est identique à Muse Spark 1.2 et à tous les autres niveaux d’effort sur Muse Spark 1.3 : 1,25 $ par million de jetons d’entrée, 4,25 $ par million de jetons de sortie, et 0,15 $ pour l’entrée en cache sur le niveau standard. Les jetons de raisonnement sont facturés comme des jetons de sortie et comptent dans le budget de sortie. Par conséquent, choisir le niveau maximal n’est pas une augmentation de prix à la ligne — c’est une promesse de dépenser davantage de ce budget en réflexion avant de répondre.
Cela fait de la question du coût réel une question de volume de tokens, et les premières données indiquent que max est dépensier précisément là où xhigh est économe. L’exécution instrumentée de AA a consommé environ 130 millions de tokens lors d’une seule évaluation de la configuration. Pour un développeur qui exécute déjà de longues boucles agentiques à xhigh, le test A/B qui compte n’est pas « est-ce que max réussit plus de tâches » mais « est-ce que max réussit suffisamment de tâches supplémentaires pour compenser une facture de tokens nettement plus lourde sur la même charge de travail ».
Le niveau Contributor de Meta — 0,10 $ en entrée et 0,20 $ en sortie par million de jetons, en échange de laisser Meta s’entraîner sur vos invites et vos complétions — s’applique au même point de contrôle, et Meta affirme qu’un pourcentage à deux chiffres non négligeable de développeurs le choisit. Les conditions de Contributor font de chaque soumission une donnée d’entraînement et ses limites de débit sont strictes : c’est donc un mauvais choix par défaut pour le fan-out en production, mais un moyen légitime de mener à moindre coût des expériences maximales onéreuses si ce compromis sur vos données vous est acceptable.
La référence tarifaire de tout cela est facile à vérifier sans se fier à la parole de Meta, car le checkpoint Muse Spark 1.3 est tarifé à l’identique du modèle déjà répertorié sur OrcaRouter au prix catalogue de Meta : Muse Spark 1.2 est sur OrcaRouter à $1.25 en entrée et $4.25 en sortie par million de jetons, sans aucune majoration, donc l’affirmation « prix inchangé » est vérifiable sur une page en direct qui affiche exactement ces chiffres. Muse Spark 1.3 lui-même n’est pas encore sur OrcaRouter. Lorsqu’un fournisseur que nous référençons commence à le servir avec max, le prix affiché de notre côté sera le prix catalogue de Meta transmis tel quel — nous n’appliquons aucune marge sur les prix des fournisseurs — et toute baisse tarifaire de Meta entre en vigueur le jour même où Meta l’applique. Pour une version comme celle-ci, où l’intérêt économique réside dans le volume de jetons plutôt que dans le prix affiché, cette transmission directe est ce qui fait que le montant effectivement facturé reste égal à celui que Meta publie.

Qui devrait passer à max
La décision se divise clairement :
• Passez aux charges de travail agentiques à long horizon — utilisation de l'ordinateur, briefs de travail de connaissances, boucles d'outils en plusieurs étapes dans Muse Code — où le split de Meta et le classement des agents de codage d'AA affichent tous deux les gains maximaux les plus élevés. Faites d'abord un test A/B contre xhigh sur un échantillon de vos tâches réelles, car la verbosité est réelle.
• Restez sur xhigh pour les appels à fort volume, sensibles à la latence ou à tour unique court, où max ajoute surtout des tokens. Terminal-Bench est la preuve que cela n’ajoute pas toujours de la capacité.
Surveillez trois choses à partir d'ici : la sortie des poids ouverts que Zuckerberg a promise sans date, le déploiement grand public de Muse Spark 1.3 sur Instagram, Facebook et Meta AI dans les prochaines semaines, et de savoir si le classement des agents de codage d'Artificial Analysis commence à afficher le prix de la ligne max maintenant que la configuration est généralement disponible.
Le blocage de deux jours s'est avéré court, mais il a fait une démonstration qui survit au déploiement lui-même : les chiffres les plus solides de Muse Spark 1.3 de Meta n'ont jamais été un mirage — ils n'attendaient qu'un examen de sécurité. Depuis le 4 septembre, le modèle qu'un développeur peut appeler et le modèle affiché au classement sont enfin le même modèle. Que max mérite ses tokens est désormais une question empirique à laquelle tout développeur peut répondre, sur l'API de Meta ou sur toute autre voie qu'il utilise déjà pour rejoindre la famille Muse Spark.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
