Muse Spark 1.2 contre Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 vs Muse Spark 1.1 : Faut-il passer à la mise à jour ?

Auteur

Jim Song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Meta a remplacé Muse Spark 1.1 par Muse Spark 1.2 le 5 août 2026 sans modifier le prix, la fenêtre de contexte, la liste des modalités, les paramètres pris en charge ni le curseur de raisonnement. La migration semble donc gratuite — même famille d'identifiants de modèle, même facturation, rien à renégocier. Ce n'est pas gratuit. Des mesures indépendantes évaluent le temps avant le premier token de la nouvelle version à 26,12 secondes contre 2,90 pour l'ancienne, et son débit soutenu à 165 tokens par seconde contre 213,5. Vous achetez trois points d'intelligence mesurée avec une attente environ neuf fois plus longue avant que quoi que ce soit ne revienne.

Que cela vaille la peine dépend presque entièrement de la durée d'exécution de vos tâches. Voici ce qui diffère réellement, ce qui est resté identique, et ce que personne ne peut encore vous dire.

La décision en quatre lignes

• Indice d'intelligence : 51 → 54, mesuré indépendamment par Artificial Analysis sur le réglage xhigh de chaque version.

• Délai avant le premier token : 2.90s → 26.12s, même source, mêmes conditions.

• Coût pour exécuter la même suite de benchmarks : $548,07 → $637,85, avec une tarification identique par jeton. Les 16 % supplémentaires sont un pur gaspillage de jetons.

• Tout ce que demande un formulaire d'achat : inchangé.

Muse Spark 1.2 vs Muse Spark 1.1-2

Ce qui est véritablement identique

Cela vaut la peine d'être énuméré, car c'est la raison pour laquelle une migration semble triviale sur le papier, et parce qu'une différence qui n'existe pas n'a pas besoin d'être testée.

Prix — 1,25 $ par million de jetons en entrée, 4,25 $ par million en sortie, 0,15 $ par million en cas de cache, 2,50 $ par millier de recherches Web intégrées. Chacun de ces montants est identique sur les deux versions.

Contexte — 1,048,576 tokens sur les deux, sans palier de surcoût pour long contexte sur aucun des deux.

Modalités — texte, images, vidéo, audio et PDF en entrée ; texte en sortie. Les deux annonces mentionnent les cinq mêmes types d’entrée.

Molette de raisonnement — obligatoire sur les deux versions, cinq niveaux (minimal, faible, moyen, élevé, très élevé), par défaut moyen sur les deux versions. Il n'y a aucun réglage sur l'une ou l'autre version qui désactive le raisonnement.

Paramètres — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Listes identiques.

Service — un seul fournisseur, Meta lui-même, sur les deux. Aucun hôte tiers, aucune variante de quantification.

Prix mixte — Artificial Analysis les évalue tous deux à 0,78 $ par million de jetons sur la base de sa pondération mixte, ce qui est conforme à ce que l'on attend de grilles tarifaires identiques.

Si vous espériez que la mise à niveau apporte plus de contexte, une garantie de longueur de complétion, ou un cache moins cher, ce n'est pas le cas. Il s'agit d'une version basée sur les poids et le post-entraînement, avec une grille tarifaire copiée-collée de la précédente.

Qu'est-ce qui a réellement bougé ?

Artificial Analysis est actuellement le seul organisme indépendant à avoir évalué les deux versions, et il les a évaluées au plus haut niveau d'effort de raisonnement, la comparaison est donc à armes égales.

Intelligence Index — 51 pour 1.1 (rang #22 sur 185) à 54 pour 1.2 (rang #13). Neuf places au classement où la médiane de la classe est de 32, donc le gain procure une position réelle, pas seulement une décimale.

Temps jusqu'au premier token — 2.90s à 26.12s. C'est la régression principale, et elle n'est pas négligeable.

Vitesse de sortie — de 213,5 à 165,0 tokens par seconde. Toujours classée 16e sur 185 et toujours décrite par Artificial Analysis comme « particulièrement rapide », mais 23 % plus lente que le modèle qu'il remplace.

Verbosité — 94M de tokens de sortie pour parcourir l'index, contre 95M. Pratiquement inchangé, et tous deux environ 45% au-dessus de la médiane de 65M.

Dépense totale d'évaluation — de 548,07 $ à 637,85 $. Comme la verbosité n'a presque pas bougé et que les prix n'ont pas bougé du tout, cette augmentation de 16 % vient d'autre chose que de la sortie visible : des traces de raisonnement interne plus longues, plus de tentatives, ou plus de tours d'outil par tâche.

Le schéma est cohérent. Meta n'a rendu le modèle ni moins cher, ni plus rapide, ni plus grand. Il a fait délibérer le modèle plus longtemps avant de s'engager, et cette délibération supplémentaire se manifeste par une latence, un streaming légèrement plus lent et une facture 16 % plus élevée pour un travail identique. Trois points d'indice, c'est ce que cela a rapporté.

À quel point la latence est vraiment mauvaise

Le chiffre de 26,12 secondes sera cité hors contexte, alors traitez-le correctement : il est mesuré au niveau xhigh, le plus coûteux des cinq niveaux d’effort, sur une suite de benchmarks conçue pour être difficile. L’API utilise par défaut medium.

Pour avoir une idée de ce que le défaut donne réellement, Muse Spark 1.1 sur OrcaRouter — qui sert de vrais appelants au niveau d'effort qu'ils demandent — affiche un temps p50 jusqu'au premier jeton de 1,84 seconde et un p95 de 6,00 secondes sur une semaine glissante. Ce sont des données de production à des niveaux d'effort de production, et cela se situe à plus d'un ordre de grandeur en dessous du chiffre de référence. La version 1.2 n'a pas encore de télémétrie de production.

Muse Spark 1.2 vs Muse Spark 1.1-3

Donc la lecture honnête n'est pas « 1.2 prend 26 secondes pour répondre. » C'est : à la configuration où 1.2 gagne ses trois points supplémentaires, le premier jeton vous coûte 26 secondes, et sur la même configuration, l'ancien modèle vous en coûtait trois. Si vous utilisiez déjà xhigh — ce qui est exactement la configuration où le gain d'intelligence existe — c'est le nombre dont vous héritez. Si vous utilisez medium ou en dessous, vous verrez un temps beaucoup plus court, et vous verrez aussi moins d'amélioration.

Ce couplage est le véritable piège de cette mise à niveau. On ne peut pas obtenir l'intelligence sans la délibération, car c'est de la délibération que provient l'intelligence.

Le repositionnement derrière les chiffres

Meta n'a publié aucun article de lancement pour la 1.2 — la page d'annonce de Muse Spark décrit toujours la 1.1 — mais elle a réécrit la description du produit, et cette réécriture explique le compromis.

Muse Spark 1.1 a été commercialisé comme un modèle de raisonnement multimodal doté d'une surface d'entrée exceptionnellement large, conçu pour les « agents multimodaux, la recherche approfondie sur des médias mixtes et l'analyse de contextes longs » : rapports volumineux, bibliothèques médiatiques, enregistrements et vidéos, en plus du texte.

La description de Muse Spark 1.2 abandonne presque tout cela et cite plutôt l’ingénierie logicielle — refactorisations multi-fichiers, sessions de débogage prolongées, génération de dépôts entiers — puis ajoute une revendication explicite de multi-agents : le modèle peut agir comme agent principal qui rassemble le contexte, planifie et délègue, ou comme sous-agent s’exécutant en parallèle sous un agent principal. Elle affirme également que la mise en cache des prompts peut réduire le coût effectif de 60 à 80 % selon la quantité de contexte répétée entre les appels. Ce dernier chiffre est une estimation de Meta plutôt qu’un résultat mesuré, bien que le taux de cache de 0,15 $ le rende arithmétiquement crédible.

Examinez la régression de latence à la lumière de ce repositionnement et cela cesse de ressembler à une erreur. Personne ne se soucie de 26 secondes de planification en refactorisant une douzaine de fichiers. Meta a choisi un client, et ce n'est pas celui à qui la version 1.1 a été vendue.

Ce que 1.1 a encore et que 1.2 n'a pas.

Quatre semaines d'existence ne suffisent pas à accumuler un historique, et à trois égards concrets, l'ancien modèle est actuellement le produit le mieux documenté.

Un record d'arène.Muse Spark 1.1 dispose d'un historique conséquent dans Design Arena : 1334 Elo au rang 5 dans le développement de jeux, 1334 au rang 7 dans les composants UI, 1320 au rang 3 dans l'art ASCII, 1318 en visualisation de données, 1309 dans les catégories de code général, ainsi qu'une échelle complète d'agents-arena couvrant les applications web, les diapositives HTML et le développement de jeux Godot. Muse Spark 1.2 n'a aucune entrée. Sur l'axe que Meta promeut le plus intensément, il n'existe aucune donnée de comparaison directe pour le nouveau modèle.

Scores des sous-indices. Artificial Analysis publie un indice de codage de 71,3 et un indice agentique de 37,5 pour la version 1.1. Il n'existe pas d'équivalent publié pour la version 1.2. Étant donné que le score agentique était de loin la dimension la plus faible de la version 1.1, et que la capacité agentique est précisément ce que la version 1.2 prétend améliorer, c'est ce chiffre qui trancherait la question de la mise à niveau — et il n'existe pas encore.

Télémétrie de production. 1.1 a une semaine de latence réelle p50 et p95 à son actif et 4,4 millions de jetons de trafic en direct sur OrcaRouter. 1.2 n'a ni l'un ni l'autre ; son point de terminaison ne signale actuellement aucune statistique de latence ni de débit, car le volume est trop faible pour être échantillonné.

Un endroit où le louer en dehors de Meta. Muse Spark 1.1 est dans le catalogue OrcaRouter au prix de 1,25 $ et 4,25 $ — le prix catalogue de Meta lui-même, répercuté sans marge. Muse Spark 1.2 n'y est pas encore, donc aujourd'hui c'est une intégration directe avec Meta avec un seul fournisseur et aucun chemin de basculement.

Muse Spark 1.2 vs Muse Spark 1.1-4

Rien de tout cela ne signifie que 1.2 est pire. Cela signifie que les preuves pour 1.2 consistent en un score composite provenant d'un seul évaluateur, tandis que les preuves pour 1.1 sont un mois d'arènes, de sous-indices et de trafic en direct. Cette asymétrie devrait influencer la façon dont vous planifiez la migration, et non pas la question de savoir si vous la tentez.

Une checklist de migration vraiment courte

Comme la grille tarifaire et la surface des paramètres sont identiques, l'échange n'est qu'une modification de chaîne de modèle. Le travail consiste à vérifier les trois éléments qui ont effectivement bougé.

Mesurez votre propre temps jusqu'au premier token avec votre propre réglage d'effort. N'acceptez ni la valeur de 2.90s ni celle de 26.12s. Lancez vos vrais prompts avec le reasoning_effort que vous transmettez réellement et comparez directement. C'est ce chiffre qui peut à lui seul faire échouer la migration.

Vérifiez votre configuration de délai d'attente et de streaming. Une augmentation de 9x de la latence du premier jeton à effort élevé dépassera les délais d'attente des clients qui étaient réglés pour 1.1, et donnera l'impression d'un blocage pour toute intégration non-streaming.

Recalculez le coût à partir des comptages de jetons mesurés, et non à partir de la grille tarifaire. Les prix sont identiques, donc toute variation de coût est comportementale. Artificial Analysis a constaté une augmentation de 16 % des dépenses pour le même travail ; que vous constatiez cela ou non dépend de la répartition de vos tâches.

Vérifiez d'abord la stabilité de la clé de cache. Avec un préfixe stable de 60 000 tokens, une étape d'agent typique passe d'environ 8,8 cents à environ 2,2 cents sur l'une ou l'autre version. Cette variation de 75 % est plus importante que tout ce que le changement de version peut faire, et elle est entièrement sous votre contrôle.

Re-testez explicitement les chemins audio et vidéo. Les deux fiches annoncent les mêmes cinq modalités d’entrée, mais la fiche de spécifications d’Artificial Analysis pour la version 1.2 n’enregistre que le texte et l’image comme évalués. Meta a réécrit le discours pour s’éloigner du travail multimédia. Personne n’a vérifié de manière indépendante si la capacité était conservée.

Gardez la version 1.1 accessible comme solution de secours. Exécuter les deux derrière une même clé fait du rollback un simple changement de configuration plutôt qu'un incident, et vous permet de faire un test A/B entre les deux sur le trafic réel au lieu de débattre d'un benchmark.

Qui bouge maintenant, qui attend.

Passez maintenant si vous exécutez des agents de codage à long horizon avec un effort de raisonnement élevé. Les tâches prennent déjà des minutes, la pénalité de latence se fond dans cette durée, le gain d'intelligence est mesuré par un tiers plutôt que revendiqué par Meta, et trois points d'indice représentent un saut significatif à ce niveau — neuf places sur un classement de 185 modèles.

Attendezsi tout ce que vous servez est interactif. Il n'existe aucune configuration dans laquelle 1.2 est plus réactif que 1.1, et le raisonnement obligatoire signifie que vous ne pouvez pas récupérer de réactivité en désactivant la réflexion. La version 1.1 reste le modèle le plus rapide à tous les niveaux d'effort et coûte exactement le même prix.

Attendez, si votre charge de travail est l'analyse multimédia — le cas d'usage des rapports longs, vidéo et audio pour lequel 1.1 a été explicitement conçu et commercialisé. Meta a cessé d'en faire la publicité et la seule évaluation indépendante de 1.2 couvre le texte et les images. La capacité pourrait très bien être intacte ; il n'existe simplement aucune preuve dans un sens ou dans l'autre, et 1.1 a un mois de recul.

Attendez si vous avez besoin des données de l'arène. Un modèle vendu sur la génération de dépôts entiers, sans entrées Design Arena et sans sous-index agentique publié, vous demande de croire Meta sur parole pour ce qu'elle a changé. Donnez-lui trois ou quatre semaines et cela ne sera plus vrai — à ce moment-là, cette décision sera bien plus facile à prendre sur la base de preuves plutôt que sur un seul chiffre composite.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube