
Muse Spark 1.2 vs GLM 5.2 : Le codeur fermé vs le généraliste ouvert
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Deux modèles à contexte de 1 000 000 de jetons, dont les prix ne diffèrent que de quinze cents par million de jetons, tous deux conçus pour un travail d'agent très axé sur le codage — et ils ne partagent presque rien d'autre. Muse Spark 1.2, dévoilé par Meta le 5 août 2026 en même temps qu'un agent terminal co-entraîné appelé Muse Code, est à poids fermé, moins cher par jeton, obtient un score de 57 sur l'actuel Artificial Analysis Intelligence Index, et ne peut pas répondre sans avoir d'abord raisonné. GLM 5.2, le modèle phare à poids ouverts de Z.ai datant de la mi-juin, est sous licence MIT, auto-hébergeable, environ cinq fois plus rapide pour le premier jeton, et fait toujours transiter quatre fois et demie plus de trafic réel via notre passerelle — 213 millions de jetons sur les sept derniers jours, contre 46 millions pour Muse Spark 1.2. Le modèle qui obtient le meilleur score et qui est le moins cher par jeton est celui qui a le moins de trafic. Le modèle ouvert est celui que les gens routent réellement.
La version honnête de ce fait est l'objet de cet article. La notation et le prix décident moins que la façon dont un modèle s'intègre à votre pipeline, et ces deux éléments font des choix opposés sur chaque axe qui détermine l'adéquation. Lorsqu'il existe des chiffres indépendants, ils proviennent d'Artificial Analysis ; lorsqu'ils proviennent de Meta ou de Z.ai, ils sont étiquetés comme rapportés par le fournisseur ; les chiffres de latence et de trafic proviennent de la propre télémétrie de production d'OrcaRouter sur sept jours.
Le contraste des spécifications, une dimension à la fois
• Prix — Muse Spark 1.2 à 1,25 $ en entrée / 4,25 $ en sortie par million de tokens, 0,15 $ en cas de succès de cache ; GLM 5.2 à 1,40 $ en entrée / 4,40 $ en sortie, 0,26 $ en cache. Meta est moins cher sur chaque ligne.
• Contexte — les deux : 1 048 576 jetons. Sortie maximale : Meta documente un plafond de 131 072 jetons pour Muse Spark 1.2 ; GLM 5.2 déclare 128 000.
• Raisonnement — le raisonnement est obligatoire sur Muse Spark 1.2 à travers cinq niveaux d'effort (de minimal à xhigh, medium par défaut) ; GLM 5.2 exécute un raisonnement hybride contrôlé par reasoning_effort à high ou max, avec le raisonnement approfondi activé par défaut.
• Entrées — Muse Spark 1.2 annonce prendre en charge les entrées texte, image, vidéo, audio et PDF ; GLM 5.2 est du texte en entrée et en sortie.
• Poids — Muse Spark 1.2 est fermé, sans dépôt ni chemin d'auto-hébergement ; GLM 5.2 propose des poids ouverts sous licence MIT, un Mixture-of-Experts à 753B de paramètres avec environ 40B actifs par jeton.
• Âge — Muse Spark 1.2 a trois jours au moment où nous écrivons ces lignes ; GLM 5.2 est en production depuis le 13 juin, avec huit semaines d’expérience sur le terrain et tout un écosystème d’hôtes et d’outils construits autour de lui.
L'écart d'indice est de quatre points. Le piège de la version est réel.
L'actuel Intelligence Index (v4.1.1) d'Artificial Analysis attribue à Muse Spark 1.2 un score de 57, classé #12 sur 185, et à GLM 5.2 un score de 53 — le score open-weights le plus élevé du classement, mais à quatre points de retard. La plupart des articles citent encore 54 pour Muse Spark 1.2, car c'est ce que l'évaluation du jour du lancement avait rapporté ; la réévaluation v4.1.1 lui a ajouté 2,7 points, la plus forte augmentation de tous les modèles de cette mise à jour. Si vous voyez « 54 vs 51 » ou « 54 vs 53 » quelque part, vérifiez sur quelle version de l'indice chaque nombre repose avant de considérer l'écart comme réel.
Il vaut la peine de dire ce que l'écart de quatre points signifie et ne signifie pas. Il signifie que sur le composite de neuf benchmarks, le modèle fermé de Meta devance celui ouvert de Z.ai à effort comparable. Il ne signifie pas que Muse Spark 1.2 bat GLM 5.2 sur tout, parce que les deux modèles atteignent leurs scores par des chemins différents. GLM 5.2 est un cas extrême en maths et en raisonnement — AIME 2026 à 99,2 — mais il est notoirement verbeux et son point faible est le travail profond à l'échelle du dépôt. Muse Spark 1.2 a la forme opposée : performant sur le codage terminal et les tâches multi-fichiers, et nettement moins cher à évaluer par tâche, car il consomme beaucoup moins de jetons en réfléchissant.

Là où les benchmarks divergent réellement
Sur Terminal-Bench 2.1, les deux sont plus proches que ne le suggère l'écart d'indice, et la source importe plus que d'habitude. Sur le même harnais Artificial Analysis, Muse Spark 1.2 obtient 80,1 et GLM 5.2 obtient 77,9. Meta revendique 82,9 pour Muse Spark 1.2 sur son propre harnais ; le meilleur chiffre rapporté par Z.ai pour GLM 5.2 est 82,7, ce qui en a fait le premier modèle open-weight à dépasser 80 sur ce benchmark. Même benchmark, quatre nombres différents — l'appariement des harnais fait varier ces scores de plusieurs points dans les deux sens ; considérez donc toute affirmation relative à un seul terminal-bench comme une fourchette.
La divergence à laquelle prêter attention est DeepSWE 1.1, le benchmark qui met à l'épreuve le raisonnement profond, multi-fichiers, à l'échelle du dépôt sur une longue boucle d'agent. Meta rapporte 59,3 pour Muse Spark 1.2 — un chiffre du vendeur, qu'aucun tiers n'a encore reproduit. Le DeepSWE publié de GLM 5.2 est de 46,2, et son prédécesseur GLM-5.1 était à 18,0 ; c'est donc la dimension sur laquelle Z.ai s'est le plus amélioré et sur laquelle il reste encore en retrait. Si votre charge de travail consiste à « modifier cinquante fichiers de manière cohérente », cet écart résume tout ; si votre charge de travail consiste en commandes terminal et en scaffolding, il est à peine perceptible.
Un autre résultat qui renverse la lecture évidente. La suite indépendante Vals AI, qui exécute des charges de travail d'agents par domaine, place Muse Spark 1.2 en cinquième position au classement général avec 71,88 % — et première sur Finance Agent, première sur TaxEval, et première sur le benchmark Legal Agent de Harvey, contre respectivement 44, 136 et 31 modèles — tandis que Terminal-Bench 2.1 n'est que son quatorzième meilleur domaine sur cinquante. Meta a commercialisé ce modèle comme un codeur, et un évaluateur indépendant a constaté qu'il est le plus performant sur les agents de documents financiers, fiscaux et juridiques. Si votre équipe rédige des contrats ou rapproche des comptes, c'est le chiffre le plus utile de cet article.
La question des poids ouverts est la véritable bifurcation.
Tout ce qui précède concerne la capacité. La décision porte principalement sur la propriété, et sur ce point, les deux ne pourraient pas être plus éloignés.
GLM 5.2 est un modèle à poids ouverts sous licence MIT. Cela change la négociation, pas seulement la facture : vous pouvez l'héberger vous-même si une charge de travail est sensible ou si le volume est élevé ; vous pouvez le déplacer entre fournisseurs sans réintégration, car les poids vous appartiennent ; et tout hôte qui l'achemine doit rivaliser sur le prix et la latence, c'est pourquoi la gamme de poids ouverts devient moins chère avec le temps. Le MoE de 753B n'est pas un modèle pour ordinateur portable — la plupart des équipes le loueront plutôt que de l'exécuter — mais l'option de partir, ou d'exécuter les mêmes poids en interne pour un coût fixe, impose un plancher sous ce que quiconque peut vous facturer.
Muse Spark 1.2 opte pour le bundle opposé. Les poids sont fermés et la seule voie propriétaire est l'API Model de Meta, que nous routons désormais aussi. En échange, vous obtenez un produit co-entraîné : Muse Code, l'agent de terminal livré avec le modèle, a été réglé sur des trajectoires de harnais échantillonnées par rejet et exécute des sous-agents persistants et redémarrables en toute sécurité sur un runtime à journal d'événements exact en relecture, avec les compétences /plan, /grill et /goal intégrées. C'est une chose vraiment différente d'« un bon modèle que vous branchez dans votre propre harnais » — c'est un agent qui fonctionne dès son arrivée. Le compromis, c'est qu'il ne fonctionne qu'à la manière de Meta, dans l'outil de Meta, sur macOS ou Linux, sans client Windows, sans MCP et sans plugins IDE pour l'instant.

Prix par jeton, prix par tâche
Par jeton, Muse Spark 1.2 est moins cher à l'entrée comme à la sortie, et il reste moins cher par tâche car c'est aussi le modèle le moins verbeux. Artificial Analysis a mesuré que GLM 5.2 brûlait 141 millions de jetons de sortie, dont 95 % de jetons de raisonnement, rien que pour exécuter l'Intelligence Index au lancement — le modèle vedette le plus verbeux du classement. Muse Spark 1.2 a brûlé 95 millions lors du même exercice à 0,40 $ par tâche. Plus de jetons à un tarif plus élevé signifie que le coût par tâche de GLM 5.2 s'accumule d'une manière que son prix catalogue masque, et c'est la bonne façon de comparer les modèles de raisonnement : évaluer le coût de la tâche accomplie, et non le taux au million de jetons.
Il existe un troisième tarif que seul l'un de ces modèles propose. Muse Spark 1.2 est livré avec un palier contributeur à 0,10 $ en entrée / 0,20 $ en sortie — un ordre de grandeur sous le palier standard, et sous le prix catalogue de GLM 5.2 dans une proportion similaire. Le prix d'entrée, c'est l'autorisation donnée à Meta d'entraîner ses futurs modèles sur votre trafic, plus un plafond de 60 requêtes par minute qui exclut tout fan-out en production. Traitez-le comme un examen juridique assorti d'une remise, et non comme une référence moins chère ; pour une équipe qui remplit les conditions et travaille sous ce plafond, cela rend la comparaison des prix sans appel.
Latence : les deux modèles s'inversent.
Si l'écart d'indice favorise Meta, c'est sur le profil de latence que GLM 5.2 l'emporte nettement en termes de ressenti. Au cours des sept derniers jours de trafic réel sur OrcaRouter, Muse Spark 1.2 affiche un p50 du temps jusqu'au premier token de 8,13 secondes et un p95 de 10,00 secondes, puis débite à 576 tokens de sortie par seconde avec un taux d'erreur nul. GLM 5.2 affiche un p50 de 1,55 seconde — plus de cinq fois plus rapide pour le premier token — mais ne débite que 78,5 tokens de sortie par seconde, avec un taux d'erreur de 0,16 %. En laboratoire, à effort maximal, l'écart se creuse : Artificial Analysis a mesuré le temps jusqu'au premier token de Muse Spark 1.2 à 26 secondes en mode xhigh, son réglage de raisonnement le plus coûteux.
Donc un modèle fait attendre puis livre rapidement ; l'autre commence immédiatement et prend son temps. Pour tout ce qu'un humain regarde — un échange de chat, une session de terminal interactive — GLM 5.2 semble meilleur, et c'est pourquoi il domine le trafic interactif via notre passerelle. Pour une génération longue, un gros patch ou un brouillon de document, Muse Spark 1.2 finira en premier une fois qu'il a démarré, car son débit de sortie est sept fois supérieur à celui de GLM 5.2. Mesurez le mauvais chiffre et vous choisirez le mauvais modèle pour la mauvaise raison.
Essayer les deux sans deuxième contrat.
Les deux modèles figurent dans le catalogue OrcaRouter au prix catalogue du fournisseur — Muse Spark 1.2 à 1,25 $ et 4,25 $, GLM 5.2 à 1,40 $ et 4,40 $ — car OrcaRouter répercute les tarifs des fournisseurs avec une marge de 0 %. Ainsi, les prix ci-dessus correspondent à la facture, et non à l'étiquette, et passer de l'un à l'autre ne nécessite qu'une modification sur une seule ligne dans la chaîne de modèle associée à la même clé, plutôt qu'une nouvelle intégration. Si un fournisseur baisse un prix, la baisse nous parvient le jour même.
La couche de routage justifie sa place ici précisément parce que les deux modèles sont complémentaires. La faiblesse de Muse Spark 1.2 tient à un premier jeton lent et à un prix élevé à l'échelle ; celle de GLM 5.2 tient au verbiage et au raisonnement sur des dépôts profonds. Une règle de routage qui envoie la passe de planification à Muse Spark 1.2 et le fan-out des workers parallèles à GLM 5.2 — ou qui bascule sur GLM 5.2 lorsque le point de terminaison de Muse Code est lent — ne coûte rien de plus à construire, car les deux se trouvent derrière un seul point de terminaison. Et pour un modèle vieux de trois jours, le basculement automatique est la façon de l'essayer sans engager une voie de production sur lui.

Qui devrait choisir quoi
Choisissez Muse Spark 1.2 lorsque l'unité de travail est un artefact volumineux et cohérent et que l'on peut attendre quelques secondes pour qu'il démarre : des refactorisations multi-fichiers, la génération de l'intégralité du dépôt, de longues boucles d'agent et — selon Vals AI — des travaux sur les documents financiers, fiscaux et juridiques. La position de leader de DeepSWE, le taux de sortie élevé et le niveau contributeur vont tous dans le même sens. Vous acceptez des poids fermés, l'outillage de Meta et un premier token plus lent, et vous devriez considérer les 82,9 et 59,3 de Meta comme des affirmations, pas des faits.
Choisissez GLM 5.2lorsque la propriété et le ressenti comptent plus que le composite : des poids ouverts que vous pouvez auto-héberger ou déplacer, un premier token rapide pour le travail interactif, un écosystème de harnais et d'outils qui fonctionne déjà avec lui, et la capacité générale à poids ouverts la plus puissante disponible. Acceptez la verbosité, le 46.2 DeepSWE, et un prix catalogue plus élevé par token, même avant la différence du nombre de tokens.
La plupart des équipes découvriront que la réponse honnête n'est ni l'une ni l'autre prise isolément. Le modèle ouvert est le cheval de bataille par lequel vous faites passer la majorité du trafic ; le modèle fermé est le spécialiste que vous pointez vers les tâches profondes et les documents sensibles. Quatre points d'indice d'écart sur un composite, un monde d'écart quant à qui détient les pondérations — tel est le choix, et il est bien plus clair que les scores.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
