Carte hero générée intitulée Claude Sonnet 5.5 vs Muse Glimmer, ayant pour sous-titre un modèle 30B pour ordinateur portable face au nouveau Sonnet, avec trois cartes de statistiques : Intelligence Index 56 vs 17, fenêtre de contexte 1M vs 131K tokens, et poids fermés vs Apache 2.0, avec un pied de page indiquant Index selon Artificial Analysis v4.3.2 ; spécifications de Muse Glimmer selon Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer : un modèle 30B pour ordinateur portable face au nouveau Sonnet

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La question de fond pour cette page est de savoir si la comparaison est légitime tout court, et la réponse honnête est que Claude Sonnet 5.5 et Muse Glimmer ne sont pas des concurrents au sens ordinaire. Sur l'Intelligence Index d'Artificial Analysis, révision v4.3.2, Claude Sonnet 5.5 obtient 56 et Muse Glimmer 17, et cet écart n'est pas du bruit — c'est à peu près la distance entre un modèle généraliste de frontière et un très bon petit modèle. Ce qui rend malgré tout ce rapprochement intéressant à lire, c'est que Muse Glimmer possède une propriété que l'autre ne peut acheter à aucun prix : c'est un modèle à poids ouverts de 30 milliards de paramètres, publié par M​eta le 10 août 2026 sous licence Apache 2.0, quantifié en 4 bits pour tenir sous 20 Go de VRAM, et conçu pour fonctionner avec le réseau débranché. Claude Sonnet 5.5 est arrivé le 28 septembre 2026 comme le Sonnet le plus rapide et le plus intelligent de son éditeur, à 2,00 $ par million de tokens en entrée et 10,00 $ par million de tokens en sortie, et accessible uniquement via le réseau. La vraie décision n'est pas de savoir quel modèle est meilleur. C'est de savoir où vous voulez que les tokens s'exécutent.

Deux modèles, deux définitions du poste

Muse Glimmer sort des M​eta Superintelligence Labs sous la forme d'un modèle de 30 milliards de paramètres entraîné par distillation de logits à partir du plus grand modèle enseignant Muse Spark de M​eta, puis affiné sur des données agentiques à contexte long et renforcé pour l'utilisation d'outils. M​eta le livre déjà quantifié : la quantification 4 bits fait passer l'empreinte mémoire de plus de 55 Go en pleine précision à moins de 20 Go, ce qui lui permet de tenir dans l'enveloppe d'un GPU grand public de 24 Go ou 32 Go. M​eta l'a testé sur une Nvidia RTX 5090 ainsi que sur des puces Apple M4 Max et M5 Max. Il accepte des entrées texte et image, renvoie du texte, fonctionne avec une fenêtre de contexte de 131 072 tokens que M​eta affirme pouvoir étendre à 262 144, et présente une date de coupure des connaissances de janvier 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d’Anthropic et celui que l’entreprise positionne comme la meilleure combinaison de vitesse et d’intelligence de sa gamme. Il fonctionne avec une fenêtre de 1 000 000 de jetons, jusqu’à 128 000 jetons de sortie en mode synchrone et 300 000 sur l’API Message Batches derrière l’en-tête output-300k-2026-03-24, accepte le texte, les images et les fichiers, propose une réflexion adaptative à effort sélectionnable avec une date limite de connaissances de juin 2026, et est disponible avec une rétention zéro des données dès le lancement. Le stockage coûte 0,20 $ par million de jetons en lecture de cache et 2,50 $ par million en écriture de cache. Anthropic affirme qu’il est 30 % plus rapide que Claude Sonnet 5 et coûte jusqu’à 30 % de moins par tâche à tarifs inchangés — des affirmations du fournisseur, non reproduites de manière indépendante.

Le contraste des spécifications vaut la peine d’être observé en une seule passe, car presque chaque ligne relève d’un type de chose différent plutôt que d’une chose meilleure ou pire :

• Poids — Muse Glimmer Apache 2.0, téléchargeables, quantifiés en 4 bits vs Claude Sonnet 5.5 fermé

• Où cela s’exécute — Muse Glimmer sur votre propre GPU, hors ligne vs Claude Sonnet 5.5 sur l’infrastructure A​nthropic

• Paramètres — Muse Glimmer 30B au total, moins de 20 Go en 4 bits par rapport à Claude Sonnet 5.5 non divulgué

• Contexte — Muse Glimmer 131 072 tokens, extensible jusqu'à 262 144 vs Claude Sonnet 5.5 1 000 000 tokens

• Prix par million — Muse Glimmer, aucuns frais par token, votre matériel vs Claude Sonnet 5.5 — 2,00 $ en entrée / 10,00 $ en sortie

• Indice d'intelligence v4.3.2 — Muse Glimmer 17 vs Claude Sonnet 5.5 56

• Coût par tâche Index tel que mesuré — Muse Glimmer 0,06 $ vs Claude Sonnet 5.5 7,60 $

Deux chiffres de cette liste méritent d'être décortiqués, car tous deux sont des pièges. Le premier est le chiffre de 0,06 $ par tâche : c'est ce qu'Artificial Analysis a dépensé en appelant Muse Glimmer (high) via un point de terminaison hébergé, à 0,325 $ par million en entrée et 1,35 $ par million en sortie ; il mesure donc l'économie de la location de ce modèle, non son exécution. En auto-hébergement, le coût marginal par token disparaît, remplacé par un GPU que vous possédez déjà ou devez acheter. Le second est l'écart de l'Index lui-même — un modèle 30B quantifié en 20 Go est évalué à la même aune que les modèles de pointe, et le classement le dit bien lorsqu'il place Muse Glimmer parmi la poignée de modèles à poids ouverts les plus performants tout en notant qu'il est cher pour sa taille.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Là où Muse Glimmer est vraiment bon, et où ça déraille

Le score composite est bien trop grossier pour constituer la réponse complète, car Muse Glimmer n’est pas uniformément à dix-sept. Il est rapide — Artificial Analysis mesure 143,8 jetons de sortie par seconde, devant les 138,7 de Claude Sonnet 5.5 — et concis, générant 59 M de jetons sur l’évaluation Index contre 410 M pour Claude Sonnet 5.5. Et sur une évaluation, il est proche de la frontière : le rappel en contexte long, où il obtient 83,3 % contre 82,7 % pour Claude Sonnet 5.5. Un modèle de 30 B qui égale un tout nouveau Sonnet de frontière sur la récupération en contexte long est la ligne la plus surprenante de cette page, et cela concorde avec la façon dont M​eta l’a entraîné — des données agentiques à contexte long, une distillation à partir d’un enseignant bien plus grand.

Les résultats agentiques sont là où le plafond du modèle se révèle et où le classement cesse d'être flatteur. Sur Terminal-Bench 4.0, Muse Glimmer obtient 0,5 % contre 63,6 % pour Claude Sonnet 5.5. Son score au benchmark d'automatisation est de 0,068 contre 0,713. Humanity's Last Exam : 22,0 % contre 55,0 %. Un résultat d'une échelle aussi faible sur un benchmark d'exécution signifie que le modèle n'achève pas les tâches, et aucune économie d'hébergement local ne rend moins coûteuse une tâche qui ne se termine jamais.

La littérature scientifique est tout aussi directe à ce sujet, et il vaut la peine de le dire plutôt que de l’enterrer : une étude d’orchestration multi-agents évaluée par les pairs, dans laquelle Muse-Glimmer-30B était l’un des modèles testés, a constaté qu’il n’avait récupéré aucun de ses candidats. Le tableau de benchmarks de M​eta lui-même pour le modèle est un document de fournisseur et est étiqueté comme tel ici ; les chiffres d’Artificial Analysis ci-dessus sont des mesures indépendantes, et ce sont ceux sur lesquels cet article s’appuie.

Ainsi, la séparation est lisible. Muse Glimmer est puissant pour sa taille pour lire une longue entrée et y répondre, rapide, peu coûteux à exécuter, et il tient dans un GPU de classe ordinateur portable. Ce n’est pas un modèle auquel on confie une tâche logicielle en plusieurs étapes avant de s’en aller. C’est là la limite honnête, et une comparaison écrite uniquement autour de scores composites la masquerait.

Ce que vous achetez réellement au tarif frontière

Le premium de Claude Sonnet 5.5 mise d'abord sur la capacité, et l'écart de dix-sept points dans l'Index en est l'illustration la plus visible. Mais trois autres choses accompagnent le tarif de sortie de 10,00 $ qui n'apparaissent sur aucun classement.

Le premier point est la fenêtre. Un million de jetons représente environ sept fois et demie les 131 072 de Muse Glimmer, et Anthropic facture le tarif standard sur la totalité, avec des lectures de cache à un dixième du prix d’entrée, de sorte que conserver un grand contexte au fil de nombreux appels soit abordable plutôt que théorique. Une invite à l’échelle d’un dépôt ne tient pas du tout dans la fenêtre plus petite ; il s’agit donc d’une différence de capacité, et non d’une préférence.

Le deuxième point est la fidélité des outils. Cinq comportements ont changé entre Claude Sonnet 5 et Claude Sonnet 5.5, et tous les cinq concernent l'utilisation des outils et le raisonnement : les paramètres d'échantillonnage non par défaut renvoient désormais une erreur 400, thinking: {"type": "disabled"} renvoie désormais une erreur 400 et devient between_tools, le choix d'outil forcé sur "any" ou un outil nommé est rejeté, si bien que les boucles doivent passer à auto avec l'utilisation stricte des outils, l'ancien outil computer_20251124 est refusé sur l'API Claude et Google Cloud, et les blocs de réflexion sont désormais liés au modèle et au compte qui les produisent. Un sixième changement ne fait rien échouer, mais passe sous silence : le texte entre les appels d'outils est renvoyé à l'intérieur des blocs de réflexion, de sorte qu'une application en streaming cesse d'afficher du texte jusqu'à ce qu'elle définisse une valeur d'affichage ou désactive la réflexion en amont. Cela représente une journée de travail de migration pour quiconque utilise Sonnet 5, et c'est le prix à payer pour la fiabilité agentique que mesurent les lignes de benchmark ci-dessus.

Le troisième point concerne la provenance et le traitement des données. La rétention zéro des données est disponible dès le lancement, Anthropic publie un seuil de retrait au 28 septembre 2027, et le modèle est disponible sur l'API Claude, Bedrock, Google Cloud et Microsoft Foundry. Pour un acheteur soumis à réglementation, ce sont des faits d'approvisionnement qui décident de l'achat avant même que le benchmark n'entre en jeu.

Hors ligne est une exigence, pas une économie de coûts

La raison pour laquelle ce duo a sa place sur une seule et même page, c'est que pour une catégorie précise de déploiement, Muse Glimmer n'est pas une option moins chère : c'est la seule option. Une requête qui ne peut pas quitter l'appareil, un atelier de production ou un site de terrain sans connectivité, un environnement isolé où un appel API constitue une violation de conformité, ou un budget de latence où un aller-retour est déjà de trop : rien de tout cela ne se résout avec un meilleur modèle derrière un réseau. Des poids Apache 2.0 qui tiennent sous 20 Go et fonctionnent hors ligne constituent la réponse entière, et Claude Sonnet 5.5, quel qu'en soit le prix, n'entre pas dans l'équation.

M​eta a publié des tests sur les puces RTX 5090, Apple M4 Max et M5 Max qui constituent la référence pratique de ce que « s'exécute localement » signifie ici, et c'est la quantification 4 bits qui rend ces cibles atteignables tout court — l'empreinte en pleine précision dépasse 55 Go. Quiconque envisage un déploiement devrait considérer les chiffres matériels comme ceux de M​eta plutôt que comme mesurés ici.

Pour tous les autres, les deux modèles sont complémentaires plutôt que substituables, et la partie opérationnellement délicate est que détenir un modèle d'API Anthropic et un modèle Meta auto-hébergé signifie normalement deux piles entièrement séparées. OrcaRouter place plus de 200 modèles derrière un unique point de terminaison compatible avec OpenAI, avec le prix catalogue du fournisseur répercuté et sans marge ajoutée, basculement automatique entre fournisseurs en amont et un DSL de routage pour composer des appels — ce qui couvre la moitié hébergée de ce dispositif, et le modèle enseignant Muse Spark 1.2 plus grand de Meta est routable ici en tant que meta/muse-spark-1.2 à 1,25 $ en entrée et 4,25 $ en sortie par million de tokens sur une fenêtre de 1 048 576 tokens, avec des lectures de cache à 0,15 $. Il transporte 42,8 millions de tokens de trafic par semaine via ce catalogue, ce qui est la partie utile de ce dispositif : le modèle enseignant hébergé est sur la même clé que tout le reste, et le modèle que vous exécutez localement n'a jamais besoin de toucher un réseau, tout simplement.

Trois remarques d'honnêteté, car il est facile de se tromper. Muse Glimmer lui-même ne figure pas parmi nos routes — la fiche de modèle n'existe pas dans notre catalogue, et cette page le dit plutôt que de laisser entendre le contraire. La capture ci-dessous est la page du modèle qui existe bel et bien, Muse Spark 1.2, qui est le checkpoint dont Muse Glimmer a été distillé, et non Muse Glimmer lui-même. Claude Sonnet 5.5 ne figure pas non plus dans notre catalogue, un jour après sa sortie ; la route vers celui-ci passe par l'API propre à A​nthropic, et Claude Sonnet 5 est routable ici depuis le 30 juin à 2,00 $ et 10,00 $ pour quiconque souhaite la cible de préproduction.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Comment décider

Partez de la contrainte, pas du score. Si la requête ne peut pas quitter une machine ou un réseau, Muse Glimmer est la réponse et l'écart d'Index n'a pas d'importance — un modèle 30B Apache 2.0 qui fonctionne hors ligne et égale un modèle de pointe sur le rappel en contexte long est, pour ce travail, la meilleure option disponible. Si la requête doit accomplir une tâche logicielle à plusieurs étapes, un modèle 30B qui obtient un demi pour cent sur Terminal-Bench n'entre pas en lice, quel que soit le matériel que vous possédez déjà.

Entre ces deux pôles, le départage se fait par la mesure plutôt que par l'opinion : les jetons par tâche terminée sur votre propre charge de travail, chiffrés deux fois — une fois aux tarifs de 2,00 $ et 10,00 $ de Claude Sonnet 5.5, et une fois au coût amorti du GPU. Le seul chiffre qui recadre toute la comparaison, 0,06 $ par tâche Index contre 7,60 $, est un montant de location hébergée pour un modèle que la plupart des gens exécuteront eux-mêmes, et le citer comme s'il s'agissait d'une économie à périmètre comparable serait l'erreur facile que cette page a précisément pour but d'éviter.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement