
Claude Sonnet 5.5 vs Muse Glimmer : un modèle 30B pour ordinateur portable face au nouveau Sonnet
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 931 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 192 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
La question de fond pour cette page est de savoir si la comparaison est légitime tout court, et la réponse honnête est que Claude Sonnet 5.5 et Muse Glimmer ne sont pas des concurrents au sens ordinaire. Sur l'Intelligence Index d'Artificial Analysis, révision v4.3.2, Claude Sonnet 5.5 obtient 56 et Muse Glimmer 17, et cet écart n'est pas du bruit — c'est à peu près la distance entre un modèle généraliste de frontière et un très bon petit modèle. Ce qui rend malgré tout ce rapprochement intéressant à lire, c'est que Muse Glimmer possède une propriété que l'autre ne peut acheter à aucun prix : c'est un modèle à poids ouverts de 30 milliards de paramètres, publié par Meta le 10 août 2026 sous licence Apache 2.0, quantifié en 4 bits pour tenir sous 20 Go de VRAM, et conçu pour fonctionner avec le réseau débranché. Claude Sonnet 5.5 est arrivé le 28 septembre 2026 comme le Sonnet le plus rapide et le plus intelligent de son éditeur, à 2,00 $ par million de tokens en entrée et 10,00 $ par million de tokens en sortie, et accessible uniquement via le réseau. La vraie décision n'est pas de savoir quel modèle est meilleur. C'est de savoir où vous voulez que les tokens s'exécutent.
Deux modèles, deux définitions du poste
Muse Glimmer sort des Meta Superintelligence Labs sous la forme d'un modèle de 30 milliards de paramètres entraîné par distillation de logits à partir du plus grand modèle enseignant Muse Spark de Meta, puis affiné sur des données agentiques à contexte long et renforcé pour l'utilisation d'outils. Meta le livre déjà quantifié : la quantification 4 bits fait passer l'empreinte mémoire de plus de 55 Go en pleine précision à moins de 20 Go, ce qui lui permet de tenir dans l'enveloppe d'un GPU grand public de 24 Go ou 32 Go. Meta l'a testé sur une Nvidia RTX 5090 ainsi que sur des puces Apple M4 Max et M5 Max. Il accepte des entrées texte et image, renvoie du texte, fonctionne avec une fenêtre de contexte de 131 072 tokens que Meta affirme pouvoir étendre à 262 144, et présente une date de coupure des connaissances de janvier 2026.

Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d’Anthropic et celui que l’entreprise positionne comme la meilleure combinaison de vitesse et d’intelligence de sa gamme. Il fonctionne avec une fenêtre de 1 000 000 de jetons, jusqu’à 128 000 jetons de sortie en mode synchrone et 300 000 sur l’API Message Batches derrière l’en-tête output-300k-2026-03-24, accepte le texte, les images et les fichiers, propose une réflexion adaptative à effort sélectionnable avec une date limite de connaissances de juin 2026, et est disponible avec une rétention zéro des données dès le lancement. Le stockage coûte 0,20 $ par million de jetons en lecture de cache et 2,50 $ par million en écriture de cache. Anthropic affirme qu’il est 30 % plus rapide que Claude Sonnet 5 et coûte jusqu’à 30 % de moins par tâche à tarifs inchangés — des affirmations du fournisseur, non reproduites de manière indépendante.
Le contraste des spécifications vaut la peine d’être observé en une seule passe, car presque chaque ligne relève d’un type de chose différent plutôt que d’une chose meilleure ou pire :
• Poids — Muse Glimmer Apache 2.0, téléchargeables, quantifiés en 4 bits vs Claude Sonnet 5.5 fermé
• Où cela s’exécute — Muse Glimmer sur votre propre GPU, hors ligne vs Claude Sonnet 5.5 sur l’infrastructure Anthropic
• Paramètres — Muse Glimmer 30B au total, moins de 20 Go en 4 bits par rapport à Claude Sonnet 5.5 non divulgué
• Contexte — Muse Glimmer 131 072 tokens, extensible jusqu'à 262 144 vs Claude Sonnet 5.5 1 000 000 tokens
• Prix par million — Muse Glimmer, aucuns frais par token, votre matériel vs Claude Sonnet 5.5 — 2,00 $ en entrée / 10,00 $ en sortie
• Indice d'intelligence v4.3.2 — Muse Glimmer 17 vs Claude Sonnet 5.5 56
• Coût par tâche Index tel que mesuré — Muse Glimmer 0,06 $ vs Claude Sonnet 5.5 7,60 $
Deux chiffres de cette liste méritent d'être décortiqués, car tous deux sont des pièges. Le premier est le chiffre de 0,06 $ par tâche : c'est ce qu'Artificial Analysis a dépensé en appelant Muse Glimmer (high) via un point de terminaison hébergé, à 0,325 $ par million en entrée et 1,35 $ par million en sortie ; il mesure donc l'économie de la location de ce modèle, non son exécution. En auto-hébergement, le coût marginal par token disparaît, remplacé par un GPU que vous possédez déjà ou devez acheter. Le second est l'écart de l'Index lui-même — un modèle 30B quantifié en 20 Go est évalué à la même aune que les modèles de pointe, et le classement le dit bien lorsqu'il place Muse Glimmer parmi la poignée de modèles à poids ouverts les plus performants tout en notant qu'il est cher pour sa taille.

Là où Muse Glimmer est vraiment bon, et où ça déraille
Le score composite est bien trop grossier pour constituer la réponse complète, car Muse Glimmer n’est pas uniformément à dix-sept. Il est rapide — Artificial Analysis mesure 143,8 jetons de sortie par seconde, devant les 138,7 de Claude Sonnet 5.5 — et concis, générant 59 M de jetons sur l’évaluation Index contre 410 M pour Claude Sonnet 5.5. Et sur une évaluation, il est proche de la frontière : le rappel en contexte long, où il obtient 83,3 % contre 82,7 % pour Claude Sonnet 5.5. Un modèle de 30 B qui égale un tout nouveau Sonnet de frontière sur la récupération en contexte long est la ligne la plus surprenante de cette page, et cela concorde avec la façon dont Meta l’a entraîné — des données agentiques à contexte long, une distillation à partir d’un enseignant bien plus grand.
Les résultats agentiques sont là où le plafond du modèle se révèle et où le classement cesse d'être flatteur. Sur Terminal-Bench 4.0, Muse Glimmer obtient 0,5 % contre 63,6 % pour Claude Sonnet 5.5. Son score au benchmark d'automatisation est de 0,068 contre 0,713. Humanity's Last Exam : 22,0 % contre 55,0 %. Un résultat d'une échelle aussi faible sur un benchmark d'exécution signifie que le modèle n'achève pas les tâches, et aucune économie d'hébergement local ne rend moins coûteuse une tâche qui ne se termine jamais.
La littérature scientifique est tout aussi directe à ce sujet, et il vaut la peine de le dire plutôt que de l’enterrer : une étude d’orchestration multi-agents évaluée par les pairs, dans laquelle Muse-Glimmer-30B était l’un des modèles testés, a constaté qu’il n’avait récupéré aucun de ses candidats. Le tableau de benchmarks de Meta lui-même pour le modèle est un document de fournisseur et est étiqueté comme tel ici ; les chiffres d’Artificial Analysis ci-dessus sont des mesures indépendantes, et ce sont ceux sur lesquels cet article s’appuie.
Ainsi, la séparation est lisible. Muse Glimmer est puissant pour sa taille pour lire une longue entrée et y répondre, rapide, peu coûteux à exécuter, et il tient dans un GPU de classe ordinateur portable. Ce n’est pas un modèle auquel on confie une tâche logicielle en plusieurs étapes avant de s’en aller. C’est là la limite honnête, et une comparaison écrite uniquement autour de scores composites la masquerait.
Ce que vous achetez réellement au tarif frontière
Le premium de Claude Sonnet 5.5 mise d'abord sur la capacité, et l'écart de dix-sept points dans l'Index en est l'illustration la plus visible. Mais trois autres choses accompagnent le tarif de sortie de 10,00 $ qui n'apparaissent sur aucun classement.
Le premier point est la fenêtre. Un million de jetons représente environ sept fois et demie les 131 072 de Muse Glimmer, et Anthropic facture le tarif standard sur la totalité, avec des lectures de cache à un dixième du prix d’entrée, de sorte que conserver un grand contexte au fil de nombreux appels soit abordable plutôt que théorique. Une invite à l’échelle d’un dépôt ne tient pas du tout dans la fenêtre plus petite ; il s’agit donc d’une différence de capacité, et non d’une préférence.
Le deuxième point est la fidélité des outils. Cinq comportements ont changé entre Claude Sonnet 5 et Claude Sonnet 5.5, et tous les cinq concernent l'utilisation des outils et le raisonnement : les paramètres d'échantillonnage non par défaut renvoient désormais une erreur 400, thinking: {"type": "disabled"} renvoie désormais une erreur 400 et devient between_tools, le choix d'outil forcé sur "any" ou un outil nommé est rejeté, si bien que les boucles doivent passer à auto avec l'utilisation stricte des outils, l'ancien outil computer_20251124 est refusé sur l'API Claude et Google Cloud, et les blocs de réflexion sont désormais liés au modèle et au compte qui les produisent. Un sixième changement ne fait rien échouer, mais passe sous silence : le texte entre les appels d'outils est renvoyé à l'intérieur des blocs de réflexion, de sorte qu'une application en streaming cesse d'afficher du texte jusqu'à ce qu'elle définisse une valeur d'affichage ou désactive la réflexion en amont. Cela représente une journée de travail de migration pour quiconque utilise Sonnet 5, et c'est le prix à payer pour la fiabilité agentique que mesurent les lignes de benchmark ci-dessus.
Le troisième point concerne la provenance et le traitement des données. La rétention zéro des données est disponible dès le lancement, Anthropic publie un seuil de retrait au 28 septembre 2027, et le modèle est disponible sur l'API Claude, Bedrock, Google Cloud et Microsoft Foundry. Pour un acheteur soumis à réglementation, ce sont des faits d'approvisionnement qui décident de l'achat avant même que le benchmark n'entre en jeu.
Hors ligne est une exigence, pas une économie de coûts
La raison pour laquelle ce duo a sa place sur une seule et même page, c'est que pour une catégorie précise de déploiement, Muse Glimmer n'est pas une option moins chère : c'est la seule option. Une requête qui ne peut pas quitter l'appareil, un atelier de production ou un site de terrain sans connectivité, un environnement isolé où un appel API constitue une violation de conformité, ou un budget de latence où un aller-retour est déjà de trop : rien de tout cela ne se résout avec un meilleur modèle derrière un réseau. Des poids Apache 2.0 qui tiennent sous 20 Go et fonctionnent hors ligne constituent la réponse entière, et Claude Sonnet 5.5, quel qu'en soit le prix, n'entre pas dans l'équation.
Meta a publié des tests sur les puces RTX 5090, Apple M4 Max et M5 Max qui constituent la référence pratique de ce que « s'exécute localement » signifie ici, et c'est la quantification 4 bits qui rend ces cibles atteignables tout court — l'empreinte en pleine précision dépasse 55 Go. Quiconque envisage un déploiement devrait considérer les chiffres matériels comme ceux de Meta plutôt que comme mesurés ici.
Pour tous les autres, les deux modèles sont complémentaires plutôt que substituables, et la partie opérationnellement délicate est que détenir un modèle d'API Anthropic et un modèle Meta auto-hébergé signifie normalement deux piles entièrement séparées. OrcaRouter place plus de 200 modèles derrière un unique point de terminaison compatible avec OpenAI, avec le prix catalogue du fournisseur répercuté et sans marge ajoutée, basculement automatique entre fournisseurs en amont et un DSL de routage pour composer des appels — ce qui couvre la moitié hébergée de ce dispositif, et le modèle enseignant Muse Spark 1.2 plus grand de Meta est routable ici en tant que meta/muse-spark-1.2 à 1,25 $ en entrée et 4,25 $ en sortie par million de tokens sur une fenêtre de 1 048 576 tokens, avec des lectures de cache à 0,15 $. Il transporte 42,8 millions de tokens de trafic par semaine via ce catalogue, ce qui est la partie utile de ce dispositif : le modèle enseignant hébergé est sur la même clé que tout le reste, et le modèle que vous exécutez localement n'a jamais besoin de toucher un réseau, tout simplement.
Trois remarques d'honnêteté, car il est facile de se tromper. Muse Glimmer lui-même ne figure pas parmi nos routes — la fiche de modèle n'existe pas dans notre catalogue, et cette page le dit plutôt que de laisser entendre le contraire. La capture ci-dessous est la page du modèle qui existe bel et bien, Muse Spark 1.2, qui est le checkpoint dont Muse Glimmer a été distillé, et non Muse Glimmer lui-même. Claude Sonnet 5.5 ne figure pas non plus dans notre catalogue, un jour après sa sortie ; la route vers celui-ci passe par l'API propre à Anthropic, et Claude Sonnet 5 est routable ici depuis le 30 juin à 2,00 $ et 10,00 $ pour quiconque souhaite la cible de préproduction.

Comment décider
Partez de la contrainte, pas du score. Si la requête ne peut pas quitter une machine ou un réseau, Muse Glimmer est la réponse et l'écart d'Index n'a pas d'importance — un modèle 30B Apache 2.0 qui fonctionne hors ligne et égale un modèle de pointe sur le rappel en contexte long est, pour ce travail, la meilleure option disponible. Si la requête doit accomplir une tâche logicielle à plusieurs étapes, un modèle 30B qui obtient un demi pour cent sur Terminal-Bench n'entre pas en lice, quel que soit le matériel que vous possédez déjà.
Entre ces deux pôles, le départage se fait par la mesure plutôt que par l'opinion : les jetons par tâche terminée sur votre propre charge de travail, chiffrés deux fois — une fois aux tarifs de 2,00 $ et 10,00 $ de Claude Sonnet 5.5, et une fois au coût amorti du GPU. Le seul chiffre qui recadre toute la comparaison, 0,06 $ par tâche Index contre 7,60 $, est un montant de location hébergée pour un modèle que la plupart des gens exécuteront eux-mêmes, et le citer comme s'il s'agissait d'une économie à périmètre comparable serait l'erreur facile que cette page a précisément pour but d'éviter.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
