
Muse Glimmer : le modèle d'agent open-weight de 30B de Meta affirme surpasser Gemma4-31B et Qwen3.6-27B
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 par million de tokens · 23 tok/s
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1348 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 283 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
Un post sur X, au matin du 10 août 2026, l'a dit plus crûment que n'importe quel communiqué de presse : « Holy meta is back. » Le communiqué auquel ce post réagissait — Muse Glimmer, le premier modèle open-weight de Meta depuis Llama 4 — est sorti le même jour, et l'annonce de Meta elle-même est presque aussi agressive que le tweet. Le tableau de benchmarks du modèle à 30 milliards de paramètres affirme qu'il bat le Gemma4-31B de Google sur 19 des 24 lignes et le Qwen3.6-27B d'Alibaba sur 14 des 24, en tête avec le benchmark agentique MCP-Atlas, où Meta rapporte respectivement 75,5 contre 54,2 et 62,5.
Avant que « écrasé » ne devienne un fait dans votre esprit, notez qui a produit ces chiffres. Chaque score du tableau de Meta a été obtenu par Meta, contre des modèles rivaux dont Meta lui-même a reconnu n'avoir pas réglé les configurations. Muse Glimmer n'a pas encore d'entrée sur Artificial Analysis, le classement indépendant qui suit précisément cette classe de taille — où Qwen3.6-27B détient actuellement un indice d'intelligence de 46 et Gemma4-31B se situe à 39. C'est donc deux histoires à la fois : une sortie open-weight véritablement importante de la part de Meta, et une affirmation de benchmark qui mettra des semaines à être vérifiée. Cet article les maintient séparées.
Ce qu'est réellement Muse Glimmer
Muse Glimmer est un modèle dense multimodal de 30B — entrée texte et image via un encodeur de perception dédié — entraîné sur plus de 100 langues et publié sous la licence permissive Apache 2.0. Ses poids sont sur Hugging Face à meta-models/Muse-Glimmer-30B. Il s'agit d'une version distillée du modèle propriétaire phare plus grand de Meta, Muse Spark 1.2, et la recette d'entraînement le montre : distillation logit depuis le professeur en pré-entraînement, entraînement intermédiaire sur des données à contexte long et riches en agents, puis ajustement supervisé combiné à une distillation on-policy et à l'apprentissage par renforcement.
Le brief produit est aussi précis que la technologie. Meta a conçu Glimmer pour des « flux de travail d’agents locaux toujours actifs » — un agent qui vit sur votre machine et peut appeler des outils, suivre des plans en plusieurs étapes, se remettre d’un échec d’appel d’outil au lieu de s’arrêter, et ajuster l’effort de raisonnement à la hausse ou à la baisse. Les tâches visées sont les moins glamour : codage local, appels de fonctions, gestion d’agenda, organisation de fichiers, évaluation LLM-as-a-judge. Il est compatible avec des frameworks d’orchestration d’agents comme OpenClaw, qui est la façon dont beaucoup de gens l’exécuteront en pratique.
Le volet matériel est l’autre moitié de l’argumentaire. À pleine précision, un {{1}}modèle 30B nécessite plus de 55 Go de mémoire{{/1}} ; la quantification ~4 bits de Meta la ramène à environ 17 à 20 Go, ce qui tient sur une {{2}}carte grand public de 24 Go ou 32 Go{{/2}} (une RTX 5090 sert de référence) et les Mac haut de gamme à mémoire unifiée. Un {{3}}rédacteur à décodage spéculatif{{/3}} — un petit modèle compagnon que Meta appelle DFlash — accélère la génération : Meta rapporte environ {{4}}3,1x sur une RTX 5090{{/4}} (de 74,9 à 233 tokens/sec dans llama.cpp), {{5}}1,8x sur un M5 Max{{/5}} et {{6}}1,5x sur un M4 Max{{/6}}, où la mémoire unifiée est déjà moins contrainte par la bande passante.
Pourquoi cette version compte au-delà de la fiche technique
Le tweet avait vu juste sur la forme. Depuis Llama 4 au printemps 2025, Meta était resté silencieux sur les poids ouverts, se repliant sur une ligne de front propriétaire sous Meta Superintelligence Labs et le Chief AI Officer Alexandr Wang. Muse Glimmer marque le retour public à la stratégie des poids ouverts qui a fait de Llama la famille de modèles la plus téléchargée de l'IA — et elle arrive avec le signal d'intention le plus fort à ce jour : Zuckerberg a publié un essai de 14 pages, « L'avenir appartient à tout le monde », en parallèle du lancement, arguant que le véritable risque de l'IA est le contrôle concentré et que les poids ouverts sont ce qui permet à l'Amérique de rester compétitive face aux laboratoires chinois de modèles ouverts. Il a appelé à un assouplissement de la réglementation américaine sur l'IA open source, et Meta a annoncé un « Future is for Everyone Fund » d'un milliard de dollars. Meta a également indiqué prévoir de publier les poids du modèle bien plus vaste Muse Spark 1.2 « dans les semaines à venir ».
Ce contexte change la façon dont vous devez lire le tableau de référence. Ce n'est pas une curiosité de laboratoire de recherche lancée en catimini ; c'est une déclaration de stratégie accompagnée d'un modèle. Glimmer occupe la position d'« agent local économique » dans la gamme de Meta, contrant délibérément l'argument selon lequel un travail d'agent sérieux nécessite une API cloud. Savoir s'il tient réellement cette promesse, c'est exactement ce que la question de la vérification cherche à déterminer.

L'affirmation « fumé », ligne par ligne.
Le tableau de Meta compare Muse Glimmer à Gemma4-31B et Qwen3.6-27B sur 24 lignes de benchmarks. Là où il revendique ses plus grandes victoires, le schéma est cohérent : le raisonnement agentique général et la recherche.
• MCP-Atlas (utilisation d'outils agentiques) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. C'est la ligne principale et le plus grand écart de l'ensemble.
• DeepSearch QA — 74,6 contre 61,7 et 71,1.
• GAIA2 (assistant général) — 43,3 contre 36,4 et 40,0.
• WildClawBench (suite agentique) — 47,6 contre 37,6 et 43,2.
• SWE-Bench Pro — 51,2 contre 36,9 et 50,2. Notez le troisième chiffre : 50,2 est la propre mesure de Meta pour Qwen3.6-27B, tandis que le chiffre publié par Alibaba est de 53,5. Même modèle, deux scores différents selon qui l’a exécuté.
• AIME 2026 — 94,7, IFBench 77,0 et AA-LCR 80,0 contre les 68,3 de Gemma.
C'est une ligne solide. Mais le tableau n'est pas un sans-faute, et les lignes où Muse Glimmer perd sont aussi instructives que celles où elle gagne. Qwen3.6-27B tient le terrain en matière d'utilisation pratique de l'ordinateur et de travaux intensifs en terminal : SWE-Bench Verified 77,2 contre 76,0 pour Glimmer, OSWorld-Verified 75,6 contre 65,9, et TerminalBench 2.1 60,7 contre 51,7, plus un avantage constant sur les tests multimodaux comme ScreenSpot Pro, OmniDocBench et MMMU-Pro. Gemma4-31B, pour sa part, affiche le meilleur bilan de sécurité sur les deux métriques que Meta rapporte — le taux de violation le plus bas sur CI Memories et le taux de réussite d'attaque le plus bas sur Siren AgentDojo — et remporte de justesse les tests de raisonnement pointus (GPQA Diamond, Humanity's Last Exam).
Prise au pied de la lettre, l’affirmation de Meta est « bat les deux autres sur la plupart des benchmarks agentiques », et sur son propre tableau, c’est à peu près vrai. Les réserves sont le cœur du sujet. Meta a effectué elle-même chaque ligne du tableau et a admis que ses configurations de test pour les modèles rivaux n’avaient pas été réglées comme la sienne. Ce n’est pas une accusation de fraude — des configurations des rivaux non réglées sont un péché courant, voire attendu, dans cette industrie — mais c’est exactement la raison pour laquelle les tableaux produits par les fournisseurs appellent une confirmation indépendante. L’écart concernant Qwen SWE-Bench Pro ci-dessus est tout le problème en miniature.
Ce que dit le tableau d'affichage indépendant
Artificial Analysis ne répertorie pas encore Muse Glimmer — le modèle n'a que quelques jours, et l'indice d'AA repose sur ses propres tests, qui prennent du temps. Mais AA suit bien les deux rivaux, ce qui donne une mesure du terrain que le nouveau venu prétend investir. À l'heure actuelle, Qwen3.6-27B affiche un indice d'intelligence de 46, décrit par AA comme le modèle à poids ouverts le plus intelligent de moins de 150 milliards de paramètres ; Gemma4-31B se situe à 39. Ce sont des chiffres indépendants, et non des allégations du fournisseur.
L'analyse indépendante révèle également une subtilité de coût que les chiffres clés masquent. Les données d'efficacité d'AA montrent que Qwen3.6-27B génère environ 54,6 tokens/sec contre 34,8 pour Gemma4-31B, avec un temps de génération du premier token plus rapide pour Gemma — mais Qwen utilise environ 3,7 fois plus de tokens de sortie pour exécuter l'index complet, ce qui rend l'évaluation de bout en bout environ 21 fois plus coûteuse. Les modèles gourmands en tokens sont plus coûteux dans le monde réel, même lorsque leurs résultats aux benchmarks sont meilleurs, et c'est un élément de décision qu'aucun tableau de fournisseur ne révélera de lui-même.
Donc, l'état honnête du monde au moment où j'écris est le suivant : un résultat solide rapporté par le fournisseur, aucun résultat indépendant du tout pour l'instant pour Muse Glimmer, et un champ rival mesuré indépendamment et divisé par tâche. « Smoked Gemma et Qwen » est une affirmation en bonne et due forme ; ce n'est pas encore un résultat vérifié. Les marqueurs de vérification à surveiller sont une entrée dans l'index AA, LMArena Elo et les reproductions communautaires — qui arrivent généralement en quelques semaines après une sortie comme celle-ci.

Ce qu'il en coûte réellement pour le faire fonctionner
Muse Glimmer est gratuit — Apache 2.0, pas de frais par jeton, aucun paiement à Meta. Le coût, c'est le matériel que vous mettez dessous. Un modèle de 30B en 4 bits nécessite environ 17 à 20 Go de mémoire résidente, plus de la place pour le cache KV, l'encodeur de perception et le DFlash drafter, c'est pourquoi Meta recommande elle-même une carte de 24 Go ou 32 Go, ou un Mac haut de gamme. Si vous possédez ce matériel, le coût marginal d'un agent local toujours actif est essentiellement l'électricité. Sinon, un GPU de 24 Go ou un Mac de la série M poussé à fond représente un vrai poste de dépense — et depuis le 9 août, il existe une troisième option : le louer. Les premières offres d'API hébergées, disponibles à cette date, facturent Muse Glimmer à 0,35 $ par million de jetons en entrée et 1,50 $ par million de jetons en sortie sur une fenêtre de contexte de 131K. C'est un tarif de marché indiqué par le fournisseur, et non un prix Meta, mais c'est le montant que vous pouvez réellement payer aujourd'hui si vous préférez ne pas acheter de matériel.
C'est la comparaison qui vaut la peine d'être faite avec soin, car « poids ouverts, prix zéro » rencontre « API hébergée, prix par jeton » à des conditions très différentes. Quand on fait les calculs, il faut évaluer honnêtement les deux côtés. De notre côté chez OrcaRouter, le prix que vous voyez pour chacun des 200+ modèles hébergés est le prix catalogue du fournisseur, répercuté avec une marge de 0 %, de sorte qu'une baisse de prix du fournisseur est disponible ici le jour même plutôt qu'après un recalcul de marge — ce qui rend la comparaison entre local et hébergé directe. Muse Glimmer lui-même ne fait pas encore partie de ces 200+ modèles, donc cette répercussion ne s'applique pas à lui aujourd'hui. Mais la discipline est le point : la façon de tarifer un modèle à poids ouverts non éprouvé est votre propre trafic, et non un tableau fournisseur, et le DSL de routage existe pour mener exactement cette comparaison une fois qu'un modèle est derrière une API que vous pouvez appeler.
Comment vous l'utiliseriez concrètement cette semaine
Parce qu'il est distribué en poids ouverts, « l'accès » n'est pas une inscription — c'est un téléchargement. Le dépôt principal est meta-models/Muse-Glimmer-30B sur Hugging Face, avec une variante GGUF déjà publiée et des variantes de quantification provenant de tiers. Dès le premier jour, l'exécution était prise en charge par llama.cpp, MLX et ExecuTorch, avec des intégrations Ollama, LM Studio, vLLM et SGLang arrivées dans les jours suivant la sortie, et des travaux d'optimisation matérielle prévus pour AMD, Arm, Dell, Intel et Nvidia. La voie pratique pour la plupart des gens est : récupérer le GGUF, le charger dans llama.cpp ou un exécuteur local, et y pointer un scaffold d'agent. Meta n'héberge aucune API publique pour Glimmer lui-même, et la voie locale est celle autour de laquelle le modèle a été conçu — mais la voie hébergée n'est plus hypothétique : des plateformes tierces ont commencé à le servir le 9 août, donc « télécharger et exécuter » et « appeler une API » sont désormais deux options viables.
Pour être honnête à notre sujet : Muse Glimmer n'est toujours pas disponible via OrcaRouter. Nous routons des API hébergées, et au moment de cette mise à jour, le modèle n'a pas encore rejoint notre catalogue — l'offre de marge de 0 % et de clé unique pour tout s'applique aux 200+ modèles que nous routons, et celui-ci n'en fait pas encore partie. Lorsqu'il le sera, la même clé qui atteint le reste du catalogue l'atteindra sans nouveau contrat, et le basculement automatique est le mécanisme qui rend sûr le fait de pointer du trafic réel vers un modèle tout nouveau, rapporté par le fournisseur, avant qu'il ne dispose d'un historique indépendant. C'est la même raison pour laquelle le DSL de routage existe : un modèle non éprouvé doit gagner sa place en production sur vos données, pas sur son propre communiqué de presse.
La capture d'écran ci-dessous montre la carte Hugging Face telle qu'elle se présentait le jour de sa sortie — sa mention « non déployé par aucun fournisseur d'inférence » fait référence à l'inférence propriétaire de Hugging Face, ce qui est distinct des annonces d'API hébergées par des tiers mises en ligne le 9 août.

Que regarder
Trois éléments trancheront cette histoire, par ordre approximatif de rapidité. Premièrement, la sortie promise des poids ouverts de Muse Spark 1.2 — si le modèle enseignant est livré dans les « prochaines semaines », Glimmer cesse d'être un cas isolé et devient le premier maillon d'une gamme complète de poids ouverts, ce qui constitue la véritable lecture stratégique du « Meta est de retour ». Deuxièmement, la mesure indépendante : une entrée dans l'index Artificial Analysis, un classement sur LMArena et des reproductions communautaires vous diront si l'affirmation de 19 sur 24 survit au contact avec quelqu'un qui n'est pas Meta. Troisièmement, la vague d'hébergement — celle-ci a déjà commencé. Les fournisseurs ont commencé à proposer Glimmer le 9 août ; la question du local par rapport à l'hébergement est donc désormais un véritable choix que l'on peut exercer avec une seule clé API. Ce qu'il reste à surveiller, c'est l'ampleur que prendra la diffusion de l'hébergement et ce que fera le prix par jeton une fois l'effet de nouveauté de la semaine de lancement dissipé.
Le tweet avait raison sur l'actualité. Savoir s'il avait raison sur le verdict — c'est une question de semaines, et la position honnête, à l'heure actuelle, est que personne en dehors de Meta n'a assez fait tourner le modèle pour le savoir. Ce qui est déjà vrai, c'est qu'un modèle agent 30B sous licence Apache-2.0, qui tient sur un GPU grand public et qui est soutenu par une poussée stratégique complète, est une sortie autour de laquelle il faut planifier, quels que soient ses scores indépendants finaux.
Des questions qui méritent vraiment qu'on y réponde
Muse Glimmer est-il vraiment open source ?
Il s'agit de poids ouverts sous la licence permissive Apache 2.0 — n'importe qui peut télécharger, modifier, affiner et déployer le modèle commercialement sans payer Meta. La formulation est soigneusement choisie : « open weights » plutôt que « open source » au sens strict de l'OSI, car les données d'entraînement, les poids du professeur Muse Spark et certains outils ne sont pas inclus. Concrètement — vous pouvez l'exécuter, le distribuer et vendre un produit basé dessus — c'est le même principe qui a fait de Llama la famille ouverte la plus déployée en IA.
Est-ce que Muse Glimmer bat vraiment Gemma4-31B et Qwen3.6-27B ?
Sur le propre tableau de Meta, oui sur la plupart des benchmarks agentiques et de recherche, avec les réserves que Meta a elle-même mené la comparaison et n'a pas optimisé les configurations de ses rivaux. Le tableau honnête est plus précis : Meta remporte les lignes de raisonnement agentique, Qwen3.6-27B remporte l'utilisation pratique de l'ordinateur et le travail en terminal, plus la plupart des tests multimodaux, et Gemma4-31B affiche le meilleur bilan de sécurité. Au jour de la sortie, il n'existe aucune entrée d'index indépendante pour Muse Glimmer, donc considérez l'affirmation de 19 sur 24 comme déclarée par le fournisseur jusqu'à ce que quelqu'un d'autre l'exécute.
Puis-je l'exécuter sur un ordinateur portable ?
Seulement si « laptop » désigne un appareil doté d'un GPU discret de 24 Go ou 32 Go, ou un Mac haut de gamme de la série M avec suffisamment de mémoire unifiée — un Muse Glimmer en 4 bits nécessite environ 17 à 20 Go, plus une marge pour le cache KV, l'encodeur de perception et le rédacteur DFlash. C'est un véritable achat pour la plupart des gens, et c'est le coût caché d'un modèle « gratuit ». Avec des graphiques intégrés ou une machine de 16 Go, vous auriez affaire à une quantification lourde et à une sortie lente, plutôt qu'à l'agent toujours actif autour duquel la version est conçue.
Où puis-je l'obtenir — est-ce sur une API ?
Les poids sont sur Hugging Face à meta-models/Muse-Glimmer-30B (avec une variante GGUF), et vous pouvez l’exécuter localement via llama.cpp, MLX, ExecuTorch, ou les outils d’exécution locaux qui l’intègrent désormais. L’accès à l’API hébergée est aussi disponible, à compter du 9 août, via des plateformes tierces au tarif de 0,35 $ par million de jetons d’entrée et 1,50 $ par million de jetons de sortie — vous n’avez donc plus besoin de posséder un GPU de 24 Go pour y faire appel. Meta elle-même n’héberge toujours pas d’API publique pour Glimmer, et il n’est pas encore sur OrcaRouter. Quand il arrivera dans notre catalogue, la même clé qui donne accès au reste du catalogue y donnera accès ; en attendant, les deux voies honnêtes sont l’inférence locale ou une plateforme hébergée tierce.
