
Muse Spark 1.2 vs Gemini 3.5 Flash-Lite : Deux laboratoires, deux définitions du sous-agent
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxNOUVEAUMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
À deux semaines d’intervalle, deux laboratoires ont envoyé un modèle et l’ont décrit avec le même mot. Selon sa propre fiche modèle, Gemini 3.5 Flash-Lite est « adapté aux sous-agents qui exécutent des tâches ciblées dans des flux de travail multi-agents complexes. » Meta affirme que Muse Spark 1.2 peut servir « soit d’agent principal pour la planification et la délégation, soit de sous-agent exécuté en parallèle. » Même vocabulaire, et il a fallu qu’Artificial Analysis fasse passer les deux à travers son Intelligence Index pour montrer à quel point ils le comprennent différemment : Flash-Lite a terminé la suite en 43 millions de jetons de sortie, Muse Spark 1.2 en a nécessité 95 millions. L’un de ces modèles pense brièvement et souvent ; l’autre pense intensément et longuement. Tous deux appellent le résultat un sous-agent.
Ce ratio de tokens est le chiffre le plus déterminant de la comparaison, car un palier de sous-agents est fait pour être déployé en éventail — vingt à la fois, cent à la fois — et le fan-out amplifie toutes les habitudes du modèle à chaque appel. Ce qui suit passe en revue ce que chaque laboratoire a réellement construit, ce que donne l'arithmétique du fan-out aux prix réels, et les cas où l'option bon marché se révèle être le choix coûteux.
Ce que chaque laboratoire entend par le mot
La version Flash-Lite est une définition de rôle par la taille. Gemini 3.5 Flash-Lite est le palier le moins cher de sa gamme, et ce positionnement est remarquable en ce qu'il lie directement les niveaux de réflexion aux charges de travail multi-étapes des sous-agents — la première fois qu'un palier de cette gamme est décrit par son rôle d'agent plutôt que par sa taille ou sa vitesse. Le raisonnement est obligatoire, mais l'effort par défaut est minimal, le curseur plafonne à « élevé », et le modèle est conçu pour être instancié en masse et répondre rapidement. Le fournisseur annonce 54,2 % sur SWE-Bench Pro contre 49,6 % pour Gemini 3 Flash, et 74,0 % sur OSWorld-Verified contre 65,1 % — des chiffres avancés par le fournisseur, non reproduits de manière indépendante, et tous deux présentés comme des gains agentiques plutôt que des gains d'intelligence brute.
La version de Meta est une définition de rôle par topologie. La description du produit Muse Spark 1.2 évoque un modèle capable de rassembler le contexte, d’élaborer un plan et de déléguer l’exécution à des sous-agents parallèles — ou d’être lui-même l’un de ces sous-agents. Son cadran de raisonnement va de minimal à xhigh avec une valeur par défaut de medium. Meta nomme explicitement les charges de travail ciblées : refactorisations multi-fichiers, sessions de débogage prolongées, génération de dépôt entier. C’est un modèle conçu pour être l’orchestrateur qui peut aussi faire le travail, ce qui est un produit différent d’un modèle conçu pour être créé vingt à la fois.
Aucun des deux laboratoires n'a publié de benchmark pour cette affirmation spécifique. Meta a livré la version 1.2 le 5 août sans aucun article de lancement — sa page d'annonce de Muse Spark 1.1 décrit toujours la version précédente.
L'écart réellement mesuré par l'indice

Scores indépendants, provenant d'Artificial Analysis exécutant le même composite de neuf évaluations sur les deux :
• Indice d'intelligence — Muse Spark 1.2 (xhigh) 54, rang #13 sur 185. Gemini 3.5 Flash-Lite 36, rang #20 sur 163. Dix-huit points, contre une médiane de classe de 32.
• Vitesse de sortie — 165,0 tokens par seconde contre 343,6. Flash-Lite diffuse plus de deux fois plus vite.
• Temps jusqu'au premier jeton — 26,12 secondes contre 10,30, tous deux à effort maximal. Artificial Analysis note que les 10,30 s de Flash-Lite se situent eux-mêmes dans le haut de la fourchette pour les modèles de raisonnement de sa gamme de prix.
• Verbosité — 95M de jetons de sortie contre 43M pour la même suite, avec une médiane de 65M sur tous les modèles. Muse Spark 1.2 est 46% au-dessus de la médiane ; Flash-Lite est 34% en dessous.
• Coût de fonctionnement de l'indice — 637,85 $ contre 153,08 $.
• Par dimension — Les sous-indices d'Artificial Analysis placent Gemini 3.5 Flash-Lite à 49,3 en codage et 26,8 en agentique. Il n'existe pas encore de répartition publiée pour Muse Spark 1.2 ; son prédécesseur a obtenu 71,3 et 37,5.
Dix-huit points d'indice, ce n'est pas une différence d'arrondi. Ce ne sont pas deux candidats pour la même place.
L'arithmétique du fan-out
Le prix par token est le mauvais prisme pour un niveau de sous-agents, car tout l'intérêt de ce niveau est d'en exécuter beaucoup. Prenons un exemple aux prix catalogue — 0,30 $ en entrée et 2,50 $ en sortie pour Gemini 3.5 Flash-Lite, 1,25 $ en entrée et 4,25 $ en sortie pour Muse Spark 1.2.
Un orchestrateur envoie vingt sous-agents. Chacun lit 25 000 jetons de contexte ciblé et écrit 1 500 jetons en retour.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = environ 22.5 cents par fan-out.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = environ 75 cents par fan-out.
Trois fois et un tiers, ce qui semble gérable. Appliquons maintenant la différence de verbosité mesurée. Si Muse Spark 1.2 écrit proportionnellement plus que Flash-Lite, comme il l'a fait sur l'index — environ 2,2 fois plus de jetons de sortie pour un travail identique — ces réponses de 1 500 jetons deviennent environ 3 300, et le fan-out passe à environ 91 cents. Quatre fois, pas trois. À cent fan-outs par heure dans un système d'agents très sollicité, c'est la différence entre 22 $ et 91 $ de l'heure, soit environ 600 000 $ par an de différence en charge continue.
Deux détails de tarification élargissent encore l'écart réel dans un sens et le rétrécissent dans l'autre :
• Flash-Lite facture le raisonnement interne au tarif de sortie. Sa grille tarifaire affiche les jetons de raisonnement interne à 2,50 $ par million — soit le même tarif que la sortie visible. Réfléchir n'est pas gratuit, c'est simplement invisible dans la réponse. Si un sous-agent réfléchit pendant 2 000 jetons avant de répondre, ajoutez un demi-cent par appel, ou 10 cents pour l'ensemble des appels.
• La mise en cache favorise Muse Spark 1.2 en termes de ratio. Les lectures d’entrée en cache coûtent 0,15 $ par million, contre un prix catalogue de 1,25 $, soit une remise de 88 %. Flash-Lite facture les lectures d’entrée en cache à 0,03 $ contre 0,30 $, soit une remise de 90 %, mais facture aussi environ 0,083 $ par million pour écrire le cache, tandis que Muse Spark 1.2 n’annonce aucun frais distinct d’écriture du cache. Pour un fan-out où chaque sous-agent partage le même préfixe de grande taille, l’écart se réduit considérablement.

La latence de production est le domaine où Flash-Lite creuse le plus l'écart, et les chiffres des benchmarks le masquent. Sur OrcaRouter, sur une semaine glissante de trafic réel, Gemini 3.5 Flash-Lite affiche un temps p50 jusqu'au premier jeton de 816 millisecondes et un p95 de 4,57 secondes. Muse Spark 1.1 — le proxy disponible le plus proche, puisque 1.2 n'a pas encore de télémétrie — affiche un p50 de 1,84 seconde et un p95 de 6,00 secondes. Lorsque vingt sous-agents s'exécutent en parallèle, le plus lent fixe le temps d'horloge, donc c'est le p95 qui régit votre latence de fan-out, pas le p50.
Quand l'option bon marché est le mauvais choix.
Quatre contraintes sur Gemini 3.5 Flash-Lite qui n'apparaissent pas dans une comparaison de prix et qui apparaîtront lors d'une revue d'incident.
• Un plafond de sortie de 65 536 jetons. La moitié de ce que permettent la plupart des modèles de cette classe, et un mur infranchissable pour un sous-agent chargé de générer un gros fichier ou de retourner un long document structuré. Le point de terminaison de Muse Spark 1.2 ne déclare aucune longueur maximale de complétion — ce qui est assez inhabituel pour être testé plutôt que cru, mais ce n'est pas une limite documentée.
• Il s'agit d'un endpoint non modéré. La fiche Flash-Lite ne comporte aucun indicateur de modération ; celle de Meta pour Muse Spark 1.2 en comporte un. C'est un véritable avantage pour certaines charges de travail et un problème de conformité pour d'autres, et cela devrait être un choix délibéré plutôt qu'une découverte.
• Recherche intégrée coûteuse. L'outil de recherche web de Flash-Lite est facturé environ 14 $ pour mille appels, contre 2,50 $ pour Muse Spark 1.2. Si vos sous-agents effectuent des recherches plutôt que de simplement lire, le modèle bon marché devient le coûteux — cinq fois et demie plus — et le volume de recherche dans une architecture en éventail évolue avec le fan-out.
• Son prix a augmenté, pas baissé. Le Gemini 3.5 Flash-Lite est affiché à 0,30 $ et 2,50 $, alors que le précédent Gemini 3.1 Flash-Lite était à 0,25 $ et 1,50 $. La sortie est 67 % plus chère que le palier qu'elle remplace. Si vous avez dimensionné un budget de sous-agent sur l'ancien modèle, redimensionnez-le.

Encore une asymétrie qu'il vaut la peine d'énoncer clairement : Muse Spark 1.2 est servi par exactement un fournisseur — Meta — sans hôtes tiers ni solution de repli. Gemini 3.5 Flash-Lite présente l'empreinte de service multi-régions classique du fournisseur. Pour un orchestrateur, c'est un point de défaillance unique pour tout votre arbre d'agents ; pour un niveau de nœuds de travail, c'est un point de défaillance unique pour le fan-out.
L'association que la plupart des équipes finiront par adopter
Lus en regard l'un de l'autre, ces deux modèles ne sont pas tant des concurrents que les deux moitiés d'une même architecture, et le propre texte commercial de Meta le confirme lorsqu'il décrit le rôle d'agent principal séparément de celui de sous-agent.
La forme qui découle des chiffres : Muse Spark 1.2 comme orchestrateur, Gemini 3.5 Flash-Lite comme travailleurs. Un appel coûteux et délibéré qui lit le dépôt, conserve le plan et décide ce qui doit être délégué — où 26 secondes de réflexion et une verbosité à l’échelle de 95M de jetons vous valent un plan digne d’exécution — suivi de vingt appels bon marché, rapides et ciblés, qui font chacun une seule chose limitée et reviennent en moins d’une seconde à p50. Vous payez des tarifs quasi-frontière une fois par tâche et des tarifs économiques par unité de travail, ce qui est exactement la courbe de coûts qu’une architecture fan-out recherche.
Inversez-le et l'économie s'effondre. Vingt sous-agents Muse Spark 1.2 à 91 cents le fan-out représentent une facture quatre fois supérieure à celle d'un travail qu'un modèle plus faible de 18 points termine en un tiers du temps, et un orchestrateur Flash-Lite à l'indice 36 produira des plans que les travailleurs ne pourront pas récupérer.
Construire un système réparti entre deux fournisseurs était la partie délicate. Gemini 3.5 Flash-Lite figure dans le catalogue OrcaRouter à $0.30 et $2.50 — prix catalogue du fournisseur, répercuté sans marge (0 %), donc un changement de prix nous parvient le jour même plutôt qu'après un cycle contractuel — et Muse Spark 1.1 y figure à $1.25 et $4.25 sur la même base, tous deux derrière un même endpoint compatible OpenAI. Cela signifie que le schéma orchestrateur-et-travailleurs se résume à deux chaînes de modèles dans une même base de code, plutôt qu'à deux SDK, deux clés et deux factures, et que le basculement automatique couvre le cas où un fournisseur a un mauvais après-midi au milieu d'un fan-out. Pour être précis sur ce qui est disponible : Muse Spark 1.2 lui-même n'est pas encore dans le catalogue — Meta le sert directement en tant que fournisseur unique — donc aujourd'hui, la version la plus proche de cette pile fait tourner la 1.1 dans le rôle d'orchestrateur.
Choisissez par rôle, pas par score
Si vous choisissez un niveau de travailleur — analyse de documents, extraction de données, modifications de fichiers ciblées, classification, le milieu étroit et répétitif d'un arbre d'agents — Gemini 3.5 Flash-Lite est le meilleur instrument, et le déficit de 18 points sur l'indice est en grande partie sans importance, car vous ne lui demandez pas de raisonner. Surveillez le plafond de sortie et la tarification de la recherche.
Si vous choisissez le modèle qui décide ce que les travailleurs font, Muse Spark 1.2 est le candidat le plus solide des deux, avec les réserves qu'il n'a pas de score agentique indépendant par dimension, aucun record d'arène de quelque nature que ce soit, aucune télémétrie de production, et un seul fournisseur. Ce sont les lacunes à combler avant qu'il ne détienne un plan de production.
Et si vous espériez qu'un seul modèle puisse faire les deux tâches, la réponse honnête des mesures est qu'aucun ne le fait. Flash-Lite ne peut pas planifier à l'index 36 ; Muse Spark 1.2 ne peut pas être lancé vingt à la fois pour 91 cents par fan-out. Le mot « sous-agent » apparaissant dans les deux descriptions de produits est une coïncidence marketing, pas un signe qu'ils appartiennent au même emplacement.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
