Muse Spark 1.2 contre GPT-5.6 Luna-1
Guides & Insights

Muse Spark 1.2 vs GPT-5.6 Luna : Trois points d'indice pour 4,6 fois le prix du token

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Artificial Analysis a fait passer la même suite de neuf benchmarks à travers ces deux modèles et a conservé les reçus. Faire passer Muse Spark 1.2 à travers cela a coûté 637,85 $. Faire passer GPT-5.6 Luna à travers cela a coûté 174,06 $. Pour cette différence de dépenses de 3,7 fois, le modèle de Meta est arrivé trois points devant — 54 contre 51 sur l'indice d'intelligence. Que ce soit un bon compromis est toute la question, et la réponse dépend bien moins du benchmark que de deux choses sur lesquelles presque personne n'écrit : comment votre framework d'agents gère la mise en cache des invites, et si votre charge de travail a besoin d'écouter ou de regarder quelque chose.

Chaque chiffre ci-dessous est soit une mesure indépendante d'Artificial Analysis, soit une liste d'API en direct, soit la propre télémétrie de production d'OrcaRouter — cette dernière mérite d'être signalée d'emblée car elle contredit les chiffres de référence d'une manière instructive. Rien ici n'est une affirmation de fournisseur déguisée en résultat ; lorsque le fournisseur est la seule source, la phrase le précise.

Le tableau d'affichage est plus serré que ce que laisse suggérer l'étiquette de prix.

Muse Spark 1.2 obtient 54 à l'indice Artificial Analysis Intelligence avec son réglage de raisonnement xhigh, se classant 13e sur 185 modèles, contre une médiane de classe de 32. GPT-5.6 Luna obtient 51 en effort maximal. Trois points sur un composite de GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR.

Trois points, c'est réel mais faible, et les sous-scores qui existent pour la génération précédente indiquent d'où cela vient. Les chiffres par dimension d'Artificial Analysis placent Muse Spark 1.1 à un indice de codage de 71,3 et un indice agentique de 37,5 ; GPT-5.6 Luna se situe à 71,4 et 45,6. Le codage était une égalité parfaite, et Luna avait huit points d'avance sur le travail agentique — la dimension exacte que Meta a réécrite dans la description du produit 1.2 pour la revendiquer. Le score composite a bougé de trois points en faveur de Meta. Personne n'a encore publié de détail par dimension pour la 1.2, donc la question de savoir si l'écart agentique s'est réellement refermé reste sans réponse.

Muse Spark 1.2 vs GPT-5.6 Luna-2

En matière de prix mixte des tokens, l'écart n'a rien de subtil. Le tarif mixte d'Artificial Analysis place Muse Spark 1.2 à 0,78 $ par million de tokens et GPT-5.6 Luna à 0,17 $. Prix catalogue : 1,25 $ en entrée et 4,25 $ en sortie pour Muse Spark 1.2 ; 0,20 $ en entrée et 1,20 $ en sortie pour Luna.

Facturé à l'unité de travail plutôt qu'au jeton, une seule étape d'agent de codage lisant 60 000 jetons de contexte et écrivant 3 000 jetons de sortie coûte environ 8,8 cents sur Muse Spark 1.2 et environ 1,6 cent sur GPT-5.6 Luna. Sur mille étapes par jour, cela représente 88 $ contre 16 $ — une différence d'environ 26 000 $ par an pour une seule boucle d'agent.

La mise en cache est là où l'écart se réduit ou double.

Les deux modèles proposent des tarifs d’entrée en cache agressifs, et le rapport entre eux n’est pas le même que celui entre leurs prix catalogue. Muse Spark 1.2 facture l’entrée en cache à 0,15 $ par million, soit 88 % de réduction sur son tarif de 1,25 $. GPT-5.6 Luna facture l’entrée en cache à 0,01 $ par million, soit 95 % de réduction sur son tarif de 0,20 $.

Relancez la même étape d'agent avec le préfixe de 60 000 jetons servi à chaud : Muse Spark 1.2 passe de 8,8 cents à environ 2,2 cents. Luna passe de 1,6 cent à environ 0,4 cent. L'écart absolu se réduit de 7,2 cents à 1,8 cent par étape, mais le multiple reste à peu près le même — la mise en cache ne sauve pas le modèle le plus cher, elle rend simplement les deux moins chers par des facteurs similaires. Ce qui change, c'est le poste qui domine : en cache, le coût de Muse Spark 1.2 est constitué à 59 % de jetons de sortie plutôt qu'à 85 % de jetons d'entrée, de sorte que la verbosité du modèle commence à compter plus que la taille de son contexte.

Ce n’est pas une préoccupation hypothétique ici. Muse Spark 1.2 a généré 95M jetons de sortie pour passer l’Intelligence Index, contre une médiane de 65M. Le propre résumé d’Artificial Analysis le qualifie de "quelque peu verbeux". Luna a brûlé 130M, ce qui semble pire jusqu’à ce qu’on multiplie par 1,20 $ au lieu de 4,25 $.

La documentation produit de Meta affirme que la mise en cache des invites peut réduire le coût effectif de 60 à 80 % selon la quantité de contexte qui se répète. Il s'agit d'une estimation du fournisseur, pas d'une mesure, mais le calcul ci-dessus se situe dans cette fourchette.

Latence : l'axe où le benchmark inverse la vérité.

Lisez uniquement les chiffres de latence d'Artificial Analysis et vous concluriez que Muse Spark 1.2 est le plus réactif. Délai jusqu'au premier jeton : 26.12 secondes pour Muse Spark 1.2, 126.99 secondes pour GPT-5.6 Luna. Près de cinq fois plus rapide.

Ces deux valeurs sont mesurées au réglage de raisonnement le plus coûteux de chaque modèle — xhigh pour Muse Spark, max pour Luna. Aucune de ces deux n'est ce que vous verrez. Sur OrcaRouter, sur une semaine de trafic réel, quel que soit l'effort réellement demandé par les appelants, GPT-5.6 Luna affiche un temps p50 jusqu'au premier jeton de 1,84 seconde et un p95 de 9,68 secondes. Muse Spark 1.1 affiche un p50 identique de 1,84 seconde avec un p95 plus resserré de 6,00 secondes. Il n'existe pas encore de télémétrie de production pour la version 1.2 car elle est trop récente.

Muse Spark 1.2 vs GPT-5.6 Luna-3

La différence structurelle est plus utile que l'un ou l'autre nombre. Le raisonnement de GPT-5.6 Luna est facultatif — le cadran d'effort va de zéro en passant par faible, moyen, élevé, très élevé jusqu'à max, et vous pouvez réellement désactiver le raisonnement pour la classification, le routage ou l'extraction. Le raisonnement de Muse Spark 1.2 est obligatoire. Le cadran atteint son minimum à minimal, et il n'existe aucun réglage qui vous donne les poids sans payer pour la délibération. Pour tout ce qui est à haut volume et sensible à la latence, c'est une contrainte de conception, et non un paramètre de réglage.

Le débit soutenu est proche : 165.0 tokens par seconde pour Muse Spark 1.2 contre 177.9 pour Luna, les deux bien au-dessus de la médiane de la classe de 71.

La note de bas de page relative aux prix sur laquelle tout le monde va trébucher.

Le prix de GPT-5.6 Luna est actuellement affiché différemment selon les endroits, et si vous construisez un modèle de coûts, vous devriez le savoir avant de citer un chiffre. Le catalogue d'Artificial Analysis et celui d'OrcaRouter affichent tous deux 0,20 $ par million de jetons en entrée et 1,20 $ par million en sortie — le tarif qui a suivi la baisse de prix de GPT-5.6 en juillet, et celui qu'Artificial Analysis a utilisé pour calculer la facture d'évaluation de 174,06 $ ci-dessus. Certaines annonces de places de marché affichent actuellement 0,10 $ et 0,60 $, avec un palier supérieur distinct qui s'applique au-delà de 272 000 jetons de prompt. La décision prudente consiste à vérifier le prix sur le point de terminaison que vous appelez réellement plutôt que sur celui de l'article comparatif.

Le détail de la tarification par paliers est réel, quel que soit le tarif de base appliqué, et il est véritablement sous-documenté : Le prix de Luna augmente dès qu'une seule requête dépasse environ 272 000 jetons de prompt. L'entrée double à peu près, la sortie augmente de moitié, et les lectures en cache suivent la même progression. Si votre raison de vous intéresser à Luna est sa fenêtre de contexte de 1,05 M de jetons, notez que vous quittez le tarif annoncé environ au quart du chemin. Muse Spark 1.2 propose un tarif fixe sur l'ensemble de ses 1 048 576 jetons, sans supplément pour contexte long — pour les requêtes uniques véritablement longues, l'écart effectif entre les deux se réduit considérablement.

Ce que Luna ne peut pas faire à aucun prix

La différence de modalité est la raison la plus évidente de choisir l'une plutôt que l'autre, et elle n'apparaît sur aucun classement.

Entrées — Muse Spark 1.2 accepte du texte, des images, de la vidéo, de l'audio et des documents PDF selon la fiche de Meta. GPT-5.6 Luna accepte du texte, des images et des fichiers. Pas d'audio, pas de vidéo. Si votre pipeline traite des enregistrements ou des séquences vidéo, Luna n'est pas du tout un candidat.

Sortie maximale — Luna déclare un plafond de 128 000 jetons pour la complétion. Le point de terminaison de Muse Spark 1.2 ne déclare aucune longueur de complétion maximale, ce qui est suffisamment inhabituel pour que vous le testiez plutôt que de planifier en conséquence.

Date limite des connaissances — Celle de Luna est datée du 16 février 2026. Meta ne publie aucune date limite pour Muse Spark 1.2, prévoyez donc un budget pour la récupération dans les deux cas.

Disponibilité — Luna est généralement disponible dans le monde entier via plusieurs itinéraires. Muse Spark 1.2 est desservi par un seul fournisseur : Meta. Un point de terminaison, une politique de région, une seule chose qui peut tomber en panne.

Modération — les deux sont des endpoints modérés.

Une mise en garde honnête sur l'avantage multimodal : la fiche de spécifications techniques d'Artificial Analysis pour Muse Spark 1.2 indique que l'évaluation a porté sur les entrées texte et image, et non sur la surface complète à cinq modalités que Meta met en avant. L'API accepte plus que ce que n'importe quel acteur indépendant a testé.

Muse Spark 1.2 vs GPT-5.6 Luna-4

L'adoption, puisqu'elle se trouve être mesurable.

Les benchmarks vous disent ce qu'un modèle sait faire ; le trafic vous dit à quoi les gens lui font confiance. Sur une semaine glissante sur OrcaRouter, GPT-5.6 Luna a déplacé 4 679,4 millions de tokens. Muse Spark 1.1 — même contexte 1M, score d'indice comparable, quatre semaines de plus au catalogue — a déplacé 4,4 millions. C'est un facteur d'environ mille.

Une partie de cela tient à la distribution : Luna est une valeur par défaut dans davantage d'outils et est en disponibilité générale mondiale depuis plus longtemps, tandis que la famille Muse Spark n'a été lancée qu'aux États-Unis. Mais un écart de mille contre un sur un routeur où les deux ne sont séparés que par une chaîne de modèle n'est pas qu'une histoire de distribution. C'est la raison pratique pour laquelle Luna est le choix par défaut le plus sûr et Muse Spark 1.2 est l'élément que vous évaluez délibérément.

Il convient de noter ce que l'on peut louer ou non aujourd'hui : GPT-5.6 Luna figure dans le catalogue OrcaRouter à 0,20 $ et 1,20 $, les mêmes chiffres que sur la liste de prix du fournisseur, car nous appliquons une marge de 0 % et répercutons directement le prix catalogue du fournisseur. Muse Spark 1.1 y est à 1,25 $ et 4,25 $ sur la même base. Muse Spark 1.2 n'est pas encore dans le catalogue — il est servi directement par Meta. Le moyen le plus honnête de réaliser cette comparaison aujourd'hui est donc de tester Luna contre Muse Spark 1.1 avec une seule clé, en changeant une seule chaîne entre les exécutions, puis de re-tester contre la 1.2 lorsqu'elle sera disponible.

Choisissez-en un.

Optez pour GPT-5.6 Luna si la charge de travail est volumineuse et à dominante textuelle : chat, classification, extraction, routage, utilisation légère d'outils. Il coûte un quart du prix moyen pondéré, il permet de désactiver entièrement le raisonnement, son p50 de 1,84 seconde est un chiffre de production réellement mesuré et non un artefact de benchmark, et c'est le modèle qui bénéficie d'un trafic en direct mille fois supérieur. Trois points d'indice ne survivent pas à ce calcul.

Optez pour Muse Spark 1.2 si la charge de travail est du codage agentique à long horizon — refactorisations multi-fichiers, débogage prolongé, travail sur l'ensemble du dépôt — ou si elle implique une entrée audio ou vidéo, où Luna ne peut tout simplement pas rivaliser. C'est aussi le meilleur choix pour des requêtes uniques véritablement énormes, car son tarif est fixe sur l'ensemble du million de jetons tandis que celui de Luna augmente par paliers au-delà de 272K.

Prenez les deuxsi vous êtes honnête sur la façon dont les systèmes d’agents sont réellement construits. Le schéma qui continue de s’imposer est un modèle bon marché qui gère la majorité des appels routiniers, et un modèle coûteux réservé aux étapes où la qualité se paie d’elle-même. Les deux modèles se trouvent derrière un même point de terminaison compatible OpenAI, si bien que cette répartition est une règle de routage plutôt qu’une relation avec un second fournisseur — et si le bras coûteux tombe en cours d’exécution, le basculement automatique fait que votre évaluation ne s’empoisonne pas silencieusement avec la moitié d’un jeu de données.

Ce qu'il faut surveiller au cours du mois à venir, c'est le détail par dimension. Tout l'argument de Muse Spark 1.2 repose sur la capacité agentique, et sur la génération précédente, c'était la dimension où Luna menait de huit points. Tant que personne n'aura publié un indice agentique pour la 1.2, le gain composite de trois points est la seule preuve existante que Meta a comblé l'écart.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube