Muse Spark 1.1 est le modèle de raisonnement multimodal de Meta, conçu pour les tâches agentiques. Il accepte une gamme exceptionnellement large d'entrées — texte, images, vidéo, audio et documents PDF — et renvoie du texte, tout en raisonnant nativement à travers les modalités dans une fenêtre de contexte de 1 million de tokens. Il prend en charge un effort de raisonnement configurable et un appel d'outils natif, ce qui le rend particulièrement adapté aux agents multimodaux, à la recherche approfondie sur des médias mixtes et à l'analyse de longs contextes. Avec une inférence efficace et une large surface d'entrée, Muse Spark 1.1 cible les charges de travail qui combinent documents, captures d'écran, enregistrements et vidéos avec du texte — allant de l'analyse de longs rapports et bibliothèques médias à la conduite de pipelines agentiques multi-étapes devant raisonner au-delà du seul texte.
Meta Muse Spark 1.1 est un modèle de langage multimodal de grande taille développé par Meta, capable de traiter du texte, des images, des vidéos, des fichiers et de l'audio dans un contexte unique.…
La principale force de Muse Spark 1.1 est sa capacité à traiter et raisonner sur un contexte très long (1,048,576 tokens) qui inclut plusieurs types de médias. Il peut analyser un PDF de 500 pages avec des images intégrées, ou une vidéo de 2 heures accompagnée de sa transcription audio, en une seule fois. Cela élimine le besoin de découpage ou de modèles séparés. Le modèle est également capable de suivre des instructions détaillées et d'effectuer des tâches de raisonnement complexes telles que le résumé, la réponse aux questions et l'extraction d'entités sur des entrées multimédia mixtes.
Utilisez Muse Spark 1.1 lorsque votre tâche bénéficie réellement d'une grande fenêtre de contexte et de multiples modalités d'entrée. Si vous n'avez besoin que d'une génération de texte courte (par exemple, 1 000 tokens) et sans images ni audio, un modèle textuel moins cher avec un contexte plus petit est plus rentable. Cependant, pour une compréhension multimodale de bout en bout – comme résumer une vidéo avec ses détails visuels et son audio – Muse Spark 1.1 peut réduire la complexité du système et la latence en évitant plusieurs appels de modèle.
Les meilleurs cas d'utilisation incluent l'examen de documents juridiques avec des PDF scannés et des dépositions audio, l'analyse de dossiers médicaux combinant images et notes, la modération de contenu vidéo (analyse d'images et d'audio), et la compréhension d'articles de recherche académique avec figures et tableaux. Tout scénario où une seule invite doit couvrir une entrée longue et hétérogène bénéficie de ce modèle. Il fonctionne également bien pour la construction de pipelines RAG multimodaux où la fenêtre de contexte peut contenir des documents entiers ainsi que des images pertinentes.
Le modèle n'est pas optimisé pour des réponses extrêmement rapides et à faible latence – les contextes volumineux augmentent le temps de traitement. Il ne supporte pas non plus la sortie en streaming (au moment de la rédaction). Pour les tâches nécessitant une interaction en temps réel (par exemple, les chatbots), des modèles plus petits sont préférables. De plus, le coût par token est plus élevé que celui de nombreux modèles textuels, donc pour les tâches purement textuelles, cela peut être excessif. Les performances du modèle sur les tâches de référence n'ont pas été divulguées ; les utilisateurs devraient évaluer sur leurs propres données.
Meta n'a pas publié publiquement de scores de référence pour Muse Spark 1.1. Il est conseillé aux utilisateurs de réaliser leurs propres évaluations sur des tâches représentatives. Le grand contexte et l'entrée multimodale du modèle suggèrent qu'il devrait bien performer sur la compréhension de documents et les Q&A visuelles, mais aucun chiffre standardisé n'existe dans les faits fournis. OrcaRouter ne fournit pas de données de référence supplémentaires ; les performances sont telles que fournies par Meta.
Le traitement de 1 048 576 tokens de données multimodales est coûteux en calcul. La latence dépend de la longueur de l'entrée, du nombre d'images ou de trames vidéo et du nombre de tokens en sortie. Pour des contextes très longs, attendez-vous à des minutes plutôt qu'à des secondes. OrcaRouter ne publie pas de benchmarks de latence pour ce modèle. Les utilisateurs doivent tester avec des charges de travail réalistes pour déterminer des temps de réponse acceptables pour leur application.
La principale limitation est l'absence de données de performance publiquement disponibles, ce qui rend difficile la comparaison avec d'autres modèles sans tests personnalisés. Le modèle ne prend pas non plus en charge les modalités de sortie au-delà du texte – il ne peut pas générer d'images ou d'audio. De plus, le contexte de 1 million de jetons est théorique ; la précision réelle peut se dégrader à la longueur maximale pour certaines tâches. Comme pour tous les grands modèles, les résultats peuvent être incohérents selon les styles de prompt.
En raison du risque de latence élevée lors du traitement de grands contextes multimodaux, ce modèle n'est pas recommandé pour les applications en temps réel telles que les chatbots interactifs ou la transcription en direct. Il est mieux adapté au traitement par lots, à l'analyse hors ligne et aux flux de travail asynchrones où un temps de traitement de quelques secondes à quelques minutes est acceptable. Pour des besoins de faible latence, envisagez des modèles plus petits et plus rapides disponibles via OrcaRouter.
Le prix est de 1,25 $ par million de jetons d'entrée et de 4,25 $ par million de jetons de sortie. Les jetons sont comptés selon le tokenizer du modèle ; les jetons d'entrée incluent tout le texte, les jetons d'image (généralement 170 jetons par image), les trames vidéo, l'audio et le contenu des fichiers. Les jetons de sortie sont le texte généré. OrcaRouter transmet le tarif du fournisseur sans aucune marge, donc le coût correspond exactement à ces chiffres. Il n'y a pas de frais de plateforme supplémentaires.
Comme le modèle prend en charge jusqu'à 1M de jetons d'entrée, un seul appel avec un long document peut coûter $1.25 ou plus rien que pour les jetons d'entrée. Pour les entrées courtes (par exemple, quelques milliers de jetons), le coût est bien inférieur – environ $0.0013 pour 1 000 jetons d'entrée. Le compromis est que pour les tâches nécessitant uniquement un petit contexte, les modèles moins chers avec des tarifs par jeton plus bas sont plus économiques. Pour les tâches multimodales avec un grand contexte, ce modèle peut être plus rentable que de répartir le travail entre plusieurs modèles.
OrcaRouter n'offre actuellement pas de mise en cache ni de remises sur le volume pour Muse Spark 1.1. La tarification est à l'usage, par jeton. Il n'y a pas de tarification par paliers basée sur le volume d'utilisation. Les utilisateurs doivent surveiller leur consommation de jetons, en particulier pour les entrées multimodales volumineuses, afin de gérer les coûts. La politique de marge zéro garantit que le coût reflète exactement le prix du fournisseur sous-jacent.
Non. OrcaRouter ne facture que la consommation de tokens au tarif du fournisseur avec une marge de zéro. Il n'y a pas de frais de requête, pas de minimum mensuel et pas de supplément pour le streaming (bien que le modèle ne prenne pas actuellement en charge le streaming). Le seul coût est celui des tokens d'entrée à $1.25/1M et des tokens de sortie à $4.25/1M. Les utilisateurs sont responsables de tous les coûts associés au codage ou à la transmission de médias vers l'API (bande passante réseau).
Utilisez le point de terminaison de complétion de chat compatible OpenAI. Définissez base_url sur https://api.orcarouter.ai/v1. Dans le corps de la requête, définissez model sur "meta/muse-spark-1.1". Incluez les messages au format OpenAI standard. Pour le contenu multimodal, utilisez un message avec le rôle "user" et un contenu sous forme de tableau de parties : text, image_url, etc. L'authentification se fait via une clé API fournie par OrcaRouter. Exemple en Python avec la bibliothèque openai : client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your-key').
L'API prend en charge les paramètres standard : max_tokens (limite de tokens de sortie), temperature (0-2, valeur par défaut 1), top_p (0-1), frequency_penalty, presence_penalty, stop sequences, et seed pour des sorties déterministes. Le modèle ne prend pas en charge le streaming ou l'appel de fonctions pour le moment. Le paramètre n (nombre de complétions) n'est pas non plus pris en charge – une seule complétion par requête. La limite de la fenêtre de contexte est de 1,048,576 tokens au total pour l'entrée et la sortie combinées.
Si vous utilisez actuellement un autre fournisseur, remplacez l'URL de base par https://api.orcarouter.ai/v1 et le nom du modèle par "meta/muse-spark-1.1". Obtenez une clé API OrcaRouter depuis le tableau de bord. Le format du corps de la requête est identique à celui de l'API d'OpenAI. Le contenu multimodal (images, vidéos, fichiers, audio) utilise le même format que les endpoints vision d'OpenAI. Aucune autre modification de code n'est requise. Testez avec une petite requête pour confirmer la tokenisation et les coûts.
Actuellement, Muse Spark 1.1 ne prend pas en charge le streaming. Les requêtes sont synchrones ; la réponse est renvoyée une fois la génération terminée. Pour les invites de long contexte, cela peut prendre un temps considérable. OrcaRouter pourrait ajouter la prise en charge du streaming à l'avenir, mais pour l'instant seul le mode non-streaming est disponible. Un traitement asynchrone peut être obtenu en envoyant des requêtes en parallèle depuis votre application.
Muse Spark 1.1 dispose d'une fenêtre de contexte de 1 048 576 tokens, parmi les plus grandes disponibles, ce qui lui permet de rivaliser avec les modèles d'autres fournisseurs. Cependant, en tant que modèle multimodal, il est spécialement conçu pour traiter des entrées mixtes. Les modèles de grand contexte purement textuels peuvent être moins chers par token pour les tâches uniquement textuelles. Les faits fournis ne précisent pas de comparaisons de référence, les utilisateurs doivent donc évaluer en fonction de leurs propres besoins multimodaux.
Les modèles multimodaux plus petits (par exemple, avec un contexte de 128K) sont plus rapides et moins chers, mais ne peuvent pas traiter autant d'informations en un seul appel. Muse Spark 1.1 sacrifie la vitesse et le coût pour pouvoir ingérer des documents entiers ou de longues vidéos. Pour les tâches qui peuvent être divisées, l'utilisation d'un modèle plus petit peut être plus efficace. Le bon choix dépend de si votre application nécessite réellement un traitement unique de très grandes entrées.
Utilisez un modèle uniquement textuel lorsque vos entrées ne contiennent pas d'images, de vidéos ou d'audio. Les modèles uniquement textuels offrant des tailles de contexte comparables sont souvent moins chers par token. Par exemple, si votre tâche consiste à résumer un document texte de 1M de tokens sans aucun élément visuel, un modèle purement textuel coûtant moins de 1,25 $/1M d'entrée serait plus rentable. Le prix de Muse Spark 1.1 est compétitif pour les tâches multimodales, mais pas pour le texte pur.
OrcaRouter fournit une interface unifiée compatible OpenAI, tandis que l'API directe de Meta peut utiliser son propre protocole. OrcaRouter n'ajoute aucune majoration, donc le coût des tokens est le même (en supposant que Meta facture le même tarif). OrcaRouter peut offrir des fonctionnalités supplémentaires telles que la gestion des clés API, le suivi d'utilisation et l'équilibrage de charge entre fournisseurs. Le choix dépend de votre préférence pour une abstraction API cohérente entre plusieurs modèles.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="meta/muse-spark-1.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Entrée / 1M tokens | $1.25 |
| Sortie / 1M tokens | $4.25 |
| Lecture cache / 1M | $0.150 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/meta/muse-spark-1.1Ouvrir @misc{orcarouter_muse_spark_1_1,
title = {Muse Spark 1.1 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.1}
}Meta. (2026). Muse Spark 1.1 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.1