Muse Spark 1.1 è il modello di ragionamento multimodale di Meta, costruito per compiti agentici. Accetta una gamma insolitamente ampia di input — testo, immagini, video, audio e documenti PDF — e restituisce testo, ragionando in modo nativo attraverso le modalità all'interno di una finestra di contesto di 1 milione di token. Supporta uno sforzo di ragionamento configurabile e chiamate di strumenti native, rendendolo adatto per agenti multimodali, ricerca approfondita su media misti e analisi di contesti lunghi. Con un'inferenza efficiente e un'ampia superficie di input, Muse Spark 1.1 si rivolge a carichi di lavoro che combinano documenti, screenshot, registrazioni e video con testo — dall'analisi di lunghi report e librerie multimediali alla guida di pipeline agentiche multi-step che devono ragionare su più del solo testo.
Meta Muse Spark 1.1 è un modello linguistico multimodale di grandi dimensioni di Meta in grado di elaborare testo, immagini, video, file e audio in un unico contesto. La sua finestra di contesto è di…
Il punto di forza principale di Muse Spark 1.1 è la capacità di elaborare e ragionare su un contesto molto lungo (1.048.576 token) che include molteplici tipi di media. Può analizzare un PDF di 500 pagine con immagini incorporate, o un video di 2 ore insieme alla sua trascrizione audio, in un'unica sessione. Questo elimina la necessità di suddividere in blocchi o di utilizzare modelli separati. Il modello è anche in grado di seguire istruzioni dettagliate e di svolgere compiti di ragionamento complessi come riassunti, risposte a domande ed estrazione di entità da input multimediali misti.
Utilizza Muse Spark 1.1 quando il tuo compito trae effettivamente vantaggio da una finestra di contesto ampia e da molteplici modalità di input. Se hai bisogno solo di generazione di testo breve (ad esempio, 1,000 token) e nessuna immagine o audio, un modello più economico solo testo con un contesto più piccolo è più conveniente. Tuttavia, per una comprensione multimodale end-to-end – come riassumere un video con i suoi dettagli visivi e audio – Muse Spark 1.1 può ridurre la complessità del sistema e la latenza evitando multiple chiamate al modello.
I casi d'uso migliori includono la revisione di documenti legali con PDF scansionati e deposizioni audio, l'analisi di cartelle cliniche che combina immagini e note, la moderazione di contenuti video (analizzando fotogrammi e audio) e la comprensione di articoli di ricerca accademica con figure e tabelle. Qualsiasi scenario in cui un singolo prompt deve coprire un input lungo ed eterogeneo trae vantaggio da questo modello. Funziona bene anche per costruire pipeline RAG multimodali in cui la finestra di contesto può contenere interi documenti più le immagini pertinenti.
Il modello non è ottimizzato per risposte estremamente veloci e a bassa latenza – contesti ampi aumentano il tempo di elaborazione. Inoltre, non supporta l'output in streaming (al momento della scrittura). Per attività che richiedono interazione in tempo reale (es. chatbot), sono preferibili modelli più piccoli. In aggiunta, il costo per token è più elevato rispetto a molti modelli solo testo, quindi per compiti puramente testuali potrebbe essere eccessivo. Le prestazioni del modello nei benchmark non sono state divulgate; gli utenti dovrebbero valutarlo sui propri dati.
Meta non ha rilasciato pubblicamente punteggi di benchmark per Muse Spark 1.1. Si consiglia agli utenti di eseguire le proprie valutazioni su compiti rappresentativi. Il contesto esteso del modello e l'input multimodale suggeriscono che dovrebbe funzionare bene nella comprensione di documenti e nel QA visivo, ma nei fatti forniti non esistono numeri standardizzati. OrcaRouter non fornisce ulteriori dati di benchmarking; le prestazioni sono quelle fornite da Meta.
Elaborare 1.048.576 token di dati multimodali è computazionalmente costoso. La latenza dipende dalla lunghezza dell'input, dal numero di immagini o fotogrammi video e dal conteggio dei token di output. Per contesti molto lunghi, aspettati minuti anziché secondi. OrcaRouter non pubblica benchmark di latenza per questo modello. Gli utenti dovrebbero testare con carichi di lavoro realistici per determinare tempi di risposta accettabili per la loro applicazione.
La limitazione principale è la mancanza di dati di performance pubblicamente disponibili, rendendo difficile il confronto con modelli alternativi senza test personalizzati. Il modello inoltre non supporta modalità di output oltre il testo – non può generare immagini o audio. Inoltre, il contesto di 1 milione di token è teorico; l'accuratezza nel mondo reale potrebbe degradarsi alla lunghezza massima per alcuni compiti. Come con tutti i modelli di grandi dimensioni, i risultati possono essere incoerenti tra diversi stili di prompt.
A causa del potenziale di alta latenza nell'elaborazione di grandi contesti multimodali, questo modello non è raccomandato per applicazioni in tempo reale come chatbot interattivi o trascrizione in diretta. È più adatto per l'elaborazione batch, l'analisi offline e i flussi di lavoro asincroni dove sono accettabili da pochi secondi a minuti di tempo di elaborazione. Per esigenze di bassa latenza, considera modelli più piccoli e veloci disponibili tramite OrcaRouter.
Il prezzo è di $1,25 per 1 milione di token in input e $4,25 per 1 milione di token in output. I token vengono conteggiati secondo il tokenizer del modello; i token in input includono tutto il testo, i token delle immagini (solitamente 170 token per immagine), i fotogrammi video, l'audio e il contenuto dei file. I token in output sono il testo generato. OrcaRouter applica la tariffa del provider senza alcun ricarico, quindi il costo è esattamente questi importi. Non sono previste commissioni aggiuntive sulla piattaforma.
Poiché il modello supporta fino a 1M token di input, una singola chiamata con un documento lungo può costare $1,25 o più solo in token di input. Per input brevi (ad esempio, poche migliaia di token), il costo è molto più basso – circa $0,0013 per 1.000 token di input. Il compromesso è che per attività che richiedono solo un piccolo contesto, modelli più economici con tariffe per token più basse sono più convenienti. Per attività multimodali con contesto esteso, questo modello può essere più conveniente rispetto alla suddivisione del lavoro tra più modelli.
OrcaRouter attualmente non offre caching o sconti sul volume per Muse Spark 1.1. Il prezzo è pay-as-you-go per token. Non esiste una tariffazione a livelli basata sul volume di utilizzo. Gli utenti dovrebbero monitorare il proprio consumo di token, specialmente per input multimodali di grandi dimensioni, per gestire i costi. La politica di zero margine garantisce che il costo rifletta esattamente il prezzo del fornitore sottostante.
No. OrcaRouter addebita solo il consumo di token alla tariffa del provider con zero margine. Non ci sono commissioni per le richieste, nessun minimo mensile e nessun costo aggiuntivo per lo streaming (anche se il modello attualmente non supporta lo streaming). L'unico costo è per i token di input a $1.25/1M e i token di output a $4.25/1M. Gli utenti sono responsabili di eventuali costi associati alla codifica o alla trasmissione di dati multimediali all'API (larghezza di banda di rete).
Utilizza l'endpoint di completamento chat compatibile con OpenAI. Imposta base_url su https://api.orcarouter.ai/v1. Nel corpo della richiesta, imposta model su "meta/muse-spark-1.1". Includi i messaggi nel formato standard di OpenAI. Per i contenuti multimodali, utilizza un messaggio con ruolo "user" e contenuto come array di parti: text, image_url, ecc. L'autenticazione avviene tramite una chiave API fornita da OrcaRouter. Esempio in Python con la libreria openai: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your-key').
L'API supporta parametri standard: max_tokens (limite di token di output), temperature (0-2, default 1), top_p (0-1), frequency_penalty, presence_penalty, sequenze di stop e seed per output deterministici. Il modello non supporta streaming o chiamata di funzioni al momento. Il parametro n (numero di completamenti) non è supportato – solo un completamento per richiesta. Il limite della finestra di contesto è di 1,048,576 token totali tra input e output combinati.
Se attualmente utilizzi un altro provider, modifica l'URL di base in https://api.orcarouter.ai/v1 e il nome del modello in "meta/muse-spark-1.1". Ottieni una chiave API OrcaRouter dalla dashboard. Il formato del corpo della richiesta è identico all'API di OpenAI. I contenuti multimodali (immagini, video, file, audio) utilizzano lo stesso formato degli endpoint di visione di OpenAI. Non sono richieste altre modifiche al codice. Esegui un test con una piccola richiesta per confermare la tokenizzazione e i costi.
Attualmente, Muse Spark 1.1 non supporta lo streaming. Le richieste sono sincrone; la risposta viene restituita al termine della generazione. Per prompt con contesto lungo, questo potrebbe richiedere un tempo significativo. OrcaRouter potrebbe aggiungere il supporto allo streaming in futuro, ma al momento è disponibile solo la modalità non-streaming. L'elaborazione asincrona può essere ottenuta inviando richieste in parallelo dalla tua applicazione.
Muse Spark 1.1 ha una finestra di contesto di 1.048.576 token, tra le più ampie disponibili, in competizione con modelli di altri fornitori. Tuttavia, essendo un modello multimodale, è progettato specificamente per gestire input misti. I modelli puramente testuali con contesto ampio potrebbero essere più economici per token per attività solo testuali. I fatti forniti non specificano confronti di benchmark, quindi gli utenti dovrebbero valutare in base alle proprie esigenze multimodali.
I modelli multimodali più piccoli (ad esempio, con contesto 128K) sono più veloci ed economici ma non possono elaborare altrettante informazioni in una singola chiamata. Muse Spark 1.1 sacrifica velocità e costo per la capacità di ingerire interi documenti o video lunghi. Per attività che possono essere suddivise in blocchi, l'uso di un modello più piccolo può essere più efficiente. La scelta giusta dipende dal fatto che la tua applicazione richieda veramente un'elaborazione una tantum di input molto grandi.
Utilizza un modello solo testo quando i tuoi input non contengono immagini, video o audio. I modelli solo testo con dimensioni di contesto comparabili sono spesso più economici per token. Ad esempio, se il tuo compito è riassumere un documento di testo di 1M token senza elementi visivi, un modello puramente testuale che costa meno di $1.25/1M input sarebbe più conveniente. Il prezzo di Muse Spark 1.1 è competitivo per attività multimodali, ma non per il solo testo.
OrcaRouter fornisce un'interfaccia unificata compatibile con OpenAI, mentre l'API diretta di Meta può utilizzare il proprio protocollo. OrcaRouter non aggiunge alcun margine, quindi il costo dei token è lo stesso (supponendo che Meta applichi la stessa tariffa). OrcaRouter può offrire funzionalità aggiuntive come gestione delle chiavi API, monitoraggio dell'utilizzo e bilanciamento del carico tra fornitori. La scelta dipende dal fatto che si preferisca un'astrazione API coerente tra più modelli.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="meta/muse-spark-1.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Input / 1M token | $1.25 |
| Output / 1M token | $4.25 |
| Lettura cache / 1M | $0.150 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/meta/muse-spark-1.1Apri @misc{orcarouter_muse_spark_1_1,
title = {Muse Spark 1.1 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.1}
}Meta. (2026). Muse Spark 1.1 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.1