Muse Spark 1.1 é o modelo de raciocínio multimodal da Meta, desenvolvido para tarefas de agente. Aceita uma gama excepcionalmente ampla de entradas — texto, imagens, vídeo, áudio e documentos PDF — e retorna texto, raciocinando nativamente entre modalidades dentro de uma janela de contexto de 1 milhão de tokens. Suporta esforço de raciocínio configurável e chamada de ferramentas nativa, tornando-o adequado para agentes multimodais, pesquisa profunda sobre mídia mista e análise de contexto longo. Com inferência eficiente e uma ampla superfície de entrada, o Muse Spark 1.1 tem como alvo cargas de trabalho que combinam documentos, capturas de tela, gravações e vídeo com texto — desde a análise de relatórios longos e bibliotecas de mídia até a condução de pipelines de agentes de várias etapas que devem raciocinar sobre mais do que apenas texto.
Meta Muse Spark 1.1 é um modelo de linguagem grande multimodal da Meta que pode processar texto, imagens, vídeo, arquivos e áudio em um único contexto. Sua janela de contexto é de 1.048.576 tokens –…
Muse Spark 1.1 tem como principal vantagem a capacidade de processar e raciocinar sobre um contexto muito longo (1.048.576 tokens) que inclui múltiplos tipos de mídia. Ele pode analisar um PDF de 500 páginas com imagens incorporadas, ou um vídeo de 2 horas junto com sua transcrição de áudio, de uma só vez. Isso elimina a necessidade de chunking ou modelos separados. O modelo também é capaz de seguir instruções detalhadas e realizar tarefas complexas de raciocínio, como sumarização, resposta a perguntas e extração de entidades em entradas de mídia mista.
Use o Muse Spark 1.1 quando sua tarefa se beneficia genuinamente de uma janela de contexto grande e múltiplas modalidades de entrada. Se você só precisa de geração de texto curto (por exemplo, 1.000 tokens) e sem imagens ou áudio, um modelo mais barato, apenas de texto, com contexto menor é mais econômico. No entanto, para compreensão multimodal de ponta a ponta – como resumir um vídeo com seus detalhes visuais e áudio – o Muse Spark 1.1 pode reduzir a complexidade do sistema e a latência ao evitar múltiplas chamadas de modelo.
Os melhores casos de uso incluem revisão de documentos legais com PDFs digitalizados e depoimentos em áudio, análise de registros médicos combinando imagens e anotações, moderação de conteúdo de vídeo (analisando quadros e áudio) e compreensão de artigos de pesquisa acadêmica com figuras e tabelas. Qualquer cenário onde uma única instrução deve cobrir uma entrada longa e heterogênea se beneficia deste modelo. Ele também funciona bem para construir pipelines multimodais de RAG onde a janela de contexto pode conter documentos inteiros mais imagens relevantes.
O modelo não é otimizado para respostas extremamente rápidas e de baixa latência – contextos grandes aumentam o tempo de processamento. Também não suporta saída em streaming (no momento da escrita). Para tarefas que exigem interação em tempo real (por exemplo, chatbots), modelos menores são preferíveis. Além disso, o custo por token é maior do que o de muitos modelos apenas de texto, então para tarefas puramente textuais pode ser exagerado. O desempenho do modelo em tarefas de benchmark não foi divulgado; os usuários devem avaliar com seus próprios dados.
A Meta não divulgou publicamente pontuações de benchmark para o Muse Spark 1.1. Os usuários são aconselhados a realizar suas próprias avaliações em tarefas representativas. O grande contexto e a entrada multimodal do modelo sugerem que ele deve ter um bom desempenho em compreensão de documentos e QA visual, mas não existem números padronizados nos fatos fornecidos. O OrcaRouter não fornece dados adicionais de benchmarking; o desempenho é conforme entregue pela Meta.
Processar 1,048,576 tokens de dados multimodais é computacionalmente caro. A latência depende do comprimento da entrada, do número de imagens ou quadros de vídeo e da contagem de tokens de saída. Para contextos muito longos, espere minutos em vez de segundos. O OrcaRouter não publica benchmarks de latência para este modelo. Os usuários devem testar com cargas de trabalho realistas para determinar tempos de resposta aceitáveis para sua aplicação.
A principal limitação é a falta de dados de desempenho publicamente disponíveis, tornando difícil comparar com modelos alternativos sem testes personalizados. O modelo também não suporta modalidades de saída além de texto – não pode gerar imagens ou áudio. Além disso, o contexto de 1 milhão de tokens é teórico; a precisão no mundo real pode degradar no comprimento máximo para algumas tarefas. Como em todos os modelos grandes, os resultados podem ser inconsistentes em diferentes estilos de prompt.
Devido à possibilidade de alta latência ao processar grandes contextos multimodais, este modelo não é recomendado para aplicações em tempo real, como chatbots interativos ou transcrição ao vivo. É mais adequado para processamento em lote, análise offline e fluxos de trabalho assíncronos, onde alguns segundos a minutos de tempo de processamento são aceitáveis. Para necessidades de baixa latência, considere modelos menores e mais rápidos disponíveis através do OrcaRouter.
O preço é de $1,25 por 1 milhão de tokens de entrada e $4,25 por 1 milhão de tokens de saída. Os tokens são contados de acordo com o tokenizer do modelo; tokens de entrada incluem todo texto, tokens de imagem (tipicamente 170 tokens por imagem), quadros de vídeo, áudio e conteúdo de arquivo. Tokens de saída são texto gerado. O OrcaRouter repassa a taxa do provedor com margem zero, portanto o custo é exatamente esses valores. Não há taxas adicionais de plataforma.
Como o modelo suporta até 1M de tokens de entrada, uma única chamada com um documento longo pode custar US$ 1,25 ou mais apenas em tokens de entrada. Para entradas curtas (por exemplo, alguns milhares de tokens), o custo é muito menor – cerca de US$ 0,0013 para 1.000 tokens de entrada. A contrapartida é que, para tarefas que exigem apenas um contexto pequeno, modelos mais baratos com taxas por token mais baixas são mais econômicos. Para tarefas multimodais de grande contexto, este modelo pode ser mais custo-efetivo do que dividir o trabalho entre vários modelos.
OrcaRouter atualmente não oferece cache ou descontos por volume para o Muse Spark 1.1. O preço é pago conforme o uso por token. Não há preços escalonados com base no volume de uso. Os usuários devem monitorar seu consumo de tokens, especialmente para grandes entradas multimodais, para gerenciar custos. A política de margem zero garante que o custo reflita exatamente o preço do provedor subjacente.
Não. O OrcaRouter cobra apenas pelo consumo de tokens na taxa do provedor, sem margem de lucro. Não há taxas de requisição, nem mínimos mensais, nem sobretaxas para streaming (embora o modelo atualmente não suporte streaming). O único custo são tokens de entrada a $1,25/1M e tokens de saída a $4,25/1M. Os usuários são responsáveis por quaisquer custos associados à codificação ou transmissão de mídia para a API (largura de banda da rede).
Use o endpoint de completions de chat compatível com OpenAI. Defina base_url como https://api.orcarouter.ai/v1. No corpo da requisição, defina model como "meta/muse-spark-1.1". Inclua mensagens no formato padrão da OpenAI. Para conteúdo multimodal, use uma mensagem com role "user" e content como um array de partes: text, image_url, etc. A autenticação é feita via chave de API fornecida pela OrcaRouter. Exemplo em Python usando a biblioteca openai: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your-key').
A API suporta parâmetros padrão: max_tokens (limite de tokens de saída), temperature (0-2, padrão 1), top_p (0-1), frequency_penalty, presence_penalty, sequências de parada e seed para saídas determinísticas. O modelo não suporta streaming ou chamada de funções no momento. O parâmetro n (número de conclusões) também não é suportado – apenas uma conclusão por solicitação. O limite da janela de contexto é de 1,048,576 tokens no total para entrada e saída combinados.
Se você atualmente usa outro provedor, altere a URL base para https://api.orcarouter.ai/v1 e o nome do modelo para "meta/muse-spark-1.1". Obtenha uma chave de API OrcaRouter no painel de controle. O formato do corpo da requisição é idêntico ao da API da OpenAI. O conteúdo multimodal (imagens, vídeos, arquivos, áudio) usa o mesmo formato dos endpoints de visão da OpenAI. Nenhuma outra alteração de código é necessária. Teste com uma requisição pequena para confirmar a tokenização e os custos.
No momento, o Muse Spark 1.1 não suporta streaming. As solicitações são síncronas; a resposta é retornada assim que a geração é concluída. Para prompts de contexto longo, isso pode levar um tempo significativo. O OrcaRouter pode adicionar suporte a streaming no futuro, mas atualmente apenas o modo não-streaming está disponível. O processamento assíncrono pode ser alcançado enviando solicitações em paralelo a partir do seu aplicativo.
Muse Spark 1.1 possui uma janela de contexto de 1.048.576 tokens, uma das maiores disponíveis, competindo com modelos de outros provedores. No entanto, por ser um modelo multimodal, é especificamente projetado para lidar com entradas mistas. Modelos de contexto grande puramente baseados em texto podem ser mais baratos por token para tarefas apenas de texto. Os fatos fornecidos não especificam comparações de benchmark, portanto os usuários devem avaliar com base em suas próprias necessidades multimodais.
Modelos multimodais menores (ex.: com contexto de 128K) são mais rápidos e baratos, mas não conseguem processar tanta informação em uma única chamada. O Muse Spark 1.1 sacrifica velocidade e custo pela capacidade de ingerir documentos inteiros ou vídeos longos. Para tarefas que podem ser fragmentadas, usar um modelo menor pode ser mais eficiente. A escolha certa depende se sua aplicação realmente exige o processamento único de entradas muito grandes.
Use um modelo apenas de texto quando suas entradas não contiverem imagens, vídeo ou áudio. Modelos apenas de texto com tamanhos de contexto comparáveis são frequentemente mais baratos por token. Por exemplo, se sua tarefa é resumir um documento de texto de 1M tokens sem elementos visuais, um modelo de texto puro custando menos de $1,25/1M de entrada seria mais custo-efetivo. O preço do Muse Spark 1.1 é competitivo para tarefas multimodais, mas não para texto puro.
OrcaRouter fornece uma interface unificada compatível com OpenAI, enquanto a API direta da Meta pode usar seu próprio protocolo. A OrcaRouter adiciona margem zero, então o custo do token é o mesmo (supondo que a Meta cobre a mesma tarifa). A OrcaRouter pode oferecer recursos adicionais como gerenciamento de chaves de API, rastreamento de uso e balanceamento de carga entre provedores. A escolha depende de se você prefere uma abstração de API consistente entre vários modelos.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="meta/muse-spark-1.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Entrada / 1M tokens | $1.25 |
| Saída / 1M tokens | $4.25 |
| Leitura de cache / 1M | $0.150 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/meta/muse-spark-1.1Abrir @misc{orcarouter_muse_spark_1_1,
title = {Muse Spark 1.1 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.1}
}Meta. (2026). Muse Spark 1.1 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.1