
Análise do Meta Muse Spark 1.1: Ainda o Mais Rápido, Já Não o Mais Barato
- metaNOVOMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 por 1M de tokens · 705 tok/s
- qwenNOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 57 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligência69Código
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 201 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
Durante quatro semanas, o caso do Meta Muse Spark 1.1 era aritmético. US$ 1,25 por milhão de tokens de entrada, US$ 4,25 de saída, para um modelo nativamente multimodal que executava ferramentas melhor do que quase tudo na sua faixa de preço. Então, em 5 de agosto de 2026, a Meta lançou o Muse Spark 1.2 junto com o Muse Code — seu primeiro agente de codificação de terminal — e anexou ao novo modelo algo que o 1.1 nunca teve: um nível de contribuidor a US$ 0,10 de entrada e US$ 0,20 de saída. Doze vezes mais barato na entrada, vinte e uma vezes mais barato na saída, em troca de deixar a Meta treinar com seus prompts. O preço do Muse Spark 1.1 não mudou um centavo. Sua posição mudou.
Este é o quadro honesto para revisar este modelo agora. O Muse Spark 1.1 não foi descontinuado, não foi reprecificado e ainda é o mais rápido e melhor documentado dos dois checkpoints de raciocínio da Meta — mas não é mais o caminho mais barato para alugar um modelo da Meta, e o agente que a Meta mais está promovendo não roda nele. Esta análise cobre o que é o 1.1, em que ele é mensuravelmente bom, o que o lançamento de agosto mudou e o conjunto mais restrito de tarefas em que ele ainda é a escolha certa. Quando um número vem das próprias avaliações da Meta, a frase diz isso; quando vem de Artificial Analysis ou do tráfego de produção, também diz isso.
Veredito rápido
• O que é — um modelo de raciocínio nativamente multimodal (texto, imagem, vídeo, PDF e áudio como entrada, texto como saída) com esforço de raciocínio configurável, projetado para executar ferramentas e operar um computador. Pesos fechados, servido pela Meta.
• Preço — $1.25 de entrada / $4.25 de saída por milhão de tokens, $0.15 em caso de acerto de cache. Inalterado desde o lançamento, e ainda cerca de um quarto do preço de saída do GPT-5.6 Sol ($5/$30) e um sexto do preço de saída do Claude Opus 4.8 ($5/$25).
• Inteligência — 51 no Artificial Analysis Intelligence Index, posição #22 de 185 em sua classe contra uma mediana de classe de 32. Uma medição independente, não uma afirmação da Meta.
• Força — uso de ferramentas e raciocínio agêntico, além de velocidade real: 213,5 tokens de saída por segundo, o que a Artificial Analysis classifica em #2 de 185.
• Fraqueza — raciocínio puro e codificação bruta estão no meio do pacote, a recuperação de contexto longo não é de ponta, e é verboso: 94M de tokens de saída para completar o Intelligence Index contra uma mediana de 65M.
• A nova ressalva — Muse Spark 1.2 agora marca três pontos a mais e, em seu nível de contribuidor, custa um vigésimo do preço. A vantagem restante da 1.1 é a latência, e é grande.
O que a Meta lançou em 5 de agosto — e o que isso fez com a 1.1
O Muse Code é um agente de codificação de terminal, atualmente em beta, instalado por meio de um script de shell de uma linha no macOS e Linux (sem versão para Windows) e executado como o binário muse. Ele assume tarefas completas de engenharia de software em grandes repositórios: planejar a mudança, escrever o código, validar o resultado. A proposta da Meta é a coesão arquitetural — o agente e o modelo foram treinados juntos, em vez de acoplados — e a lista de recursos mira diretamente o Claude Code e o Codex: agentes em segundo plano que continuam trabalhando depois que você fecha o terminal, retomada por log de eventos, árvores de trabalho paralelas de subagentes e um sandbox de SO com aprovações habilitadas por padrão. A demonstração publicada pela Meta é um loop de otimização de kernel de GPU que executa mais de 1.000 chamadas de ferramentas por até 24 horas em hardware NVIDIA Hopper.
O Muse Code executa o Muse Spark 1.2, não o 1.1. Essa é a primeira consequência prática para qualquer pessoa que ler esta análise: se você quer o agente da Meta, você está no novo checkpoint.
A segunda consequência é o preço, e é a mais interessante. A Meta lançou a versão 1.2 com dois IDs de modelo distintos em vez de um:
• Padrão (muse-spark-1.2) — $1,25 de entrada, $0,15 de entrada em cache, $4,25 de saída por milhão de tokens. Idêntico ao Muse Spark 1.1. A Meta garante que prompts e respostas neste nível não são usados para melhorar seus produtos.
• Colaborador (muse-spark-1.2-contributor) — $0.10 de entrada, $0.002 de entrada em cache, $0.20 de saída. Em troca, você concede à Meta permissão para treinar modelos futuros com seus prompts e respostas.
• Muse Spark 1.1 — não existe um nível de contribuidor. Ele permanece com o preço padrão, e a Meta não anunciou nenhuma descontinuação.
A própria caracterização da Meta para o nível de contribuidor é que ele é "mais de 10 vezes mais barato do que até mesmo o nível pré-pago", o que é uma subestimativa: os múltiplos reais são 12,5× na entrada e 21,25× na saída, com entrada em cache a um custo quase zero de $0,002. Essa é a manchete de "preço baixo" que o lançamento gerou, e ela pertence apenas ao 1.2.

A história do preço, reescrita
Antes de reformular seu orçamento em torno de US$ 0,20 por token de saída, leia o restante dos termos do nível de contribuidor, porque são eles que o tornam barato. Os limites de requisições caem de 3.000 requisições por minuto documentadas no nível padrão para 60 no nível de contribuidor — um teto que permite que um desenvolvedor experimente em um laptop e proíbe uma frota de agentes em produção. E a troca de dados não é uma formalidade: seus prompts e as respostas do seu modelo se tornam material de treinamento. Para qualquer pessoa que lide com dados de clientes, código-fonte proprietário ou qualquer coisa sob obrigação de confidencialidade, o nível de contribuidor não é uma versão mais barata do mesmo produto; é um produto diferente. A Meta reconheceu isso no mesmo lançamento ao adicionar uma opção de retenção zero de dados para clientes empresariais no caminho pago.
Portanto, a comparação honesta não é "1.1 a $4.25 versus 1.2 a $0.20." É: com o preço padrão, os dois modelos custam exatamente o mesmo, e o 1.2 é o que tem melhor pontuação. O nível de $0.20 é uma oferta real e agressiva, mas é voltado para indivíduos e experimentos, e está disponível apenas no modelo mais novo.
O que realmente determina a conta em qualquer um dos modelos é o cache, não a tarifa anunciada. Considere uma etapa representativa de agente: 60.000 tokens de contexto de repositório ou documento na entrada, 3.000 tokens de plano-e-resposta na saída. A frio, isso dá US$ 0,075 de entrada mais US$ 0,013 de saída — cerca de 8,8 centavos, ou US$ 88 por mil etapas. Mantenha o prefixo de contexto estável para que ele atinja o cache a US$ 0,15 por milhão e a entrada cai para US$ 0,009, colocando a etapa em aproximadamente 2,2 centavos e a execução de mil etapas em US$ 22. Uma variação de 75%, controlada inteiramente pela reutilização de um prefixo estável pelo seu framework de agente ou pela reconstrução do prompt a cada turno. Se você tomar uma única ação de engenharia após ler esta análise, que seja a estabilidade da chave de cache, e não a escolha do modelo.
Uma nota estrutural sobre onde você o aluga. O Muse Spark 1.1 está no catálogo da OrcaRouter por US$ 1,25 e US$ 4,25 com uma leitura de cache de US$ 0,15 — os mesmos números que a Meta cobra, porque a OrcaRouter opera com margem de 0% e repassa o preço de tabela do provedor diretamente, então uma alteração de preço do fornecedor chega aqui no mesmo dia em que chega lá. O Muse Spark 1.2 ainda não está no catálogo e é servido diretamente pela Meta. Isso é relevante para a comparação que você provavelmente está prestes a fazer: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 e Gemini 3.1 Pro ficam todos sob uma única chave pelo preço de tabela, então você pode avaliá-los contra o Muse Spark 1.1 em um único conjunto de avaliação sem um segundo contrato, e o número na sua planilha é o número na fatura.
O que o Muse Spark 1.1 realmente é
Muse Spark é a principal linha de raciocínio do Meta Superintelligence Labs, o grupo que Mark Zuckerberg criou sob Alexandr Wang. Ela marca uma reversão estratégica: enquanto os modelos Llama da Meta eram de pesos abertos, a família Muse — Spark, mais os geradores de imagem e vídeo — é fechada e entregue como produto e API. A Spark 1.0 chegou em 8 de abril de 2026; a 1.1 veio em 9 de julho, junto com a prévia pública da API Meta Model. A mudança prática para os desenvolvedores é que a Meta agora é uma fornecedora direta de API, competindo diretamente com OpenAI e Anthropic, não apenas uma publicadora de pesos — e o lançamento, em 5 de agosto, de um agente de codificação é a confirmação mais clara disso até agora.
A versão 1.1 foi um avanço substancial, e não apenas um lançamento pontual. Na Artificial Analysis, ganhou oito pontos no Índice de Inteligência em três meses, de 43 para 51. Seu índice de codificação subiu 12 pontos, para 71; SciCode melhorou para 58%; e Humanity's Last Exam subiu para 45%. A Meta afirmou que os maiores ganhos foram no uso de ferramentas, uso de computador, codificação e compreensão multimodal — consistente com um modelo ajustado para agir, e não apenas responder.
Quanto ao contexto, a confusão anterior foi resolvida: a Artificial Analysis e a OrcaRouter listam a janela em 1.048.576 tokens, e a Meta descreve uma janela que o modelo compacta ativamente. No entanto, manter um milhão de tokens não é o mesmo que recuperá-los, e a pontuação de recuperação de contexto longo do 1.1, de cerca de 54,1, indica que a recuperação é comum. Trate a janela como uma capacidade, não uma garantia.
Esforço de raciocínio: Instantâneo, Contemplação e o dial abaixo
Na superfície de consumo da Meta, o Muse Spark apresenta dois modos nomeados: Respostas instantâneas, imediatamente, sem raciocínio prolongado, como uma conversa de chat padrão; Contemplating executa vários agentes em paralelo usando uma técnica de "compressão de pensamento" emprestada do aprendizado por reforço, e a Meta a posiciona contra o DeepMind Deep Think e o GPT-5.4 Pro em trabalhos científicos e analíticos exigentes. Através da API, a mesma capacidade aparece como um parâmetro configurável de esforço de raciocínio — a Artificial Analysis publica suas pontuações na configuração xhigh do modelo, a mais cara que ele expõe.
{{1}}Trate esse dial como uma alavanca de custo{{/1}}, {{2}}não um controle de qualidade{{/2}}. {{3}}O raciocínio com agentes paralelos consome muito mais tokens{{/3}} {{4}}do que uma única passagem{{/4}}, {{5}}e os números de benchmark que você leu{{/5}} {{6}}foram produzidos com esforço máximo{{/6}}. {{7}}Use o padrão no nível mais baixo para chamadas rotineiras{{/7}} {{8}}e reserve o esforço alto{{/8}} {{9}}para os casos{{/9}} {{10}}em que uma primeira resposta errada{{/10}} {{11}}é cara{{/11}}.
Como se sai: forte com ferramentas, mediano sem.
A maneira mais clara de ler o Muse Spark 1.1 é com ferramentas versus sem ferramentas. Com ferramentas, ele lidera os testes agênticos: MCP Atlas 88,1 contra 82,2 do Claude Opus 4.8; JobBench 54,7 contra 48,4; Legal Agent Bench 20,0 contra 12,9 do Grok 4.5; e Humanity's Last Exam com ferramentas 62,1 contra 57,9. Sem ferramentas, ele é comum — o Humanity's Last Exam simples fica em torno de 45, bem atrás dos aproximadamente 77 do Gemini 3.1 Pro no mesmo teste.
Em precisão de execução, também fica atrás dos líderes: uso de computador OSWorld-Verified 80.8 contra 83.4 do Opus 4.8, codificação SWE-Bench Pro 61.5 contra 69.2, codificação de horizonte longo DeepSWE 1.1 53.3 contra 67.0 do GPT-5.5, e raciocínio visual BabyVision 76.3 contra 83.6. Muitos desses números são reportados pelos fornecedores, vários de avaliações da própria Meta, e executados em diferentes plataformas — interprete-os como direcionais e re-teste em suas próprias tarefas.

A imagem independente da Artificial Analysis é mais compacta e mais útil. Intelligence Index 51, posição #22 de 185, contra uma mediana de classe de 32. Velocidade de 213,5 tokens de saída por segundo, posição #2 de 185 — este é um modelo genuinamente rápido. Posição de preço #31, preço de cache-hit de $0,15 com um desconto de 88%. Verbosidade de 94M tokens de saída para percorrer o índice contra uma mediana de 65M, que é de onde vem uma parte considerável da conta real. Gasto total para avaliá-lo em toda a suíte: $548,07.
Uma ressalva que vale a pena ter em mente: a Meta anuncia entrada de texto, imagem, vídeo, áudio e PDF, mas o cartão de especificações técnicas da Artificial Analysis para o 1.1 registra apenas texto e imagem como avaliados. Ambas as coisas podem ser verdadeiras — a API aceita mais do que o que a estrutura de benchmark exercitou — mas ninguém fora da Meta publicou resultados em uma carga de trabalho de vídeo ou áudio. Se a análise de mídia mista é o motivo de você estar aqui, reserve tempo para verificar isso você mesmo.
Você deve migrar para a 1.2? A resposta da latência
Em codificação, a Meta diz sim, e seus números são internamente consistentes: Terminal-Bench 2.1 subindo de 76.2% para 82.9%, DeepSWE v1.1 de 53.0% para 59.3%, e seu benchmark interno de codificação de 68.3% para 70.6%. Estas são avaliações conduzidas pela Meta, com pontuação pass@1 em cinco tentativas no próprio harness da Meta — aplica-se a ressalva padrão de que modelos concorrentes em um harness de um fornecedor são frequentemente subajustados. Independentemente, a Artificial Analysis moveu o Muse Spark 1.2 para 54 no Índice de Inteligência, posição #13 de 185, três pontos acima do 1.1.
O que a Meta usou para comprar esses pontos foi deliberação, e isso aparece em todas as medições de tempo. A Artificial Analysis mede o tempo até o primeiro token em 26,12 segundos para o 1.2, contra 2,90 segundos para o 1.1 — ambos no nível máximo de esforço de raciocínio de cada modelo. A velocidade de saída caiu de 213,5 para 165 tokens por segundo. A verbosidade aumentou ligeiramente, 95M contra 94M tokens, e o custo de executar a mesma suíte de benchmarks subiu de US$ 548,07 para US$ 637,85 com preços idênticos por token. Esse último número é a expressão mais clara do trade-off: mesma tabela de preços, 16% mais tokens consumidos, três pontos de índice a mais.
Leia atentamente o valor de 26 segundos, porque é fácil interpretar mal. É uma medição de benchmark de esforço máximo, e a API usa por padrão uma configuração intermediária. Como ponto de referência de tráfego real, o Muse Spark 1.1 no OrcaRouter — atendendo a qualquer esforço que os chamadores realmente solicitem — mostra um p50 de tempo até o primeiro token de 1,84 segundos e um p95 de 6,00 segundos ao longo de uma semana de tráfego de produção, com taxa de erro zero. A latência de benchmark no esforço máximo e a latência de produção no esforço padrão são grandezas diferentes, e a diferença entre elas costuma ser superior a uma ordem de magnitude.
Então a decisão se resolve claramente pelo formato da carga de trabalho. Se você está executando agentes de codificação de horizonte longo que mantêm um repositório em contexto e trabalham por minutos a fio, o 1.2 é o modelo melhor e a penalidade de latência se amortiza em uma tarefa que nunca pareceria instantânea de qualquer forma. Se você está servindo qualquer coisa interativa — uma superfície de chat, um loop de chamada de ferramentas com um humano esperando, um SLO de latência medido em segundos — o Muse Spark 1.1 continua sendo o modelo com melhor formato na família, e sua classificação de velocidade não é um erro de arredondamento. Nada sobre o lançamento de agosto muda isso.
Experiência do desenvolvedor e limites
A API do Meta Model continua em pré-visualização pública, embora o lançamento de agosto tenha ampliado o acesso global e adicionado a opção empresarial de retenção zero de dados. A Meta oferece uma interface no estilo OpenAI e acesso ao SDK, e o Spark está disponível para consumidores no modo "Thinking" do Meta AI. Os limites de taxa agora são publicados em vez de estimados — 3.000 solicitações por minuto documentadas para o nível padrão —, mas status de pré-visualização continua sendo status de pré-visualização, então mantenha uma rota de fallback para os dias em que a capacidade estiver limitada. O failover automático entre provedores é exatamente o tipo de infraestrutura que um endpoint de nível de pré-visualização justifica, e é por isso que rotear um modelo de pré-visualização por meio de um gateway não custa nada e garante um segundo caminho.

Através do OrcaRouter, o ID do modelo é meta/muse-spark-1.1 e tanto /v1/chat/completions quanto /v1/responses estão disponíveis, então um cliente OpenAI existente precisa de uma URL base e uma string de modelo e nada mais:
from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
= client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Planeje e execute as ferramentas para corrigir este problema."}])
print(response.choices[0].message.content)
Onde cabe — e onde não cabe
Adequado para: automação de execução de ferramentas e uso de computador em que o tempo de resposta é visível para uma pessoa; raciocínio sensível a custos em escala sobre dados que você não pode fornecer a um conjunto de treinamento; fluxos de trabalho que combinam texto com imagens, vídeo, PDFs ou áudio, com sua própria verificação no caminho de mídia; e equipes que querem um padrão rápido e barato, com um modelo premium mantido em reserva para as etapas mais difíceis.
Ajuste fraco: precisão de codificação no topo do ranking e a engenharia greenfield mais difícil, que ainda pertencem ao Claude Opus 4.8 e ao GPT-5.6 Sol; problemas de raciocínio puro sem ferramentas; tarefas de precisão visual, onde o Gemini 3.1 Pro lidera; trabalho de repositório de longo horizonte, que agora é explicitamente função do 1.2 e do Muse Code; e qualquer coisa em que você precise do token mais barato possível da Meta, porque esse nível não existe neste modelo.
Perguntas Frequentes
O Muse Spark 1.1 ainda está disponível agora que o 1.2 foi lançado?
Sim. A Meta anunciou que não haverá descontinuação nem reajuste de preços no lançamento de 5 de agosto — o 1.1 permanece na Meta Model API a $1,25 e $4,25 por milhão de tokens, e está no catálogo do OrcaRouter com os mesmos valores. A cobertura do lançamento o descreve consistentemente como continuando com os preços atuais da API. Dito isso, a atenção da engenharia da Meta migrou visivelmente: o agente de codificação, os novos benchmarks e o nível de baixo custo estão todos vinculados ao 1.2.
Posso obter o Muse Spark 1.1 no nível de contribuidor de $0,10?
Não. O nível de contribuidor é um ID de modelo separado no checkpoint mais recente, muse-spark-1.2-contributor. Não há equivalente 1.1, então os tokens de raciocínio Meta mais baratos exigem mudar de versão — e aceitar um limite de 60 solicitações por minuto, além da permissão para a Meta treinar com seus prompts e completions.
Devo atualizar para o Muse Spark 1.2?
Se sua carga de trabalho for codificação de longa duração ou trabalho de agente em escala de repositório, sim: ele pontua mais alto tanto nas avaliações de codificação da própria Meta quanto no índice independente da Artificial Analysis, pelo mesmo preço padrão. Se sua carga de trabalho for interativa ou sensível à latência, não: o 1.2 troca aproximadamente nove vezes o tempo até o primeiro token e 23% da velocidade de saída por três pontos de índice, e seu raciocínio não pode ser desativado. Ambos estão na mesma API, então a mudança se resume a uma string de modelo em qualquer dos casos — o que é o teste A/B mais barato possível e vale a pena rodar no seu próprio tráfego antes de decidir.
O Muse Spark 1.1 é de código aberto?
Não, e é esse o ponto. Ao contrário dos modelos Llama da Meta, a família Muse tem pesos fechados e é entregue como produto e API. Não há pesos no Hugging Face, nenhum caminho de auto-hospedagem e nenhum provedor terceirizado — a Meta é a única parte que serve esse modelo, o que torna uma camada de roteamento com failover a resposta prática para o risco de provedor único, em vez de um segundo fornecedor.
O veredicto, uma versão depois
Muse Spark 1.1 é um modelo agêntico rápido, barato e genuinamente multimodal, forte no uso de ferramentas e, honestamente, mediano em codificação pura e raciocínio. Nada do que foi medido nele piorou em agosto. O que mudou foi o formato da família ao seu redor: a Meta agora tem um modelo com melhor pontuação pelo mesmo preço padrão, um nível drasticamente mais barato para desenvolvedores dispostos a trocar seus dados, e um produto de agente que não roda nem no 1.1 nem em nada que se possa apontar como 1.1.
O que resta é uma recomendação mais restrita, mas real. Se você precisa da qualidade de raciocínio da Meta a uma velocidade perceptível por humanos — um segundo até o primeiro token em produção, 213 tokens por segundo depois disso — a 1.1 ainda é a versão a se usar, e os três pontos de índice que a 1.2 adiciona não valem uma espera nove vezes maior. Se você não precisa dessa velocidade, não há mais muita razão para permanecer. De qualquer forma, é uma única string de modelo, então o conselho honesto é rodar ambos no seu próprio conjunto de avaliação por um dia e deixar seu orçamento de latência decidir.
Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
