Muse Spark 1.2 versus Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 vs Muse Spark 1.1: Você Deve Fazer o Upgrade?

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Meta substituiu o Muse Spark 1.1 pelo Muse Spark 1.2 em 5 de agosto de 2026 sem alterar o preço, a janela de contexto, a lista de modalidades, os parâmetros suportados ou o dial de raciocínio. A migração, portanto, parece gratuita — mesma família de string de modelo, mesma cobrança, nada a renegociar. Não é gratuita. Medições independentes colocam o tempo até o primeiro token da nova versão em 26,12 segundos contra 2,90 da versão antiga, e sua saída sustentada em 165 tokens por segundo contra 213,5. Você está comprando três pontos de inteligência medida com cerca de nove vezes a espera antes que qualquer coisa volte.

Se vale a pena fazer isso depende quase inteiramente de por quanto tempo suas tarefas rodam. Aqui está o que realmente difere, o que permaneceu idêntico e o que ninguém pode te dizer ainda.

A decisão em quatro linhas

• Índice de Inteligência: 51 → 54, medido independentemente pela Artificial Analysis na configuração xhigh de cada versão.

• Tempo até o primeiro token: 2.90s → 26.12s, mesma fonte, mesmas condições.

• Custo para executar a mesma suíte de benchmarks: $548,07 → $637,85, com preços idênticos por token. Os 16% extras são pura queima de tokens.

• Tudo o que um formulário de aquisição pergunta: inalterado.

Muse Spark 1.2 vs Muse Spark 1.1-2

O que é genuinamente idêntico

Vale a pena enumerar isso porque é a razão pela qual uma migração parece trivial no papel, e porque uma diferença que não existe é algo que você não precisa testar.

Preço — US$ 1,25 por milhão de tokens de entrada, US$ 4,25 por milhão de saída, US$ 0,15 por milhão em cache hit, US$ 2,50 por mil pesquisas integradas na web. Cada um desses valores é o mesmo nas duas versões.

Contexto — 1.048.576 tokens em ambos, sem nível de sobretaxa de contexto longo em nenhum deles.

Modalidades — texto, imagens, vídeo, áudio e PDF como entrada; texto como saída. Ambos os anúncios divulgam os mesmos cinco tipos de entrada.

Seletor de raciocínio — obrigatório em ambos, com cinco níveis (mínimo, baixo, médio, alto, muito alto), padrão médio em ambos. Não há configuração em nenhuma das versões que desative o pensamento.

Parâmetros — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Listas idênticas.

Servindo — um único provedor, a própria Meta, em ambos. Sem hosts de terceiros, sem variantes de quantização.

Preço combinado — a Artificial Analysis estima ambos em US$ 0,78 por milhão de tokens em sua ponderação combinada, o que é de se esperar de tabelas de preços idênticas.

Se você esperava que a atualização viesse com mais contexto, uma garantia de comprimento de conclusão ou um cache mais barato, não veio. Esta é uma versão de pesos e pós-treinamento com uma tabela de preços copiada e colada da anterior.

O que realmente se moveu

Artificial Analysis é atualmente a única parte independente a ter avaliado ambas as versões, e avaliou ambas com o seu maior esforço de raciocínio, portanto a comparação é equitativa.

Índice de Inteligência — 51 para 1.1 (classificação #22 de 185) a 54 para 1.2 (classificação #13). Nove posições no ranking, onde a mediana da classe é 32, então o ganho resulta em posição real, não apenas um decimal.

Tempo até o primeiro token — 2.90s a 26.12s. Esta é a regressão principal e não é marginal.

Velocidade de saída — 213,5 a 165,0 tokens por segundo. Ainda classificado em #16 de 185 e ainda descrito pela Artificial Analysis como "notavelmente rápido", mas 23% mais lento que o modelo que substitui.

Verbosidade — 94M de tokens de saída para percorrer o índice, contra 95M. Efetivamente inalterado, e ambos cerca de 45% acima da mediana de 65M.

Gasto total com avaliação — US$ 548,07 a US$ 637,85. Já que a verbosidade quase não mudou e os preços não mudaram em nada, esse aumento de 16% vem de outro lugar que não a saída visível: rastros de raciocínio interno mais longos, mais novas tentativas ou mais turnos de ferramenta por tarefa.

O padrão é coerente. A Meta não tornou o modelo mais barato, mais rápido ou maior. Ela fez o modelo deliberar por mais tempo antes de se comprometer, e a deliberação extra aparece como latência, como streaming ligeiramente mais lento e como uma conta 16% maior para o trabalho idêntico. Três pontos de índice foi o que isso rendeu.

O quão ruim a latência realmente é

O valor de 26,12 segundos será citado fora de contexto, então trate-o corretamente: ele é medido em xhigh, o mais caro dos cinco níveis de esforço, em uma suíte de benchmarks projetada para ser difícil. A API usa como padrão medium.

Para ter uma noção de como o padrão realmente se comporta, o Muse Spark 1.1 no OrcaRouter — atendendo chamadas reais com qualquer esforço que solicitem — apresenta um p50 de tempo até o primeiro token de 1,84 segundos e um p95 de 6,00 segundos ao longo de uma semana contínua. São dados de produção em níveis de esforço de produção, e estão mais de uma ordem de magnitude abaixo do valor de referência. A versão 1.2 ainda não tem telemetria de produção.

Muse Spark 1.2 vs Muse Spark 1.1-3

Portanto, a leitura honesta não é "1.2 leva 26 segundos para responder." É: na configuração em que o 1.2 ganha seus três pontos extras, o primeiro token custa 26 segundos, e na mesma configuração o modelo antigo custava três. Se você já estava rodando em xhigh — que é exatamente a configuração onde o ganho de inteligência existe — esse é o número que você herda. Se você rodar em medium ou abaixo, verá algo muito mais curto, e também verá menos da melhoria.

Esse acoplamento é a verdadeira armadilha nesta atualização. Você não pode obter a inteligência sem a deliberação, porque é a deliberação que dá origem à inteligência.

O reposicionamento por trás dos números

A Meta não publicou post de lançamento para a 1.2 — a página de anúncio do Muse Spark ainda descreve a 1.1 — mas reescreveu a descrição do produto, e a reescrita explica a troca.

Muse Spark 1.1 foi vendido como um modelo de raciocínio multimodal com uma superfície de entrada incomumente ampla, voltado para "agentes multimodais, pesquisa profunda sobre mídias mistas e análise de contexto longo": relatórios extensos, bibliotecas de mídia, gravações e vídeo junto com texto.

A descrição do Muse Spark 1.2 abandona quase tudo isso e menciona engenharia de software em seu lugar — refatorações de múltiplos arquivos, sessões estendidas de depuração, geração de repositório inteiro — e então acrescenta uma alegação explícita de multiagente: o modelo pode atuar como o agente principal que reúne contexto, planeja e delega, ou como um subagente executando em paralelo sob um deles. Também afirma que o cache de prompt pode reduzir o custo efetivo em 60–80%, dependendo de quanto contexto se repete entre chamadas. Esse último número é uma estimativa da Meta, em vez de um resultado medido, embora a taxa de cache de $0,15 o torne aritmeticamente plausível.

Leia a regressão de latência em relação a esse reposicionamento e isso deixa de parecer um erro. Ninguém que esteja refatorando uma dúzia de arquivos se importa com 26 segundos de planejamento. A Meta escolheu um cliente, e não é aquele para quem o 1.1 foi vendido.

O que 1.1 ainda tem que 1.2 não tem

Quatro semanas de existência não são suficientes para acumular um histórico, e de três maneiras concretas o modelo mais antigo é atualmente o produto mais bem documentado.

Um recorde de arena.Muse Spark 1.1 tem um histórico substancial no Design Arena: 1334 Elo na posição 5 em desenvolvimento de jogos, 1334 na posição 7 em componentes de UI, 1320 na posição 3 em arte ASCII, 1318 em visualização de dados, 1309 em categorias gerais de código, além de uma escada completa de agents-arena cobrindo aplicativos web, slides HTML e desenvolvimento de jogos Godot. Muse Spark 1.2 não tem nenhuma entrada. No eixo em que a Meta está agora fazendo o marketing mais intenso, não há nenhum dado de confronto direto para o novo modelo.

Pontuações de subíndice. A Artificial Analysis publica um índice de codificação de 71,3 e um índice agêntico de 37,5 para o 1.1. Não há contraparte publicada para o 1.2. Como a pontuação agêntica foi a dimensão mais fraca do 1.1 por ampla margem, e a capacidade agêntica é exatamente o que o 1.2 afirma melhorar, este é o número que resolveria a questão da atualização — e ele ainda não existe.

Telemetria de produção. 1.1 conta com uma semana de dados reais de latência p50 e p95 e 4,4 milhões de tokens de tráfego ao vivo no OrcaRouter. 1.2 não tem nenhum dos dois; seu endpoint atualmente não reporta nenhuma estatística de latência ou throughput porque o volume é baixo demais para amostragem.

Algum lugar para alugá-lo além da Meta.Muse Spark 1.1 está no catálogo do OrcaRouter por $1,25 e $4,25 — o preço de tabela da própria Meta, repassado com margem de 0%. O Muse Spark 1.2 ainda não está lá, então hoje é uma integração direta com a Meta, com um único provedor e sem caminho de failover.

Muse Spark 1.2 vs Muse Spark 1.1-4

Nada disso significa que 1.2 é pior. Significa que a evidência para 1.2 consiste em uma pontuação composta de um avaliador, enquanto a evidência para 1.1 é um mês de arenas, subíndices e tráfego ao vivo. Essa assimetria deve afetar como você organiza a migração, não se você deve tentá-la.

Um checklist de migração que é realmente curto

Como a tabela de preços e a superfície de parâmetros são idênticas, a troca é uma alteração de string do modelo. O trabalho está em verificar as três coisas que de fato mudaram.

Meça seu próprio tempo até o primeiro token na sua configuração de esforço. Não aceite nem o valor de 2,90s nem o de 26,12s. Execute seus prompts reais com qualquer reasoning_effort que você realmente passar e compare diretamente. Este é o número que pode inviabilizar a migração de imediato.

Verifique sua configuração de timeout e streaming. Um aumento de 9x na latência do primeiro token em alto esforço excederá os timeouts do cliente ajustados para 1.1, e fará qualquer integração sem streaming parecer uma trava.

Recalcule o custo a partir das contagens de tokens medidas, não da tabela de preços. Os preços são idênticos, portanto qualquer alteração de custo é comportamental. A Artificial Analysis viu 16% a mais de gastos para o mesmo trabalho; se você verá isso depende da sua combinação de tarefas.

Verifique primeiro a estabilidade da chave de cache. Com um prefixo estável de 60.000 tokens, uma etapa típica de agente cai de cerca de 8,8 centavos para cerca de 2,2 centavos em qualquer uma das versões. Essa variação de 75% é maior do que qualquer coisa que a mudança de versão faça, e está inteiramente sob seu controle.

Re-teste explicitamente os caminhos de áudio e vídeo. Ambas as listagens anunciam as mesmas cinco modalidades de entrada, mas o cartão de especificações da Artificial Analysis para a versão 1.2 registra apenas texto e imagem como avaliados. A Meta reformulou o discurso para se afastar do trabalho com mídia mista. Ninguém independente verificou se a capacidade se manteve.

Mantenha a 1.1 acessível como fallback. Executar ambos atrás de uma única chave significa que o rollback é uma mudança de configuração em vez de um incidente, e permite fazer A/B dos dois em tráfego real em vez de discutir sobre um benchmark.

Quem se move agora, quem espera.

Mova-se agora se você roda agentes de codificação de longo horizonte com alto esforço de raciocínio. As tarefas já levam minutos, a penalidade de latência desaparece nisso, o ganho de inteligência é medido por um terceiro em vez de ser reivindicado pela Meta, e três pontos de índice é um salto significativo neste nível — nove posições em um ranking de 185 modelos.

Espere, se qualquer coisa que você sirva for interativa. Não existe configuração em que 1.2 seja mais responsivo que 1.1, e o raciocínio obrigatório significa que você não pode recuperar a responsividade desativando o pensamento. A versão 1.1 continua sendo o modelo mais rápido em todos os níveis de esforço e custa exatamente o mesmo.

Espere, se a sua carga de trabalho é análise de mídia mista — o caso de uso de relatórios longos, vídeo e áudio para o qual o 1.1 foi explicitamente construído e comercializado. A Meta parou de divulgá-lo e a única avaliação independente do 1.2 cobre texto e imagens. A capacidade pode muito bem estar intacta; simplesmente não há evidências em nenhum dos sentidos, e o 1.1 tem um mês disso.

Espere se você precisar dos dados da arena. Um modelo vendido com base em geração de repositório inteiro, sem entradas no Design Arena e sem subíndice agêntico publicado, está pedindo que você aceite a palavra da Meta sobre aquilo que ela mudou. Dê três ou quatro semanas e isso não será mais verdade — momento em que essa decisão fica muito mais fácil de tomar com base em evidências do que em um único número composto.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube