Muse Spark 1.2 e Muse Code-1
Guides & Insights

Muse Spark 1.2 e Muse Code: o terceiro modelo da Meta em quatro meses empata com o Grok 4.5

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Meta lançou Muse Spark 1.2 em 5 de agosto de 2026, quatro semanas após o Muse Spark 1.1 e cerca de quatro meses após o primeiro Muse Spark. Esta versão chegou com algo que as duas anteriores não tinham: um agente de codificação próprio da Meta, Muse Code, lançado em versão beta e co-treinado com o modelo em que roda. E no único placar que nem a Meta nem seus rivais controlam, o lançamento coloca a Meta em empate técnico com a SpaceXAI — Muse Spark 1.2 e Grok 4.5 agora ambos marcam 54 no Artificial Analysis Intelligence Index. Cinco dias depois, veio a maior novidade: em 10 de agosto, a Meta disse que vai abrir os pesos do Muse Spark 1.2 — um anúncio que, se concretizado, tornaria o modelo o mais forte rival atual dos EUA com pesos abertos contra os modelos chineses.

Duas coisas devem ser separadas antes que qualquer um dos números abaixo signifique algo. A pontuação do Intelligence Index, os números de latência e as contagens de tokens vêm da Artificial Analysis, que executa suas próprias avaliações e publica os resultados; esses são independentes. Os resultados de codificação com os quais a Meta abriu seu anúncio — Terminal-Bench 2.1, DeepSWE v1.1 e um benchmark interno — foram executados pela Meta, no harness da Meta, com cada modelo concorrente emparelhado ao seu próprio produto de agente. Ambos os tipos de número são úteis. Não são o mesmo tipo de evidência, e este artigo os mantém separados.

O que a Meta realmente lançou

Muse Spark 1.2 and Muse Code-2

O anúncio, publicado no blog de pesquisa de IA da Meta e datado de 5 de agosto, aborda dois produtos de uma só vez.

Muse Spark 1.2 — uma atualização focada em codificação para a família Muse Spark. A Meta afirma que aumentou a escala da computação de treinamento em tarefas de codificação e ampliou a diversidade dos ambientes de treinamento, mantendo a capacidade de agente geral que foi o principal argumento de venda do lançamento 1.1. As metas de treinamento declaradas são de longo horizonte: geração de repositórios inteiros, grandes projetos ponta a ponta e o que a Meta chama de auto-research, com planejamento para sequenciar o trabalho, condicionamento de objetivo para manter a direção ao longo de muitas etapas e compactação de contexto para manter o estado relevante ativo à medida que uma sessão se prolonga.

Muse Code — um agente de codificação de terminal em beta, instalado com um script de shell de uma linha do domínio de desenvolvedores da Meta. Ele executa agentes assíncronos persistentes em segundo plano que sobrevivem ao longo de uma sessão, em um runtime de log de eventos local que a Meta descreve como de reprodução exata e seguro para reinicialização, e coordena múltiplos subagentes por tarefa em árvores de trabalho isoladas. Ele vem com três habilidades integradas: /plan para planejamento com aprovação, /grill para submeter o trabalho já feito a um teste de estresse, e /goal para conduzir uma tarefa até a conclusão.

O emparelhamento não é incidental. A Meta afirma que os dois foram co-treinados — o modelo foi ajustado em trajetórias de amostragem por rejeição do harness, com otimizações de receita para objetivos, compactação e subagentes. Essa é a mesma jogada de co-treinamento que produziu Claude Code e Codex, e tem uma consequência para qualquer um que leia números de benchmark: as pontuações principais de codificação do modelo foram produzidas dentro do harness contra o qual ele foi treinado. Isso não é trapaça; é assim que a avaliação agêntica funciona atualmente. Mas isso significa que uma pontuação de 1,2 obtida por meio de algum outro scaffold é uma questão em aberto, e não uma suposição segura.

O restante da especificação está inalterado em relação à 1.1, que é por si só informativa. O contexto permanece em 1,048,576 tokens. O raciocínio continua obrigatório em cinco níveis de esforço — mínimo, baixo, médio, alto, xhigh — com médio como padrão; não há configuração em que você obtenha os pesos sem pagar por alguma deliberação. No lançamento, os pesos eram fechados, sem um repositório no Hugging Face, e a própria Model API da Meta era o único lugar de primeira parte para chamá-lo. Isso agora está programado para mudar: em 10 de agosto, a Meta anunciou que abrirá os pesos, revertendo a política de pesos fechados que regeu os três primeiros lançamentos do Muse Spark.

43, depois 51, depois 54

Muse Spark 1.2 and Muse Code-3

A Artificial Analysis avalia o Muse Spark 1.2 com 54 pontos em seu Índice de Inteligência na configuração de raciocínio xhigh, classificando-o em 13.º lugar entre 185 modelos, frente a uma mediana da classe de 32. O índice é um composto ponderado de nove avaliações — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR — divididas igualmente entre agentes, codificação, capacidade geral e raciocínio científico.

Lida como uma série, e não como um instantâneo, a trajetória da Meta é a história real. O Muse Spark original marcou 43 em abril. O Muse Spark 1.1 chegou a 51 em 9 de julho, um ganho de oito pontos em um trimestre. O Muse Spark 1.2 adiciona mais três em menos de um mês. A Meta avançou 11 pontos de índice em quatro meses e agora está lançando mais rápido do que o ecossistema de avaliação consegue acompanhar — ainda não há um detalhamento por benchmark publicado para o 1.2, e nenhum registro no Design Arena para ele, enquanto o 1.1 tem ambos.

Cinquenta e quatro coloca a Meta no mesmo nível do Grok 4.5, o modelo que a SpaceXAI lançou um dia antes do Muse Spark 1.1, e atrás de um grupo de ponta bem acirrado: Claude Opus 5 com 61, Claude Fable 5 com 60, GPT-5.6 Sol com 59. A distância para o topo é de seis ou sete pontos. A distância em relação a onde a Meta começou o ano é de onze. Se essa distância vai fechar depende de o ritmo se manter, e a Meta está em um ciclo de lançamentos de quatro semanas no momento.

Contudo, um empate em um índice composto não é um empate em um trabalho, e vale a pena dizer o que o 54 resolve e o que não resolve. Ele resolve que o Muse Spark 1.2 pertence à mesma conversa que o Grok 4.5 em capacidade agregada. Ele não diz qual deles escreve melhores patches, porque o sub-índice de codificação que responderia a isso ainda não foi publicado para o 1.2.

Números de codificação da Meta, leia com atenção.

O anúncio da Meta lidera em três gráficos. Em suas próprias execuções, relatado como pass@1 em cinco tentativas, com cada modelo concorrente emparelhado com seu próprio produto de agente:

Terminal-Bench 2.1 — 82,9% para Muse Spark 1.2, acima dos 76,2% da versão 1.1. Claude Opus 5 aparece à frente com 86,7%.

DeepSWE v1.1 — 59,3%, acima de 53,0%.

Benchmark interno de codificação da Meta — 70,6%, acima dos 68,3%.

Os deltas são a parte crível. Um ganho de 6,7 pontos no Terminal-Bench e 6,3 no DeepSWE, medidos da mesma forma no mesmo harness pela mesma equipe com um mês de intervalo, é uma leitura razoável de o quanto a 1.2 melhorou em relação à 1.1 naquilo que a Meta estava otimizando. A colocação entre diferentes fornecedores é a parte que deve ser encarada com ressalvas: o pareamento de harness é uma grande variável livre, e um laboratório que ajusta seu próprio harness junto com seu próprio modelo não está em posição de ajustar o de todos os outros com o mesmo capricho. A Meta ficou em segundo lugar no próprio slide, o que ao menos não é o formato habitual de um benchmark de fornecedor, mas nenhum terceiro reproduziu qualquer um desses resultados até o momento em que este texto foi escrito.

A segunda lista de preços

A mudança mais impactante desta versão não aparece nos gráficos de benchmark. O Muse Spark 1.2 vem com duas listas de preços.

Nível padrão — $1,25 por milhão de tokens de entrada, $0,15 por milhão em acerto de cache, $4,25 por milhão de saída. Inalterado desde a versão 1.1, ao centavo. Limite de taxa em cerca de 3.000 solicitações por minuto. A fundamentação de pesquisa na web é cobrada separadamente a $2,50 por mil consultas.

Nível de contribuidor — $0,10 de entrada, $0,002 de entrada em cache, $0,20 de saída. Isso é 12,5× mais barato na entrada e 21,25× mais barato na saída. O preço de admissão é a permissão para a Meta treinar modelos futuros com seu tráfego, e um limite de taxa de 60 solicitações por minuto — 2% do orçamento padrão.

A $0,10 e $0,20, o Muse Spark 1.2 ficaria abaixo de quase todos os modelos próximos da fronteira no mercado, incluindo o nível de baixo custo com pesos abertos para o qual, de outra forma, perde em preço. Esse é o número interessante neste lançamento, e não é realmente uma decisão de preço. Sessenta requisições por minuto, por si só, inviabiliza a maioria dos padrões de fan-out em produção, então o nível é voltado para experimentação e trabalho de equipes pequenas, e não para servir tráfego. E “podemos treinar com seu tráfego” é uma questão para quem aprova a governança de dados na sua organização, não para quem escolhe modelos. Trate isso como uma revisão jurídica com um desconto anexado, não um SKU mais barato.

Quanto custa produzir o 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publica o custo de suas próprias execuções de avaliação, e é nessa coluna que a forma do Muse Spark 1.2 aparece. Passar pela suíte de nove benchmarks custou US$ 637,85 e queimou 95 milhões de tokens de saída, contra US$ 548,07 e 94 milhões para o Muse Spark 1.1 — com preços idênticos por token. Os 16% extras são pura deliberação.

Os números de latência se movem na mesma direção. Medido em xhigh, o tempo até o primeiro token é de 26,12 segundos para 1.2 contra 2,90 segundos para 1.1, e a velocidade de saída cai de 213,5 para 165,0 tokens por segundo. A Meta comprou três pontos de índice com tempo de raciocínio, e o design de raciocínio obrigatório significa que você não pode recusar a compra — apenas escolher quanto dela você faz.

Esse número de 26 segundos será citado incorretamente, então aqui está a correção antecipada: é uma medição no nível de esforço mais caro que o modelo expõe, e a API usa o nível médio por padrão. Como ponto de referência do tráfego real, em vez de um ambiente de benchmark, o Muse Spark 1.1 servido por meio do OrcaRouter — com o nível de esforço que os chamadores realmente solicitarem — mostra, ao longo de 7 dias, um p50 de tempo até o primeiro token de 1.84 segundos e um p95 de 6.00 segundos, com 519 tokens por segundo e uma taxa de erro zero. A latência de benchmark no esforço máximo e a latência de produção no esforço padrão são grandezas diferentes e geralmente diferem por uma ordem de magnitude. Leia 26.12s como o teto do raciocínio profundo, não como o que uma solicitação vai parecer.

Onde você pode ligar hoje

Muse Spark 1.2 é servido pela própria Model API da Meta e, até o momento em que escrevo, em nenhum outro lugar — ainda não há repositório no Hugging Face e ele não está no catálogo do OrcaRouter. É isso que o anúncio de 10 de agosto está prestes a mudar: a Meta diz que os pesos serão abertos 'nas próximas semanas' e, quando isso acontecer, a questão da disponibilidade passa de 'onde é servido?' para 'quais pesos, sob qual licença e em quais runtimes'. O Muse Spark 1.1 está no catálogo do OrcaRouter, a US$ 1,25 e US$ 4,25 — os mesmos valores que a Meta cobra, porque o OrcaRouter não aplica margem (0%) e repassa o preço de tabela do provedor diretamente.

Isso importa mais para a comparação do que para o próprio modelo. Se você está montando um modelo de custos para esta versão, os modelos com os quais você a compararia — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — são acessados por uma única chave pelo preço de tabela; portanto, o valor na sua planilha é o valor na fatura, e um corte de preço do provedor entra em vigor no mesmo dia, em vez de depois de uma renovação. No caso específico do Muse Spark 1.2, hoje a resposta é o endpoint da Meta, um segundo contrato e uma fatura separada — e, quando os pesos forem disponibilizados, uma instalação auto-hospedada se torna uma terceira opção.

O que mudou em 10 de agosto

Cinco dias após o lançamento, a postura da Meta em relação ao seu próprio carro-chefe mudou. Em um anúncio datado de 10 de agosto, a Meta disse que abrirá os pesos do Muse Spark 1.2 “nas próximas semanas”, tornando-o o primeiro lançamento do Muse Spark que uma equipe poderia executar por conta própria. A declaração é feita pelos executivos, não foi enviada: ainda não há repositório no Hugging Face, e a data exata, a contagem de parâmetros e a licença não estão confirmados.

O que está em jogo é a corrida dos pesos de fronteira. O Muse Spark 1.2 marca 54 no Artificial Analysis Intelligence Index — acima de todos os modelos de pesos abertos dos EUA atualmente disponíveis para download — portanto, se os pesos forem lançados como prometido, seria o rival americano de pesos abertos mais forte contra os laboratórios chineses, o enquadramento que Zuckerberg defendeu longamente em 10 de agosto em um ensaio de 6.500 palavras acusando as restrições dos EUA sobre dados de treinamento de entregar a liderança em pesos abertos a laboratórios estrangeiros. A mudança já tem um primeiro lançamento: o Muse Glimmer, um modelo de 30 bilhões de parâmetros lançado no mesmo dia sob uma licença Apache 2.0, destilado do Muse Spark e criado para cargas de trabalho locais baseadas em agentes. Os próprios benchmarks da Meta o colocam à frente do Gemma4-31B e Qwen3.6-27B da Google em tarefas de agente; esses números são fornecidos pelo fabricante e ainda não foram reproduzidos.

O que o anúncio não respondeu

Sem número de codificação independente. A Artificial Analysis publica um índice composto para o 1.2, mas ainda não os subíndices de codificação e agênticos que publicou para o 1.1 (71,3 e 37,5, respectivamente). Como o trabalho agêntico era, de longe, a dimensão mais fraca do 1.1, e a codificação agêntica é exatamente o que o 1.2 afirma ter corrigido, este é o número que resolveria a questão do lançamento.

Nenhuma reprodução dos resultados do harness. Todos os números de codificação no anúncio foram executados pela Meta. Ninguém ainda publicou pontuações do Muse Spark 1.2 a partir de uma estrutura neutra.

Sem verificação multimodal. A listagem do Muse Spark anuncia entrada de texto, imagem, vídeo, áudio e PDF. A avaliação independente cobre texto e imagem. A mensageria 1.2 da Meta passou quase inteiramente para o trabalho de software, e o caso de uso de mídia mista 1.1 foi explicitamente vendido; por enquanto, não há marketing nem medição por trás dele.

Sem histórico de throughput. O volume no endpoint ainda é muito baixo para que as estatísticas de latência contínua usuais sejam preenchidas.

O que assistir nas próximas quatro semanas

Quatro coisas vão decidir se este lançamento é o que a Meta diz que é. A primeira é uma pontuação agêntica independente para a 1.2 — se o subíndice que era 37,5 na 1.1 se moveu substancialmente, a proposta de codificação é real. A segunda é se alguém reproduz o resultado do Terminal-Bench fora do Muse Code; um modelo que só se sai bem dentro do próprio harness é um produto, não uma capacidade. A terceira é o que acontece com o nível de contribuidor: se o limite de 60 requisições for afrouxado, um modelo próximo da fronteira a US$ 0,10 de entrada e US$ 0,20 de saída muda a aritmética do nível de orçamento de uma forma que um ganho de três pontos no índice nunca faria. A quarta é a promessa dos pesos: a Meta diz que os pesos do Muse Spark 1.2 serão abertos 'nas próximas semanas', e se o repositório chegar nesse cronograma — sob qual licença e com que rapidez os runtimes locais o adotarem — decidirá se a mudança para pesos abertos é real.

E se o ritmo se mantiver, o Muse Spark 1.3 está previsto para o início de setembro. Com base nisso, o número a observar quando ele chegar não é a pontuação do índice. É se a Meta consegue adicionar capacidade sem acrescentar mais vinte segundos de raciocínio no início de cada solicitação. O primeiro fruto dessa mudança já foi lançado: Muse Glimmer, um modelo de pesos abertos de 30 bilhões de parâmetros que a Meta lançou em 10 de agosto sob licença Apache 2.0, projetado para executar agentes localmente — a prévia mais próxima até agora de como seria um Muse Spark 1.2 aberto.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente