Um cartão de título principal para a notícia de que o Muse Spark 1.3 com raciocínio máximo já está no ar. Sobrelinha 'Meta Superintelligence Labs — 4 de setembro de 2026', manchete 'Muse Spark 1.3 com raciocínio máximo já está no ar', subtítulo observando que a Meta passou nos testes de segurança dois dias após o lançamento e disponibilizou o modo de raciocínio por trás das suas pontuações de destaque no Muse Code e na API Meta Model pelo mesmo preço, selos 'esforço de raciocínio: máximo', 'mesmo preço de tabela de US$ 1,25 / US$ 4,25' e 'a configuração por trás do DeepSWE 75.4', rodapé 'Agora selecionável no muse-spark-1.3 — tokens de raciocínio cobrados como saída', logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Muse Spark 1.3 Max Reasoning Está no Ar: A Configuração por Trás das Melhores Pontuações da Meta Agora Está Disponível para Todos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Muse Spark 1.3 — o modelo de raciocínio de fronteira que a Meta Superintelligence Labs lançou em 2 de setembro — acaba de ganhar o modo sobre o qual seu próprio placar foi construído. Em 4 de setembro, após dois dias de testes de segurança adicionais, a Meta liberou a configuração de raciocínio "max", que consome mais computação, para desenvolvedores na Meta Model API e no Muse Code, seu agente de codificação em terminal. O diretor de IA Alexandr Wang anunciou a novidade no X, e a conta @AIatMeta da empresa confirmou; o que era uma configuração limitada à Meta e a uma prévia para parceiros no lançamento agora é um nível de raciocínio que qualquer desenvolvedor pode selecionar.

Essa sequência é importante porque vários dos números que dominaram a cobertura do lançamento do Muse Spark 1.3 — 75,4 no DeepSWE v1.1, 66,9 no OSWorld 2.0, 1.754 no GDPval-AA v2 — vieram da configuração max, enquanto o modelo que os desenvolvedores podiam de fato chamar foi lançado com o esforço de raciocínio limitado a "xhigh". A Meta foi explícita no lançamento de que o max ainda estava em testes de segurança, mas a divisão significou que o placar principal e o modelo chamável eram duas coisas diferentes por dois dias. O lançamento de quinta-feira fecha essa lacuna, e o faz sem tocar no preço por token. Os números de benchmark dessa lista são da própria Meta e permanecem não reproduzidos por um harness independente; tudo o que foi relatado pelo fornecedor neste artigo está rotulado como tal.

O que foi retido — e o que mudou em 4 de setembro

A escada de raciocínio do Muse Spark 1.3 não mudou desde que a API paga da família foi aberta: o raciocínio está sempre ativado, e o parâmetro de esforço do modelo na Meta Model API aceita minimal, low, medium, high e xhigh, com o modelo gastando mais do seu orçamento de saída pensando à medida que o nível aumenta. Max fica acima de xhigh — mais computação, mais tokens de raciocínio e, na visão da Meta, significativamente mais forte em tarefas agênticas de longo horizonte. No lançamento de 2 de setembro, a Meta disponibilizou todos os níveis até xhigh, mas manteve o max fora da API pública enquanto aguardava o que chamou de testes de segurança adicionais, compartilhando-o apenas com um conjunto limitado de parceiros — suficiente para uma avaliação independente ser executada, mas não para uma carga de trabalho de produção.

Em 4 de setembro, Wang disse que os testes estavam concluídos. Max agora é uma configuração selecionável no Muse Code — o script de instalação está em dev.meta.ai/install.sh — e no ID de modelo muse-spark-1.3 por meio da Meta Model API, onde o parâmetro effort agora aceita max. Wang descreveu o escalonamento de dois dias como a forma da Meta de controlar o acesso "no nível de configuração" e disse ao Axios que a Meta não precisou pausar seu trabalho mais amplo por preocupações de segurança. A janela foi curta, mas é um precedente real: a Meta agora está disposta a reter um modo de raciocínio específico atrás de uma revisão de segurança enquanto lança o restante de um checkpoint imediatamente.

Uma ressalva prática para quem chama o modelo por meio de um gateway em vez do endpoint da própria Meta: várias páginas de documentação de terceiros e listagens de agregadores foram escritas no dia do lançamento e ainda enumeram o esforço de raciocínio apenas até xhigh. O valor max é uma liberação gradual do lado da Meta, então verifique se a rota pela qual você faz a chamada atualizou sua superfície de parâmetros antes de presumir que max está disponível — um proxy que validou seus valores aceitos em 2 de setembro pode rejeitar "max" até que seus mantenedores se atualizem.

O que o Max realmente compra — e onde isso não ajuda

Os materiais de quinta-feira da Meta incluem uma divisão explícita entre max e xhigh nos benchmarks que ela executa, e isso é a coisa mais útil que já publicou sobre o modelo até agora. Tudo isso é relatado pelo fornecedor, produzido dentro do próprio harness Muse Code da Meta, e a Meta diz que suas comparações contra o Claude Opus 5 e o GPT-5.6 Sol foram execuções de "melhor esforço" nas próprias configurações máximas desses concorrentes, que "podem não refletir o desempenho otimizado pelo provedor". Com essa ressalva, a divisão conta uma história direcional clara:

• OSWorld 2.0 (tarefas de agente de uso de computador) — 66.9 em max vs 57.2 em xhigh

• GDPval-AA v2 (Elo de agente de trabalho de conhecimento) — 1.754 no máximo vs 1.709 em xhigh

• JobBench (tarefas profissionais de longo horizonte) — 64.9 em max vs 61.2 em xhigh

• DeepSearchQA — um empate em 89.4

• Terminal-Bench 2.1 (codificação de agente de terminal) — 89.2 em xhigh contra 88.8 em max, a única suíte em que a configuração lançada em 2 de setembro vence

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

O padrão merece uma leitura cuidadosa. Max ajuda mais onde a tarefa é um longo loop agêntico — operar um computador, executar um briefing de trabalho do conhecimento, manter um cronograma de subtarefas como o JobBench faz. Em um benchmark de terminal de turno único, ele não acrescentou nada e custou um pouco: Terminal-Bench é o lembrete de que "mais raciocínio" não é uma melhoria monotônica, e é a razão para fazer A/B de max contra xhigh na sua própria carga de trabalho, em vez de assumir que a configuração mais alta é melhor em todos os lugares. Meta também destaca o resultado de 75.4 do DeepSWE v1.1 — a manchete do primeiro dia, acima dos 59.3 que a Meta relatou para o Muse Spark 1.2 seis semanas antes — como um número da configuração max. É esse o número que os avaliadores independentes vão executar novamente primeiro.

A leitura independente está começando a recuperar o atraso.

O que faltava no lançamento era qualquer medição independente, e essa lacuna está se fechando em um cronograma que coincide com a liberação do max. O Coding Agent Index da Artificial Analysis — que pontua cada modelo dentro de seu harness nativo de agente de código e combina tarefas do DeepSWE, Terminal-Bench e SWE-Atlas — posicionou o Muse Spark 1.3 (max) no harness Muse Code com 68 nesta semana, em segundo lugar no ranking, atrás do Claude Opus 5 (xhigh) no Claude Code e à frente do Claude Fable 5 (max), com 67, e do GPT-5.6 Sol (max), com 65. A mesma tabela pontua a configuração xhigh em produção com 64 no mesmo harness Muse Code, o que é a leitura mais direta e comparável até agora do que o max agrega — cerca de quatro pontos de índice — em um conjunto de tarefas independente. Essa linha do ranking foi publicada enquanto o max ainda estava em pré-visualização para parceiros; a configuração que ela descreve é a que ficou geralmente disponível em 4 de setembro.

A Artificial Analysis também atualizou o próprio model card da configuração máxima desde o lançamento. Durante o período de preview, o card não listava provedor nem preço; agora, o card ao vivo lista a Meta pelo preço padrão de US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída — o mesmo preço de tabela do Muse Spark 1.2 —, além de acrescentar uma ressalva de verbosidade: a execução de avaliação da AA consumiu cerca de 130 milhões de tokens contra uma mediana de 79 milhões, custou cerca de US$ 1.335 no total e fica perto de US$ 0,95 por tarefa na estimativa por tarefa da AA, a cerca de 190 tokens de saída por segundo.

Um número da cobertura anterior merece uma checagem de versão. A Artificial Analysis atualizou seu Intelligence Index para a v4.2 nesta semana — a mesma semana em que o max foi lançado — recalculando as pontuações de todos os modelos e alterando as medianas. Na tabela atual, a configuração max marca 53, contra uma mediana de 29 entre modelos comparáveis; o 62 que circulou na cobertura da semana de lançamento foi medido na versão anterior do índice, e os dois não são comparáveis. A comparação xhigh-versus-max da própria Meta, mostrada acima, é independente do índice da AA e não é afetada pela atualização.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Qual é o custo máximo — a conta está nos tokens, não na lista de preços

A Meta não publica um preço separado para a configuração max, nem uma análise de latência dedicada. O preço por token é idêntico ao do Muse Spark 1.2 e ao de todos os outros níveis de esforço no Muse Spark 1.3: US$ 1,25 por milhão de tokens de entrada, US$ 4,25 por milhão de tokens de saída e US$ 0,15 para entrada em cache no nível padrão. Tokens de raciocínio são cobrados como tokens de saída e contam contra o orçamento de saída; portanto, escolher max não é um aumento de preço itemizado — é uma promessa de gastar mais desse orçamento pensando antes de responder.

Isso torna a questão do custo real uma questão de volume de tokens, e os dados iniciais dizem que max é caro exatamente onde xhigh é enxuto. A execução instrumentada da AA consumiu cerca de 130 milhões de tokens em uma única avaliação da configuração. Para um desenvolvedor que já executa longos loops agênticos em xhigh, o teste A/B que importa não é "max passa mais tarefas", mas "max passa tarefas adicionais suficientes para pagar uma conta de tokens materialmente maior na mesma carga de trabalho."

A camada Contributor da Meta — US$ 0,10 na entrada e US$ 0,20 na saída por milhão de tokens, em troca de permitir que a Meta treine com seus prompts e completions — aplica-se ao mesmo checkpoint, e a Meta afirma que uma porcentagem significativa de dois dígitos dos desenvolvedores a escolhe. Os termos do Contributor fazem de cada envio um dado de treinamento, e seus limites de taxa são apertados; portanto, é uma opção padrão ruim para fan-out em produção, mas uma forma legítima de executar experimentos máximos caros de forma barata, se a troca de dados for aceitável para você.

A âncora de preço de tudo isso é fácil de verificar sem precisar acreditar na palavra da Meta, porque o checkpoint Muse Spark 1.3 tem exatamente o mesmo preço daquele que já está listado na OrcaRouter ao preço de tabela da própria Meta: o Muse Spark 1.2 está na OrcaRouter a $1.25 por milhão de tokens de entrada e $4.25 por milhão de tokens de saída, com zero markup, portanto, a alegação de “preço inalterado” pode ser conferida em uma página ao vivo que mostra exatamente esses números. O Muse Spark 1.3 em si ainda não está na OrcaRouter. Quando um provedor do nosso catálogo começar a servi-lo com max, o preço exibido em nossa plataforma será o preço de tabela da Meta repassado diretamente — não aplicamos markup aos preços dos provedores — e qualquer corte de preço do fornecedor entra em vigor no mesmo dia em que a Meta o fizer. Para um lançamento como este, em que o lado econômico interessante está no volume de tokens, e não no preço anunciado, esse repasse direto é o que faz com que o valor efetivamente cobrado de você seja igual ao valor que a Meta publica.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Quem deve mudar para o max

A decisão se divide claramente:

• Opção para cargas de trabalho de agente de longo horizonte — uso de computador, briefs de trabalho de conhecimento, loops de ferramentas de múltiplas etapas no Muse Code — onde a própria divisão da Meta e o painel de agente de codificação da AA mostram os maiores ganhos máximos. Primeiro, faça um teste A/B contra xhigh em uma amostra de suas tarefas reais, porque a verbosidade é real.

• Mantenha-se em xhigh para chamadas de alto volume, sensíveis à latência ou de turno único curto, onde max principalmente adiciona tokens. O Terminal-Bench é a prova de que max nem sempre adiciona capacidade.

• Observe três coisas a partir de agora: o lançamento dos pesos abertos que Zuckerberg prometeu sem data definida, a disponibilização do Muse Spark 1.3 aos consumidores no Instagram, no Facebook e no Meta AI nas próximas semanas, e se o painel de agentes de codificação do Artificial Analysis começa a precificar a linha max agora que a configuração está em disponibilidade geral.

O gate de dois dias acabou sendo curto, mas deixou um ponto que sobrevive ao próprio lançamento: os números mais fortes do Muse Spark 1.3 da Meta nunca foram uma miragem — estavam apenas esperando uma revisão de segurança. Desde 4 de setembro, o modelo que um desenvolvedor pode invocar e o modelo do ranking são finalmente o mesmo modelo. Se o max vale seus tokens agora é uma questão empírica que qualquer desenvolvedor pode responder, na API da Meta ou em qualquer rota que já use para chegar à família Muse Spark.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente