
Muse Spark 1.3 Max Reasoning Está no Ar: A Configuração por Trás das Melhores Pontuações da Meta Agora Está Disponível para Todos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Muse Spark 1.3 — o modelo de raciocínio de fronteira que a Meta Superintelligence Labs lançou em 2 de setembro — acaba de ganhar o modo sobre o qual seu próprio placar foi construído. Em 4 de setembro, após dois dias de testes de segurança adicionais, a Meta liberou a configuração de raciocínio "max", que consome mais computação, para desenvolvedores na Meta Model API e no Muse Code, seu agente de codificação em terminal. O diretor de IA Alexandr Wang anunciou a novidade no X, e a conta @AIatMeta da empresa confirmou; o que era uma configuração limitada à Meta e a uma prévia para parceiros no lançamento agora é um nível de raciocínio que qualquer desenvolvedor pode selecionar.
Essa sequência é importante porque vários dos números que dominaram a cobertura do lançamento do Muse Spark 1.3 — 75,4 no DeepSWE v1.1, 66,9 no OSWorld 2.0, 1.754 no GDPval-AA v2 — vieram da configuração max, enquanto o modelo que os desenvolvedores podiam de fato chamar foi lançado com o esforço de raciocínio limitado a "xhigh". A Meta foi explícita no lançamento de que o max ainda estava em testes de segurança, mas a divisão significou que o placar principal e o modelo chamável eram duas coisas diferentes por dois dias. O lançamento de quinta-feira fecha essa lacuna, e o faz sem tocar no preço por token. Os números de benchmark dessa lista são da própria Meta e permanecem não reproduzidos por um harness independente; tudo o que foi relatado pelo fornecedor neste artigo está rotulado como tal.
O que foi retido — e o que mudou em 4 de setembro
A escada de raciocínio do Muse Spark 1.3 não mudou desde que a API paga da família foi aberta: o raciocínio está sempre ativado, e o parâmetro de esforço do modelo na Meta Model API aceita minimal, low, medium, high e xhigh, com o modelo gastando mais do seu orçamento de saída pensando à medida que o nível aumenta. Max fica acima de xhigh — mais computação, mais tokens de raciocínio e, na visão da Meta, significativamente mais forte em tarefas agênticas de longo horizonte. No lançamento de 2 de setembro, a Meta disponibilizou todos os níveis até xhigh, mas manteve o max fora da API pública enquanto aguardava o que chamou de testes de segurança adicionais, compartilhando-o apenas com um conjunto limitado de parceiros — suficiente para uma avaliação independente ser executada, mas não para uma carga de trabalho de produção.
Em 4 de setembro, Wang disse que os testes estavam concluídos. Max agora é uma configuração selecionável no Muse Code — o script de instalação está em dev.meta.ai/install.sh — e no ID de modelo muse-spark-1.3 por meio da Meta Model API, onde o parâmetro effort agora aceita max. Wang descreveu o escalonamento de dois dias como a forma da Meta de controlar o acesso "no nível de configuração" e disse ao Axios que a Meta não precisou pausar seu trabalho mais amplo por preocupações de segurança. A janela foi curta, mas é um precedente real: a Meta agora está disposta a reter um modo de raciocínio específico atrás de uma revisão de segurança enquanto lança o restante de um checkpoint imediatamente.
Uma ressalva prática para quem chama o modelo por meio de um gateway em vez do endpoint da própria Meta: várias páginas de documentação de terceiros e listagens de agregadores foram escritas no dia do lançamento e ainda enumeram o esforço de raciocínio apenas até xhigh. O valor max é uma liberação gradual do lado da Meta, então verifique se a rota pela qual você faz a chamada atualizou sua superfície de parâmetros antes de presumir que max está disponível — um proxy que validou seus valores aceitos em 2 de setembro pode rejeitar "max" até que seus mantenedores se atualizem.
O que o Max realmente compra — e onde isso não ajuda
Os materiais de quinta-feira da Meta incluem uma divisão explícita entre max e xhigh nos benchmarks que ela executa, e isso é a coisa mais útil que já publicou sobre o modelo até agora. Tudo isso é relatado pelo fornecedor, produzido dentro do próprio harness Muse Code da Meta, e a Meta diz que suas comparações contra o Claude Opus 5 e o GPT-5.6 Sol foram execuções de "melhor esforço" nas próprias configurações máximas desses concorrentes, que "podem não refletir o desempenho otimizado pelo provedor". Com essa ressalva, a divisão conta uma história direcional clara:
• OSWorld 2.0 (tarefas de agente de uso de computador) — 66.9 em max vs 57.2 em xhigh
• GDPval-AA v2 (Elo de agente de trabalho de conhecimento) — 1.754 no máximo vs 1.709 em xhigh
• JobBench (tarefas profissionais de longo horizonte) — 64.9 em max vs 61.2 em xhigh
• DeepSearchQA — um empate em 89.4
• Terminal-Bench 2.1 (codificação de agente de terminal) — 89.2 em xhigh contra 88.8 em max, a única suíte em que a configuração lançada em 2 de setembro vence

O padrão merece uma leitura cuidadosa. Max ajuda mais onde a tarefa é um longo loop agêntico — operar um computador, executar um briefing de trabalho do conhecimento, manter um cronograma de subtarefas como o JobBench faz. Em um benchmark de terminal de turno único, ele não acrescentou nada e custou um pouco: Terminal-Bench é o lembrete de que "mais raciocínio" não é uma melhoria monotônica, e é a razão para fazer A/B de max contra xhigh na sua própria carga de trabalho, em vez de assumir que a configuração mais alta é melhor em todos os lugares. Meta também destaca o resultado de 75.4 do DeepSWE v1.1 — a manchete do primeiro dia, acima dos 59.3 que a Meta relatou para o Muse Spark 1.2 seis semanas antes — como um número da configuração max. É esse o número que os avaliadores independentes vão executar novamente primeiro.
A leitura independente está começando a recuperar o atraso.
O que faltava no lançamento era qualquer medição independente, e essa lacuna está se fechando em um cronograma que coincide com a liberação do max. O Coding Agent Index da Artificial Analysis — que pontua cada modelo dentro de seu harness nativo de agente de código e combina tarefas do DeepSWE, Terminal-Bench e SWE-Atlas — posicionou o Muse Spark 1.3 (max) no harness Muse Code com 68 nesta semana, em segundo lugar no ranking, atrás do Claude Opus 5 (xhigh) no Claude Code e à frente do Claude Fable 5 (max), com 67, e do GPT-5.6 Sol (max), com 65. A mesma tabela pontua a configuração xhigh em produção com 64 no mesmo harness Muse Code, o que é a leitura mais direta e comparável até agora do que o max agrega — cerca de quatro pontos de índice — em um conjunto de tarefas independente. Essa linha do ranking foi publicada enquanto o max ainda estava em pré-visualização para parceiros; a configuração que ela descreve é a que ficou geralmente disponível em 4 de setembro.
A Artificial Analysis também atualizou o próprio model card da configuração máxima desde o lançamento. Durante o período de preview, o card não listava provedor nem preço; agora, o card ao vivo lista a Meta pelo preço padrão de US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída — o mesmo preço de tabela do Muse Spark 1.2 —, além de acrescentar uma ressalva de verbosidade: a execução de avaliação da AA consumiu cerca de 130 milhões de tokens contra uma mediana de 79 milhões, custou cerca de US$ 1.335 no total e fica perto de US$ 0,95 por tarefa na estimativa por tarefa da AA, a cerca de 190 tokens de saída por segundo.
Um número da cobertura anterior merece uma checagem de versão. A Artificial Analysis atualizou seu Intelligence Index para a v4.2 nesta semana — a mesma semana em que o max foi lançado — recalculando as pontuações de todos os modelos e alterando as medianas. Na tabela atual, a configuração max marca 53, contra uma mediana de 29 entre modelos comparáveis; o 62 que circulou na cobertura da semana de lançamento foi medido na versão anterior do índice, e os dois não são comparáveis. A comparação xhigh-versus-max da própria Meta, mostrada acima, é independente do índice da AA e não é afetada pela atualização.

Qual é o custo máximo — a conta está nos tokens, não na lista de preços
A Meta não publica um preço separado para a configuração max, nem uma análise de latência dedicada. O preço por token é idêntico ao do Muse Spark 1.2 e ao de todos os outros níveis de esforço no Muse Spark 1.3: US$ 1,25 por milhão de tokens de entrada, US$ 4,25 por milhão de tokens de saída e US$ 0,15 para entrada em cache no nível padrão. Tokens de raciocínio são cobrados como tokens de saída e contam contra o orçamento de saída; portanto, escolher max não é um aumento de preço itemizado — é uma promessa de gastar mais desse orçamento pensando antes de responder.
Isso torna a questão do custo real uma questão de volume de tokens, e os dados iniciais dizem que max é caro exatamente onde xhigh é enxuto. A execução instrumentada da AA consumiu cerca de 130 milhões de tokens em uma única avaliação da configuração. Para um desenvolvedor que já executa longos loops agênticos em xhigh, o teste A/B que importa não é "max passa mais tarefas", mas "max passa tarefas adicionais suficientes para pagar uma conta de tokens materialmente maior na mesma carga de trabalho."
A camada Contributor da Meta — US$ 0,10 na entrada e US$ 0,20 na saída por milhão de tokens, em troca de permitir que a Meta treine com seus prompts e completions — aplica-se ao mesmo checkpoint, e a Meta afirma que uma porcentagem significativa de dois dígitos dos desenvolvedores a escolhe. Os termos do Contributor fazem de cada envio um dado de treinamento, e seus limites de taxa são apertados; portanto, é uma opção padrão ruim para fan-out em produção, mas uma forma legítima de executar experimentos máximos caros de forma barata, se a troca de dados for aceitável para você.
A âncora de preço de tudo isso é fácil de verificar sem precisar acreditar na palavra da Meta, porque o checkpoint Muse Spark 1.3 tem exatamente o mesmo preço daquele que já está listado na OrcaRouter ao preço de tabela da própria Meta: o Muse Spark 1.2 está na OrcaRouter a $1.25 por milhão de tokens de entrada e $4.25 por milhão de tokens de saída, com zero markup, portanto, a alegação de “preço inalterado” pode ser conferida em uma página ao vivo que mostra exatamente esses números. O Muse Spark 1.3 em si ainda não está na OrcaRouter. Quando um provedor do nosso catálogo começar a servi-lo com max, o preço exibido em nossa plataforma será o preço de tabela da Meta repassado diretamente — não aplicamos markup aos preços dos provedores — e qualquer corte de preço do fornecedor entra em vigor no mesmo dia em que a Meta o fizer. Para um lançamento como este, em que o lado econômico interessante está no volume de tokens, e não no preço anunciado, esse repasse direto é o que faz com que o valor efetivamente cobrado de você seja igual ao valor que a Meta publica.

Quem deve mudar para o max
A decisão se divide claramente:
• Opção para cargas de trabalho de agente de longo horizonte — uso de computador, briefs de trabalho de conhecimento, loops de ferramentas de múltiplas etapas no Muse Code — onde a própria divisão da Meta e o painel de agente de codificação da AA mostram os maiores ganhos máximos. Primeiro, faça um teste A/B contra xhigh em uma amostra de suas tarefas reais, porque a verbosidade é real.
• Mantenha-se em xhigh para chamadas de alto volume, sensíveis à latência ou de turno único curto, onde max principalmente adiciona tokens. O Terminal-Bench é a prova de que max nem sempre adiciona capacidade.
• Observe três coisas a partir de agora: o lançamento dos pesos abertos que Zuckerberg prometeu sem data definida, a disponibilização do Muse Spark 1.3 aos consumidores no Instagram, no Facebook e no Meta AI nas próximas semanas, e se o painel de agentes de codificação do Artificial Analysis começa a precificar a linha max agora que a configuração está em disponibilidade geral.
O gate de dois dias acabou sendo curto, mas deixou um ponto que sobrevive ao próprio lançamento: os números mais fortes do Muse Spark 1.3 da Meta nunca foram uma miragem — estavam apenas esperando uma revisão de segurança. Desde 4 de setembro, o modelo que um desenvolvedor pode invocar e o modelo do ranking são finalmente o mesmo modelo. Se o max vale seus tokens agora é uma questão empírica que qualquer desenvolvedor pode responder, na API da Meta ou em qualquer rota que já use para chegar à família Muse Spark.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
