Cartão hero gerado intitulado 'Step 5 Preview vs Muse Glimmer - a API e o laptop'. O cartão esquerdo 'Step 5 Preview' traz: AA Index 44 contra uma mediana da classe de 26, StepFun, anunciado em 20 de setembro de 2026, cerca de 600B no total / 27B ativos, contexto de 1M tokens, US$ 1,00 de entrada / US$ 2,70 de saída por 1M tokens, roda nos servidores do fornecedor. O cartão direito 'Muse Glimmer' traz: AA Index 17, Meta Superintelligence Labs, lançado em 10 de agosto de 2026, 30B parâmetros em 4 bits abaixo de 20 GB, contexto de 131K tokens extensível para 262K, Apache 2.0, roda na sua própria GPU offline. Um rodapé diz: 'Valores do índice conforme a Artificial Analysis; especificações do Muse Glimmer conforme a Meta.'
Guides & Insights

Step 5 Preview vs Muse Glimmer: A Frontier API e o Modelo de Laptop

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em um ranking, Step 5 Preview e Muse Glimmer não estão próximos: 44 contra 17 no Artificial Analysis Intelligence Index — uma diferença de vinte e sete pontos em uma escala cujo líder atual fica na casa dos cinquenta e poucos — que nenhuma quantidade de ajuste vai fechar. Na pergunta que uma equipe realmente precisa responder — onde meus tokens rodam —, eles são concorrentes diretos. Step 5 Preview é o carro-chefe da StepFun, anunciado em 20 de setembro de 2026, com aproximadamente 600 bilhões de parâmetros totais e 27 bilhões ativos, um contexto de 1M de tokens, com preço de US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída, e acessível apenas pela rede. Muse Glimmer é o modelo agêntico de pesos abertos de 30 bilhões de parâmetros do Meta Superintelligence Labs, lançado em 10 de agosto de 2026 sob a licença Apache 2.0, distribuído quantizado em 4 bits para caber em menos de 20 GB de memória e rodar em uma única GPU de consumidor com a rede desconectada. A forma correta de ler esse pareamento não é "qual é mais inteligente". É "qual das duas restrições — capacidade ou perímetro — é aquela que sua carga de trabalho não consegue mudar."

A comparação também é um corretivo útil para um hábito que este mercado adquiriu: tratar a pontuação de um índice composto como se fosse todo o valor de um modelo. A diferença de vinte e sete pontos é real e não é o único número no arquivo. Na recuperação de contexto longo, o mesmo painel independente coloca o Muse Glimmer a menos de meio ponto de modelos de pesos abertos de uma classe de peso muito maior, e os benchmarks agênticos da própria Meta são respeitáveis para um modelo que roda em um laptop. Enquanto isso, a fraqueza mais citada do Step 5 Preview não é em absoluto a capacidade, mas a verbosidade, e ele permanece fechado até que seus pesos prometidos cheguem, em 15 de outubro.

Dois modelos, dois objetos completamente diferentes

O Step 5 Preview é um sistema de mistura de especialistas servido a partir da infraestrutura da StepFun: cerca de 600 bilhões de parâmetros totais, 27 bilhões ativos por token, entrada de texto e imagem, uma janela de contexto de 1M tokens e uma pontuação independente de 44 no Intelligence Index, contra uma mediana de 26 de modelos comparáveis. Sua saída roda a 87 tokens por segundo, contra uma média de 78 na medição do mesmo ranking, e gerou cerca de 160 milhões de tokens de saída em toda a suíte de tarefas do índice, enquanto o modelo mediano emite cerca de 82 milhões — aproximadamente o dobro de texto por unidade de trabalho, cobrado a US$ 2,70 por milhão. Os pesos BF16 foram prometidos para 15 de outubro de 2026 e ainda não estão no repositório, então hoje o modelo existe para você apenas como uma API.

O Muse Glimmer é o objeto oposto. É um modelo de 30 bilhões de parâmetros treinado por destilação de logits a partir do professor Muse Spark, maior, da Meta, e depois ajustado em dados agênticos de contexto longo e reforçado para uso de ferramentas. A Meta o distribui quantizado em 4 bits, o que reduz a memória de mais de 55 GB em precisão total para menos de 20 GB — dentro de um envelope de 24 GB ou 32 GB de VRAM — e ele foi testado pela Meta em uma Nvidia RTX 5090 e nos processadores Apple M4 Max e M5 Max. Ele aceita entrada de texto e imagem em mais de cem idiomas, oferece suporte a um contexto de 131.072 tokens, extensível para 262.144, e foi criado para receber um objetivo, dividi-lo em etapas, chamar ferramentas e tentar novamente uma chamada que falhou em vez de parar. Ele usa a licença Apache 2.0 e funciona offline.

• Pontuação independente — Step 5 Preview: 44 contra uma mediana de 26 em sua classe vs Muse Glimmer: 17 no mesmo índice em sua configuração superior.

• Escala — Step 5 Preview: cerca de 600B no total, 27B ativos por StepFun vs Muse Glimmer: 30B no total, quantizado para 4 bits em menos de 20 GB.

• Janela de contexto — Step 5 Preview: 1 milhão de tokens vs Muse Glimmer: 131.072, extensível até 262.144, segundo a Meta.

• Preço — Step 5 Preview: US$ 1,00 de entrada / US$ 2,70 de saída por milhão de tokens, publicado vs Muse Glimmer: sem cobrança por token; você fornece a GPU.

• Onde é executado — Prévia da Etapa 5: os servidores do fornecedor, via HTTP vs Muse Glimmer: seu próprio hardware, offline.

• Licença — Step 5 Preview: pré-visualização fechada, pesos prometidos para 15 de outubro de 2026 vs Muse Glimmer: Apache 2.0, disponível para download agora.

• Recuperação de contexto longo — O Muse Glimmer obtém 80,0 na avaliação de raciocínio de contexto longo do placar do índice, a meio ponto de modelos de faixa de preço várias vezes superior e próximo o suficiente da leitura do Step 5 Preview para que a diferença não seja relevante para a decisão em trabalhos de localização de fatos.

Os vinte e sete pontos, e o que eles não medem

Um modelo de 30B destilado para rodar em 20 GB de memória vai perder para um modelo de ponta de 600B em um índice de inteligência geral, e o próprio material da Meta não afirma o contrário — uma de suas formulações é direta ao dizer que o Glimmer não foi projetado para igualar o poder de raciocínio bruto de modelos de nuvem em escala total. Portanto, a pontuação de 17 não é um veredito sobre a engenharia; é o resultado esperado de se ponderar um objetivo diferente. A pergunta certa é quais das suas tarefas essa lacuna realmente abrange.

A leitura de contexto longo é onde os dois mais se aproximam e onde a intuição se desfaz. O Muse Glimmer obtém 80,0 na avaliação de raciocínio de contexto longo do leaderboard — uma pontuação que seria banal para um modelo de fronteira e é notável para um que corre numa GPU de consumidor. Se a sua carga de trabalho for recuperação, sumarização ou extração em documentos longos, um modelo local a esse nível não é obviamente a ferramenta errada, e o facto de o pedido nunca sair da sua máquina é uma funcionalidade que não pode comprar a uma API por preço algum.

Depois, há a parte da comparação que os números da Meta não mostram. Um estudo revisado por pares sobre orquestração multiagente testou o Muse-Glimmer-30B em uma configuração controlada — mesma tarefa, mesmo harness, mesmos consultores — e descobriu que ele não recuperou nenhum dos candidatos produzidos por modelos de fronteira maiores, falhando nas três tentativas em cada configuração. Trata-se de um único estudo de uma única configuração, e é o tipo de evidência que uma página de modelo nunca expõe. Para pipelines agênticos em que um orquestrador mais fraco precisa se recuperar da falha de um modelo mais forte, esse é o resultado mais relevante para a decisão neste texto, e vale a pena lê-lo antes de qualquer um dos benchmarks relatados pela Meta.

Esses benchmarks, para fins de completude, são da própria Meta e não reproduzidos: 76,0% no SWE-Bench Verified, 51,2% no SWE-Bench Pro, 51,7% no TerminalBench 2.1, 65,9% no OSWorld-Verified, 83,5% no GPQA Diamond, 22% no Humanity's Last Exam e 75,5 no MCP-Atlas. Eles são medidos em relação a modelos de sua própria classe de tamanho, e descrevem um agente local capaz, e não um raciocinador de fronteira.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Onde o limite de fato recai

A vantagem estrutural do Step 5 Preview é que ele faz o trabalho que você não consegue fazer localmente. Um contexto de 1M tokens, entrada de imagens, uma pontuação medida próxima à fronteira e 87 tokens de saída por segundo sem precisar comprar hardware: para elaborar rascunhos, planejar, revisar código em um grande repositório, ou em qualquer caso em que o teto do modelo seja o gargalo, a API vence — e os vinte e sete pontos são todo o argumento. O custo disso é o oposto do de Muse Glimmer: os prompts saem do seu perímetro, o preço é cobrado novamente a cada token, e a verbosidade do modelo torna cargas de trabalho com saídas longas mais caras do que a tarifa de US$ 2,70 sugere.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

A vantagem do Muse Glimmer é que ele faz o trabalho que não pode sair. Se os dados são regulamentados, se o orçamento de latência é de alguns milissegundos, se a máquina está offline ou se o custo marginal da milionésima requisição tem de ser zero, então nenhuma API é candidata — nem esta, nem nenhuma. O preço disso é a capacidade: você está escolhendo um 17 onde existe um 44 e, na orquestração agêntica, pode estar escolhendo um coordenador que não consegue se recuperar dos erros de um modelo mais forte.

Para a maioria das equipes, a resposta não é uma escolha, mas uma divisão — e a divisão precisa de um lugar onde residir. O OrcaRouter roteia mais de 200 modelos por trás de uma única chave de API e uma única fatura, com 0% de markup e o preço de tabela do provedor repassado, além de failover automático e uma DSL de roteamento para enviar tráfego por tarefa, custo ou. Nem o Step 5 Preview nem o Muse Glimmer estão nesse catálogo — o carro-chefe da StepFun não é roteado por nós e o Glimmer é um download local —, portanto o valor oferecido não é o acesso a nenhum dos dois modelos. É o conjunto pelo qual você pode compará-los, chamável com uma única chave hoje, para que a decisão entre local e remoto seja resolvida pela sua própria distribuição de tarefas, em vez de pela última página de fornecedor que você leu.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Como decidir

Escolha o Step 5 Preview quando o teto for a restrição. Se suas tarefas forem abertas, multimodais, de contexto longo ou agênticas no sentido de precisarem de um planejador capaz, o modelo de API é o único dos dois que consegue realizá-las, e seu preço é baixo o suficiente para sua classe, de modo que pilotá-lo é uma linha de orçamento e não um projeto. Orce para a verbosidade, planeje que a data de peso de 15 de outubro atrase e mantenha fora disso as cargas de trabalho que não devem sair do prédio.

Escolha o Muse Glimmer quando o perímetro for a restrição. Se os seus dados não puderem ser enviados, se precisar de executar num avião ou numa fábrica, ou se os seus volumes tornarem o preço por token absurdo, um modelo de 30B Apache-2.0 que cabe em 20 GB é a escolha prática, e o seu resultado de recuperação de contexto longo é suficientemente bom para que a lacuna de capacidade não apareça em todas as cargas de trabalho. Teste-o em orquestração antes de confiar nele para isso, porque é aí que a evidência independente é mais fraca.

Se ambas as restrições se aplicarem ao mesmo tempo, execute as duas: local para os dados que não podem sair, API para as tarefas que precisam de um modelo maior, e faça com que a decisão de encaminhamento seja uma alteração de configuração em vez de uma migração. A comparação que importa não é 44 contra 17. É quais dos seus pedidos podem dar-se ao luxo de sair da máquina, e essa é uma pergunta que só o seu próprio tráfego pode responder.