Cartão de destaque gerado intitulado Claude Sonnet 5.5 vs Muse Glimmer, com o subtítulo um modelo de laptop de 30B contra o novo Sonnet, com três cartões de estatísticas: Índice de Inteligência 56 vs 17, janela de contexto 1M vs 131K tokens, e pesos fechados vs Apache 2.0, com um rodapé informando Índice conforme Artificial Analysis v4.3.2; especificações do Muse Glimmer conforme a Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: Um modelo de laptop de 30B contra o novo Sonnet

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A pergunta que enquadra esta página é se a comparação é legítima, e a resposta honesta é que Claude Sonnet 5.5 e Muse Glimmer não são concorrentes no sentido comum. No Intelligence Index da Artificial Analysis, revisão v4.3.2, Claude Sonnet 5.5 pontua 56 e Muse Glimmer pontua 17, e essa diferença não é ruído — é aproximadamente a distância entre um modelo de fronteira de propósito geral e um modelo pequeno muito bom. O que torna o par digno de leitura mesmo assim é que Muse Glimmer tem uma propriedade que o outro não pode comprar a nenhum preço: é um modelo de pesos abertos de 30 bilhões de parâmetros, publicado pela Meta em 10 de agosto de 2026 sob Apache 2.0, quantizado para 4 bits de modo que cabe em menos de 20 GB de VRAM, e projetado para rodar com a rede desconectada. Claude Sonnet 5.5 chegou em 28 de setembro de 2026 como o Sonnet mais rápido e mais inteligente do fornecedor, com preço de US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, e acessível apenas pela rede. A decisão real não é qual modelo é melhor. É onde você quer que os tokens rodem.

Dois modelos, duas definições do trabalho

O Muse Glimmer surge dos M​eta Superintelligence Labs como um modelo de 30 bilhões de parâmetros treinado por destilação de logits a partir do Muse Spark, o professor maior da M​eta, e depois ajustado com dados agênticos de contexto longo e reforçado para o uso de ferramentas. A M​eta já o lançou quantizado: o modo de 4 bits reduz a pegada de memória de mais de 55 GB em precisão total para menos de 20 GB, o que o coloca dentro do limite de uma GPU de consumidor de 24 GB ou 32 GB. A M​eta o testou em uma Nvidia RTX 5090 e nos chips Apple M4 Max e M5 Max. Ele aceita entrada de texto e imagem, retorna texto, opera com uma janela de contexto de 131.072 tokens que a M​eta diz poder ser estendida para 262.144, e tem um corte de conhecimento de janeiro de 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

O Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic e o que a empresa posiciona como a melhor combinação de velocidade e inteligência de seu portfólio. Ele opera com uma janela de 1.000.000 de tokens, até 128.000 tokens de saída de forma síncrona e 300.000 na API Message Batches por trás do cabeçalhooutput-300k-2026-03-24, aceita texto, imagens e arquivos, oferece raciocínio adaptativo com esforço selecionável e corte de junho de 2026, e está disponível com retenção zero de dados desde o lançamento. O armazenamento custa US$ 0,20 por milhão de tokens em leituras de cache e US$ 2,50 por milhão em gravações de cache. A Anthropic afirma que ele é 30% mais rápido que o Claude Sonnet 5 e custa até 30% menos por tarefa com tarifas inalteradas — alegações do fornecedor, não reproduzidas de forma independente.

O contraste das especificações vale a pena ser visto de uma só vez, porque quase cada linha é um tipo diferente de coisa, e não algo melhor ou pior:

• Pesos — Muse Glimmer Apache 2.0, disponível para download, quantizado para 4 bits vs Claude Sonnet 5.5 fechado

• Onde roda — Muse Glimmer na sua própria GPU, offline vs. Claude Sonnet 5.5 na infraestrutura da A​nthropic

• Parâmetros — Muse Glimmer 30B no total, menos de 20 GB em 4 bits vs. Claude Sonnet 5.5 não divulgado

• Contexto — Muse Glimmer 131.072 tokens, extensível até 262.144 vs Claude Sonnet 5.5 1.000.000 tokens

• Preço por milhão — Muse Glimmer sem cobrança por token, seu hardware vs Claude Sonnet 5.5 $2,00 entrada / $10,00 saída

• Índice de Inteligência v4.3.2 — Muse Glimmer 17 vs Claude Sonnet 5.5 56

• Custo por tarefa do Index conforme medido — Muse Glimmer US$ 0,06 vs. Claude Sonnet 5.5 US$ 7,60

Dois números dessa lista merecem ser analisados em detalhe, porque ambos são armadilhas. O primeiro é o número de US$ 0,06 por tarefa: é o que a Artificial Analysis gastou ao chamar Muse Glimmer (high) por meio de um endpoint hospedado, a US$ 0,325 por milhão de tokens de entrada e US$ 1,35 por milhão de tokens de saída, então ele mede a economia de alugar esse modelo, não de executá-lo. Em auto-hospedagem, o custo marginal por token desaparece e é substituído por uma GPU que você já possui ou precisa comprar. O segundo é a própria lacuna do Index — um modelo 30B quantizado em 20 GB está sendo pontuado na mesma régua que modelos de fronteira, e o ranking deixa isso claro quando coloca Muse Glimmer entre os poucos modelos de pesos abertos mais bem colocados, ao mesmo tempo que observa que ele é caro para o seu tamanho.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Onde o Muse Glimmer é genuinamente bom, e onde as coisas desandam

A pontuação composta é muito grosseira para ser a resposta completa, porque o Muse Glimmer não é uniformemente dezessete. É rápido — a Artificial Analysis mede 143,8 tokens de saída por segundo, à frente dos 138,7 do Claude Sonnet 5.5 — e é conciso, gerando 59M tokens na avaliação do Index, contra os 410M do Claude Sonnet 5.5. E em uma avaliação, ele chega perto da fronteira: recall de contexto longo, em que pontua 83,3% contra os 82,7% do Claude Sonnet 5.5. Um modelo de 30B que iguala um Sonnet de fronteira novíssimo em recuperação de contexto longo é a linha mais surpreendente desta página, e é consistente com a forma como a Meta o treinou — dados agênticos de contexto longo, destilação de um professor muito maior.

Os resultados agênticos são onde o teto do modelo aparece e o ranking deixa de ser lisonjeiro. No Terminal-Bench 4.0, o Muse Glimmer pontua 0,5% contra 63,6% do Claude Sonnet 5.5. Sua pontuação no benchmark de automação é 0,068 contra 0,713. Humanity's Last Exam: 22,0% contra 55,0%. Uma pontuação tão baixa em um benchmark de execução significa que o modelo não está concluindo tarefas, e nenhuma economia de hospedagem local torna mais barata uma tarefa que nunca termina.

A literatura científica também é direta sobre isso, e vale a pena afirmar em vez de esconder: um estudo revisado por pares sobre orquestração multiagente, no qual o Muse-Glimmer-30B foi um dos modelos testados, descobriu que ele não recuperou nenhum de seus candidatos. A própria tabela de benchmarks da M​eta para o modelo é um documento de fornecedor e é rotulada como tal aqui; os números da Artificial Analysis acima são medições independentes, e são neles que este texto se apoia.

Então, a divisão é legível. O Muse Glimmer é forte para o seu tamanho ao ler uma entrada longa e responder sobre ela, rápido, barato de rodar e cabe em uma GPU de classe de laptop. Não é um modelo ao qual você entrega uma tarefa de software com várias etapas e depois vai embora. Essa é a fronteira honesta, e uma comparação escrita apenas com base em pontuações compostas a esconderia.

O que você está realmente comprando à taxa de fronteira

O premium do Claude Sonnet 5.5 compra capacidade antes de tudo, e a diferença de dezessete pontos no Index é a forma mais evidente disso. Mas três outras coisas vêm com o preço de saída de $10.00 que não aparecem em nenhum ranking.

A primeira é a janela. Um milhão de tokens é aproximadamente sete vezes e meia os 131.072 do Muse Glimmer, e a Anthropic cobra a tarifa padrão sobre tudo isso, com leituras de cache a um décimo do preço de entrada, de modo que carregar um contexto grande ao longo de muitas chamadas seja acessível em vez de teórico. Um prompt em escala de repositório não cabe de forma alguma na janela menor, portanto isso é uma diferença de capacidade, e não uma preferência.

A segunda é a fidelidade das ferramentas. Cinco comportamentos mudaram entre Claude Sonnet 5 e Claude Sonnet 5.5, e todos os cinco são sobre uso de ferramentas e raciocínio: parâmetros de amostragem não padrão agora retornam um 400, thinking: {"type": "disabled"} agora retorna um 400 e se torna between_tools, a escolha forçada de ferramenta de "any" ou de uma ferramenta nomeada é rejeitada, então os loops precisam passar para auto com uso estrito de ferramentas, a ferramenta mais antiga computer_20251124 é recusada na API Claude e no Google Cloud, e os blocos de pensamento agora estão vinculados ao modelo e à conta que os produzem. Uma sexta mudança não quebra nada, mas fica silenciosa: texto entre chamadas de ferramentas retorna dentro de blocos de pensamento, então um aplicativo de streaming para de mostrar saída até definir um valor de exibição ou desativar o pensamento antecipado. Isso é um dia de trabalho de migração para qualquer pessoa no Sonnet 5, e é o preço de entrada para a confiabilidade agêntica que as linhas de benchmark acima estão medindo.

O terceiro é a proveniência e o tratamento de dados. A retenção zero de dados está disponível desde o lançamento, a Anthropic publica uma data mínima de descontinuação de 28 de setembro de 2027, e o modelo está disponível na API Claude, no Bedrock, no Google Cloud e no Microsoft Foundry. Para um comprador regulado, esses são fatos de aquisição que decidem a compra antes que o benchmark decida.

Offline é um requisito, não uma economia de custos.

A razão pela qual este emparelhamento pertence a uma só página é que, para uma classe específica de implementação, o Muse Glimmer não é uma opção mais barata — é a única opção. Uma requisição que não pode sair do dispositivo, um chão de fábrica ou um local de campo sem conectividade, um ambiente isolado da rede (air-gapped) onde uma chamada de API é uma violação de conformidade, ou um orçamento de latência em que uma ida e volta já é demais: nenhum desses casos é resolvido por um modelo melhor atrás de uma rede. Pesos do Apache 2.0 que cabem em menos de 20 GB e funcionam offline são a resposta inteira, e o Claude Sonnet 5.5, a qualquer preço, não participa da questão.

Os testes publicados pela M​eta nos chips RTX 5090 e Apple M4 Max e M5 Max são a referência prática para o que "rodar localmente" significa aqui, e a quantização de 4 bits é o que faz com que esses alvos sejam alcançáveis, em primeiro lugar — a pegada em precisão total é superior a 55 GB. Quem planeja uma implantação deve tratar os números de hardware como sendo da M​eta, e não como medidos aqui.

Para todos os demais, os dois modelos são complementares, e não substitutos, e a parte operacionalmente incômoda é que manter um modelo da API da Anthro​pic e um modelo M​eta auto-hospedado normalmente significa duas pilhas totalmente separadas. O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com Open​AI, com o preço de lista do provedor repassado e sem markup adicionado, failover automático entre provedores upstream e uma DSL de roteamento para compor chamadas — o que cobre a metade hospedada dessa configuração, e o modelo professor maior da M​eta, o Muse Spark 1.2, é roteável aqui como meta/muse-spark-1.2 a $1,25 de entrada e $4,25 de saída por milhão de tokens em uma janela de 1.048.576 tokens, com leituras de cache a $0,15. Ele está transportando 42,8 milhões de tokens de tráfego por semana por meio deste catálogo, que é a parte útil dessa configuração: o modelo professor hospedado está na mesma chave que todo o resto, e o modelo que você executa localmente nunca precisa tocar em rede alguma.

Três notas de honestidade, porque é fácil errar sobre elas. O próprio Muse Glimmer não é uma das nossas rotas — o card do modelo não existe no nosso catálogo, e esta página diz isso em vez de dar a entender o contrário. A captura abaixo é a página do modelo que existe, Muse Spark 1.2, que é o checkpoint do qual Muse Glimmer foi destilado, e não o próprio Muse Glimmer. Claude Sonnet 5.5 também não está no nosso catálogo, um dia após o lançamento; a rota até ele é a própria API da Anthropic, e o Claude Sonnet 5 tem uma rota disponível aqui desde 30 de junho por $2.00 e $10.00 para quem quiser o alvo de staging.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Como decidir

Comece pela restrição, não pela pontuação. Se a solicitação não pode sair de uma máquina ou de uma rede, Muse Glimmer é a resposta e a lacuna do Index é irrelevante — um modelo 30B Apache 2.0 que roda offline e iguala um modelo de fronteira em recall de contexto longo é, para essa tarefa, a melhor opção disponível. Se a solicitação tiver de concluir uma tarefa de software de várias etapas, um modelo 30B que pontua meio por cento no Terminal-Bench não entra na disputa, independentemente do hardware que você já possui.

Entre esses dois polos, o critério de desempate é a medição, não a opinião: tokens por tarefa concluída na sua própria carga de trabalho, com preços calculados duas vezes — uma a US$ 2,00 e US$ 10,00 do Claude Sonnet 5.5, e outra pelo custo amortizado da GPU. O único número que reformula toda a comparação, US$ 0,06 por tarefa Index contra US$ 7,60, é um valor de aluguel hospedado para um modelo que a maioria das pessoas executará por conta própria, e citá-lo como se fosse uma economia comparável em bases equivalentes seria o erro fácil que esta página existe para evitar.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente