Muse Spark 1.2 vs Claude Haiku 4.5: Preço Combinado Idêntico, Ideias Opostas Sobre o Pensamento
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Preço Combinado Idêntico, Ideias Opostas Sobre o Pensamento

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Artificial Analysis define o preço do Muse Spark 1.2 em US$ 0,78 por milhão de tokens combinados e do Claude Haiku 4.5 em US$ 0,77. Um centavo de diferença, de dois laboratórios que não concordaram em mais nada. O modelo da Meta não consegue parar de raciocinar; o Claude Haiku 4.5 só raciocina quando você pede. A Meta oferece 1.048.576 tokens de contexto; o Claude Haiku 4.5 oferece 200.000. A Meta lançou este modelo em 5 de agosto de 2026 como um modelo de codificação com um agente de terminal integrado; o Claude Haiku 4.5 foi lançado em outubro de 2025 como o trabalhador rápido e barato que recebe ordens de um modelo maior. Mesmo preço por token, máquinas completamente diferentes.

Essa coincidência é o ponto útil para iniciar uma comparação, porque elimina a variável pela qual as pessoas normalmente decidem e força a questão a ser sobre a forma em vez disso. O que segue usa números independentes onde eles existem — Artificial Analysis para pontuações de índice e latência de laboratório, a telemetria de produção de sete dias da própria OrcaRouter para latência de tráfego real — e sinaliza números relatados pelo fornecedor como tais, incluindo um destaque de benchmark do fornecedor que não tem contrapartida de terceiros.

O contraste especular, uma dimensão de cada vez.

• Preço — Muse Spark 1.2 a $1.25 de entrada / $4.25 de saída por milhão; Claude Haiku 4.5 a $1.00 de entrada / $5.00 de saída. A Meta é mais barata na entrada, e a Claude Haiku 4.5 na saída.

• Cache — $0,15 por milhão em um acerto de cache do Muse Spark 1.2, um desconto de 88%; $0,10 por milhão em uma leitura de cache do Claude Haiku 4.5, um desconto de 90%, com as gravações de cache cobradas a $1,25.

• Contexto — 1.048.576 tokens vs 200.000. Uma diferença de 5,2×, e a maior lacuna entre eles.

• Saída máxima — o Claude Haiku 4.5 declara um teto de 64.000 tokens; o endpoint Muse Spark 1.2 não declara nenhum comprimento máximo de conclusão, o que é incomum o suficiente para testar em vez de presumir.

• Raciocínio — obrigatório no Muse Spark 1.2, com cinco níveis de esforço, de mínimo a xhigh, e um padrão médio; opcional no Claude Haiku 4.5, que é um modelo sem raciocínio até que você ative o pensamento estendido e forneça a ele um orçamento de pensamento.

• Entradas — A Meta anuncia texto, imagens, vídeo, áudio e PDF; Claude Haiku 4.5 aceita texto e imagens. Ambos retornam texto.

• Pesos e provedores — ambos fechados. Muse Spark 1.2 é servido apenas pela Model API da própria Meta; Claude Haiku 4.5 está disponível pelo fornecedor e por meio dos revendedores e agregadores de nuvem usuais.

• Idade — Muse Spark 1.2 tem apenas alguns dias. Claude Haiku 4.5 está em produção desde 15 de outubro de 2025, com corte de conhecimento em julho de 2025 e nove meses de experiência de campo acumulada.

A lacuna do índice é real. O número que todos citarão não é.

A Artificial Analysis pontua o Muse Spark 1.2 em 54 no seu Índice de Inteligência, posição #13 de 185. Sua entrada atual para o Claude Haiku 4.5 é 24. Coloque-os lado a lado e você tem uma manchete; veja o que as entradas realmente são e a manchete cai por terra.

O 54 é o Muse Spark 1.2 avaliado em xhigh, sua configuração de raciocínio mais cara. O 24 é o Claude Haiku 4.5 avaliado como um modelo sem raciocínio — com o pensamento desligado — e a Artificial Analysis o sinaliza como uma estimativa, em vez de uma execução concluída. Numa versão anterior do mesmo índice, antes da reponderação v4.1, a Artificial Analysis posicionou o Claude Haiku 4.5 em 55 com raciocínio ativado e 42 sem ele. Esses números mais antigos também não podem ser comparados a 54, porque as versões do índice reescalam e uma pontuação da era v3 não é uma pontuação v4.1.

Portanto, a declaração honesta é mais restrita do que o leaderboard faz parecer: Muse Spark 1.2 com esforço máximo obtém 54 no índice atual; não há pontuação v4.1 publicada para o Claude Haiku 4.5 com pensamento estendido ativado, portanto ainda não existe uma comparação equivalente desses dois com esforço total. Qualquer pessoa que mostre 54 contra 24 está comparando um modelo com deliberação total contra um modelo instruído a não deliberar.

Quando o fornecedor publica um número, ele é específico: Claude Haiku 4.5 obtém 73,3% no SWE-bench Verified, com média de 50 execuções e um orçamento de raciocínio de 128K. Esse é um número do fornecedor, e o orçamento de raciocínio nele é enorme para um modelo comercializado pela velocidade — mas é a mesma avaliação que a indústria cita para modelos de fronteira, e coloca o Haiku em uma faixa que seu preço não sugere. As alegações correspondentes da Meta para o Muse Spark 1.2 são Terminal-Bench 2.1 com 82,9% e DeepSWE v1.1 com 59,3%, também executadas pelo fornecedor, no próprio harness da Meta, com cada concorrente pareado ao seu próprio produto de agente. Dois fornecedores, dois benchmarks, sem sobreposição. Atualmente, não há uma única avaliação na qual ambos os modelos tenham uma pontuação publicada pelo mesmo avaliador.

Quatro números de latência, duas histórias diferentes

A latência é onde o enquadramento de "mesmo preço" deixa de ser uma curiosidade e passa a ser uma decisão, e é também onde a fonte de medição mais importa.

No harness de benchmark, a Artificial Analysis registra tempo até o primeiro token de 26,12 segundos para Muse Spark 1.2 em xhigh, e 1,00 segundo para Claude Haiku 4.5. Uma diferença de 26×, e se esse fosse o quadro completo, a comparação terminaria.

Em produção, isso se inverte. Ao longo de sete dias de tráfego real no OrcaRouter — com chamadas usando o esforço que realmente desejam — Claude Haiku 4.5 mostra um tempo p50 até o primeiro token de 3.84 segundos e um p95 de 10.00 segundos, a 214 tokens por segundo e uma taxa de erro de 1.0%. Muse Spark 1.1, a versão do modelo da Meta que está no catálogo, mostra um p50 de 1.84 segundos e um p95 de 6.00 segundos, a 519 tokens por segundo, sem erros registrados. No tráfego real, o modelo da Meta é o mais rápido.

Ambos os conjuntos de números são verdadeiros e medem coisas diferentes. O número de laboratório é cada modelo com deliberação máxima e cache frio, o que é um teste justo do teto e um teste ruim para uma caixa de chat. O número de produção inclui cache hits, prompts curtos, níveis baixos de esforço e tudo o mais que aplicações reais fazem, o que é um teste justo da mediana e nenhum teste do pior caso. A armadilha é citar um e raciocinar sobre o outro. Se você está dimensionando um timeout voltado ao usuário, o p95 é o seu número. Se você está perguntando quanto custa uma etapa agentiva profunda em tempo de relógio, o número de benchmark está mais próximo da verdade — e a ressalva honesta é que ainda não existe tal número de produção para o Muse Spark 1.2 em si, porque ele é novo demais e não é amplamente roteado.

Ambos os laboratórios venderam a você um subagente. Mas queriam dizer coisas diferentes.

O argumento de venda do fornecedor para o Claude Haiku 4.5 foi explícito sobre a hierarquia: modelos da classe Sonnet planejam e orquestram, instâncias Haiku executam em paralelo na camada inferior. Baratos, rápidos, descartáveis, muitos de uma vez. O design do produto segue essa lógica — uma janela de 200K é suficiente para uma subtarefa delimitada e deliberadamente insuficiente para um repositório inteiro, o modo de raciocínio fica desativado por padrão porque um trabalhador que delibera é um trabalhador que custa dinheiro ao orquestrador, e o próprio marketing do fornecedor nomeia chat em tempo real, atendimento ao cliente e programação em par como alvo.

A proposta da Meta para o Muse Spark 1.2 afirma ambas as extremidades da mesma hierarquia. O texto da Meta diz que o modelo pode ser o agente principal que reúne contexto, planeja e delega, ou um subagente executando em paralelo sob um deles. O Muse Code, o agente terminal lançado junto com ele, coordena múltiplos subagentes persistentes por tarefa em worktrees isolados, em um runtime de log de eventos com reprodução exata. A janela de um milhão de tokens e o raciocínio sempre ativo são o que um planejador precisa; são exatamente o que você não escolheria para um worker de fan-out, porque cada instância paralela está pagando por uma deliberação que você não pediu.

Lido como arquitetura em vez de marketing, essa é a diferença real: o fornecedor construiu um worker e espera que você traga um orquestrador; a Meta construiu um orquestrador e afirma que ele também pode funcionar. Se você já opera uma hierarquia, o experimento interessante não é escolher entre eles — é o Muse Spark 1.2 planejando e o Claude Haiku 4.5 executando, um formato que nenhum fornecedor vai te vender como pacote.

O que um passo real custa em cada um

Taxas por milhão não determinam nada em modelos de raciocínio, porque o modelo escolhe quantos tokens gastar. Precifique a etapa em vez disso.

Considere uma tarefa de código escopada: 60.000 tokens de contexto de repositório na entrada, 3.000 tokens de patch na saída. A frio, Claude Haiku 4.5 custa $0,060 de entrada mais $0,015 de saída — 7,5 centavos. O Muse Spark 1.2 custa $0,075 mais $0,013 — 8,8 centavos. Próximos o suficiente para serem ruído, exatamente como a taxa combinada prometia.

Agora adicione o que a taxa combinada esconde. O Muse Spark 1.2 não consegue desativar o raciocínio e, na sua configuração média padrão, uma etapa como esta provavelmente emite alguns milhares de tokens de raciocínio antes do patch — eles são cobrados como saída. Adicione 3.000 e a mesma etapa custa $0,075 + $0,026 = 10,1 centavos, cerca de 35% acima do Haiku em entradas idênticas. O Claude Haiku 4.5 com raciocínio desativado não paga nada pela deliberação e permanece em 7,5 centavos; com um grande orçamento de raciocínio, ele superará o Muse Spark 1.2, porque o Claude Haiku 4.5 cobra $5,00 por milhão de saída contra os $4,25 da Meta.

O cache inverte a ênfase novamente. Mantenha o contexto do repositório estável para que ele seja cacheado, e o custo de entrada do Haiku cai para $0.006 e o do Muse Spark 1.2 para $0.009 — o lado da entrada deixa de importar totalmente e toda a comparação passa a ser uma disputa por tokens de saída, que é uma disputa sobre o quanto cada modelo pensa. Em uma carga de trabalho que repete contexto, a estabilidade da chave de cache vale mais do que a escolha do modelo, e isso é verdade para ambos os modelos.

A janela de 1M é o único lugar onde as contas não fecham. Qualquer coisa que genuinamente precise de mais de 200.000 tokens em uma única chamada não pode ser executada no Claude Haiku 4.5 por nenhum preço. Ou você divide em blocos e orquestra — que é o que o fornecedor pretende — ou usa um modelo que tenha espaço.

Experimentar ambos sem um segundo contrato.

Claude Haiku 4.5 está no catálogo da OrcaRouter por US$ 1,00 e US$ 5,00 — o preço de tabela do fornecedor, porque a OrcaRouter opera com margem de 0% e repassa o preço do provedor sem alterações, o que também significa que uma alteração de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de no próximo ciclo contratual. Os números de latência de produção acima vêm dessa mesma camada de roteamento.

Muse Spark 1.2 não está no catálogo. A Model API da Meta é atualmente o único lugar para chamá-lo, então um verdadeiro confronto direto hoje significa uma integração por meio de nós e uma direta com a Meta. O Muse Spark 1.1 está hospedado, com os mesmos US$ 1,25 e US$ 4,25 que a Meta cobra pelo 1.2, o que o torna um substituto razoável para o perfil de custo e latência da família, mas não para os ganhos de codificação pelos quais o 1.2 está sendo vendido. Quando o 1.2 se tornar roteável, a comparação torna-se uma mudança de uma linha na string do modelo com a mesma chave — e, para o experimento de orquestrador mais worker descrito acima, o DSL de roteamento é como você conecta um planejador e um worker fan-out em uma única chamada, em vez de construir a transferência manualmente.

Escolha pela forma do trabalho, não pela pontuação.

Escolha Claude Haiku 4.5 quando o trabalho é delimitado e o usuário está esperando. Agentes de suporte, classificação, extração, chat, completions de programação em par e o nível de trabalhadores paralelos de uma hierarquia de agentes. É uma quantidade conhecida com nove meses de histórico em campo; o raciocínio é opcional, então você só paga pela deliberação quando quiser, e 200K é suficiente para quase qualquer subtarefa com escopo definido. Seu resultado publicado no SWE-bench Verified diz que é muito mais capaz do que o preço sugere, desde que você esteja disposto a gastar o orçamento de raciocínio que esse resultado usou.

Escolha Muse Spark 1.2 quando a unidade de trabalho for um repositório em vez de uma solicitação. Refatorações de múltiplos arquivos, depuração estendida, geração de projeto inteiro, loops de agente de longo horizonte onde ninguém está observando um spinner. A janela de um milhão de tokens elimina um problema de divisão em blocos que o Haiku não consegue resolver a nenhum preço, e o raciocínio obrigatório que o arruína para chat é o padrão correto quando um plano errado custa mais do que um lento.

O que deve decidir isso não é o número do índice. Em vez disso, faça duas perguntas: uma única chamada chega a precisar ver mais de 200.000 tokens, e há um humano esperando pelo primeiro token? O sim para a primeira aponta para a Meta. O sim para a segunda aponta para o fornecedor. Sim para ambas significa que você quer dois modelos, o que é a resposta honesta com mais frequência do que o marketing de qualquer um dos fornecedores admite.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente