Muse Spark 1.2 vs Claude Haiku 4.5: Preço Combinado Idêntico, Ideias Opostas Sobre o Pensamento
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Preço Combinado Idêntico, Ideias Opostas Sobre o Pensamento

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.

That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.

O contraste especular, uma dimensão de cada vez.

Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.

Cache — $0,15 por milhão em um acerto de cache do Muse Spark 1.2, um desconto de 88%; $0,10 por milhão em uma leitura de cache do Claude Haiku 4.5, um desconto de 90%, com as gravações de cache cobradas a $1,25.

Contexto — 1.048.576 tokens vs 200.000. Uma diferença de 5,2×, e a maior lacuna entre eles.

Saída máxima — o Claude Haiku 4.5 declara um teto de 64.000 tokens; o endpoint Muse Spark 1.2 não declara nenhum comprimento máximo de conclusão, o que é incomum o suficiente para testar em vez de presumir.

Raciocínio — obrigatório no Muse Spark 1.2, com cinco níveis de esforço, de mínimo a xhigh, e um padrão médio; opcional no Claude Haiku 4.5, que é um modelo sem raciocínio até que você ative o pensamento estendido e forneça a ele um orçamento de pensamento.

Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.

Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.

Idade — Muse Spark 1.2 tem apenas alguns dias. Claude Haiku 4.5 está em produção desde 15 de outubro de 2025, com corte de conhecimento em julho de 2025 e nove meses de experiência de campo acumulada.

A lacuna do índice é real. O número que todos citarão não é.

A Artificial Analysis pontua o Muse Spark 1.2 em 54 no seu Índice de Inteligência, posição #13 de 185. Sua entrada atual para o Claude Haiku 4.5 é 24. Coloque-os lado a lado e você tem uma manchete; veja o que as entradas realmente são e a manchete cai por terra.

O 54 é o Muse Spark 1.2 avaliado em xhigh, sua configuração de raciocínio mais cara. O 24 é o Claude Haiku 4.5 avaliado como um modelo sem raciocínio — com o pensamento desligado — e a Artificial Analysis o sinaliza como uma estimativa, em vez de uma execução concluída. Numa versão anterior do mesmo índice, antes da reponderação v4.1, a Artificial Analysis posicionou o Claude Haiku 4.5 em 55 com raciocínio ativado e 42 sem ele. Esses números mais antigos também não podem ser comparados a 54, porque as versões do índice reescalam e uma pontuação da era v3 não é uma pontuação v4.1.

Portanto, a declaração honesta é mais restrita do que o leaderboard faz parecer: Muse Spark 1.2 com esforço máximo obtém 54 no índice atual; não há pontuação v4.1 publicada para o Claude Haiku 4.5 com pensamento estendido ativado, portanto ainda não existe uma comparação equivalente desses dois com esforço total. Qualquer pessoa que mostre 54 contra 24 está comparando um modelo com deliberação total contra um modelo instruído a não deliberar.

Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.

Quatro números de latência, duas histórias diferentes

A latência é onde o enquadramento de "mesmo preço" deixa de ser uma curiosidade e passa a ser uma decisão, e é também onde a fonte de medição mais importa.

No harness de benchmark, a Artificial Analysis registra tempo até o primeiro token de 26,12 segundos para Muse Spark 1.2 em xhigh, e 1,00 segundo para Claude Haiku 4.5. Uma diferença de 26×, e se esse fosse o quadro completo, a comparação terminaria.

Em produção, isso se inverte. Ao longo de sete dias de tráfego real no OrcaRouter — com chamadas usando o esforço que realmente desejam — Claude Haiku 4.5 mostra um tempo p50 até o primeiro token de 3.84 segundos e um p95 de 10.00 segundos, a 214 tokens por segundo e uma taxa de erro de 1.0%. Muse Spark 1.1, a versão do modelo da Meta que está no catálogo, mostra um p50 de 1.84 segundos e um p95 de 6.00 segundos, a 519 tokens por segundo, sem erros registrados. No tráfego real, o modelo da Meta é o mais rápido.

Ambos os conjuntos de números são verdadeiros e medem coisas diferentes. O número de laboratório é cada modelo com deliberação máxima e cache frio, o que é um teste justo do teto e um teste ruim para uma caixa de chat. O número de produção inclui cache hits, prompts curtos, níveis baixos de esforço e tudo o mais que aplicações reais fazem, o que é um teste justo da mediana e nenhum teste do pior caso. A armadilha é citar um e raciocinar sobre o outro. Se você está dimensionando um timeout voltado ao usuário, o p95 é o seu número. Se você está perguntando quanto custa uma etapa agentiva profunda em tempo de relógio, o número de benchmark está mais próximo da verdade — e a ressalva honesta é que ainda não existe tal número de produção para o Muse Spark 1.2 em si, porque ele é novo demais e não é amplamente roteado.

Ambos os laboratórios venderam a você um subagente. Mas queriam dizer coisas diferentes.

The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.

A proposta da Meta para o Muse Spark 1.2 afirma ambas as extremidades da mesma hierarquia. O texto da Meta diz que o modelo pode ser o agente principal que reúne contexto, planeja e delega, ou um subagente executando em paralelo sob um deles. O Muse Code, o agente terminal lançado junto com ele, coordena múltiplos subagentes persistentes por tarefa em worktrees isolados, em um runtime de log de eventos com reprodução exata. A janela de um milhão de tokens e o raciocínio sempre ativo são o que um planejador precisa; são exatamente o que você não escolheria para um worker de fan-out, porque cada instância paralela está pagando por uma deliberação que você não pediu.

Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.

O que um passo real custa em cada um

Taxas por milhão não determinam nada em modelos de raciocínio, porque o modelo escolhe quantos tokens gastar. Precifique a etapa em vez disso.

Considere uma tarefa de código escopada: 60.000 tokens de contexto de repositório na entrada, 3.000 tokens de patch na saída. A frio, Claude Haiku 4.5 custa $0,060 de entrada mais $0,015 de saída — 7,5 centavos. O Muse Spark 1.2 custa $0,075 mais $0,013 — 8,8 centavos. Próximos o suficiente para serem ruído, exatamente como a taxa combinada prometia.

Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.

O cache inverte a ênfase novamente. Mantenha o contexto do repositório estável para que ele seja cacheado, e o custo de entrada do Haiku cai para $0.006 e o do Muse Spark 1.2 para $0.009 — o lado da entrada deixa de importar totalmente e toda a comparação passa a ser uma disputa por tokens de saída, que é uma disputa sobre o quanto cada modelo pensa. Em uma carga de trabalho que repete contexto, a estabilidade da chave de cache vale mais do que a escolha do modelo, e isso é verdade para ambos os modelos.

The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.

Experimentar ambos sem um segundo contrato.

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.

Muse Spark 1.2 não está no catálogo. A Model API da Meta é atualmente o único lugar para chamá-lo, então um verdadeiro confronto direto hoje significa uma integração por meio de nós e uma direta com a Meta. O Muse Spark 1.1 está hospedado, com os mesmos US$ 1,25 e US$ 4,25 que a Meta cobra pelo 1.2, o que o torna um substituto razoável para o perfil de custo e latência da família, mas não para os ganhos de codificação pelos quais o 1.2 está sendo vendido. Quando o 1.2 se tornar roteável, a comparação torna-se uma mudança de uma linha na string do modelo com a mesma chave — e, para o experimento de orquestrador mais worker descrito acima, o DSL de roteamento é como você conecta um planejador e um worker fan-out em uma única chamada, em vez de construir a transferência manualmente.

Escolha pela forma do trabalho, não pela pontuação.

Escolha Claude Haiku 4.5 quando o trabalho é delimitado e o usuário está esperando. Agentes de suporte, classificação, extração, chat, completions de programação em par e o nível de trabalhadores paralelos de uma hierarquia de agentes. É uma quantidade conhecida com nove meses de histórico em campo; o raciocínio é opcional, então você só paga pela deliberação quando quiser, e 200K é suficiente para quase qualquer subtarefa com escopo definido. Seu resultado publicado no SWE-bench Verified diz que é muito mais capaz do que o preço sugere, desde que você esteja disposto a gastar o orçamento de raciocínio que esse resultado usou.

Escolha Muse Spark 1.2 quando a unidade de trabalho for um repositório em vez de uma solicitação. Refatorações de múltiplos arquivos, depuração estendida, geração de projeto inteiro, loops de agente de longo horizonte onde ninguém está observando um spinner. A janela de um milhão de tokens elimina um problema de divisão em blocos que o Haiku não consegue resolver a nenhum preço, e o raciocínio obrigatório que o arruína para chat é o padrão correto quando um plano errado custa mais do que um lento.

What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube