
Muse Spark 1.2 vs DeepSeek V4 Flash: Quatro Pontos de Índice para Nove Vezes a Conta
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxNOVOMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2278 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
$72,02 e $637,85. Esses são os valores que a Artificial Analysis gastou para executar DeepSeek V4 Flash e Muse Spark 1.2 nos mesmos nove benchmarks, e os modelos terminaram com quatro pontos de diferença — 50 contra 54 no Intelligence Index. O modelo da Meta é melhor. Também é 8,9 vezes mais caro para realizar o mesmo trabalho, tem pesos fechados, é oferecido por exatamente um provedor e é cinco dias mais novo que o DeepSeek V4 Flash. Se essa diferença de quatro pontos vale isso depende inteiramente do que você está construindo, e esta comparação serve principalmente para tornar essa pergunta respondível.
Ambos os modelos chegaram com menos de uma semana de diferença — DeepSeek V4 Flash (build 0731) em 31 de julho de 2026, Muse Spark 1.2 em 5 de agosto — e ambos são comercializados para trabalho de agente de longo horizonte. Cada pontuação de índice, valor de latência e custo de avaliação abaixo é da Artificial Analysis, que executa os benchmarks por conta própria e publica a conta. Quando um número vem da Meta ou da documentação do próprio fornecedor, em vez de uma execução independente, a frase diz isso.
Os quatro números que decidem isto
• Índice de Inteligência — Muse Spark 1.2 54 (#13 de 185), DeepSeek V4 Flash 50 (#3 de 101 em sua classe, contra uma mediana de classe de 25).
• Preço combinado por milhão de tokens — $0,78 vs $0,06. Treze vezes.
• Custo da mesma suíte de nove benchmarks — $637.85 vs $72.02.
• Onde você pode executá-lo — um provedor, pesos fechados vs. seis provedores de API além de pesos com licença MIT que você mesmo pode hospedar.
Mesma suíte, duas faturas muito diferentes

A coluna de custo de avaliação é a comparação de custos mais honesta disponível para dois modelos, porque é o mesmo trabalho, precificado pelas tarifas de cada modelo, com cada modelo gastando quantos tokens decidir gastar. O Muse Spark 1.2 precisou de $637,85 para concluir o Intelligence Index. O DeepSeek V4 Flash precisou de $72,02 — mais barato do que todos os outros modelos conhecidos que a Artificial Analysis já mediu, uma descoberta que ganhou seu próprio ciclo de imprensa no início de agosto.
O que torna essa diferença interessante é que ela acontece apesar de o modelo DeepSeek V4 Flash ser o mais verboso, não por causa disso. Ao executar a suíte, o DeepSeek V4 Flash emitiu 210 milhões de tokens de saída contra os 95 milhões do Muse Spark 1.2 — mais que o dobro. O modelo da Meta é significativamente mais eficiente em tokens na mesma tarefa, e isso não importa em nada, porque o DeepSeek V4 Flash cobra US$ 0,28 por milhão de tokens de saída contra os US$ 4,25 da Meta. Uma vantagem de preço de 15× engole uma desvantagem de verbosidade de 2,2× sem perceber.
É isso que você deve levar para o seu próprio modelo de custo. A eficiência de tokens é uma propriedade real, e os modelos de raciocínio diferem nela por grandes fatores, mas, nos atuais spreads de mercado, é um termo de segunda ordem. A tabela de preços decide, e só vira quando dois modelos estão dentro de aproximadamente 3× um do outro em preço.
Onde estão os quatro pontos — e o que ninguém publicou

Aqui está a parte desconfortável deste confronto: o Intelligence Index é um composto de nove avaliações em agentes, codificação, capacidade geral e raciocínio científico, e a Artificial Analysis ainda não publicou o detalhamento por benchmark do Muse Spark 1.2. Portanto, "54 versus 50" é atualmente uma manchete sem decomposição. Quatro pontos podem ser uma lacuna de codificação, uma lacuna de contexto longo, uma lacuna de resistência a alucinações, ou quatro pequenas lacunas que se anulam na sua carga de trabalho.
Os próprios números de cada fornecedor preenchem parte do vazio, e nenhum pode ser verificado contra o outro. A Meta reporta Terminal-Bench 2.1 em 82,9% para o Muse Spark 1.2 (acima dos 76,2% do 1.1) e DeepSWE v1.1 em 59,3% (acima dos 53,0%) — executados no harness da Meta, pass@1 em cinco tentativas, com cada modelo concorrente pareado com seu próprio produto de agente. O lançamento do V4 Flash posicionou o modelo como um upgrade pós-treinamento ajustado para trabalho de agente e terminal em uma mistura de especialistas com 284B total / 13B ativos. Não há benchmark no qual ambos os laboratórios tenham publicado um número comparável, e nenhum terceiro reproduziu qualquer um dos conjuntos.
O que é estabelecido de forma independente é limitado e vale a pena afirmar claramente: em um índice composto, conduzido por um avaliador, o Muse Spark 1.2 terminou quatro pontos à frente, a 8,9 vezes o custo. Tudo o que for mais detalhado do que isso ainda é material do fornecedor.
Três maneiras de pagar pelo Muse Spark 1.2, uma e meia para o DeepSeek
Comparações de preços aqui são invulgarmente escorregadias, porque a Meta envia duas tabelas de preços e o fornecedor envia os pesos ele mesmo.
• Meta standard tier — US$ 1,25 de entrada, US$ 0,15 de entrada em cache, US$ 4,25 de saída por milhão, com um teto de taxa em torno de 3.000 solicitações por minuto.
• Nível de contribuidor Meta — US$ 0,10 por entrada, US$ 0,002 por entrada em cache, US$ 0,20 por saída, em troca da permissão para treinar futuros modelos da Meta no seu tráfego, limitado a 60 solicitações por minuto.
• Preço de tabela do DeepSeek V4 Flash — US$ 0,14 por entrada, US$ 0,28 por saída, US$ 0,003 em cache hit (um desconto de 98%, a taxa de cache mais agressiva de qualquer modelo nesta faixa), de seis provedores de API concorrentes.
• DeepSeek V4 Flash auto-hospedado — pesos abertos com licença MIT, então o preço é o seu próprio hardware e o teto é a sua própria capacidade.
Leia a segunda e a terceira linhas juntas e a classificação se inverte: no nível de contribuidor, o Muse Spark 1.2 é mais barato por token do que o DeepSeek V4 Flash, a US$ 0,10/US$ 0,20 contra US$ 0,14/US$ 0,28, enquanto pontua quatro pontos a mais. Esse é o preço mais agressivo de toda esta comparação e quase ninguém conseguirá usá-lo, porque 60 requisições por minuto equivalem a 2% do orçamento padrão e descartam essencialmente qualquer fan-out de produção. Ele é precificado para avaliação e trabalho de equipes pequenas, e a moeda são os seus prompts. Se essa troca está disponível para você é uma decisão de governança de dados que cabe ao jurídico, não um item que você troca em um arquivo de configuração.
O lado dos pesos abertos funciona ao contrário. Pesos MIT significam que o preço mínimo não é definido pelo fornecedor — se o seu volume justifica as GPUs, ninguém pode aumentar sua taxa, descontinuar seu modelo ou alterar os termos. Essa opcionalidade não tem equivalente no lado da Meta em nenhum nível.
Um provedor versus seis

Muse Spark 1.2 é servido pela Model API da Meta e por nenhum outro lugar. Sem hosts de terceiros, sem escolha de quantização, sem caminho de fallback e — no momento em que este texto foi escrito — sem listagem no OpenRouter, sem repositório no Hugging Face e sem entrada no catálogo do OrcaRouter. Um modelo fechado de provedor único é, por construção, um ponto único de falha, e para um modelo com cinco dias de existência não há histórico de uptime que o tranquilize.
DeepSeek V4 Flash é o caso oposto. Seis provedores de API servem o modelo hoje, os pesos são MIT, e ele está no catálogo do OrcaRouter a US$ 0,15 de entrada e US$ 0,29 de saída — preço de tabela do provedor, repassado com margem de 0% — com failover automático entre provedores, de modo que a degradação de um único host não derruba a carga de trabalho junto com ele. Esse é o argumento prático para o modelo mais barato, que não tem nada a ver com sua pontuação: você pode movê-lo, espelhã-lo ou sair de vez, e nenhuma dessas opções exige uma nova integração.
Para o Muse Spark 1.2 hoje, uma avaliação significa um segundo contrato, uma segunda fatura e um segundo caminho de SDK. O modelo da Meta vale a pena ser testado pelos seus méritos, mas fique claro que o custo operacional de executá-lo não é apenas o preço do token.
Latência, medida em tráfego real
No harness de benchmark, o Artificial Analysis registra tempo para o primeiro token de 1,33 segundos para o DeepSeek V4 Flash e 26,12 segundos para o Muse Spark 1.2 em sua configuração de raciocínio xhigh, com velocidades de saída de 103,3 e 165,0 tokens por segundo, respectivamente. O modelo da Meta gera mais rápido depois que começa e leva muito tempo para começar, que é exatamente como é a deliberação obrigatória no esforço máximo.
Os números de produção contam uma versão mais suave da mesma história. Ao longo de sete dias de roteamento ao vivo no OrcaRouter, o DeepSeek V4 Flash apresenta um p50 de tempo até o primeiro token de 439 milissegundos e um p95 de 1,96 segundos, a 111 tokens por segundo, com uma taxa de erro de 1,6%. Não há um dado de produção equivalente para o Muse Spark 1.2 porque ele ainda não é roteado em lugar nenhum; o Muse Spark 1.1, a proxy disponível mais próxima, apresenta um p50 de 1,84 segundos e um p95 de 6,00 segundos. A resposta mediana abaixo de um segundo é uma categoria na qual o DeepSeek V4 Flash se encontra e na qual nenhuma versão do Muse Spark entrou.
Ambos os modelos declaram cerca de um milhão de tokens de contexto — 1.048.576 para ambos, com o DeepSeek V4 Flash limitando as conclusões a 384.000 tokens e o endpoint Muse Spark sem declarar teto de conclusão algum. No quesito contexto, esse confronto é um empate no papel e não verificado na prática para ambos.
Três perguntas que valem a pena fazer antes de você mudar
Hospedar o DeepSeek V4 Flash por conta própria é realmente mais barato do que US$ 0,15 por milhão?
Normalmente não, e é esse o ponto. Um modelo de mistura de especialistas com 284 bilhões de parâmetros e 13 bilhões ativos exige capacidade séria de múltiplas GPUs para servir com latência razoável, e a US$ 0,15 por milhão de tokens de entrada, a taxa hospedada é difícil de superar, exceto em volume muito alto e muito constante. O valor da licença MIT para a maioria das equipes não é que elas farão auto-hospedagem — é que elas poderiam, de forma crível, o que limita o que qualquer provedor pode cobrar e elimina o risco de descontinuação. Trate isso como um seguro e compre os tokens hospedados.
O nível de contribuidor torna o Muse Spark 1.2 o modelo mais barato?
No cartão de preços, sim; na prática, apenas para cargas de trabalho com menos de 60 solicitações por minuto cujos dados você tem permissão de doar. Se ambas as condições forem verdadeiras — um pico de pesquisa, uma ferramenta interna, um harness de benchmark em entradas sintéticas — então um modelo quatro pontos de índice à frente a um preço menor por token é genuinamente a melhor compra e você deve escolhê-lo. Se qualquer uma falhar, o nível padrão é o preço real, e o nível padrão é 13× a taxa combinada do modelo V4 Flash.
Quatro pontos de índice parecem pouco. Quando isso importa?
Quando os erros se acumulam. Em uma chamada única de classificação ou sumarização, uma diferença composta de quatro pontos é muitas vezes invisível, e pagar 9× por ela é indefensável. Em um loop de agente de cinquenta etapas, uma diferença de sucesso por etapa que parece pequena se multiplica em uma grande diferença na frequência com que a execução inteira precisa ser reiniciada — e um reinício custa a trajetória inteira, não apenas uma etapa. É nesse caso que o preço da Meta é discutível. É também o caso em que você deve medir na sua própria tarefa em vez de confiar em um composto, porque ninguém publicou o subíndice agêntico que resolveria isso para o 1.2.
O veredicto, e a condição a ele anexada.
Para quase toda carga de trabalho em que o custo é uma restrição real, o DeepSeek V4 Flash é o padrão correto: {{1}}quatro pontos atrás em um índice composto{{/1}}, {{2}}treze vezes mais barato combinado{{/2}}, {{3}}latência mediana abaixo de um segundo em produção{{/3}}, {{4}}seis provedores{{/4}}, {{5}}pesos MIT{{/5}} e {{6}}nenhum fornecedor capaz de mudar os termos para você{{/6}}. Atualmente, ele é o modelo conhecido mais barato para rodar uma suíte completa de benchmarks, e não chegou lá por ser ruim.
Muse Spark 1.2 justifica seu preço em um formato específico de trabalho: codificação agêntica de horizonte longo, onde uma trajetória falha é cara, onde a deliberação extra é amortizada ao longo de minutos de trabalho em vez de ser sentida por um usuário em espera, e onde você pode conviver com um único provedor e sem detalhamento independente do que compõe os quatro pontos. A Meta lançou três modelos em quatro meses e avançou onze pontos de índice nesse período, então o caso pode se fortalecer rapidamente — mas hoje ele se baseia em benchmarks de codificação administrados pelo fornecedor e em uma pontuação composta.
Se você for escolher esta semana, rode ambos em cinquenta passos do seu próprio loop de agente e compare trajetórias concluídas por dólar em vez de tokens por dólar. Essa única medição resolve essa comparação melhor do que todos os benchmarks publicados nela.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
