
Muse Spark 1.2 vs GPT-5.6 Luna: Três Pontos de Índice para 4,6x o Preço do Token
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Artificial Analysis rodou a mesma bateria de nove benchmarks em ambos os modelos e guardou os recibos. Passar o Muse Spark 1.2 por ela custou $637,85. Passar o GPT-5.6 Luna por ela custou $174,06. Por essa diferença de 3,7x no gasto, o modelo da Meta ficou três pontos à frente — 54 contra 51 no Índice de Inteligência. Se isso é um bom negócio é toda a questão, e a resposta depende muito menos do benchmark do que de duas coisas sobre as quais quase ninguém escreve: como o seu framework de agentes lida com cache de prompt e se a sua carga de trabalho algum dia precisa ouvir ou assistir a qualquer coisa.
Cada figura abaixo é uma medição independente da Artificial Analysis, uma listagem de API ao vivo ou a telemetria de produção da própria OrcaRouter — esta última merecendo destaque desde o início, pois contradiz os números de benchmark de maneira instrutiva. Nada aqui é uma alegação de fornecedor disfarçada de resultado; quando o fornecedor é a única fonte, a frase deixa isso claro.
O placar está mais próximo do que o preço sugere
{{1}}O Muse Spark 1.2 obtém 54 no Artificial Analysis Intelligence Index em sua configuração de raciocínio xhigh, classificando-se em #13 de 185 modelos contra uma mediana da classe de 32.{{/1}} {{2}}O GPT-5.6 Luna obtém 51 com esforço máximo.{{/2}} {{3}}Três pontos em uma composição de GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR.{{/3}}
A diferença de três pontos é real, mas pequena, e os subescores que existem para a geração anterior sugerem de onde isso vem. Os índices por dimensão da Artificial Analysis colocam o Muse Spark 1.1 com um índice de codificação de 71,3 e um índice agêntico de 37,5; o GPT-5.6 Luna está em 71,4 e 45,6. A codificação foi um empate técnico, e a Luna estava oito pontos à frente no trabalho agêntico — exatamente a dimensão que a Meta reescreveu a descrição do produto do 1.2 para reivindicar. O composto mudou três pontos a favor da Meta. Ninguém ainda publicou um detalhamento por dimensão para o 1.2, então se a lacuna agêntica realmente fechou não foi verificado.

Quanto ao preço combinado de tokens, a diferença não é sutil. A taxa combinada da Artificial Analysis coloca o Muse Spark 1.2 em {{1}}$0,78{{/1}} por milhão de tokens e o GPT-5.6 Luna em {{2}}$0,17{{/2}}. Preços de tabela: {{3}}$1,25 de entrada e $4,25 de saída{{/3}} para o Muse Spark 1.2, {{4}}$0,20 de entrada e $1,20 de saída{{/4}} para a Luna.
Com preço por unidade de trabalho em vez de por token, uma única etapa de agente de codificação que lê 60.000 tokens de contexto e escreve 3.000 tokens de saída custa cerca de 8,8 centavos no Muse Spark 1.2 e cerca de 1,6 centavos no GPT-5.6 Luna. Ao longo de mil etapas por dia, isso representa US$ 88 contra US$ 16 — uma diferença de aproximadamente US$ 26.000 por ano para um único loop de agente.
É no cache que a lacuna ou se fecha, ou dobra.
Ambos os modelos praticam taxas agressivas de entrada em cache, e a proporção entre elas não é a mesma que a proporção entre seus preços de tabela. O Muse Spark 1.2 lê entrada em cache a US$ 0,15 por milhão, um desconto de 88% sobre sua taxa de US$ 1,25. O GPT-5.6 Luna lê entrada em cache a US$ 0,01 por milhão, um desconto de 95% sobre US$ 0,20.
Execute novamente a mesma etapa do agente com o prefixo de 60.000 tokens servido aquecido: o Muse Spark 1.2 cai de 8,8 centavos para cerca de 2,2 centavos. O Luna cai de 1,6 centavos para cerca de 0,4 centavos. A diferença absoluta diminui de 7,2 centavos para 1,8 centavos por etapa, mas o múltiplo permanece aproximadamente o mesmo — o cache não resgata o modelo mais caro, apenas torna ambos mais baratos por fatores semelhantes. O que muda é qual item de linha domina: com cache, o custo do Muse Spark 1.2 é 59% de tokens de saída, em vez de 85% de tokens de entrada, então a verbosidade do modelo passa a importar mais do que o tamanho do contexto.
Isso não é uma preocupação hipotética aqui. O Muse Spark 1.2 gerou 95M tokens de saída passando pelo Intelligence Index, contra uma mediana de 65M. O próprio resumo da Artificial Analysis o chama de "um tanto verboso". A Luna queimou 130M, o que parece pior até você multiplicar por $1.20 em vez de $4.25.
O texto do produto da Meta afirma que o cache de prompts pode reduzir o custo efetivo em 60–80%, dependendo de quanto do contexto se repete. Isso é uma estimativa do fornecedor, não uma medição, mas a aritmética acima se enquadra nesse intervalo.
Latência: o eixo onde o benchmark inverte a verdade
Se você lesse apenas os números de latência da Artificial Analysis, concluiria que o Muse Spark 1.2 é o responsivo. Tempo até o primeiro token: 26,12 segundos para o Muse Spark 1.2, 126,99 segundos para o GPT-5.6 Luna. Quase cinco vezes mais rápido.
Ambos são medidos na configuração de raciocínio mais cara de cada modelo — xhigh para o Muse Spark, max para a Luna. Nenhum deles é o que você verá. No OrcaRouter, ao longo de uma semana de tráfego real, com o nível de esforço que os chamadores realmente solicitam, o GPT-5.6 Luna apresenta um p50 de tempo até o primeiro token de 1,84 segundos e um p95 de 9,68 segundos. O Muse Spark 1.1 mostra um p50 idêntico de 1,84 segundos com um p95 mais baixo de 6,00 segundos. Ainda não há telemetria de produção para o 1.2 porque ele é muito novo.

A diferença estrutural é mais útil do que qualquer um dos números. O raciocínio do GPT-5.6 Luna é opcional — o dial de esforço vai de nenhum passando por baixo, médio, alto e muito alto até máximo, e você pode realmente desligar o raciocínio para classificação, roteamento ou extração. O raciocínio do Muse Spark 1.2 é obrigatório; o dial não desce abaixo de mínimo, e não há configuração que forneça os pesos sem pagar pela deliberação. Para qualquer uso de alto volume e sensível à latência, isso é uma restrição de design, não um parâmetro de ajuste.
A taxa de transferência sustentada é próxima: 165,0 tokens por segundo para Muse Spark 1.2 contra 177,9 para Luna, ambos bem acima da mediana da classe de 71.
A nota de rodapé de preços em que todos vão tropeçar
O preço da GPT-5.6 Luna aparece atualmente com valores diferentes em lugares diferentes, e se você está construindo um modelo de custos, deve ficar atento a isso antes de citar um número. O catálogo da Artificial Analysis e o da OrcaRouter mostram US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída — a tarifa que passou a valer após o corte de preço da GPT-5.6 em julho e que a Artificial Analysis usou para calcular a conta de US$ 174,06 da avaliação acima. Algumas listagens de marketplace atualmente mostram US$ 0,10 e US$ 0,60, com um patamar superior separado que entra em vigor acima de 272.000 tokens de prompt. O mais seguro é verificar o preço no endpoint que você está realmente chamando, em vez do que aparece no artigo de comparação.
O detalhe do escalonamento é real independentemente de qual taxa-base se aplica, e é genuinamente pouco coberto: O preço da Luna sobe de forma escalonada quando uma única solicitação excede aproximadamente 272.000 tokens de prompt. O input aproximadamente dobra, o output aumenta pela metade, e as leituras em cache acompanham essa escala. Se o seu motivo para considerar a Luna é a janela de contexto de 1,05M tokens, note que você deixa a taxa anunciada em cerca de um quarto do caminho. A Muse Spark 1.2 tem uma taxa fixa em todos os seus 1.048.576 tokens, sem sobretaxa de contexto longo — para solicitações únicas genuinamente longas, a diferença efetiva entre as duas se reduz consideravelmente.
O que Luna não pode fazer a qualquer preço
A diferença de modalidade é a razão mais clara para escolher um em vez do outro, e ela não aparece em nenhum leaderboard.
• Entradas — Muse Spark 1.2 aceita texto, imagens, vídeo, áudio e documentos PDF, conforme a listagem da Meta. GPT-5.6 Luna aceita texto, imagens e arquivos. Sem áudio, sem vídeo. Se o seu pipeline envolve gravações ou filmagens, o Luna não é candidato de forma alguma.
• Saída máxima — Luna declara um teto de conclusão de 128.000 tokens. O endpoint do Muse Spark 1.2 não declara nenhum comprimento máximo de conclusão, o que é tão incomum que você deve testá-lo em vez de planejar em torno disso.
• Data de corte do conhecimento — A data de corte da Luna's é publicada como 16 de fevereiro de 2026. A Meta não publica data de corte para o Muse Spark 1.2; portanto, reserve orçamento para recuperação de qualquer forma.
• Disponibilidade — A Luna está disponível mundialmente por meio de múltiplas rotas. O Muse Spark 1.2 é fornecido por exatamente um provedor: Meta. Um endpoint, uma política de região, uma única coisa que pode falhar.
• Moderação — ambos são endpoints moderados.
Uma ressalva honesta sobre a vantagem multimodal: o cartão de especificações técnicas da Artificial Analysis para o Muse Spark 1.2 lista entrada de texto e imagem como o que foi avaliado, não a superfície completa de cinco modalidades que a Meta anuncia. A API aceita mais do que qualquer pessoa independente testou.

Adoção, visto que é mensurável.
Benchmarks mostram o que um modelo pode fazer; o tráfego mostra o que as pessoas confiam a ele. Ao longo de uma semana contínua no OrcaRouter, o GPT-5.6 Luna movimentou 4.679,4 milhões de tokens. O Muse Spark 1.1 — mesmo contexto de 1M, pontuação de índice comparável, quatro semanas mais antigo no catálogo — movimentou 4,4 milhões. Isso é um fator de cerca de mil.
Parte disso é distribuição: a Luna é o padrão em mais ferramentas e está GA mundialmente há mais tempo, enquanto a família Muse Spark foi lançada somente nos EUA. Mas uma diferença de mil para um em um roteador onde ambos estão a uma string de modelo de distância um do outro não é puramente uma história de distribuição. É a razão prática pela qual a Luna é o padrão mais seguro e a Muse Spark 1.2 é a coisa que você avalia deliberadamente.
Vale notar o que você pode e não pode alugar hoje: a GPT-5.6 Luna está no catálogo do OrcaRouter a US$ 0,20 e US$ 1,20 — os mesmos números da lista de preços do próprio provedor, já que operamos com margem de 0% e repassamos o preço de tabela do provedor diretamente. A Muse Spark 1.1 também está lá a US$ 1,25 e US$ 4,25, na mesma base. A Muse Spark 1.2 ainda não está no catálogo — ela é servida diretamente pela Meta. Portanto, a maneira mais barata de fazer essa comparação com honestidade hoje é usar a Luna contra a Muse Spark 1.1 em uma chave, alternando uma string entre as execuções, e então testar novamente contra a 1.2 quando ela for disponibilizada.
Escolha um.
Use o GPT-5.6 Luna se a carga de trabalho for de alto volume e em formato de texto: chat, classificação, extração, roteamento, uso leve de ferramentas. Custa um quarto do preço médio, permite desativar o raciocínio por completo, seu p50 de 1,84 segundo é um número real medido em produção, e não um artefato de benchmark, e é o modelo com mil vezes mais tráfego real por trás dele. Três pontos de índice não sobrevivem a essa aritmética.
Escolha o Muse Spark 1.2 se a carga de trabalho for codificação agêntica de horizonte longo — refatorações de vários arquivos, depuração estendida, trabalho em todo o repositório — ou se envolver entrada de áudio ou vídeo, onde a Luna simplesmente não consegue competir. Também é a melhor escolha para solicitações únicas verdadeiramente enormes, já que sua taxa é fixa em todo o milhão de tokens, enquanto a da Luna aumenta acima de 272K.
Use ambos se você for honesto sobre como os sistemas de agentes são realmente construídos. O padrão que continua vencendo é um modelo barato lidando com a maioria rotineira das chamadas e um caro reservado para as etapas em que a qualidade se paga. Ambos os modelos ficam atrás de um único endpoint compatível com OpenAI, de modo que essa divisão é uma regra de roteamento, e não uma relação com um segundo fornecedor — e se o braço caro cair no meio da execução, o failover automático significa que sua avaliação não se envenena silenciosamente com metade de um conjunto de dados.
A coisa a observar no próximo mês é o detalhamento por dimensão. Toda a proposta do Muse Spark 1.2 é a capacidade agêntica, e na geração anterior essa era a dimensão em que a Luna liderava por oito pontos. Até que alguém publique um índice agêntico para o 1.2, o ganho composto de três pontos é a única evidência de que a Meta fechou essa diferença.
