
Mercury 2.5 vs Mercury 2.5 Preview: Um Modelo de Difusão, Duas Datas de Lançamento
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Eis um confronto direto em que ambos os concorrentes compartilham um cartão do modelo. O Mercury 2.5 Preview da Inception, lançado em 31 de agosto de 2026, e o Mercury 2.5, lançado em 8 de setembro de 2026, são o mesmo modelo de linguagem por difusão com oito dias de diferença: um canal de prévia que a Inception abriu para desenvolvedores e a versão de produção "pronta para empresas" que ela lançou uma semana depois. A Inception não divulgou um checkpoint diferente, um número de velocidade diferente ou um preço diferente para o Mercury 2.5 — e os números que de fato mudaram entre os dois anúncios parecem uma arrumação, não um modelo novo. O valor de contexto foi corrigido de 256K na página de prévia para 260K no lançamento, e o ganho de inteligência sobre o Mercury 2 foi reformulado de "mais de 10 pontos" (materiais de prévia) para "40 por cento" (materiais de lançamento). O motor, a alegação de 1.107 tokens por segundo e a tabela de preços são idênticos. Portanto, esta não é a habitual disputa de ficha técnica, e inflar uma delas seria desonesto. A comparação que importa entre esses dois nomes é sobre embalagem e timing: o que o lançamento de produção realmente mudou, o que o rótulo Preview realmente estava lhe dizendo e qual nome suas chamadas de API devem usar agora.
Por que um modelo está sendo comparado consigo mesmo
Os fornecedores geralmente fazem uma prévia de um modelo e depois o incorporam silenciosamente ao nome principal; a listagem da prévia desaparece e ninguém escreve a comparação. A Inception, em vez disso, manteve os dois nomes lado a lado por uma semana, e a identidade da Preview só agora está sendo aposentada — exatamente por isso esta comparação tem conteúdo. A Preview foi o caminho rápido que a Inception usou para colocar sua aposta em difusão diante dos desenvolvedores. Ela apareceu em 31 de agosto com a ficha técnica que hoje é a do Mercury 2.5: um LLM de difusão (dLLM) que gera e refina blocos de tokens em paralelo, em vez de emitir um token por vez; uma alegação de 1.107 tokens por segundo em GPUs padrão; uma alegação de tempo para o primeiro token inferior a 300 ms; uma janela de contexto de 260 mil tokens com saída de 65.536 tokens; níveis de raciocínio ajustáveis; uso nativo de ferramentas, chamadas de ferramentas em paralelo e saída estruturada. Cada um desses números é da própria Inception, e nenhum laboratório independente havia medido o modelo quando a Preview foi lançada.
Em 8 de setembro, a Inception lançou o Mercury 2.5 como "o próximo nível de inteligência para LLMs de difusão" e seu modelo de raciocínio mais rápido em produção — pronto para empresas, voltado para agentes de voz, subagentes de codificação, busca empresarial e cargas de trabalho de suporte. Mesmas especificações, mesmo posicionamento, mesma tabela de preços. O lançamento também antecipou dois irmãos que esclarecem para onde a Inception está caminhando: o Mercury Voice, um dLLM ajustado para um primeiro token em menos de 170ms para agentes de voz, e o Mercury Router, que roteia prompts entre modelos por qualidade, velocidade e custo. O Mercury 2.5 é o carro-chefe de uma família construída para cargas de trabalho sensíveis à latência e orientadas a agentes, em vez de para o nível de qualidade de fronteira.
O que o lançamento de 8 de setembro realmente mudou
Compare os dois nomes linha por linha e o delta não é o motor — é tudo o que está em volta do motor:
• Status — Mercury 2.5 Preview: uma prévia fechada que poderia "alterar o comportamento ou a disponibilidade." Mercury 2.5: um modelo de produção lançado com um compromisso pronto para o ambiente corporativo, um canal de vendas e uma listagem de produção datada.
• Identidade — A página de modelos da Inception agora lista Mercury 2.5, Mercury Voice e Mercury Router, sem nenhum Preview à vista, e sua nota de rodapé de suporte menciona Mercury 1, Mercury 2 e Mercury Edit 2 como os modelos que "permanecem com suporte para clientes existentes". O Preview não aparece em nenhuma das listas. Para a fornecedora, o rótulo de preview foi absorvido pelo Mercury 2.5.
• Endpoint — A plataforma de desenvolvedores da Inception disponibiliza o modelo como mercury-2.5, e a listagem de produção que entrou no ar em 8 de setembro é onde o novo tráfego é atendido. No catálogo que inicialmente continha o Preview no final de agosto, o nome Preview agora não resolve para nenhum endpoint de serviço ativo, enquanto a listagem Mercury 2.5 adicionada em 8 de setembro responde. Qualquer pessoa que programou usando o Preview pelo nome deve apontar novamente para Mercury 2.5 e confirmar o que seu provedor está realmente cobrando — o id que você integrou na primeira semana é o que está sendo desativado.
• Preço — lista idêntica e desconto idêntico. Ambos são $0.20 por milhão de entrada e $0.75 por milhão de saída, com entrada em cache a $0.02, e ambos foram lançados com cerca de 80% de desconto: $0.04 / $0.15, cache a $0.004. O desconto do Preview foi explicitamente limitado a 8 de setembro; o Mercury 2.5 foi lançado com a mesma oferta de 80%, e a tarifa com desconto é o que sua listagem de produção ainda mostra no momento em que este texto foi escrito. Essa é a armadilha, detalhada abaixo.
• Onboarding — o lançamento da produção adicionou uma franquia de tokens gratuitos para novas contas de desenvolvedores — os materiais de lançamento citam 100 milhões de tokens — e abriu um caminho de contato empresarial que uma prévia nunca teve.
• Evidência — inalterado. Nenhum dos nomes possui um benchmark independente, e as afirmações do fornecedor são as mesmas afirmações com uma redação ligeiramente diferente: um salto de inteligência de "mais de 10 pontos" sobre o Mercury 2 nos materiais de pré-visualização torna-se um aumento de "40 por cento" nos materiais de lançamento, juntamente com a mesma paridade declarada com o nível de fronteira otimizado para custo (GPT-5.6 Luna em modo de baixo esforço, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) e os mesmos 79% relatados pelo fornecedor no GPQA Diamond e 77% no IFBench. Uma afirmação reformulada não é uma afirmação verificada.

A armadilha de preços no coração do pareamento
Como os dois nomes têm o mesmo preço de tabela e a mesma oferta inicial de 80%, é fácil presumir que sempre custam o mesmo. Mas não precisam custar. O desconto do Preview teve uma parada definitiva em 8 de setembro; o desconto de lançamento do Mercury 2.5 está rodando com um cronômetro recomeçado. Durante uma semana, foi perfeitamente possível pagar $0,20 / $0,75 por uma chamada ao Preview enquanto o mesmo mecanismo respondia a $0,04 / $0,15 sob seu nome de produção — ou, mais provavelmente, estar em um ID de preview que havia silenciosamente parado de atender enquanto a conta continuava chegando. Um desconto de lançamento que expira por endpoint é exatamente o tipo de letra miúda que transforma uma história de "mesmo modelo, mesmo preço" em uma diferença de custo real.
O número mais confiável é o preço de tabela, e o conselho mais confiável é orçar em torno dele: $0,20 / $0,75 por milhão, entrada em cache $0,02 — barato para um modelo de raciocínio com contexto de 260K, confortavelmente abaixo do nível principal, mas não os $0,04 / $0,15 que os banners de lançamento anunciam. Trate a taxa com desconto como um preço de teste com prazo de validade, verifique o que seu provedor cobra pelo ID exato do modelo no seu código, em vez do nome na página de marketing, e se você aderiu à Prévia, migre para o Mercury 2.5 antes que um vencimento ou um endpoint aposentado decida por você.
Este é também o tipo de problema que uma camada de roteamento existe para eliminar. Um roteador de modelos que repassa os preços de tabela dos provedores com margem de 0% mostra o preço que um fornecedor realmente cobra, atualizado no mesmo dia em que um desconto de lançamento entra em vigor ou expira, e o failover automático mantém as chamadas fluindo quando um endpoint é descontinuado por baixo de você. Mercury 2.5 não está no OrcaRouter até o momento desta publicação — a Inception está servindo-o por meio de sua própria API e de várias plataformas de terceiros — portanto, por enquanto, a página de modelos do fornecedor é a fonte da verdade sobre a tarifa. No momento em que um provedor o listar, esses mecanismos de repasse são o que você obtém com uma única chave, e uma redução de preço ou a expiração de um desconto aparece do nosso lado no mesmo dia em que é anunciada.
O problema de evidência que ambos os nomes compartilham.
O placar honesto para esta dupla é curto, porque as duas colunas são o mesmo modelo com a mesma ausência de comprovação. Nem Mercury 2.5 nem Mercury 2.5 Preview têm uma pontuação de índice independente, uma execução reproduzida ou uma colocação em arena em 9 de setembro de 2026. As próprias alegações da Inception — o salto de inteligência sobre o Mercury 2, a paridade com o nível Haiku 4.5, os 79% no GPQA Diamond, os 1.107 tokens por segundo — são palavras da empresa, e são idênticas para ambos os nomes porque o modelo é idêntico.
A única evidência independente na família aponta como interpretar a alegação de velocidade. A Artificial Analysis mediu o Mercury 2, o antecessor, a 684 tokens por segundo no endpoint de produção, atribuindo-lhe 22 no Intelligence Index — genuinamente rápido, e prova de que a abordagem de difusão não é uma miragem, mas bem aquém dos aproximadamente 1.000 tokens por segundo que a Inception anuncia para esse modelo no hardware Blackwell. Espere uma diferença semelhante entre o valor de 1.107 do Mercury 2.5 e o que um endpoint compartilhado multi-inquilino realmente entrega sob carga real. A mesma cautela se aplica à qualidade: um modelo de difusão recém-lançado, avaliado apenas pelo seu criador, não deve ser levado ao pé da letra quanto a igualar o Claude Haiku 4.5 até que um terceiro o teste.

Os rastreadores que começaram a cobrir o lançamento refletem exatamente esse estado de coisas. Um registro BenchLM para o Mercury 2.5, publicado em 8 de setembro, dá ao modelo nenhuma pontuação pública e nenhum ranking público; ele traz os números de 79% GPQA Diamond e 77% IFBench da Inception, explicitamente rotulados como fornecidos pelo provedor, e observa que a velocidade de execução independente não foi medida. A primeira entrada do índice Artificial Analysis, uma colocação no LMArena, ou uma execução reproduzida do GPQA transformarão o Mercury 2.5 de uma alegação em um objeto comparável — e isso se aplicará a ambos os nomes ao mesmo tempo, porque há apenas um modelo a medir.

Qual nome você deve chamar
• Nova integração, sem legado:chame Mercury 2.5 e ignore a Preview. O nome de produção carrega o mesmo mecanismo, o mesmo desconto por enquanto, os termos empresariais e a garantia de que é o id que o fornecedor está realmente servindo. A Preview adiciona risco de instabilidade e nada mais.
• Já integrou o Preview: verifique hoje o que seu provedor fornece sob esse nome e o que ele cobra por isso. Aponte novamente seu cliente para o id do Mercury 2.5 e confirme a taxa. Manter o nome Preview no código de produção agora é uma aposta de que um canal de preview explicitamente com prazo limitado sobreviverá à sua própria aposentadoria.
• Tráfego empresarial ou de produção crítica:Mercury 2.5 passa pelo caminho empresarial da Inception, não por um rótulo de preview sem compromisso por trás. As necessidades de voz e roteamento apontam para Mercury Voice e Mercury Router, respectivamente, que ainda são eles próprios previews.
• Quem estiver avaliando o nível de difusão:ambos os nomes são o mesmo alvo de avaliação, então execute sua avaliação contra o Mercury 2.5 uma vez e trate o resultado como aplicável à linha do modelo. Faça orçamento pelo preço de tabela e pondere as afirmações do fornecedor como hipóteses até que uma pontuação independente seja divulgada.
O que assistir
Três coisas vão resolver esse pareamento nas próximas semanas. Primeiro, o primeiro benchmark independente — uma colocação em índice ou uma execução reproduzida de GPQA ou AIME — que testará a alegação de paridade que é toda a aposta comercial. Segundo, se a identidade Preview desaparece por completo do ecossistema de modelos, como a própria página de modelos da Inception já sugere. Terceiro, o que acontece com o desconto de lançamento de 80% agora que o marco de 8 de setembro ao qual o Preview estava vinculado já passou: uma extensão torna o Mercury 2.5 estruturalmente barato, enquanto um retorno a US$ 0,20 / US$ 0,75 o torna apenas competitivo. Até lá, a resposta correta para "Mercury 2.5 ou Mercury 2.5 Preview?" é que é um único modelo, e você deve chamar aquele que ainda é um produto.
