Um cartão de título hero para 'Mercury 2.5 vs Mercury 2.5 Preview' com o subtítulo 'Um modelo de difusão, duas datas de lançamento — o que a atualização de produção realmente muda'. Três chips ficam abaixo: um glifo de colunas divididas rotulado 'SAME ENGINE', um glifo de raio rotulado '1,107 tok/s CLAIM' e um glifo de relógio rotulado 'AUG 31 vs SEP 8'. O logotipo do OrcaRouter está no canto inferior direito.
Guides & Insights

Mercury 2.5 vs Mercury 2.5 Preview: Um Modelo de Difusão, Duas Datas de Lançamento

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Eis um confronto direto em que ambos os concorrentes compartilham um cartão do modelo. O Mercury 2.5 Preview da Inception, lançado em 31 de agosto de 2026, e o Mercury 2.5, lançado em 8 de setembro de 2026, são o mesmo modelo de linguagem por difusão com oito dias de diferença: um canal de prévia que a Inception abriu para desenvolvedores e a versão de produção "pronta para empresas" que ela lançou uma semana depois. A Inception não divulgou um checkpoint diferente, um número de velocidade diferente ou um preço diferente para o Mercury 2.5 — e os números que de fato mudaram entre os dois anúncios parecem uma arrumação, não um modelo novo. O valor de contexto foi corrigido de 256K na página de prévia para 260K no lançamento, e o ganho de inteligência sobre o Mercury 2 foi reformulado de "mais de 10 pontos" (materiais de prévia) para "40 por cento" (materiais de lançamento). O motor, a alegação de 1.107 tokens por segundo e a tabela de preços são idênticos. Portanto, esta não é a habitual disputa de ficha técnica, e inflar uma delas seria desonesto. A comparação que importa entre esses dois nomes é sobre embalagem e timing: o que o lançamento de produção realmente mudou, o que o rótulo Preview realmente estava lhe dizendo e qual nome suas chamadas de API devem usar agora.

Por que um modelo está sendo comparado consigo mesmo

Os fornecedores geralmente fazem uma prévia de um modelo e depois o incorporam silenciosamente ao nome principal; a listagem da prévia desaparece e ninguém escreve a comparação. A Inception, em vez disso, manteve os dois nomes lado a lado por uma semana, e a identidade da Preview só agora está sendo aposentada — exatamente por isso esta comparação tem conteúdo. A Preview foi o caminho rápido que a Inception usou para colocar sua aposta em difusão diante dos desenvolvedores. Ela apareceu em 31 de agosto com a ficha técnica que hoje é a do Mercury 2.5: um LLM de difusão (dLLM) que gera e refina blocos de tokens em paralelo, em vez de emitir um token por vez; uma alegação de 1.107 tokens por segundo em GPUs padrão; uma alegação de tempo para o primeiro token inferior a 300 ms; uma janela de contexto de 260 mil tokens com saída de 65.536 tokens; níveis de raciocínio ajustáveis; uso nativo de ferramentas, chamadas de ferramentas em paralelo e saída estruturada. Cada um desses números é da própria Inception, e nenhum laboratório independente havia medido o modelo quando a Preview foi lançada.

Em 8 de setembro, a Inception lançou o Mercury 2.5 como "o próximo nível de inteligência para LLMs de difusão" e seu modelo de raciocínio mais rápido em produção — pronto para empresas, voltado para agentes de voz, subagentes de codificação, busca empresarial e cargas de trabalho de suporte. Mesmas especificações, mesmo posicionamento, mesma tabela de preços. O lançamento também antecipou dois irmãos que esclarecem para onde a Inception está caminhando: o Mercury Voice, um dLLM ajustado para um primeiro token em menos de 170ms para agentes de voz, e o Mercury Router, que roteia prompts entre modelos por qualidade, velocidade e custo. O Mercury 2.5 é o carro-chefe de uma família construída para cargas de trabalho sensíveis à latência e orientadas a agentes, em vez de para o nível de qualidade de fronteira.

O que o lançamento de 8 de setembro realmente mudou

Compare os dois nomes linha por linha e o delta não é o motor — é tudo o que está em volta do motor:

Status — Mercury 2.5 Preview: uma prévia fechada que poderia "alterar o comportamento ou a disponibilidade." Mercury 2.5: um modelo de produção lançado com um compromisso pronto para o ambiente corporativo, um canal de vendas e uma listagem de produção datada.

Identidade — A página de modelos da Inception agora lista Mercury 2.5, Mercury Voice e Mercury Router, sem nenhum Preview à vista, e sua nota de rodapé de suporte menciona Mercury 1, Mercury 2 e Mercury Edit 2 como os modelos que "permanecem com suporte para clientes existentes". O Preview não aparece em nenhuma das listas. Para a fornecedora, o rótulo de preview foi absorvido pelo Mercury 2.5.

Endpoint — A plataforma de desenvolvedores da Inception disponibiliza o modelo como mercury-2.5, e a listagem de produção que entrou no ar em 8 de setembro é onde o novo tráfego é atendido. No catálogo que inicialmente continha o Preview no final de agosto, o nome Preview agora não resolve para nenhum endpoint de serviço ativo, enquanto a listagem Mercury 2.5 adicionada em 8 de setembro responde. Qualquer pessoa que programou usando o Preview pelo nome deve apontar novamente para Mercury 2.5 e confirmar o que seu provedor está realmente cobrando — o id que você integrou na primeira semana é o que está sendo desativado.

Preço — lista idêntica e desconto idêntico. Ambos são $0.20 por milhão de entrada e $0.75 por milhão de saída, com entrada em cache a $0.02, e ambos foram lançados com cerca de 80% de desconto: $0.04 / $0.15, cache a $0.004. O desconto do Preview foi explicitamente limitado a 8 de setembro; o Mercury 2.5 foi lançado com a mesma oferta de 80%, e a tarifa com desconto é o que sua listagem de produção ainda mostra no momento em que este texto foi escrito. Essa é a armadilha, detalhada abaixo.

Onboarding — o lançamento da produção adicionou uma franquia de tokens gratuitos para novas contas de desenvolvedores — os materiais de lançamento citam 100 milhões de tokens — e abriu um caminho de contato empresarial que uma prévia nunca teve.

Evidência — inalterado. Nenhum dos nomes possui um benchmark independente, e as afirmações do fornecedor são as mesmas afirmações com uma redação ligeiramente diferente: um salto de inteligência de "mais de 10 pontos" sobre o Mercury 2 nos materiais de pré-visualização torna-se um aumento de "40 por cento" nos materiais de lançamento, juntamente com a mesma paridade declarada com o nível de fronteira otimizado para custo (GPT-5.6 Luna em modo de baixo esforço, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) e os mesmos 79% relatados pelo fornecedor no GPQA Diamond e 77% no IFBench. Uma afirmação reformulada não é uma afirmação verificada.

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

A armadilha de preços no coração do pareamento

Como os dois nomes têm o mesmo preço de tabela e a mesma oferta inicial de 80%, é fácil presumir que sempre custam o mesmo. Mas não precisam custar. O desconto do Preview teve uma parada definitiva em 8 de setembro; o desconto de lançamento do Mercury 2.5 está rodando com um cronômetro recomeçado. Durante uma semana, foi perfeitamente possível pagar $0,20 / $0,75 por uma chamada ao Preview enquanto o mesmo mecanismo respondia a $0,04 / $0,15 sob seu nome de produção — ou, mais provavelmente, estar em um ID de preview que havia silenciosamente parado de atender enquanto a conta continuava chegando. Um desconto de lançamento que expira por endpoint é exatamente o tipo de letra miúda que transforma uma história de "mesmo modelo, mesmo preço" em uma diferença de custo real.

O número mais confiável é o preço de tabela, e o conselho mais confiável é orçar em torno dele: $0,20 / $0,75 por milhão, entrada em cache $0,02 — barato para um modelo de raciocínio com contexto de 260K, confortavelmente abaixo do nível principal, mas não os $0,04 / $0,15 que os banners de lançamento anunciam. Trate a taxa com desconto como um preço de teste com prazo de validade, verifique o que seu provedor cobra pelo ID exato do modelo no seu código, em vez do nome na página de marketing, e se você aderiu à Prévia, migre para o Mercury 2.5 antes que um vencimento ou um endpoint aposentado decida por você.

Este é também o tipo de problema que uma camada de roteamento existe para eliminar. Um roteador de modelos que repassa os preços de tabela dos provedores com margem de 0% mostra o preço que um fornecedor realmente cobra, atualizado no mesmo dia em que um desconto de lançamento entra em vigor ou expira, e o failover automático mantém as chamadas fluindo quando um endpoint é descontinuado por baixo de você. Mercury 2.5 não está no OrcaRouter até o momento desta publicação — a Inception está servindo-o por meio de sua própria API e de várias plataformas de terceiros — portanto, por enquanto, a página de modelos do fornecedor é a fonte da verdade sobre a tarifa. No momento em que um provedor o listar, esses mecanismos de repasse são o que você obtém com uma única chave, e uma redução de preço ou a expiração de um desconto aparece do nosso lado no mesmo dia em que é anunciada.

O problema de evidência que ambos os nomes compartilham.

O placar honesto para esta dupla é curto, porque as duas colunas são o mesmo modelo com a mesma ausência de comprovação. Nem Mercury 2.5 nem Mercury 2.5 Preview têm uma pontuação de índice independente, uma execução reproduzida ou uma colocação em arena em 9 de setembro de 2026. As próprias alegações da Inception — o salto de inteligência sobre o Mercury 2, a paridade com o nível Haiku 4.5, os 79% no GPQA Diamond, os 1.107 tokens por segundo — são palavras da empresa, e são idênticas para ambos os nomes porque o modelo é idêntico.

A única evidência independente na família aponta como interpretar a alegação de velocidade. A Artificial Analysis mediu o Mercury 2, o antecessor, a 684 tokens por segundo no endpoint de produção, atribuindo-lhe 22 no Intelligence Index — genuinamente rápido, e prova de que a abordagem de difusão não é uma miragem, mas bem aquém dos aproximadamente 1.000 tokens por segundo que a Inception anuncia para esse modelo no hardware Blackwell. Espere uma diferença semelhante entre o valor de 1.107 do Mercury 2.5 e o que um endpoint compartilhado multi-inquilino realmente entrega sob carga real. A mesma cautela se aplica à qualidade: um modelo de difusão recém-lançado, avaliado apenas pelo seu criador, não deve ser levado ao pé da letra quanto a igualar o Claude Haiku 4.5 até que um terceiro o teste.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

Os rastreadores que começaram a cobrir o lançamento refletem exatamente esse estado de coisas. Um registro BenchLM para o Mercury 2.5, publicado em 8 de setembro, dá ao modelo nenhuma pontuação pública e nenhum ranking público; ele traz os números de 79% GPQA Diamond e 77% IFBench da Inception, explicitamente rotulados como fornecidos pelo provedor, e observa que a velocidade de execução independente não foi medida. A primeira entrada do índice Artificial Analysis, uma colocação no LMArena, ou uma execução reproduzida do GPQA transformarão o Mercury 2.5 de uma alegação em um objeto comparável — e isso se aplicará a ambos os nomes ao mesmo tempo, porque há apenas um modelo a medir.

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

Qual nome você deve chamar

Nova integração, sem legado:chame Mercury 2.5 e ignore a Preview. O nome de produção carrega o mesmo mecanismo, o mesmo desconto por enquanto, os termos empresariais e a garantia de que é o id que o fornecedor está realmente servindo. A Preview adiciona risco de instabilidade e nada mais.

Já integrou o Preview: verifique hoje o que seu provedor fornece sob esse nome e o que ele cobra por isso. Aponte novamente seu cliente para o id do Mercury 2.5 e confirme a taxa. Manter o nome Preview no código de produção agora é uma aposta de que um canal de preview explicitamente com prazo limitado sobreviverá à sua própria aposentadoria.

Tráfego empresarial ou de produção crítica:Mercury 2.5 passa pelo caminho empresarial da Inception, não por um rótulo de preview sem compromisso por trás. As necessidades de voz e roteamento apontam para Mercury Voice e Mercury Router, respectivamente, que ainda são eles próprios previews.

Quem estiver avaliando o nível de difusão:ambos os nomes são o mesmo alvo de avaliação, então execute sua avaliação contra o Mercury 2.5 uma vez e trate o resultado como aplicável à linha do modelo. Faça orçamento pelo preço de tabela e pondere as afirmações do fornecedor como hipóteses até que uma pontuação independente seja divulgada.

O que assistir

Três coisas vão resolver esse pareamento nas próximas semanas. Primeiro, o primeiro benchmark independente — uma colocação em índice ou uma execução reproduzida de GPQA ou AIME — que testará a alegação de paridade que é toda a aposta comercial. Segundo, se a identidade Preview desaparece por completo do ecossistema de modelos, como a própria página de modelos da Inception já sugere. Terceiro, o que acontece com o desconto de lançamento de 80% agora que o marco de 8 de setembro ao qual o Preview estava vinculado já passou: uma extensão torna o Mercury 2.5 estruturalmente barato, enquanto um retorno a US$ 0,20 / US$ 0,75 o torna apenas competitivo. Até lá, a resposta correta para "Mercury 2.5 ou Mercury 2.5 Preview?" é que é um único modelo, e você deve chamar aquele que ainda é um produto.