Um cartão de título hero para 'Mercury 2.5 Preview vs Gemini 3.1 Pro' com o subtítulo 'Duas prévias, seis meses de diferença'. O painel esquerdo, rotulado 'Mercury 2.5 Preview', mostra um raio, uma pílula 'contexto de 256K', uma etiqueta 'somente texto' e uma pílula 'intro $0.04'; o painel direito, rotulado 'Gemini 3.1 Pro', mostra um conjunto de glifos multimodais (imagem, áudio, vídeo), uma pílula 'contexto de 1M', um selo 'AA Index 57 no lançamento' e uma pílula '$2.00 / $12.00'. Um selo fino 'vs' fica entre eles. O logotipo da OrcaRouter é sobreposto no canto inferior direito.
Guides & Insights

Mercury 2.5 Preview vs Gemini 3.1 Pro: Duas prévias, com seis meses de diferença

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois modelos deste confronto trazem a palavra "preview" em seus nomes, e é aí que a semelhança termina. Mercury 2.5 Preview e Gemini 3.1 Pro são ambos modelos de raciocínio que você pode usar via API hoje, mas são previews em extremos opostos de suas vidas. O Gemini 3.1 Pro, o principal modelo de raciocínio, está em preview desde 19 de fevereiro de 2026 — seis meses de avaliações independentes, posições em leaderboards públicos e tráfego de produção por trás dele, com um Artificial Analysis Intelligence Index de 57 no lançamento, entrada multimodal em texto, imagem, áudio e vídeo, um contexto de 1M de tokens e um preço de $2.00 / $12.00 por milhão de tokens. O Mercury 2.5 Preview, o LLM de difusão da Inception lançado em 31 de agosto de 2026, tem apenas dois dias: um modelo somente de texto com contexto de 256K, uma velocidade declarada de 1.107 tokens por segundo, um preço de tabela de $0.20 / $0.75 (cerca de $0.04 / $0.15 com desconto até 8 de setembro) e nenhum benchmark independente sequer. Chamar os dois de "previews" esconde a questão real, que é o quanto uma vantagem inicial de seis meses de evidências vale contra uma forma fundamentalmente mais rápida de gerar texto.

O que cada modelo realmente é

O Gemini 3.1 Pro é um carro-chefe de raciocínio fechado, multimodal e de propósito geral. Ele lê texto, imagens, áudio e vídeo, lida com uma janela de contexto de 1M de tokens com teto de saída de 64K e ajusta dinamicamente a profundidade de seu raciocínio — o fornecedor descreve uma intensidade de raciocínio em quatro níveis que escala com a complexidade da tarefa. Seus números de lançamento — ARC-AGI-2 em 77,1%, GPQA Diamond em 94,3%, SWE-bench Verified em 80,6%, Terminal-Bench 2.0 em 68,5% — são relatados pelo fornecedor, mas se apoiam em seis meses de escrutínio independente, incluindo uma nova medição da Artificial Analysis em uma escala de índice mais rigorosa, na qual o modelo registra cerca de 46,5. Essa nova medição é exatamente o que um modelo maduro merece: ele foi testado com afinco o suficiente para que o índice se tornasse mais rigoroso em torno dele. O Mercury 2.5 Preview é um modelo de difusão — ele gera e refina tokens em paralelo, em vez de um por vez — com raciocínio ajustável, chamadas de ferramentas paralelas e JSON alinhado a esquemas, construído para as cargas de trabalho de latência composta que a Inception nomeia: agentes de busca, pipelines de voz, subagentes de codificação. Toda alegação de qualidade associada a ele, incluindo um salto de mais de 10 pontos sobre o Mercury 2, é do próprio fornecedor, e nenhum terceiro o mediu.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

O contraste da especificação

Preço — Mercury 2.5 Preview: US$ 0,20 / US$ 0,75 por 1M entrada/saída, ~US$ 0,04 / US$ 0,15 introdutório até 8 de setembro. Gemini 3.1 Pro: US$ 2,00 / US$ 12,00 por 1M, passando para US$ 4,00 / US$ 18,00 acima de 200K de entrada.

Contexto / saída — Mercury 2.5 Preview: 256K de contexto. Gemini 3.1 Pro: 1M de contexto, 64K de saída máxima.

Entradas — Mercury 2.5 Preview: apenas texto. Gemini 3.1 Pro: texto, imagem, áudio, vídeo, arquivo.

Arquitetura — Mercury 2.5 Preview: LLM de difusão, geração paralela de tokens. Gemini 3.1 Pro: autorregressivo, profundidade dinâmica de raciocínio.

Velocidade — Mercury 2.5 Preview: 1.107 tokens/seg alegados. Gemini 3.1 Pro: nenhuma afirmação de destaque comparável.

Evidência — Mercury 2.5 Preview: apenas dados relatados pelo fornecedor. Gemini 3.1 Pro: AA Index 57 no lançamento (46.5 na escala mais recente), além de um longo histórico de avaliações independentes.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

A lacuna de multimodalidade é a diferença decisiva.

Para a maioria das aplicações, esta comparação é resolvida antes que preços ou benchmarks entrem em cena, porque o Mercury 2.5 Preview não consegue ver. O Gemini 3.1 Pro lê capturas de tela, diagramas, áudio e vídeo — é o modelo para o qual você aponta um PDF, um gráfico, uma gravação de reunião ou uma interface quando quer uma resposta sobre algo que ainda não é texto. O Mercury 2.5 Preview é somente texto por design; um modelo de linguagem por difusão que gera texto em paralelo não tem nenhum caminho de entrada de imagem ou áudio. Para uma aplicação com muitos documentos, um agente de visão ou qualquer produto multimodal, o Gemini 3.1 Pro é o único candidato aqui, ponto final. A restrição de somente texto do Mercury 2.5 Preview não é uma ressalva em letras miúdas; é a fronteira que decide para quais cargas de trabalho o modelo é sequer elegível.

Seis meses de teste versus dois dias

Em termos de evidências, isto não é uma disputa, e é importante dizer claramente porquê. O Gemini 3.1 Pro tem sido analisado minuciosamente por laboratórios independentes há seis meses; sua pontuação foi estabelecida, remedida e debatida, que é o que "confiável" significa para um modelo. O Mercury 2.5 Preview tem uma única fonte de informação — seu criador — e essa fonte afirma um salto de inteligência de mais de 10 pontos sobre o Mercury 2 e paridade com o nível de custo otimizado da fronteira. Ambas as afirmações podem ser verdadeiras. Nenhuma foi confirmada por ninguém fora da Inception, e o modelo é novo demais para que isso seja qualquer coisa além do esperado. A assimetria não é que um seja melhor; é que um é verificável e o outro ainda não é.

Onde a velocidade de Mercúrio realmente vence

O argumento honesto a favor do Mercury 2.5 Preview é restrito, apenas texto e real. A geração paralela de tokens muda a matemática da latência de uma forma que nenhum modelo autoregressivo — incluindo o Gemini 3.1 Pro — consegue acompanhar, porque um modelo autoregressivo é serial por construção. Para um pipeline de voz, a ironia é que a entrada e a saída são áudio, mas o raciocínio entre elas é texto: uma camada rápida de raciocínio em texto é exatamente o que faz um agente de voz parecer responsivo. Para um agente de busca que faz chamadas de ferramenta repetidas, e para um subagente de codificação que dispara muitas completions pequenas por tarefa, a latência por chamada se acumula em velocidade percebida. No preço de lançamento — US$ 0,04 na entrada, US$ 0,15 na saída — o Mercury 2.5 Preview é cerca de 80 vezes mais barato que a taxa padrão de saída do Gemini 3.1 Pro, o que o torna não apenas mais rápido, mas uma classe de custo diferente para raciocínio de texto em alto volume. A ressalva que precisa acompanhar cada uma dessas frases: a velocidade é alegada, a paridade de qualidade é alegada, e não existe nenhuma medição independente.

Preços: o premium de contexto longo da Gemini versus o teaser da Mercury

O cartão de preços do Gemini 3.1 Pro tem um detalhe que vale a pena conhecer antes de comparar os números de destaque: solicitações que ultrapassam 200 mil tokens de entrada saltam de US$ 2,00 / US$ 12,00 para US$ 4,00 / US$ 18,00 por milhão. Em um modelo de contexto de 1M, esse prêmio de contexto longo não é um caso isolado — é o preço de realmente usar a janela pela qual o modelo é famoso. O Mercury 2.5 Preview não tem esse degrau, e seu contexto de 256K dificilmente alcançará o território de contexto longo com frequência. Mas o preço baixo do Mercury é uma isca com expiração em 8 de setembro, enquanto o do Gemini é uma tarifa publicada e estável. Ao comparar, compare o preço de tabela de US$ 0,20 / US$ 0,75 do Mercury com o nível padrão do Gemini, não o valor com desconto — o desconto é o incentivo para testar, não o preço para planejar.

A decisão de roteamento

Ambos os modelos são roteáveis hoje, e isso muda como você deve tratar cada um deles. O Gemini 3.1 Pro está no OrcaRouter como google/gemini-3.1-pro-preview, pelo preço de tabela do provedor, repassado com 0% de margem, portanto os níveis padrão e de contexto longo custam exatamente o que o provedor publica, ao lado de mais de 200 outros modelos em uma única chave de API. Um selo de preview é exatamente o tipo de coisa para contornar em vez de apostar — o painel de taxa de erro da página do modelo está lá por um motivo, e o failover automático significa que uma resposta de preview degradada é roteada para um segundo provedor sem alteração de código. O Mercury 2.5 Preview ainda não está no OrcaRouter; a Inception o disponibiliza por meio de sua própria API e de várias plataformas de terceiros. Um modelo com dois dias de existência que você ainda não pode colocar atrás de failover é um candidato a teste, não uma dependência de produção. No dia em que um provedor o listar, o mesmo repasse se aplica e o desconto introdutório chega aqui no mesmo dia — é quando esse confronto vira uma regra de roteamento em vez de uma decisão.

O veredito honesto é que estas duas prévias respondem a perguntas diferentes. O Gemini 3.1 Pro responde "em qual modelo devo construir meu produto hoje" — é multimodal, de contexto longo, testado de forma independente e estável, a um preço que reflete tudo isso. O Mercury 2.5 Preview responde "quão rápido o raciocínio de texto pode fisicamente chegar" — e sua arquitetura de velocidade é a coisa mais interessante no modelo, aguardando um laboratório independente confirmar se a qualidade que a acompanha é real. Se sua carga de trabalho é multimodal ou de contexto longo, a escolha já está feita. Se for somente texto, com latência que se acumula e sensível a preço, o Mercury 2.5 Preview é a aposta a observar — e 8 de setembro é a data para observá-lo frente a frente.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube