Um cartão de título herói para 'Mercury 2.5 Preview vs Grok 4.6' com o subtítulo 'Será que uma Preview de 1.107 tokens/s consegue superar o campeão de valor?', mostrando um chip de raio rotulado como '1.107 tok/s', um chip de balança rotulado como 'PREÇO vs VELOCIDADE', um chip de troféu rotulado como 'AA #3' e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Mercury 2.5 Preview vs Grok 4.6: Será que uma Preview de 1.107 tokens/s consegue superar o campeão de valor?

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Aqui está a resposta em uma frase: Mercury 2.5 Preview é o modelo de raciocínio confiável mais barato em produção hoje, a US$ 0,04 / US$ 0,15 por milhão de tokens, e Grok 4.6 é o modelo mais barato na fronteira da inteligência, a US$ 2,00 / US$ 6,00 — portanto, a questão prática entre eles é se um modelo de difusão em pré-visualização, que a Inception apenas afirma ser "comparável a" GPT-5.6 Luna (Low) e Claude Haiku 4.5, consegue fazer os trabalhos pelos quais, de outra forma, você pagaria o nível de fronteira. Mercury 2.5 Preview, lançado em 31 de agosto de 2026, gera tokens em paralelo e afirma 1.107 tokens por segundo em GPUs padrão; Grok 4.6, o carro-chefe da fronteira lançado em 12 de agosto de 2026, pontua 61 no Artificial Analysis Intelligence Index, empatado em 3º lugar global, e faz isso a um preço que a fronteira nunca viu antes. Esse choque — a afirmação mais rápida na base da curva de preços encontrando o melhor valor no topo dela — é o tema deste artigo.

Principais conclusões

• O Grok 4.6 a US$ 2,00 / US$ 6,00 com um Índice de Inteligência AA de 61 é o campeão de valor do nível de fronteira; o Mercury 2.5 Preview a US$ 0,04 / US$ 0,15 é uma aposta de que qualidade boa o suficiente por 1/50 do preço vence a qualidade de fronteira que você raramente precisa.

• As alegações de velocidade e qualidade do Mercury 2.5 Preview são inteiramente da Inception; não existiam pontuações de benchmark independentes no primeiro dia.

O desconto de lançamento de 80% no Mercury 2.5 Preview expira em 8 de setembro de 2026, após o qual seu preço de tabela é de $0.20 / $0.75 — ainda 10× mais barato que o Grok 4.6 na entrada, mas uma história menor.

• O Grok 4.6 é roteado pelo OrcaRouter hoje ao preço de tabela; o Mercury 2.5 Preview ainda não é roteado e é servido pela API própria da Inception e por várias plataformas de terceiros.

O placar

A two-column scoreboard titled 'Mercury 2.5 Preview vs Grok 4.6 — the scoreboard': left column Mercury 2.5 Preview — Intelligence claimed cheap-tier parity, Price $0.04/$0.15 (80% off), Speed 1,107 tok/s (claimed), Context 260K, Agentic no public scores, Weights closed; right column Grok 4.6 — Intelligence AA Index 61 (#3), Price $2.00/$6.00, Speed not a headline spec, Context 500K, Agentic APEX-Agents 57.5, Weights closed; footer 'Mercury figures vendor-reported, unreproduced; Grok per xAI and Artificial Analysis'.

Inteligência — Mercury 2.5 Preview: sem índice independente; Inception afirma paridade com o nível de custo otimizado. Grok 4.6: AA Intelligence Index 61, empatado em #3 globalmente (de acordo com a Artificial Analysis; os números do próprio laboratório são relatados pelo fornecedor).

Preço — Mercury 2.5 Preview: $0,04 / $0,15 por 1M (80% de desconto sobre $0,20 / $0,75, até 8 de setembro de 2026). Grok 4.6: $2,00 / $6,00 por 1M, dobrando para $4,00 / $12,00 para prompts com 200 mil tokens ou mais.

Velocidade — Mercury 2.5 Preview: 1.107 tokens/segundo, conforme alegado pelo fornecedor. Grok 4.6: a velocidade não é a especificação de destaque; o modelo foi criado para execuções longas de agentes, não para fluxos rápidos.

Contexto — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.

Trabalho agêntico — Mercury 2.5 Preview: sem pontuações públicas, embora chamadas de ferramentas paralelas sejam suportadas. Grok 4.6: APEX-Agents 57.5, DeepSWE v1.1 65.9, CursorBench v3.2 69.9 (relatado pelo fornecedor, em grande parte não reproduzido).

Pesos — Mercury 2.5 Preview: fechado, proprietário. Grok 4.6: fechado, proprietário.

O campeão de valor e o salto de preço

A posição do Grok 4.6 é incomum. Ele ocupa o 3º lugar em inteligência no índice Artificial Analysis, empatado com o GPT-5.6 Sol Max — embora seja mais barato do que todos os modelos dentro de dez pontos dele — e a cobertura do seu lançamento destacou longas execuções agênticas terminando com uma média de aproximadamente US$ 0,84 por tarefa em uma avaliação conduzida por um fornecedor. Isso é a definição de um campeão de custo-benefício: capacidade próxima da fronteira a um preço que torna os custos por tarefa visíveis em uma planilha. O Mercury 2.5 Preview não está tentando ser isso. A Inception o posiciona contra modelos como GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite e Claude Haiku 4.5 — o nível otimizado para custo, não a fronteira. Se a Inception estiver certa, o Mercury 2.5 Preview é um nível abaixo do Grok 4.6 em capacidade e vários níveis abaixo em preço, o que é um produto perfeitamente coerente: uma alternativa de preço menor para cargas de trabalho em que o nível de fronteira é desperdício.

O que a decodificação paralela realmente muda

A arquitetura é a parte que vale a pena entender, porque ela muda o que "rápido" significa. Modelos autorregressivos emitem um token por etapa, então a taxa de transferência é limitada pela latência sequencial; um LLM de difusão como o Mercury 2.5 Preview gera um bloco de tokens em paralelo e os refina ao longo de etapas de denoising, o que desacopla a taxa de transferência do número de tokens produzidos. É por isso que a Inception pode afirmar 1.107 tokens/seg em GPUs padrão — sem aceleradores especiais, sem truques de batching — e por que a afirmação real do produto é um tempo até o primeiro token inferior a 300 milissegundos para cargas de trabalho interativas. Para um agente de voz, um pipeline de busca ou um subagente de codificação que chama o modelo a cada turno, essa diferença de latência é o produto: é a diferença entre um loop de voz que parece ao vivo e um que faz pausas. O problema é que modelos de linguagem de difusão são uma área de pesquisa jovem, o número 1.107 é da Inception, e nenhum laboratório independente reproduziu a velocidade ou mediu o desvio de qualidade, se houver, que a geração paralela introduz em prompts longos ou adversariais.

Onde Grok 4.6 ainda domina o trabalho

Nada na Mercury 2.5 Preview toca as partes do mercado em que a Grok 4.6 está realmente vencendo. Os ganhos da Grok sobre a Grok 4.5 concentraram-se em benchmarks de agentes e codificação — DeepSWE +11,9 pontos, APEX-Agents +10,4, Terminal-Bench +10,3 — e sua janela de contexto de 500 mil tokens existe para agentes de longo horizonte que precisam manter a tarefa inteira em contexto. A Mercury 2.5 Preview oferece chamadas paralelas de ferramentas, mas um modelo sem pontuações independentes de agentes, com limite de saída de 65.536 tokens e contexto de 260 mil não é a ferramenta para uma execução de engenharia de software de 50 etapas. Os dois modelos quase não se sobrepõem no uso: a Grok 4.6 é o motor para o trabalho que precisa realmente terminar; a Mercury 2.5 Preview é o motor para o trabalho que precisa parecer instantâneo e custar quase nada por chamada.

A janela de 80% de desconto

A precificação aqui tem uma data de validade, e isso muda a decisão. A tarifa de US$ 0,04 / US$ 0,15 do Mercury 2.5 Preview é um desconto de 80% sobre o preço de tabela de US$ 0,20 / US$ 0,75, e a Inception afirmou que a promoção é válida até 8 de setembro de 2026. Os US$ 2,00 / US$ 6,00 do Grok 4.6 são um preço de tabela estável com uma estrutura limpa — entrada em cache a US$ 0,50, um nível prioritário a 2× e um acréscimo para prompts longos a 200 mil tokens que cobra a solicitação inteira pela tarifa mais alta. Se você estiver comparando os números de hoje, o Mercury parece 50× mais barato na entrada e 40× mais barato na saída; se o desconto expirar como programado, a diferença real de longo prazo é de 10× na entrada e 5× na saída. Nenhuma das duas perspectivas é desonesta — são apenas horizontes de tempo diferentes, e um pipeline precificado com base no desconto, sem um ponto de reavaliação, é um pipeline que será surpreendido em 9 de setembro. Os US$ 2,00 / US$ 6,00 do Grok 4.6 são exatamente o que você paga no OrcaRouter, onde o preço de tabela do provedor é repassado com margem de 0% — quando o provedor altera um número, o novo valor fica ativo na mesma chave no mesmo dia, com failover automático se um caminho do provedor limitar a taxa.

O veredito em uma linha

Se o trabalho precisa ser concluído e você quer capacidade de ponta pelo melhor preço da categoria, compre o Grok 4.6 — é um campeão comprovado de custo-benefício, disponível no OrcaRouter por $2.00 / $6.00 hoje. Se o trabalho é raciocínio de texto de alto volume, sensível à latência, em que respostas suficientemente boas são baratas de verificar, o Mercury 2.5 Preview a $0.04 / $0.15 é uma oportunidade de preço que vale a pena testar dentro da janela de desconto — lembre-se apenas de que toda afirmação do lado dele no tabuleiro é da Inception, e a prova ainda está em aberto.

A screenshot of the Inception documentation page 'Models, Endpoints, and Pricing' (captured September 1, 2026), showing the Mercury family pricing table — Mercury 2 and Mercury Edit 2 both at $0.25 input / $0.025 cached / $0.75 output per 1M tokens — and a cURL chat-completions API example.A screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the '$2.00' price badge, and the model description noting the August 12, 2026 release.

OrcaRouter repassa os preços de lista dos provedores com margem de 0% e failover automático, portanto uma alteração de preço do fornecedor fica ativa na mesma chave no mesmo dia.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube