Card de título gerado com o título 'Step 5 Preview vs Gemini 3.1 Pro — duas prévias separadas por sete meses', com uma linha do tempo marcando Gemini 3.1 Pro Preview em 19 de fevereiro de 2026, ainda em prévia, e Step 5 Preview em 20 de setembro de 2026, com pesos previstos para 15 de outubro. Abaixo, dois cards: Step 5 Preview com AA Index 44, entrada de texto e imagem, e tempo até o primeiro token de 2,96 s; Gemini 3.1 Pro Preview com AA Index 30, entrada de texto, imagem, áudio, vídeo e arquivo, e tempo até o primeiro token de 35,72 s. Um rodapé diz 'Ambos de acordo com o Artificial Analysis Intelligence Index v4.3.2.'
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro: Dois modelos chamados Preview, sete meses de diferença

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tanto Step 5 Preview quanto Gemini 3.1 Pro carregam a palavra preview, e a palavra não significa a mesma coisa em nenhum dos dois. A StepFun anunciou o Step 5 Preview em 20 de setembro de 2026, com a API aberta, os pesos programados para 15 de outubro e um repositório BF16 no Hugging Face contendo nada além de um .gitattributes. O outro vem sendo disponibilizado como gemini-3.1-pro-preview na API e como "Gemini 3.1 Pro Preview" em todos os rankings desde 19 de fevereiro de 2026, lidando com tráfego de produção por sete meses sem que o rótulo alguma vez tenha sido retirado. Um é um preview genuíno de algo ainda não finalizado. O outro é uma convenção de nomenclatura ligada a um produto finalizado. Compará-los no mesmo eixo significa decidir qual dessas duas coisas você está realmente comprando, e a resposta de segunda ordem — de que o modelo, ainda chamado de preview depois de sete meses, é o mais previsível dos dois — é a parte que vale a pena levar para uma decisão de compra.

O que o mesmo quadro diz

O Artificial Analysis avalia ambos no Intelligence Index v4.3.2, dez avaliações. É o único lugar onde esses dois foram medidos pela mesma mão, e o resultado é mais divergente do que os materiais promocionais de qualquer um dos lados sugeririam.

• Índice de Inteligência — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30

• Classificação — Step 5 Preview 24º de 200 modelos vs. Gemini 3.1 Pro Preview 69º de 200

• Preço por 1M de tokens — Step 5 Preview US$ 1,00 de entrada / US$ 2,70 de saída vs Gemini 3.1 Pro US$ 2,00 de entrada / US$ 12,00 de saída

• Desconto de cache — Step 5 Preview 95% vs Gemini 3.1 Pro 90%

• Velocidade de saída — Step 5 Preview 99,8 tokens/seg vs Gemini 3.1 Pro 118,9 tokens/seg

• Tempo até o primeiro token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s

• Contexto — ambos com 1M de tokens; nosso catálogo lista o Gemini 3.1 Pro com um teto de saída de 65K, e a StepFun não publicou nenhum.

• Modalidades de entrada — Step 5 Preview: texto e imagem. Gemini 3.1 Pro: texto, imagem, áudio, vídeo e arquivo. Ambos geram apenas texto

• Pesos — Step 5 Preview encerrado hoje, checkpoint BF16 agendado para 15 de outubro; Gemini 3.1 Pro proprietário do início ao fim

Uma diferença de 14 pontos numa escala em que o topo da tabela fica em 53 é grande, e deve ser relatada ao lado daquilo que a torna estranha: os próprios números de avaliação publicados pelo Google para este modelo são excelentes. O fornecedor relata 77,1% no ARC-AGI-2, 82,8% na sua suíte multimodal, 94,1 no GPQA Diamond e 47,0 no Humanity's Last Exam. Não são valores fracos. Também são do próprio Google, executados nos harnesses do Google, e medem capacidades específicas em vez do agregado que o índice pontua. Ambos os conjuntos de números podem estar corretos ao mesmo tempo. Quando a avaliação de destaque de um fornecedor e um compósito independente divergem de forma tão acentuada, é o compósito que deve servir de base para planear uma carga de trabalho de produção, porque é ele que penaliza o modelo pelas coisas que o fornecedor não escolheu medir.

Vale mais a pena ler as duas linhas de velocidade em conjunto do que separadamente. O Gemini 3.1 Pro gera tokens 19% mais rápido depois que começa — 118,9 contra 99,8 — e leva 35,72 segundos para começar, contra 2,96 do Step 5 Preview. Esse é o perfil de um modelo que delibera antes de emitir. Para um job em lote em que não há um humano esperando, o gerador mais rápido vence em throughput. Para um loop de agente que faz dezenas de chamadas dependentes, uma diferença de doze vezes no tempo até o primeiro token é a diferença entre uma ferramenta interativa e uma fila.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

O único eixo em que o Gemini vence de forma absoluta

A modalidade não é uma nota de rodapé nesta comparação. O Gemini 3.1 Pro aceita texto, imagens, áudio, vídeo e arquivos arbitrários, e o Step 5 Preview aceita texto e imagens. Se o seu pipeline envolve uma gravação de tela, uma gravação de chamada, um pacote de PDFs ou um feed de vídeo, apenas um desses dois modelos consegue sequer receber a entrada, e a diferença de 14 pontos no índice é irrelevante, porque o outro modelo não consegue responder à pergunta.

Essa assimetria decide mais cargas de trabalho reais do que as tabelas de benchmark. Revisão de vídeo, análise de reuniões, transcrição de áudio somada a raciocínio e fluxos de trabalho com documentos baseados em arquivos digitalizados são todos casos em que a amplitude do Gemini 3.1 Pro o torna o único candidato nesta página. É também por isso que o modelo permaneceu em produção por sete meses sob o rótulo de prévia: as cargas de trabalho que ele sustenta são aquelas em que um modelo mais recente de texto e imagem não consegue deslocá-lo.

Para trabalho com texto e imagens, o cálculo se inverte. O Step 5 Preview está 14 pontos à frente no agregado, é cerca de duas vezes mais rápido no preço de entrada e 4,4 vezes mais barato na saída, e responde em um doze avos do tempo. Em uma carga de trabalho de extração de documentos ou de chat sobre capturas de tela, não há motivo para pagar o adicional e esperar os onze segundos extras de deliberação.

Onde a precificação fica menos uniforme do que parece

Os preços anunciados subestimam a diferença, e a razão é um limite de escalão e não uma taxa.

Os $2,00 e $12,00 do Gemini 3.1 Pro são válidos para até 200.000 tokens de entrada. Acima disso, ambas as tarifas passam para $4,00 e $18,00 — um aumento de 50% na saída que se aplica à solicitação inteira, não apenas à parte que ultrapassa o limite. Os $1,00 e $2,70 do Step 5 Preview não têm faixa publicada; o preço é o preço em qualquer extensão que a janela de contexto permitir.

Ambos os modelos anunciam um contexto de 1M de tokens, então ambos convidam você a construir pipelines de contexto longo. Em um deles, uma requisição de 300.000 tokens custa o dobro do que a lista de preços sugere; no outro, não. Essa é uma vantagem estrutural para o Step 5 Preview exatamente na categoria para a qual a StepFun o criou — trabalho agêntico de horizonte longo com um contexto grande e repetidamente referenciado — e é ampliada pelo desconto de cache, onde os 95% do Step 5 Preview contra os 90% do Gemini 3.1 Pro aumentam ainda mais a diferença no padrão de prefixo repetido que um loop de agente produz.

Calculado por alto, e sinalizado como aritmética em vez de um valor citado: um loop de agente que envia um contexto de 250.000 tokens em cada um dos quarenta turnos equivale a dez milhões de tokens de entrada. Na tarifa acima de 200K do Gemini 3.1 Pro, com o cache absorvendo o prefixo repetido, isso representa um aumento significativo em relação ao que a tarifa de tabela de US$ 2,00 sugere. Na tarifa fixa de US$ 1,00 do Step 5 Preview, com um desconto de cache mais profundo, o mesmo loop custa menos e, mais importante, custa algo que você consegue prever a partir da lista de preços sem primeiro ler a tabela de faixas.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

A disponibilidade é a diferença silenciosa.

O Gemini 3.1 Pro está disponível para chamadas há sete meses por meio da API do Google e, de forma mais útil para o planejamento, por meio de vários provedores independentes — e é isso que torna um valor de latência p50 significativo, em vez de anedótico. O Step 5 Preview abriu sua API em 20 de setembro e tem exatamente uma fonte. Um endpoint de fonte única com apenas alguns dias de existência é o componente menos previsível que você poderia colocar em um caminho de produção, não porque o modelo seja ruim, mas porque ninguém conhece ainda sua curva de capacidade.

Esse é o argumento a favor do roteamento em vez da escolha. O Gemini 3.1 Pro Preview está no nosso catálogo a US$ 2,00 e US$ 12,00 com o degrau de faixa repassado sem alteração, e os modelos com os quais ele é comparado ficam ao lado dele, atrás de uma única chave para mais de 200 modelos, com o preço de tabela do provedor repassado a 0% de markup. O Step 5 Preview não está nessa lista — ele roda na própria API da StepFun e, até os pesos chegarem, esse é o único lugar onde ele roda. O failover automático é o que torna um preview com poucos dias seguro para testar em vez de uma aposta: mantenha o caminho de produção em um modelo com histórico comprovado, envie o volume de texto e imagem para o Step 5 Preview enquanto o avalia com seu próprio tráfego, e deixe o fallback aguentar quando o endpoint do preview degradar. Não há um segundo contrato nem um SDK separado para os modelos que roteamos, então um reajuste de preço do Google aparece na sua fatura como o número atual, e não na renovação.

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Qual deles você está realmente comprando?

Se o seu trabalho chega como vídeo, áudio ou arquivos, o Gemini 3.1 Pro é o único modelo nesta página que consegue aceitá-lo, e a diferença no índice não entra na decisão. Sete meses em produção com o rótulo de preview ainda anexado é um sinal de estabilidade, não um aviso: a convenção de nomenclatura persiste porque o Google nunca precisou mudá-la, e o modelo se comporta como o cavalo de batalha de produção que é.

Se o seu trabalho envolve texto e imagens em volume com um grande contexto repetido, o Step 5 Preview está à frente em todas as métricas que importam — 14 pontos de índice, metade do preço de entrada, uma taxa de saída 4,4x mais barata, sem salto de nível, um desconto de cache mais profundo e um tempo até o primeiro token medido em segundos, e não em meio minuto. O que você está comprando ali é um endpoint de fonte única com poucos dias, sem licença publicada e sem teto de saída publicado, o que é um risco real e limitado.

O que é preciso observar não é o índice. É se a StepFun publica um teto de saída junto com a janela de contexto de 1 milhão de tokens, porque o anúncio do fornecedor não diz nada a esse respeito, e uma configuração separada de terceiros que circulou durante o vazamento listava 350.000 de contexto com um limite de saída de 64.000 — um produto materialmente diferente do que consta na lista de preços. O teto de 65K do Gemini 3.1 Pro, conforme o nosso catálogo o apresenta, também não é generoso, mas está declarado, e um limite declarado é aquele com o qual você pode projetar.