
Step 5 Preview vs Gemini 3.1 Pro: Dois modelos chamados Preview, sete meses de diferença
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tanto Step 5 Preview quanto Gemini 3.1 Pro carregam a palavra preview, e a palavra não significa a mesma coisa em nenhum dos dois. A StepFun anunciou o Step 5 Preview em 20 de setembro de 2026, com a API aberta, os pesos programados para 15 de outubro e um repositório BF16 no Hugging Face contendo nada além de um .gitattributes. O outro vem sendo disponibilizado como gemini-3.1-pro-preview na API e como "Gemini 3.1 Pro Preview" em todos os rankings desde 19 de fevereiro de 2026, lidando com tráfego de produção por sete meses sem que o rótulo alguma vez tenha sido retirado. Um é um preview genuíno de algo ainda não finalizado. O outro é uma convenção de nomenclatura ligada a um produto finalizado. Compará-los no mesmo eixo significa decidir qual dessas duas coisas você está realmente comprando, e a resposta de segunda ordem — de que o modelo, ainda chamado de preview depois de sete meses, é o mais previsível dos dois — é a parte que vale a pena levar para uma decisão de compra.
O que o mesmo quadro diz
O Artificial Analysis avalia ambos no Intelligence Index v4.3.2, dez avaliações. É o único lugar onde esses dois foram medidos pela mesma mão, e o resultado é mais divergente do que os materiais promocionais de qualquer um dos lados sugeririam.
• Índice de Inteligência — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
• Classificação — Step 5 Preview 24º de 200 modelos vs. Gemini 3.1 Pro Preview 69º de 200
• Preço por 1M de tokens — Step 5 Preview US$ 1,00 de entrada / US$ 2,70 de saída vs Gemini 3.1 Pro US$ 2,00 de entrada / US$ 12,00 de saída
• Desconto de cache — Step 5 Preview 95% vs Gemini 3.1 Pro 90%
• Velocidade de saída — Step 5 Preview 99,8 tokens/seg vs Gemini 3.1 Pro 118,9 tokens/seg
• Tempo até o primeiro token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s
• Contexto — ambos com 1M de tokens; nosso catálogo lista o Gemini 3.1 Pro com um teto de saída de 65K, e a StepFun não publicou nenhum.
• Modalidades de entrada — Step 5 Preview: texto e imagem. Gemini 3.1 Pro: texto, imagem, áudio, vídeo e arquivo. Ambos geram apenas texto
• Pesos — Step 5 Preview encerrado hoje, checkpoint BF16 agendado para 15 de outubro; Gemini 3.1 Pro proprietário do início ao fim
Uma diferença de 14 pontos numa escala em que o topo da tabela fica em 53 é grande, e deve ser relatada ao lado daquilo que a torna estranha: os próprios números de avaliação publicados pelo Google para este modelo são excelentes. O fornecedor relata 77,1% no ARC-AGI-2, 82,8% na sua suíte multimodal, 94,1 no GPQA Diamond e 47,0 no Humanity's Last Exam. Não são valores fracos. Também são do próprio Google, executados nos harnesses do Google, e medem capacidades específicas em vez do agregado que o índice pontua. Ambos os conjuntos de números podem estar corretos ao mesmo tempo. Quando a avaliação de destaque de um fornecedor e um compósito independente divergem de forma tão acentuada, é o compósito que deve servir de base para planear uma carga de trabalho de produção, porque é ele que penaliza o modelo pelas coisas que o fornecedor não escolheu medir.
Vale mais a pena ler as duas linhas de velocidade em conjunto do que separadamente. O Gemini 3.1 Pro gera tokens 19% mais rápido depois que começa — 118,9 contra 99,8 — e leva 35,72 segundos para começar, contra 2,96 do Step 5 Preview. Esse é o perfil de um modelo que delibera antes de emitir. Para um job em lote em que não há um humano esperando, o gerador mais rápido vence em throughput. Para um loop de agente que faz dezenas de chamadas dependentes, uma diferença de doze vezes no tempo até o primeiro token é a diferença entre uma ferramenta interativa e uma fila.

O único eixo em que o Gemini vence de forma absoluta
A modalidade não é uma nota de rodapé nesta comparação. O Gemini 3.1 Pro aceita texto, imagens, áudio, vídeo e arquivos arbitrários, e o Step 5 Preview aceita texto e imagens. Se o seu pipeline envolve uma gravação de tela, uma gravação de chamada, um pacote de PDFs ou um feed de vídeo, apenas um desses dois modelos consegue sequer receber a entrada, e a diferença de 14 pontos no índice é irrelevante, porque o outro modelo não consegue responder à pergunta.
Essa assimetria decide mais cargas de trabalho reais do que as tabelas de benchmark. Revisão de vídeo, análise de reuniões, transcrição de áudio somada a raciocínio e fluxos de trabalho com documentos baseados em arquivos digitalizados são todos casos em que a amplitude do Gemini 3.1 Pro o torna o único candidato nesta página. É também por isso que o modelo permaneceu em produção por sete meses sob o rótulo de prévia: as cargas de trabalho que ele sustenta são aquelas em que um modelo mais recente de texto e imagem não consegue deslocá-lo.
Para trabalho com texto e imagens, o cálculo se inverte. O Step 5 Preview está 14 pontos à frente no agregado, é cerca de duas vezes mais rápido no preço de entrada e 4,4 vezes mais barato na saída, e responde em um doze avos do tempo. Em uma carga de trabalho de extração de documentos ou de chat sobre capturas de tela, não há motivo para pagar o adicional e esperar os onze segundos extras de deliberação.
Onde a precificação fica menos uniforme do que parece
Os preços anunciados subestimam a diferença, e a razão é um limite de escalão e não uma taxa.
Os $2,00 e $12,00 do Gemini 3.1 Pro são válidos para até 200.000 tokens de entrada. Acima disso, ambas as tarifas passam para $4,00 e $18,00 — um aumento de 50% na saída que se aplica à solicitação inteira, não apenas à parte que ultrapassa o limite. Os $1,00 e $2,70 do Step 5 Preview não têm faixa publicada; o preço é o preço em qualquer extensão que a janela de contexto permitir.
Ambos os modelos anunciam um contexto de 1M de tokens, então ambos convidam você a construir pipelines de contexto longo. Em um deles, uma requisição de 300.000 tokens custa o dobro do que a lista de preços sugere; no outro, não. Essa é uma vantagem estrutural para o Step 5 Preview exatamente na categoria para a qual a StepFun o criou — trabalho agêntico de horizonte longo com um contexto grande e repetidamente referenciado — e é ampliada pelo desconto de cache, onde os 95% do Step 5 Preview contra os 90% do Gemini 3.1 Pro aumentam ainda mais a diferença no padrão de prefixo repetido que um loop de agente produz.
Calculado por alto, e sinalizado como aritmética em vez de um valor citado: um loop de agente que envia um contexto de 250.000 tokens em cada um dos quarenta turnos equivale a dez milhões de tokens de entrada. Na tarifa acima de 200K do Gemini 3.1 Pro, com o cache absorvendo o prefixo repetido, isso representa um aumento significativo em relação ao que a tarifa de tabela de US$ 2,00 sugere. Na tarifa fixa de US$ 1,00 do Step 5 Preview, com um desconto de cache mais profundo, o mesmo loop custa menos e, mais importante, custa algo que você consegue prever a partir da lista de preços sem primeiro ler a tabela de faixas.

A disponibilidade é a diferença silenciosa.
O Gemini 3.1 Pro está disponível para chamadas há sete meses por meio da API do Google e, de forma mais útil para o planejamento, por meio de vários provedores independentes — e é isso que torna um valor de latência p50 significativo, em vez de anedótico. O Step 5 Preview abriu sua API em 20 de setembro e tem exatamente uma fonte. Um endpoint de fonte única com apenas alguns dias de existência é o componente menos previsível que você poderia colocar em um caminho de produção, não porque o modelo seja ruim, mas porque ninguém conhece ainda sua curva de capacidade.
Esse é o argumento a favor do roteamento em vez da escolha. O Gemini 3.1 Pro Preview está no nosso catálogo a US$ 2,00 e US$ 12,00 com o degrau de faixa repassado sem alteração, e os modelos com os quais ele é comparado ficam ao lado dele, atrás de uma única chave para mais de 200 modelos, com o preço de tabela do provedor repassado a 0% de markup. O Step 5 Preview não está nessa lista — ele roda na própria API da StepFun e, até os pesos chegarem, esse é o único lugar onde ele roda. O failover automático é o que torna um preview com poucos dias seguro para testar em vez de uma aposta: mantenha o caminho de produção em um modelo com histórico comprovado, envie o volume de texto e imagem para o Step 5 Preview enquanto o avalia com seu próprio tráfego, e deixe o fallback aguentar quando o endpoint do preview degradar. Não há um segundo contrato nem um SDK separado para os modelos que roteamos, então um reajuste de preço do Google aparece na sua fatura como o número atual, e não na renovação.

Qual deles você está realmente comprando?
Se o seu trabalho chega como vídeo, áudio ou arquivos, o Gemini 3.1 Pro é o único modelo nesta página que consegue aceitá-lo, e a diferença no índice não entra na decisão. Sete meses em produção com o rótulo de preview ainda anexado é um sinal de estabilidade, não um aviso: a convenção de nomenclatura persiste porque o Google nunca precisou mudá-la, e o modelo se comporta como o cavalo de batalha de produção que é.
Se o seu trabalho envolve texto e imagens em volume com um grande contexto repetido, o Step 5 Preview está à frente em todas as métricas que importam — 14 pontos de índice, metade do preço de entrada, uma taxa de saída 4,4x mais barata, sem salto de nível, um desconto de cache mais profundo e um tempo até o primeiro token medido em segundos, e não em meio minuto. O que você está comprando ali é um endpoint de fonte única com poucos dias, sem licença publicada e sem teto de saída publicado, o que é um risco real e limitado.
O que é preciso observar não é o índice. É se a StepFun publica um teto de saída junto com a janela de contexto de 1 milhão de tokens, porque o anúncio do fornecedor não diz nada a esse respeito, e uma configuração separada de terceiros que circulou durante o vazamento listava 350.000 de contexto com um limite de saída de 64.000 — um produto materialmente diferente do que consta na lista de preços. O teto de 65K do Gemini 3.1 Pro, conforme o nosso catálogo o apresenta, também não é generoso, mas está declarado, e um limite declarado é aquele com o qual você pode projetar.
