
Step 5 Preview vs Claude Opus 5: Sete Pontos de Índice por uma Conta Sete Vezes Maior
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O material de lançamento da StepFun para Step 5 Preview começa com uma única afirmação comparativa: uma única tarefa nele custa um oitavo do que a mesma tarefa no Claude Opus 5. Os dois modelos agora estão no mesmo ranking independente, então essa afirmação pode ser verificada em vez de debatida. A Artificial Analysis submeteu cada um ao Intelligence Index v4.3.2 — dez avaliações — e publicou quanto custou cada execução, com o Claude Opus 5 pontuado em sua própria configuração máxima de esforço de raciocínio. Step 5 Preview: 44 no índice, US$ 922,84 para completar a execução. Claude Opus 5: 51 no índice, US$ 7.274,74. Isso é 7,9 vezes mais dinheiro por 7 pontos de pontuação, e a proporção citada pela StepFun acaba sendo a correta. O que a proporção esconde é a parte interessante, porque a diferença não é principalmente uma diferença de preço. É uma diferença de verbosidade vestindo as roupas de uma diferença de preço, e separar as duas muda qual modelo você deve colocar diante de qual carga de trabalho.
Dois custos de execução, uma placa e o que realmente há dentro deles
O custo total de execução é a comparação única mais limpa disponível aqui, porque ambos os modelos responderam às mesmas perguntas sob o mesmo harness, e nenhum dos fornecedores produziu esse número. É também o número com maior probabilidade de ser mal interpretado, por isso vale a pena destrinchá-lo.
• Pontuação do índice — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 obteve pontuação na sua configuração máxima de esforço de raciocínio
• Custo total para concluir o índice — Step 5 Preview $922,84 vs Claude Opus 5 $7.274,74
• Preço combinado em uma mistura 7:2:1 de acerto de cache / entrada / saída — Step 5 Preview US$ 0,51 por 1 milhão de tokens vs Claude Opus 5 US$ 3,85
• Tokens de saída gerados durante a execução do índice — Step 5 Preview 160M vs Claude Opus 5 140M
• Preço de lista — Step 5 Preview US$ 1,00 entrada / US$ 2,70 saída vs. Claude Opus 5 US$ 5,00 entrada / US$ 25,00 saída
Observe as linhas três e cinco em conjunto e a aritmética deixa de ser uma simples comparação de preços. A tarifa combinada do Step 5 Preview é 7,5 vezes mais barata, e o preço de tabela é 5 vezes mais barato na entrada e 9,3 vezes mais barato na saída — ou seja, a combinação está fazendo um trabalho que o preço de entrada não faz. Isso acontece porque a combinação é ponderada em favor da saída, e é justamente na saída que os dois modelos mais divergem. O Claude Opus 5 cobra 9,3 vezes a tarifa de saída do Step 5 Preview, e ambos os modelos escrevem muitíssimo: 140M tokens de saída para o Claude Opus 5, contra uma mediana de 92M entre os modelos que o índice avalia, e 160M para o Step 5 Preview, contra a mesma mediana de 92M.
Portanto, a leitura honesta é mais restrita do que “o modelo barato é uma pechincha”. O Step 5 Preview é mais barato em todos os eixos, e não é um modelo parcimonioso — ele gera 74% mais saída do que o modelo mediano em relação ao qual é medido, que é exatamente o comportamento que o preço deveria punir. O Claude Opus 5 gera 52% mais que a mediana e cobra 9,3 vezes mais por cada um desses tokens. Quem restringe o comprimento da saída obtém uma proporção diferente de quem não restringe.
A questão não é qual é melhor. É onde está o ponto de transição.
Suponha que o índice seja um proxy razoável para o trabalho que você realmente envia — tarefas agênticas de horizonte longo, código, uso de ferramentas em várias etapas. Então o ponto de cruzamento é simples de enunciar: o Claude Opus 5 precisa ser pelo menos 7,9 vezes mais útil por tarefa antes de compensar o seu custo, e, no índice, ele é 7 pontos melhor numa escala de 100 pontos. Esses dois fatos não precisam apontar na mesma direção, porque uma diferença de 7 pontos no índice não equivale a ser 16% melhor em tudo. É o agregado de dez avaliações, e a composição importa mais do que o total.
Esse é o argumento para se importar com a forma das duas pontuações em vez da manchete. A leitura do Step 5 Preview no Terminal-Bench 4.0 é de 33,3% — um resultado agêntico real, à frente do DeepSeek V4.1 Flash com 26,8% — mas nada no registro publicado ainda mostra que ele iguala o Claude Opus 5 nas avaliações de longo horizonte em que o modelo da Anthropic é mais forte. Os próprios materiais da StepFun admitem isso na formulação: no ALE-CLI, FrontierFinance e DRACO, a empresa coloca o Step 5 Preview em segundo lugar, atrás do GPT-6 Astra ou do Claude Opus 5, e à frente dos outros modelos abertos na comparação. O segundo lugar a um quinto do preço é um resultado genuinamente bom. Também não é o primeiro lugar, e as tarefas em que um modelo termina em segundo geralmente são as tarefas que precisavam do primeiro lugar.
A outra assimetria é o que acontece numa chamada ruim. Uma resposta errada de um modelo barato que levou quatro segundos e 2.000 tokens custa a você a nova tentativa; a mesma resposta errada do Claude Opus 5 a 25 dólares por milhão de tokens de saída custa a você a nova tentativa mais a deliberação. Se o seu pipeline tenta novamente em caso de falha — a maioria dos loops de agente faz isso —, o custo efetivo por bem-sucedida tarefa é o número que importa, e ele não tem a mesma proporção que o preço de tabela, porque os dois modelos não vão falhar na mesma taxa. Ninguém publicou esse número para o Step 5 Preview ainda.

O contraste da especificação, dimensão por dimensão
• Pontuação do índice — Step 5 Preview 44 vs Claude Opus 5 51, ambos no Intelligence Index v4.3.2, com o Claude Opus 5 em sua configuração máxima de esforço de raciocínio
• Preço por 1M de tokens — Step 5 Preview US$ 1,00 de entrada / US$ 2,70 de saída vs. Claude Opus 5 US$ 5,00 de entrada / US$ 25,00 de saída
• Desconto de cache — Step 5 Preview 95% vs Claude Opus 5 90%
• Contexto — ambos com 1M de tokens; a StepFun não publicou um limite de saída e o da Anthropic é 128K
• Entrada — ambos aceitam texto e imagens; ambos produzem apenas texto
• Velocidade de saída — Step 5 Preview 99,8 tokens/seg vs Claude Opus 5 55,3 tokens/seg
• Superfície de controle — Step 5 Preview expõe pensamento estendido; Claude Opus 5 substitui temperature e top_p por um seletor adaptativo de esforço de raciocínio
• Pesos — Step 5 Preview encerrado hoje, checkpoint BF16 agendado para 15 de outubro; Claude Opus 5 proprietário do início ao fim
• Evidência independente — ambos avaliados pela Artificial Analysis; as linhas de benchmark agêntico da StepFun são executadas pelo fornecedor e não reproduzidas
Duas linhas merecem uma observação. A diferença de velocidade é real e, na prática, maior do que a tabela sugere: 99,8 tokens por segundo contra 55,3 é um modelo que termina cerca de duas vezes mais rápido na mesma saída, e o tempo até o primeiro token de 2,96 segundos do Step 5 Preview contra os 56,84 segundos do Claude Opus 5 no mesmo quadro é uma ordem de grandeza diferente — embora esse segundo número esteja medindo a configuração de raciocínio de esforço máximo, na qual o modelo delibera antes de emitir qualquer coisa. Não é a latência que uma chamada de produção vê. Em relação ao endpoint padrão, nosso próprio catálogo reporta um tempo até o primeiro token p50 de 6,73 segundos para o Claude Opus 5, que é o número com o qual planejar se você não está pedindo deliberadamente o máximo de deliberação.
A linha de desconto de cache é a que decide silenciosamente cargas de trabalho repetidas, e favorece o Step 5 Preview, 95% a 90%. Um loop de agente que reenvia o mesmo prompt de sistema e contexto de repositório a cada chamada vive quase inteiramente nesse desconto, então uma diferença de cinco pontos se acumula ao longo de uma sessão longa.

Onde o Claude Opus 5 ainda é a única resposta
Nada do que foi dito acima argumenta contra o modelo da Anthropic. Ele custa o que custa porque faz aquilo que o índice tenta medir, e faz isso perto do topo da tabela — 51 no Intelligence Index v4.3.2, sete pontos à frente do Step 5 Preview e ao alcance dos líderes da geração atual. As cargas de trabalho em que uma diferença agregada de 7 pontos subestima a diferença são aquelas sem tolerância para uma resposta de segundo lugar: uma refatoração de várias horas em que o modo de falha é uma mudança sutil de comportamento, um modelo financeiro em que a cadeia de raciocínio tem de ser auditável, uma migração em que uma decisão errada é descoberta uma semana depois. Nesses casos, a nova tentativa não é barata e a deliberação é o produto.
As cargas de trabalho em que a diferença é irrelevante são aquelas construídas a partir de muitas pequenas decisões: etapas de classificação e roteamento, extração, sumarização, arcabouço de teste, as mil chamadas que um agente faz entre as duas chamadas que realmente importam. Nessas, um modelo em 44 que responde na metade do tempo a um quinto do preço de entrada não é uma concessão. É o padrão correto, com o modelo caro reservado para a etapa que tem de estar certa.
Executando a divisão sem executar duas integrações
A versão prática desta comparação é um pipeline em camadas, e o motivo pelo qual as equipes não constroem um é a aquisição, e não a engenharia — dois fornecedores, dois contratos, dois SDKs, duas chaves para rotacionar. O Claude Opus 5 está no nosso catálogo a US$ 5,00 e US$ 25,00, e os modelos de texto mais baratos que você colocaria à frente dele estão no mesmo catálogo, todos atrás de uma única chave para mais de 200 modelos, com o preço de lista do provedor repassado com 0% de markup. O Step 5 Preview não está nessa lista — ele roda na API própria da StepFun e, até que os pesos sejam disponibilizados, esse é o único lugar onde ele roda. Compor o escalonamento em camadas entre os modelos que nós roteamos é uma expressão de DSL de roteamento, e não uma mudança no código — envie as chamadas de rotina para o modelo pequeno, escale para o modelo caro sob uma condição de confiança ou complexidade, e mantenha ambas as etapas atrás do mesmo endpoint.
O failover automático é importante por uma razão específica aqui, e não como um recurso genérico. O Step 5 Preview abriu sua API no dia do anúncio sem pesos publicados e sem frota de serviço divulgada; é um endpoint de pré-visualização com poucos dias de existência, e endpoints de pré-visualização têm restrições de capacidade de uma forma que os maduros não têm. O Claude Opus 5 é servido por muitos provedores independentes, o que é a redundância que uma pré-visualização não pode oferecer. Manter um modelo comprovado como a perna de fallback — do nosso lado, isso significa um modelo de produção do catálogo, não a pré-visualização — é como você obtém um sinal de qualidade real na sua própria carga de trabalho sem fazer com que seu caminho de produção dependa de uma frota que ainda está sendo dimensionada.

A regra de decisão
Se sua carga de trabalho for um pequeno número de tarefas muito difíceis, o Claude Opus 5 não é a opção cara — é a barata, porque a segunda melhor resposta custa mais do que a diferença. Se sua carga de trabalho for um grande número de tarefas comuns, com um pequeno número de tarefas difíceis dentro dela, o Step 5 Preview a US$ 1,00 e US$ 2,70 com 95% de desconto de cache é o padrão mais adequado, e a diferença de 7 pontos é, em grande parte, um erro de arredondamento em trabalho que não precisava disso.
O que mudaria esse cálculo seriam evidências independentes sobre taxas de falha e sobre as linhas agênticas de longo horizonte. Os próprios números da StepFun colocam o modelo em segundo lugar nas avaliações em torno das quais ela construiu seu lançamento, e nenhuma terceira parte os reproduziu. Fique de olho no checkpoint de 15 de outubro para ver duas coisas: se a licença permite o ajuste fino que lhe permitiria fechar uma lacuna de 7 pontos com seus próprios dados, e se a verbosidade se mantém depois que o sufixo preview for removido. O primeiro mudaria a proporção; o segundo já a alterou uma vez.
