
Step 5 Preview vs. Intern-S2 Mobius: Você precisa de um carro-chefe de 600B ou de um raciocinador rápido de 35B?
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
A razão honesta para comparar Step 5 Preview com Intern-S2 Mobius não é que sejam semelhantes. É que são respostas a duas perguntas diferentes do mesmo comprador — a equipe que tem uma carga de trabalho de raciocínio para executar e nenhum apetite para comprar um cluster. Da StepFun, o Step 5 Preview, anunciado em 20 de setembro de 2026, é a resposta grande: aproximadamente 600 bilhões de parâmetros totais, com 27 bilhões ativos, um contexto de 1M de tokens, uma pontuação de 44 no Artificial Analysis Intelligence Index, medida de forma independente, e um preço publicado de US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. Da InternLM, o Intern-S2 Mobius, lançado em 29 de julho de 2026, é a resposta pequena: um modelo de pesos abertos de 35 bilhões de parâmetros, construído sobre a arquitetura Mobius-v0, com pré-treinamento contínuo a partir do Qwen3.5-35B, cuja afirmação central não é capacidade, mas velocidade — aproximadamente 4x de aceleração ponta a ponta em benchmarks de raciocínio em relação à linha de base da qual foi treinado, sem nenhuma pontuação independente de benchmark de qualquer tipo. Um é um carro-chefe que você aluga; o outro é um modelo pequeno que você executa. A comparação é, na verdade, sobre se a carga de trabalho à sua frente justifica mesmo o carro-chefe.
Uma arrumação antes dos números, porque isso consome tempo real das pessoas: a InternLM lançou vários modelos sob a bandeira Intern-S2, e eles não são a mesma coisa. O Intern-S2-397B é o carro-chefe científico multimodal; o Intern-S2 Mobius é o raciocinador eficiente de 35B discutido aqui; um lançamento anterior do Intern-S2 é ainda outro modelo separado. Se você está procurando por "Intern-S2" e caindo em tabelas de benchmark de um modelo 397B, você está lendo sobre um checkpoint diferente.
O que cada modelo realmente afirma
As alegações do Step 5 Preview são as convencionais para um carro-chefe de 2026, e uma delas é verificada de forma independente. A StepFun lista cerca de 600B de parâmetros totais, com 27B ativos, entrada de texto e imagem, uma janela de contexto de 1M tokens e um preço de US$ 1,00/US$ 2,70 por milhão de tokens de entrada e saída. A Artificial Analysis mede-o em 44 em seu Intelligence Index, acima da mediana de 26 de modelos comparáveis, com saída de 87 tokens por segundo contra uma média de 78 e cerca de 160 milhões de tokens de saída gerados em toda a suíte de tarefas do índice, contra uma mediana de 82 milhões — aproximadamente o dobro da pegada típica de verbosidade, o que importa em um modelo cobrado por saída.
A alegação do Intern-S2 Mobius é arquitetural e mais restrita. Seu design separa conhecimento de computação: uma Memória compartilhada globalmente armazena vetores de conhecimento, e vários Raciocinadores consultam e refinam iterativamente estados ocultos em relação a ela, em vez de vincular armazenamento e computação camada por camada como um transformer convencional faz. O benefício declarado pela InternLM é um ganho de velocidade ponta a ponta de aproximadamente 4x em benchmarks de raciocínio em comparação com o Qwen3.5-35B do qual deriva, com pontuações de raciocínio comparáveis ou superiores, além de cadeias de pensamento visíveis mais curtas. O modelo é Apache 2.0, tem entrada de texto e imagem e está disponível para download.
• Escala — Step 5 Preview: cerca de 600B no total, 27B ativos por StepFun vs Intern-S2 Mobius: 35B no total.
• Pontuação independente — Step 5 Preview: 44 no Artificial Analysis Intelligence Index vs Intern-S2 Mobius: nenhuma publicada por terceiros.
• Velocidade — Step 5 Preview: 87 tokens de saída por segundo contra uma média de 78, medidos pelo index board vs Intern-S2 Mobius: "quase 4x" em relação à sua própria linha de base Qwen3.5-35B, relatado pelo fornecedor e não reproduzido.
• Janela de contexto — Step 5 Preview: 1M de tokens por StepFun vs Intern-S2 Mobius: nenhum número independente de contexto publicado.
• Preço — Step 5 Preview: US$ 1,00 de entrada / US$ 2,70 de saída por milhão de tokens vs. Intern-S2 Mobius: sem preço de API; você paga pelo hardware.
• Licença e acesso — Step 5 Preview: pré-visualização fechada através da API do fornecedor, pesos BF16 prometidos para 15 de outubro de 2026 vs. Intern-S2 Mobius: pesos Apache 2.0 disponíveis agora.
• Verbosidade — Prévia do Step 5: cerca de 160M tokens de saída em toda a suíte de índices contra uma mediana de 82M, segundo o quadro de índices vs. Intern-S2 Mobius: traços de raciocínio visíveis mais curtos alegados pela InternLM, não medidos por mais ninguém.
A afirmação de 4x, e por que esse é o número interessante aqui
Leia os números dos dois fornecedores lado a lado e a discrepância é óbvia: o número principal da StepFun é uma pontuação de capacidade; o da InternLM é um multiplicador de vazão. Isso não é coincidência, e é a coisa mais útil nesta comparação. Uma aceleração ponta a ponta de 4x em tarefas de raciocínio, se sobreviver ao contato com o harness de outra pessoa, vale mais para uma implantação de alto volume do que alguns pontos em um índice — muda a aritmética de executar a carga de trabalho. O Intern-S2 Mobius mira equipes cujo gargalo é tokens por segundo por dólar, não a capacidade máxima.
A ressalva é que o multiplicador é medido em relação ao Qwen3.5-35B, o modelo a partir do qual o Intern-S2 Mobius passou por pré-treinamento contínuo, e que nunca teve o treinamento Mobius. Isso é uma comparação com o seu próprio ponto de partida, e não com um rival. Não há reprodução independente da alegação de throughput, nenhuma pontuação de índice de terceiros e nenhuma janela de contexto publicada por ninguém além do fornecedor. Trate "quase 4x" como um sinal arquitetural interessante e uma hipótese a ser testada no seu próprio harness, não como uma especificação.
O Step 5 Preview tem o perfil de evidências oposto. Seu número de capacidade é medido de forma independente; sua história de eficiência é a parte fraca. A leitura de verbosidade do painel de índices — cerca de 160 milhões de tokens de saída, enquanto o modelo mediano emite cerca de 82 milhões — é o contrapeso honesto para um preço de saída de US$ 2,70, e significa que uma carga de trabalho que depende de gerações estruturadas longas gastará substancialmente mais do que o preço de etiqueta sugere. O que ele tem que o Intern-S2 Mobius não tem é um preço de API publicado, e é isso que o torna comparável em primeiro lugar.
O repositório do Hugging Face para o build prometido do fornecedor conta a outra metade da história: é assim que se parece um lançamento de pesos abertos quando já foi anunciado, mas ainda não foi disponibilizado.

Onde a questão da pegada realmente pesa
A verdadeira vantagem do Intern-S2 Mobius não está na sua pontuação, que ninguém mediu, mas no que custa estar errado sobre ele. Trinta e cinco bilhões de parâmetros é um porte que uma equipe consegue servir em hardware que já possui, avaliar sem um pedido de compra e abandonar sem dar baixa em nada. Essa é uma vantagem estrutural que o carro-chefe não consegue igualar, por mais pontos que marque, e é a razão pela qual vale a pena fazer esta comparação, em vez de descartá-la como um confronto desigual.

A vantagem do carro-chefe é a imagem espelhada. O contexto de 1M tokens do Step 5 Preview, a entrada de imagens e a capacidade medida de raciocínio geral cobrem trabalho que um modelo de 35B provavelmente não cobriria bem, e não custa nada experimentar durante uma janela gratuita — o modelo esteve gratuito em três superfícies de desenvolvedor distintas durante outubro. Nenhum desses fatos está disponível para um modelo auto-hospedado: não há semana gratuita para rodar suas próprias GPUs, e não há tabela de preços que converta a decisão em um item de linha.
Se você quer que a comparação sobreviva para além da janela promocional, o que se deve construir é um harness, e não uma preferência. O OrcaRouter encaminha mais de 200 modelos por trás de uma única chave de API e de uma única fatura, com 0% de markup e o preço de lista do provedor repassado integralmente, com failover automático e uma DSL de roteamento para direcionar o tráfego por custo, latência ou capacidade. Nem o Step 5 Preview nem o Intern-S2 Mobius estão nesse catálogo — o carro-chefe da StepFun não é roteado por nós, e o Intern-S2 Mobius é um download para auto-hospedagem —, então o valor aqui não é o acesso a nenhum dos dois. É que os modelos com os quais você vai compará-los estão a uma chave de distância, e uma decisão tomada por medição se move junto com as evidências, e não com um post de lançamento.

Como decidir
Se a sua carga de trabalho for agêntica, multimodal, de contexto longo ou aberta — do tipo em que você não consegue enumerar as tarefas de antemão —, o carro-chefe é a resposta, e o Step 5 Preview é uma instância razoável dele: medido, precificado, barato para pilotar e reversível por token. Apenas reserve orçamento para a verbosidade, e não para a tarifa anunciada.
Se sua carga de trabalho é estreita, repetitiva e de raciocínio em alto volume sobre dados que precisam permanecer dentro do seu perímetro, o modelo pequeno é a resposta, e o Intern-S2 Mobius é um candidato genuíno justamente porque é pequeno: ele roda no hardware que você já tem, tem licença Apache 2.0, e a alegação de velocidade, se se confirmar, é o tipo de coisa que decide uma questão de economia unitária. Entre sabendo que você está testando a alegação do fornecedor, em vez de herdar o veredito de outra pessoa.
O erro é tratar a escolha como permanente. Compre primeiro a avaliação do modelo pequeno, porque é o experimento barato; alugue o modelo principal para as tarefas em que o modelo pequeno falha, porque esse é o reparo barato. Equipes que mantêm as duas opções vivas na mesma chave e no mesmo harness acabam tomando essa decisão com os próprios dados, e essa é a única versão dela que se sustenta quando qualquer um dos fornecedores lança um sucessor.
