Cartão de comparação de duas colunas gerado com o título 'Step 5 Preview vs Intern-S2 Mobius' e o subtítulo 'Um flagship de 600B que você aluga, ou um modelo de raciocínio de 35B que você executa'. O cartão esquerdo, 'Step 5 Preview', traz: AA Index 44 (medido); cerca de 600B no total / 27B ativos; contexto de 1M tokens; US$ 1,00 de entrada / US$ 2,70 de saída por 1M; API de prévia fechada; pesos prometidos para 15 de outubro de 2026. O cartão direito, 'Intern-S2 Mobius', traz: sem pontuação independente; 35B de parâmetros; contexto não publicado; sem preço de API, auto-hospedagem; Apache 2.0 disponível agora; alegado ganho de velocidade de cerca de 4x, não reproduzido. Um rodapé informa: 'Os números do Step 5 Preview são do StepFun e da Artificial Analysis; os números do Intern-S2 Mobius são alegações da InternLM, não reproduzidas.'
Engineering & Research

Step 5 Preview vs. Intern-S2 Mobius: Você precisa de um carro-chefe de 600B ou de um raciocinador rápido de 35B?

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A razão honesta para comparar Step 5 Preview com Intern-S2 Mobius não é que sejam semelhantes. É que são respostas a duas perguntas diferentes do mesmo comprador — a equipe que tem uma carga de trabalho de raciocínio para executar e nenhum apetite para comprar um cluster. Da StepFun, o Step 5 Preview, anunciado em 20 de setembro de 2026, é a resposta grande: aproximadamente 600 bilhões de parâmetros totais, com 27 bilhões ativos, um contexto de 1M de tokens, uma pontuação de 44 no Artificial Analysis Intelligence Index, medida de forma independente, e um preço publicado de US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. Da InternLM, o Intern-S2 Mobius, lançado em 29 de julho de 2026, é a resposta pequena: um modelo de pesos abertos de 35 bilhões de parâmetros, construído sobre a arquitetura Mobius-v0, com pré-treinamento contínuo a partir do Qwen3.5-35B, cuja afirmação central não é capacidade, mas velocidade — aproximadamente 4x de aceleração ponta a ponta em benchmarks de raciocínio em relação à linha de base da qual foi treinado, sem nenhuma pontuação independente de benchmark de qualquer tipo. Um é um carro-chefe que você aluga; o outro é um modelo pequeno que você executa. A comparação é, na verdade, sobre se a carga de trabalho à sua frente justifica mesmo o carro-chefe.

Uma arrumação antes dos números, porque isso consome tempo real das pessoas: a InternLM lançou vários modelos sob a bandeira Intern-S2, e eles não são a mesma coisa. O Intern-S2-397B é o carro-chefe científico multimodal; o Intern-S2 Mobius é o raciocinador eficiente de 35B discutido aqui; um lançamento anterior do Intern-S2 é ainda outro modelo separado. Se você está procurando por "Intern-S2" e caindo em tabelas de benchmark de um modelo 397B, você está lendo sobre um checkpoint diferente.

O que cada modelo realmente afirma

As alegações do Step 5 Preview são as convencionais para um carro-chefe de 2026, e uma delas é verificada de forma independente. A StepFun lista cerca de 600B de parâmetros totais, com 27B ativos, entrada de texto e imagem, uma janela de contexto de 1M tokens e um preço de US$ 1,00/US$ 2,70 por milhão de tokens de entrada e saída. A Artificial Analysis mede-o em 44 em seu Intelligence Index, acima da mediana de 26 de modelos comparáveis, com saída de 87 tokens por segundo contra uma média de 78 e cerca de 160 milhões de tokens de saída gerados em toda a suíte de tarefas do índice, contra uma mediana de 82 milhões — aproximadamente o dobro da pegada típica de verbosidade, o que importa em um modelo cobrado por saída.

A alegação do Intern-S2 Mobius é arquitetural e mais restrita. Seu design separa conhecimento de computação: uma Memória compartilhada globalmente armazena vetores de conhecimento, e vários Raciocinadores consultam e refinam iterativamente estados ocultos em relação a ela, em vez de vincular armazenamento e computação camada por camada como um transformer convencional faz. O benefício declarado pela InternLM é um ganho de velocidade ponta a ponta de aproximadamente 4x em benchmarks de raciocínio em comparação com o Qwen3.5-35B do qual deriva, com pontuações de raciocínio comparáveis ou superiores, além de cadeias de pensamento visíveis mais curtas. O modelo é Apache 2.0, tem entrada de texto e imagem e está disponível para download.

• Escala — Step 5 Preview: cerca de 600B no total, 27B ativos por StepFun vs Intern-S2 Mobius: 35B no total.

• Pontuação independente — Step 5 Preview: 44 no Artificial Analysis Intelligence Index vs Intern-S2 Mobius: nenhuma publicada por terceiros.

• Velocidade — Step 5 Preview: 87 tokens de saída por segundo contra uma média de 78, medidos pelo index board vs Intern-S2 Mobius: "quase 4x" em relação à sua própria linha de base Qwen3.5-35B, relatado pelo fornecedor e não reproduzido.

• Janela de contexto — Step 5 Preview: 1M de tokens por StepFun vs Intern-S2 Mobius: nenhum número independente de contexto publicado.

• Preço — Step 5 Preview: US$ 1,00 de entrada / US$ 2,70 de saída por milhão de tokens vs. Intern-S2 Mobius: sem preço de API; você paga pelo hardware.

• Licença e acesso — Step 5 Preview: pré-visualização fechada através da API do fornecedor, pesos BF16 prometidos para 15 de outubro de 2026 vs. Intern-S2 Mobius: pesos Apache 2.0 disponíveis agora.

• Verbosidade — Prévia do Step 5: cerca de 160M tokens de saída em toda a suíte de índices contra uma mediana de 82M, segundo o quadro de índices vs. Intern-S2 Mobius: traços de raciocínio visíveis mais curtos alegados pela InternLM, não medidos por mais ninguém.

A afirmação de 4x, e por que esse é o número interessante aqui

Leia os números dos dois fornecedores lado a lado e a discrepância é óbvia: o número principal da StepFun é uma pontuação de capacidade; o da InternLM é um multiplicador de vazão. Isso não é coincidência, e é a coisa mais útil nesta comparação. Uma aceleração ponta a ponta de 4x em tarefas de raciocínio, se sobreviver ao contato com o harness de outra pessoa, vale mais para uma implantação de alto volume do que alguns pontos em um índice — muda a aritmética de executar a carga de trabalho. O Intern-S2 Mobius mira equipes cujo gargalo é tokens por segundo por dólar, não a capacidade máxima.

A ressalva é que o multiplicador é medido em relação ao Qwen3.5-35B, o modelo a partir do qual o Intern-S2 Mobius passou por pré-treinamento contínuo, e que nunca teve o treinamento Mobius. Isso é uma comparação com o seu próprio ponto de partida, e não com um rival. Não há reprodução independente da alegação de throughput, nenhuma pontuação de índice de terceiros e nenhuma janela de contexto publicada por ninguém além do fornecedor. Trate "quase 4x" como um sinal arquitetural interessante e uma hipótese a ser testada no seu próprio harness, não como uma especificação.

O Step 5 Preview tem o perfil de evidências oposto. Seu número de capacidade é medido de forma independente; sua história de eficiência é a parte fraca. A leitura de verbosidade do painel de índices — cerca de 160 milhões de tokens de saída, enquanto o modelo mediano emite cerca de 82 milhões — é o contrapeso honesto para um preço de saída de US$ 2,70, e significa que uma carga de trabalho que depende de gerações estruturadas longas gastará substancialmente mais do que o preço de etiqueta sugere. O que ele tem que o Intern-S2 Mobius não tem é um preço de API publicado, e é isso que o torna comparável em primeiro lugar.

O repositório do Hugging Face para o build prometido do fornecedor conta a outra metade da história: é assim que se parece um lançamento de pesos abertos quando já foi anunciado, mas ainda não foi disponibilizado.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

Onde a questão da pegada realmente pesa

A verdadeira vantagem do Intern-S2 Mobius não está na sua pontuação, que ninguém mediu, mas no que custa estar errado sobre ele. Trinta e cinco bilhões de parâmetros é um porte que uma equipe consegue servir em hardware que já possui, avaliar sem um pedido de compra e abandonar sem dar baixa em nada. Essa é uma vantagem estrutural que o carro-chefe não consegue igualar, por mais pontos que marque, e é a razão pela qual vale a pena fazer esta comparação, em vez de descartá-la como um confronto desigual.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

A vantagem do carro-chefe é a imagem espelhada. O contexto de 1M tokens do Step 5 Preview, a entrada de imagens e a capacidade medida de raciocínio geral cobrem trabalho que um modelo de 35B provavelmente não cobriria bem, e não custa nada experimentar durante uma janela gratuita — o modelo esteve gratuito em três superfícies de desenvolvedor distintas durante outubro. Nenhum desses fatos está disponível para um modelo auto-hospedado: não há semana gratuita para rodar suas próprias GPUs, e não há tabela de preços que converta a decisão em um item de linha.

Se você quer que a comparação sobreviva para além da janela promocional, o que se deve construir é um harness, e não uma preferência. O OrcaRouter encaminha mais de 200 modelos por trás de uma única chave de API e de uma única fatura, com 0% de markup e o preço de lista do provedor repassado integralmente, com failover automático e uma DSL de roteamento para direcionar o tráfego por custo, latência ou capacidade. Nem o Step 5 Preview nem o Intern-S2 Mobius estão nesse catálogo — o carro-chefe da StepFun não é roteado por nós, e o Intern-S2 Mobius é um download para auto-hospedagem —, então o valor aqui não é o acesso a nenhum dos dois. É que os modelos com os quais você vai compará-los estão a uma chave de distância, e uma decisão tomada por medição se move junto com as evidências, e não com um post de lançamento.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Como decidir

Se a sua carga de trabalho for agêntica, multimodal, de contexto longo ou aberta — do tipo em que você não consegue enumerar as tarefas de antemão —, o carro-chefe é a resposta, e o Step 5 Preview é uma instância razoável dele: medido, precificado, barato para pilotar e reversível por token. Apenas reserve orçamento para a verbosidade, e não para a tarifa anunciada.

Se sua carga de trabalho é estreita, repetitiva e de raciocínio em alto volume sobre dados que precisam permanecer dentro do seu perímetro, o modelo pequeno é a resposta, e o Intern-S2 Mobius é um candidato genuíno justamente porque é pequeno: ele roda no hardware que você já tem, tem licença Apache 2.0, e a alegação de velocidade, se se confirmar, é o tipo de coisa que decide uma questão de economia unitária. Entre sabendo que você está testando a alegação do fornecedor, em vez de herdar o veredito de outra pessoa.

O erro é tratar a escolha como permanente. Compre primeiro a avaliação do modelo pequeno, porque é o experimento barato; alugue o modelo principal para as tarefas em que o modelo pequeno falha, porque esse é o reparo barato. Equipes que mantêm as duas opções vivas na mesma chave e no mesmo harness acabam tomando essa decisão com os próprios dados, e essa é a única versão dela que se sustenta quando qualquer um dos fornecedores lança um sucessor.