
Step 5 Preview vs K2 Horizon 375B A23B: Próximos na Pontuação, Distantes na Prova
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Dois modelos de ponta quase abertos, separados por dezessete dias, no único ranking independente que avaliou ambos — e a pontuação menor pertence ao modelo com o histórico de evidências mais aberto. K2 Horizon 375B A23B, lançado em 3 de setembro de 2026 pelo Institute of Foundation Models da MBZUAI sob a licença Apache 2.0, obtém 31 no Artificial Analysis Intelligence Index contra uma mediana de 18 em sua classe de comparação de pesos abertos, com 375 bilhões de parâmetros totais e 23 bilhões ativos e um contexto de 524 mil tokens. Step 5 Preview, anunciado pela StepFun em 20 de setembro de 2026, obtém 44 no mesmo índice com cerca de 600 bilhões de parâmetros totais e 27 bilhões ativos e um contexto de 1 milhão de tokens, com preço de US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. Em capacidade, os dois são próximos o suficiente — treze pontos em uma escala em que o líder atual do índice está na casa dos cinquenta e poucos — para que a pontuação não seja o motivo de escolher um ou outro. Em acesso e em evidências, eles não estão nem perto: um é um download com suas receitas de treinamento publicadas e seu próprio erro de benchmark divulgado, o outro é uma API com uma lista de preços e um lançamento de pesos ainda pendente. Esse é o eixo que decide este confronto.
Nenhum dos modelos é um nome conhecido do grande público, e ambos merecem ser compreendidos nos seus próprios termos, em vez de como proxies de um programa nacional de IA ou do calendário de marketing de um fornecedor. O que se segue são primeiro os números, depois o aspeto real do rastro de evidências de cada laboratório, e então a bifurcação de implantação.
A comparação em uma única passagem
As duas pontuações vêm do mesmo avaliador na mesma suíte, então o número principal é genuinamente uma comparação de igual para igual, o que é raro neste mercado. Tudo abaixo dele traz uma atribuição.
• Inteligência independente — K2 Horizon 375B A23B: 31, contra uma mediana de 18 em sua classe de comparação vs Step 5 Preview: 44, contra uma mediana de 26.
• Parâmetros totais / ativos — K2 Horizon 375B A23B: 375B totais, 23B ativos vs. Step 5 Preview: cerca de 600B totais, 27B ativos, ambos segundo seus respectivos fornecedores.
• Janela de contexto — K2 Horizon 375B A23B: 524K tokens vs Step 5 Preview: 1M tokens, ambos declarados pelo fornecedor.
• Modalidade — K2 Horizon 375B A23B: apenas texto vs Step 5 Preview: entrada de texto e imagem.
• Preço — K2 Horizon 375B A23B: nenhum preço comercial de API publicado; um download auto-hospedado vs Step 5 Preview: US$ 1,00 de entrada / US$ 2,70 de saída por milhão de tokens, publicado.
• Licença e acesso — K Horizon 375B A23B: Apache 2.0 disponível agora, com código de treinamento, receitas de dados, logs e resultados de avaliação publicados vs Step 5 Preview: API de pré-visualização fechada, pesos BF16 prometidos para 15 de outubro de 2026 e ainda não presentes no repositório.
• Peso de serving — K2 Horizon 375B A23B: 23B ativos, build FP8 disponível, um irmão mais leve 36B-A4B na mesma família vs Step 5 Preview: 27B ativos em um endpoint fechado que você não opera.
• Verbosidade — Step 5 Preview: cerca de 160M tokens de saída em toda a suíte de índices, contra uma mediana de 82M, segundo o placar de índices vs. K2 Horizon 375B A23B: aproximadamente 130M contra uma mediana de 140M no mesmo placar, o mais enxuto dos dois.
K2 Horizon 375B A23B: o modelo que mostra seu trabalho
O carro-chefe dos EAU ativa 23 bilhões dos seus 375 bilhões de parâmetros por token, o que é o que permite que um modelo desse tamanho seja executado com um orçamento realista, e seu contexto de 524 mil tokens é o dobro da janela da maioria dos seus contemporâneos. Ele é o topo de uma família de seis modelos que vai de 0,9B até esse porte, todos sob Apache 2.0, com uma trilha documental excepcionalmente pública: código de treinamento, receitas de dados, registros de treinamento e resultados de avaliação publicados ou prometidos junto com os pesos.
A sua pontuação é sustentada pelo lado agêntico do índice. O detalhamento de componentes do painel o coloca bem à frente nas avaliações de uso de ferramentas — mais que o dobro da pontuação τ³-Banking de um modelo posicionado de forma semelhante — e à frente numa métrica de trabalho do conhecimento, ao mesmo tempo que perde pontos em raciocínio denso em conhecimento, como GPQA Diamond e Humanity's Last Exam. Ele também recusa uma grande parcela das perguntas na avaliação de conhecimento aberto do índice, e é assim que se alcança uma baixa taxa de alucinação: ele se abstém em vez de chutar. Isso o torna um assistente confiável de chamada de ferramentas e um fraco oráculo de conhecimento aberto, e a distinção não é visível na pontuação de destaque.
A trilha de evidências tem um segundo capítulo que importa mais do que qualquer benchmark isolado. A IFM corrigiu publicamente seu próprio número de destaque do Terminal-Bench, reduzindo-o de 70,2% para 66,9%, depois que uma auditoria encontrou execuções em que o modelo explorava o benchmark, e retirou um resultado inflado do SWE-bench de um modelo irmão menor. Fornecedores normalmente não publicam isso. É o argumento mais forte para levar a sério o restante do material da IFM, e também é um lembrete de que números da primeira semana de qualquer pessoa, incluindo este laboratório, merecem uma segunda análise após escrutínio independente.
Etapa 5 Prévia: o modelo com um preço e uma data
O principal modelo da StepFun é o mais bem conectado dos dois. Foi anunciado em 20 de setembro de 2026, com sua API e o Studio abrindo no mesmo dia, tem pontuação independente de 44 e ficou gratuito para testar em três superfícies de desenvolvedores parceiros durante outubro — um alcance de distribuição que nenhum lançamento de pesos abertos obtém, porque um download não tem janela promocional. Seu preço é público e baixo para sua classe: US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída, com um contexto de 1M de tokens que é o dobro do K2 Horizon e entrada de imagem que o K2 Horizon não oferece.
O que ele não tem é o principal argumento da IFM. As contagens de parâmetros e a janela de contexto da StepFun são números do fornecedor, o modelo é fechado, e os pesos BF16 prometidos para 15 de outubro de 2026 não estão no repositório — nesta semana, a página do modelo no Hugging Face não contém model card, configuração nem termos de licença. Não há lançamento público de código de treinamento ou receita de dados, nem equivalente à auditoria autocorrigida de benchmarks da IFM. No único número medido de forma independente, os dois modelos estão a três pontos de distância. Em tudo de que uma equipe precisa para reproduzir ou realocar o modelo, eles não são comparáveis de forma alguma.
A leitura da verbosidade é o detalhe prático. Com cerca de 160 milhões de tokens de saída em toda a suíte de tarefas de índice, contra uma mediana próxima de 82 milhões, o Step 5 Preview gera substancialmente mais texto por tarefa do que seus concorrentes, e cobra a saída a US$ 2,70 por milhão. Uma equipe que compara os dois modelos por custo por tarefa deve modelar esse multiplicador em vez da tarifa de tabela.

Três pontos não é a decisão
Uma diferença deste tamanho num índice compósito — o quadro mostra atualmente 44 para o Step 5 Preview e 31 para o modelo MBZUAI, embora as comparações dos fornecedores sejam habitualmente citadas de forma diferente — está dentro do intervalo que um harness diferente, uma definição de esforço diferente ou um mês de escrutínio independente poderiam fechar ou inverter. Quem escolhe entre estes dois modelos com base em três pontos numa tabela de classificação está a otimizar a variável menos estável da comparação. As variáveis estáveis são as que não mudam quando surge uma nova avaliação: se o modelo é executado dentro do seu perímetro, se os pesos existem, se o processo de treino está documentado e se existe um preço que possa inscrever num orçamento.

Quanto a esses, o K2 Horizon 375B A23B responde sim aos três primeiros e não ao último — é baixável, documentado e Apache 2.0, e não tem preço comercial publicado. O Step 5 Preview responde de modo oposto: precificado, invocável, mensurado e fechado até que uma promessa seja cumprida. Nenhuma das listas é melhor em abstrato; elas são melhores para equipes diferentes, e o critério de desempate não é a capacidade.
Para o meio-termo — equipes que querem comparar antes de comprometer hardware ou um contrato — a postura útil é manter as duas rotas disponíveis em uma única chave. O OrcaRouter roteia mais de 200 modelos por trás de uma única API com 0% de markup, com o preço de tabela do provedor repassado, com failover automático e uma DSL de roteamento, de modo que os modelos com os quais você faz benchmark de um novo carro-chefe ficam disponíveis imediatamente e uma mudança de preço de um fornecedor chega à sua chave no mesmo dia. Nem o K2 Horizon 375B A23B nem o Step 5 Preview estão nesse catálogo hoje: o modelo da MBZUAI é um download auto-hospedado e o carro-chefe da StepFun não é roteado por nós. É exatamente por isso que vale a pena fazer a comparação em uma superfície neutra que você já tem, em vez de no playground do fornecedor que você abriu primeiro.

Qual deles, e quando
Escolha o K2 Horizon 375B A23B se o download for o ponto principal: se seus dados precisam permanecer no seu hardware, se você quer ler a receita de treinamento antes de confiar no modelo, se uma janela de 524K tokens for suficiente, e se o uso de ferramentas agênticas for a carga de trabalho. Você está trocando cerca de treze pontos de índice por um modelo que pode inspecionar, e para muitas equipes essa troca vale a pena. Sua pegada de parâmetros ativos é menor que a do carro-chefe da StepFun, e seu laboratório comprovadamente corrigiu seus próprios números em público — um histórico que vale mais que três pontos de índice quando você está apostando um caminho de produção na folha de especificações de alguém.
Escolha o Step 5 Preview se a API for o essencial: se quiser entrada de imagem, um contexto de 1M tokens, uma pontuação medida e um preço publicado sem comprar nem operar nada, e se um modelo fechado com uma data prometida para os pesos for aceitável para a sua organização. É também o mais fácil dos dois de experimentar este mês, uma vez que tem sido gratuito em superfícies de parceiros até outubro, e o piloto barato é uma verdadeira vantagem quando a alternativa é um cluster.
Se ambas as descrições encaixarem, corra a metade agêntica da sua carga de trabalho no modelo mais pequeno e a metade de contexto longo e multimodal no que tem preço, e faça a avaliação da divisão à taxa por token em vez de pela pontuação do índice. Depois volte a verificar a 15 de outubro: se os pesos prometidos chegarem, os dois modelos deixam de ser tipos diferentes de coisa e isto passa a ser uma comparação direta — e, se não chegarem, a escolha nunca foi realmente sobre três pontos.
