
Step 5 Preview vs A.X-K2: Um Modelo de API de 600B Contra um Download de 690B
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Step 5 Preview e A.X-K2 são as duas metades de uma decisão que não para de surgir neste outono: alugar um modelo de ponta de uma API ou levar para casa um carro-chefe de pesos abertos e executá-lo você mesmo. O Step 5 Preview da StepFun é o aluguel — anunciado em 20 de setembro de 2026, chamável no mesmo dia a US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída, aproximadamente 600 bilhões de parâmetros totais com 27 bilhões ativos, um contexto de 1M de tokens e uma pontuação independente de 44 no Índice de Inteligência da Artificial Analysis. O A.X-K2 da SK Telecom é o download — lançado em 12 de agosto de 2026 sob a licença Apache 2.0, aproximadamente 688 a 692 bilhões de parâmetros totais com 33 bilhões ativos, um contexto de 262K tokens e uma pontuação de 21 no índice. Um é maior, o outro tem preço definido, e o que tem preço definido é o que pontua muito mais alto. Essa inversão é toda a comparação, e vale a pena entendê-la antes de escolher um lado por princípio.
O enquadramento habitual para estes dois modelos é nacional: o carro-chefe de IA soberana da Coreia contra um dos laboratórios mais agressivos da China. Esse enquadramento não é útil para uma decisão de implantação. O que é útil é que o A.X-K2 é o único do par que você pode manter, e o Step 5 Preview é o único do par que você pode comprar por token. Todo o resto decorre dessa divisão.
Os números, vinculados às suas fontes
A única medição em bases realmente iguais é o Intelligence Index, e ele é independente dos dois lados: 44 para o Step 5 Preview contra uma mediana de 26 entre modelos comparáveis, e 21 para o A.X-K2 contra uma mediana de 18 em sua classe de comparação de pesos abertos, ambos medidos pelo mesmo terceiro, na mesma escala. Lidos no momento da redação, esses são os números de hoje — as pontuações neste índice mudam quando o avaliador recalibra, e uma leitura anterior da mesma página do A.X-K2 mostrava um número mais alto. Todo o resto nesta comparação vem com uma atribuição que você precisa carregar junto.
• Inteligência independente — Step 5 Preview: 44 no Artificial Analysis Intelligence Index vs A.X-K2: 21 no mesmo índice, medidos de forma independente.
• Parâmetros totais / ativos — Step 5 Preview: cerca de 600B no total, 27B ativos segundo a StepFun vs. A.X-K2: cerca de 688–692B no total, 33B ativos de acordo com materiais da SK Telecom e o cartão de índice.
• Janela de contexto — Prévia do Step 5: 1M de tokens por StepFun vs A.X-K2: 262K tokens.
• Modalidade — Step 5 Preview aceita texto e imagem; A.X-K2 é somente texto.
• Preço — Step 5 Preview: US$ 1,00 por milhão de entrada e US$ 2,70 por milhão de saída, publicados pelo fornecedor vs A.X-K2: nenhum preço comercial de API publicado.
Onde é executado — Step 5 Preview: a própria API e o Studio da StepFun, além de superfícies de parceiros durante janelas promocionais vs. A.X-K2: seu hardware, a partir de um download.
Lançamento — Step 5 Preview anunciado em 20 de setembro de 2026 vs A.X-K2 lançado em 12 de agosto de 2026.
• Licença — Step 5 Preview: pré-visualização fechada com pesos BF16 prometidos para 15 de outubro de 2026 vs A.X-K2: Apache 2.0.
A.X-K2: o instrumento mais pesado, com a evidência mais frágil
A SK Telecom construiu o A.X-K2 como sucessor do A.X K1, e a arquitetura é voltada diretamente para o custo de contexto longo: uma configuração de mistura de especialistas com 256 especialistas e 8 ativos por token, treinada nativamente em FP8, com um mecanismo que a empresa chama de Sparse Gated Attention. Trata-se de um trabalho de engenharia sério, e é a razão pela qual um modelo com quase 700 bilhões de parâmetros totais consegue ser servido por uma organização que não é uma hyperscaler.
O que ele não tem é confirmação independente. A SK Telecom relata um ganho médio de 32,2 pontos em catorze benchmarks sobre o A.X K1, um salto de cerca de 83,9 pontos em avaliações de contexto longo e de agentes, 97,1 no AIME 2026, 80,5 no benchmark de conhecimento coreano KMMLU-Pro e 91,6 no CLIcK, e afirma que iguala ou supera lançamentos recentes do Qwen e do DeepSeek em matemática e trabalhos em língua coreana. Cada um desses é um número do próprio fornecedor. A pontuação independente — 21 no Intelligence Index — supera a mediana de 18 de sua classe de comparação de pesos abertos, mas fica vinte e três pontos abaixo do Step 5 Preview, e o conjunto de pontos fortes do A.X-K2 é onde esse índice específico não pesa muito: suas nove avaliações são em grande parte em inglês, centradas em raciocínio e agentes, e nem uma delas é um benchmark de língua coreana.
Nada disso torna o A.X-K2 um modelo pior do que sua pontuação. Isso faz de sua pontuação um limite inferior daquilo que ele entrega para uma carga de trabalho em coreano ou intensiva em matemática, segundo a palavra do fornecedor, até que um laboratório independente publique essas avaliações. O lado do custo é mais concreto: uma implantação de referência dessa classe de peso precisa de quatro GPUs da classe B300 e cerca de 656 GiB em FP8. Esse é o preço do download e, ao contrário de uma conta de tokens, não volta a diminuir quando o experimento termina.
Prévia da Etapa 5: aquela que você pode experimentar por HTTP hoje
A vantagem do Step 5 Preview não é ser maior ou mais aberto — não é nenhuma das duas coisas —, mas sim ter preço definido, ser invocável e ter pontuação independente, além de ter sido gratuito para testar em três superfícies de parceiros em outubro. Para uma equipe que está avaliando em vez de hospedar por conta própria, essa combinação vale mais do que uma licença Apache 2.0, porque converte uma decisão de hardware em uma chamada de API. O registro da StepFun sobre o modelo é escasso nos pontos habituais, porém: o par de parâmetros 600B/27B e o contexto de 1M de tokens são números do próprio fornecedor, os pesos prometidos ainda não foram disponibilizados, e o dado mais útil do conselho independente sobre ele provavelmente não é a pontuação de 44, mas sim a verbosidade — cerca de 160 milhões de tokens de saída gerados ao longo da suíte de tarefas do índice, contra uma mediana próxima de 82 milhões —, e o A.X-K2 está ainda mais distante, com cerca de 230 milhões contra uma mediana de 140 milhões. Em um modelo que cobra US$ 2,70 por milhão de tokens de saída, essa lacuna é a diferença entre uma avaliação barata e um hábito de produção caro.
Por que o modelo maior obtém uma pontuação mais baixa
Contagens de parâmetros não são pontos, e este emparelhamento demonstra isso de forma clara. Os ~300 bilhões de parâmetros totais extras do A.X-K2 proporcionam densidade que aparece nos pontos em que sua própria suíte de avaliação recompensa — profundidade em coreano, matemática, conhecimento amplo — enquanto o índice no qual ambos os modelos aparecem é majoritariamente em inglês, com forte ênfase em raciocínio e centrado em agentes, onde os criadores do Step 5 Preview parecem ter ajustado deliberadamente. O design com 27B ativos também torna o modelo da StepFun consideravelmente mais barato de servir em qualquer taxa de transferência dada, e é por isso que existe um preço de serviço hospedado.
Há uma segunda leitura, menos lisonjeira, que aponta no sentido oposto. O A.X-K2 está disponível desde 12 de agosto e o Step 5 Preview desde 20 de setembro; o modelo mais recente tem menos semanas de escrutínio independente, e o seu 44 ainda pode mudar à medida que chegam mais avaliações. Ambos os números são provisórios, tal como são provisórias as pontuações do primeiro trimestre de qualquer modelo. A diferença é que a pontuação provisória do A.X-K2 é a melhor evidência de que alguém fora da SK Telecom dispõe, ao passo que a pontuação provisória do Step 5 Preview assenta numa ficha de especificações do fabricante que um terceiro reproduziu, pelo menos em parte.
A economia de serving, que é onde a decisão realmente reside
Se o puder chamar, paga 1,00 $ de entrada e 2,70 $ de saída por milhão de tokens e fica pronto — sem aquisição, sem GPUs, sem operações. Se o descarregar, paga o hardware, a energia, o trabalho de quantização e a estrutura de avaliação, e mantém os seus prompts e os seus dados dentro do seu próprio perímetro. O A.X-K2 com 33B ativos não é um modelo de portátil; a configuração de referência é um pequeno cluster. A pré-visualização fechada do Step 5 Preview não oferece perímetro nenhum até 15 de outubro, quando os pesos BF16 forem prometidos — e até que esses ficheiros apareçam no repositório, essa data é um compromisso e não uma opção.

Este é o ponto em que uma camada de roteamento justifica o seu lugar em vez de apenas se autopromover. A maioria das equipas não quer responder a "alugar ou comprar" uma vez e para sempre; quer saber o que um modelo faz com o seu tráfego antes de comprar hardware para ele e, depois, manter a capacidade de mudar se a resposta se alterar. A OrcaRouter não encaminha o Step 5 Preview nem o A.X-K2 — ambos estão fora do nosso catálogo atualmente. O que faz é colocar mais de 200 modelos por trás de uma única chave de API e de uma única fatura, com 0% de margem e o preço de tabela do fornecedor repercutido, para que o conjunto de comparação com que testa qualquer um dos novos modelos de topo seja o conjunto que pode chamar esta tarde, e o failover automático mantém um caminho de produção vivo enquanto ainda está a decidir.


Qual escolher
Escolha o Step 5 Preview se sua carga de trabalho for raciocínio geral, codificação agêntica ou qualquer coisa com contexto longo, se você quiser pagar por token em vez de comprar silício, e se a entrada de imagens importar — ele vence na pontuação independente, no comprimento de contexto, na latência até a primeira resposta e na variedade de modalidades, e é o único dos dois que você pode colocar em um piloto sem compras este mês.
Escolha o A.X-K2 se seu idioma for coreano, se sua carga de trabalho for densa em matemática, ou se os dados simplesmente não puderem sair da sua infraestrutura — e vá sabendo que você está aceitando a tabela de benchmark da SK Telecom por confiança, que a conta de hardware é real e que a pontuação independente que você pode apontar é vinte e três pontos mais baixa. Se essa troca parecer errada, a resposta honesta não é escolher o outro flagship; é comparar os dois com o seu próprio tráfego, que é a única comparação que os números de qualquer um dos fornecedores não podem substituir.
Nenhum dos modelos é o padrão seguro. Step 5 Preview é a opção barata, comedida e invocável, com seus pesos ainda a caminho; A.X-K2 é a opção mais pesada, soberana e baixável, com suas evidências ainda pendentes. Escolha a restrição que de fato limita sua equipe — o perímetro ou a conta — e abra mão da outra.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
