Gráfico principal para A.X K2 DSpark vs A.X K2: um modelo de rascunho propondo quatro tokens candidatos em paralelo que a A.X K2 (688B / 33B ativos) verifica, com a legenda 'mesma resposta, decodificação mais rápida.'
Guides & Insights

A.X K2 DSpark vs A.X K2: O que um modelo somente-drafter realmente oferece

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais estranha em uma comparação entre {{1}}A.X K2 DSpark{{/1}} e {{2}}A.X K2{{/2}} é que ela não é realmente uma comparação. {{3}}A.X K2 DSpark{{/3}} não pode ser usado no lugar de {{4}}A.X K2{{/4}} — ele não pode ser usado de forma alguma sozinho. É um "checkpoint apenas de rascunho" que a SK Telecom soltou silenciosamente no Hugging Face no início de agosto, sem nenhum anúncio: um modelo de rascunho de decodificação especulativa cujo único trabalho é fazer com que {{5}}A.X K2, o carro-chefe Mixture-of-Experts de pesos abertos da empresa com 688 bilhões de parâmetros{{/5}}, gere tokens mais rápido, deixando suas respostas intactas. Portanto, a verdadeira questão que este confronto levanta não é "qual é melhor" — é "você deve rodar {{6}}A.X K2{{/6}} com {{7}}DSpark{{/7}}, ou sem ele?" Todas as informações neste artigo vêm com a fonte indicada, porque a lacuna entre o que o repositório nos diz e o que foi de fato medido é toda a história.

O que A.X K2 DSpark realmente é

O model card da SK Telecom é incomumente direto sobre para que serve o modelo. O A.X K2 DSpark "é um modelo de rascunho de decodificação especulativa para o A.X K2" e "um checkpoint apenas de rascunho: não tem uso autônomo e deve ser carregado pelo vLLM juntamente com o A.X K2 por meio de decodificação especulativa." Na prática, isso significa que você o baixa, aponta um vLLM compatível para ele e para o A.X K2, e os dois trabalham em equipe: o DSpark propõe tokens candidatos, o A.X K2 os verifica, e apenas tokens verificados são emitidos.

Dois detalhes do mecanismo de rascunho podem ser conhecidos a partir do repositório. Primeiro, o DSpark propõe múltiplos tokens candidatos em paralelo, em vez de escrever uma sequência de rascunho um token por vez, baseando-se nas representações ocultas do próprio A.X K2 juntamente com modelagem leve de dependências locais. Segundo, todo o mecanismo é construído para ser sem perdas: cada candidato é verificado pelo modelo alvo antes de ser confirmado, de modo que a distribuição de saída do A.X K2 permanece inalterada por construção.

O lançamento em si é um pré-anúncio. A ficha diz que o modelo está "atualmente em validação final e com lançamento público planejado para os próximos dias", e que a avaliação está "atualmente em andamento" — todas as métricas de throughput, TPOT e comprimento médio aceito na ficha ainda estão listadas como TBD.

Por que este "versus" é na verdade "com versus sem"

Como A.X K2 DSpark não tem uso autônomo, não há cenário em que você o escolha em vez de A.X K2. A escolha é entre A.X K2 sozinho e A.X K2 com o modelo de rascunho anexado. Na qualidade da saída, as duas configurações são idênticas por construção; o único eixo que pode variar é a velocidade de decodificação.

Para registro, eis o que é o A.X K2: um decodificador Mixture-of-Experts de 688B no total, 33B ativos, com 256 especialistas mais um especialista compartilhado (8 ativos por passagem direta), 61 camadas, 64 cabeças de atenção e um vocabulário de 163.840 tokens, lançado com pesos abertos sob a licença Apache 2.0 em 29 de julho. Foi pré-treinado em cerca de 8,2 trilhões de tokens nativamente em MXFP8, usa o Sparse Gated Attention da SK Telecom para eficiência em contextos longos e possui um contexto de 262.144 tokens (128K nativos estendidos para 256K via YaRN). A SK Telecom relata que ele obtém, em média, +32,2 pontos percentuais acima do A.X K1 em 14 benchmarks, com as avaliações de contexto longo e de agente cerca de 83,9 pontos maiores — tudo relatado pelo fornecedor, sem nenhuma pontuação composta independente publicada ainda.

DSpark é projetado especificamente para essa arquitetura. O cartão diz que ele é correspondido à estrutura MoE, ao layout de atenção e à configuração nativa de 256K do A.X K2, e não é validado contra nenhum outro alvo. Ele herda o mesmo contexto de 262.144 tokens, então executá-lo não custa nada em tamanho de janela.

A comparison scoreboard for A.X K2 DSpark and A.X K2: drafter-only checkpoint vs 688B / 33B-active MoE target; identical output by construction; shared 262,144-token context and Apache 2.0 license; DSpark's 60-85% faster decode labeled as a paper claim not yet measured on A.X K2; A.X K2 live open weights since 7-29.

Lendo a ficha do modelo: conhecível, ainda não confirmado.

O repositório fornece uma visão clara do que é o modelo e uma breve lista de coisas que ele não informa.

Conhecível hoje:

• É um checkpoint somente para drafter, sem uso autônomo, carregado pelo vLLM juntamente com o A.X K2 por meio de decodificação especulativa.

• A licença é Apache 2.0; os pesos são gratuitos para baixar e usar.

• O comprimento do contexto corresponde ao A.X K2 em 262.144 tokens.

• Ele roda através do fork do vLLM da SK Telecom (repositório SKT-AI/vllm, branch axk2-v0.23.0) usando a flag --speculative-config.

• O método está documentado em um artigo, "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, submetido em 6 de julho de 2026) — esse artigo também é a fonte dos números de aceleração que você verá citados.

• Nenhum provedor de inferência o implanta atualmente, portanto não há API hospedada para chamar.

Ainda não confirmado:

• Um anúncio oficial — a carta promete lançamento público "dentro dos próximos dias."

• Qualquer valor de speedup específico do A.X K2. A avaliação está em andamento e todas as métricas de desempenho estão TBD.

• O quanto isso realmente ajuda sob carga, que a placa sinaliza como "dependente da carga de trabalho."

• Qualquer medição independente, de terceiros, do modelo preliminar.

The Hugging Face model card for skt/A.X-K2-DSpark, showing it is a DSpark speculative-decoding draft model and a drafter-only checkpoint for A.X K2 with no standalone use, Apache 2.0 license, a 262,144-token context, release status 'planned for public release within the next few days,' and the note that no inference provider deploys it.

Como o DSpark é diferente da decodificação especulativa comum

Decodificação especulativa é um truque já batido: um modelo de rascunho pequeno e rápido escreve um palpite para os próximos tokens, e o modelo grande verifica todo o palpite em uma única passagem direta, aceitando o prefixo que sobrevive à verificação antes de dar um passo corretivo. Quando bem feita, reduz drasticamente a latência sem perda de qualidade.

A ressalva, como o artigo da DSpark a apresenta, é que os rascunhadores paralelos recentes — que propõem sequências longas em uma única passada — sofrem de "decaimento rápido de aceitação" porque os tokens posteriores no rascunho não carregam dependência dos anteriores, então são rejeitados com muito mais frequência. E verificar cegamente blocos longos desperdiça capacidade de lote em tokens que provavelmente serão rejeitados, o que prejudica a vazão precisamente em sistemas de serving de alta concorrência.

DSpark aborda ambos os problemas:

• Drafting semiautoregressivo. Ele combina um backbone paralelo com um módulo sequencial leve, adicionando modelagem de dependência intra-bloco para que tokens de draft posteriores dependam dos anteriores — que é o que mitiga o decaimento de sufixo.

{{1}}Verificação agendada por confiança{{/1}}. Em vez de verificar um comprimento de bloco fixo, ela adapta {{2}}o comprimento da verificação por solicitação{{/2}}, com base em {{3}}probabilidades estimadas de sobrevivência do prefixo{{/3}} e {{4}}no perfil de throughput do mecanismo{{/4}}. A verificação torna-se {{5}}consciente da carga{{/5}}.

Os números do relatório — e o que eles não lhe dizem

Aqui está o número que você verá citado: a DSpark "acelera as velocidades de geração por usuário em 60 a 85 por cento" em níveis de throughput equivalentes, em comparação com a linha de base de produção MTP-1. O artigo também relata um comprimento aceito substancialmente melhorado em relação aos drafters autorregressivos e paralelos de última geração em benchmarks offline, e afirma que isso evita uma degradação severa do throughput sob restrições estritas de interatividade.

Leia as letras miúdas, porque isso importa para este confronto específico: esse número de 60–85% foi medido no sistema de serviço do DeepSeek-V4 sob tráfego real de usuários — não no A.X K2. É uma afirmação sobre o método DSpark implantado na pilha de um modelo diferente. O cartão DSpark do A.X K2, em contraste, ainda não tem nenhum número de aceleração. O placar honesto para este emparelhamento é, portanto: saída idêntica por construção, e uma aceleração que o artigo do método sugere ser plausível, mas que a própria SK Telecom ainda não mediu no modelo para o qual este checkpoint de rascunho foi construído.

The arXiv abstract page for the DSpark paper (arXiv 2607.05147), stating that DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput against the MTP-1 production baseline, deployed in the DeepSeek-V4 serving system.

O que realmente é necessário para executá-lo

O pré-requisito é a parte que faz a maioria das pessoas desistir: é preciso auto-hospedar o A.X K2. Não há API hospedada para o modelo-alvo — ele é open-weight, e servir um MoE de 688B/33B ativos é um compromisso sério de infraestrutura. DSpark só importa para equipes que já assumiram esse compromisso.

Se você tiver, o custo marginal de adicionar o modelo de rascunho é pequeno:

• Baixe o checkpoint de rascunho Apache 2.0 e execute o fork do vLLM da SK Telecom (branch axk2-v0.23.0).

• Habilite a decodificação especulativa por meio da flag --speculative-config, apontando-a para o checkpoint DSpark.

• Reserve memória extra para os pesos provisórios e aceite que agora você está em um fork de fornecedor do vLLM em vez da versão padrão — uma consideração de manutenção.

• Lembre-se da ressalva do próprio artigo: a verificação não é gratuita — sob alta concorrência, a verificação descuidada consome a capacidade do lote, que é exatamente o modo de falha que a verificação agendada por confiança foi projetada para gerenciar.

Mais uma coisa que vale a pena saber: a Hugging Face relata que os downloads "não são rastreados para este modelo", portanto não há nenhum sinal público de quantas equipes realmente o testaram.

Quem deve escolher qual

Use o A.X K2 padrão se qualquer uma destas descrições se aplicar a você:

• Você executa o vLLM padrão e não quer um segundo checkpoint nem um fork de fornecedor no caminho.

• Suas cargas de trabalho são limitadas por throughput, mas não por latência, e os usuários toleram esperar por gerações longas.

• Você prefere esperar pelo lançamento oficial e pelas primeiras medições independentes.

Execute A.X K2 mais DSpark se for você:

• Você auto-hospeda A.X K2 e a latência de geração ou o throughput de tokens é o que está atrapalhando.

• Cargas de trabalho de contexto longo e agênticas fazem os usuários esperar por saídas longas — o cenário para o qual a decodificação especulativa foi construída.

Você se sente confortável em executar um componente de pré-anúncio cuja desvantagem é limitada: no pior caso, ele não ajuda, e não pode alterar a qualidade da saída.

{{1}}Não escolha nenhum dos dois se você não fizer self-host de um MoE de 688B de forma alguma.{{/1}} {{2}}A soberania e os pontos fortes em coreano do A.X K2 só chegam até você se você o executar,{{/2}} {{3}}e muitas equipes, em vez disso, alcançarão modelos abertos de ponta por meio de um catálogo hospedado.{{/3}} {{4}}É aí que manter sua integração agnóstica de modelo compensa:{{/4}} {{5}}o endpoint único compatível com OpenAI do OrcaRouter abrange mais de 200 modelos{{/5}} {{6}}pelo preço de tabela do provedor, com margem de 0%,{{/6}} {{7}}failover automático{{/7}} {{8}}e um DSL de roteamento para compor vários modelos em uma única chamada.{{/8}} {{9}}(Nem o A.X K2 nem o A.X K2 DSpark estão hospedados em qualquer lugar hoje{{/9}} {{10}}— inclusive no OrcaRouter —{{/10}} {{11}}então isso diz respeito ao resto da sua stack, não ao roteamento deste par.){{/11}} {{12}}A postura ainda se aplica:{{/12}} {{13}}teste um modelo não comprovado em uma fração do tráfego e faça failover automaticamente,{{/13}} {{14}}em vez de apostar um caminho de produção nele.{{/14}}

O que assistir em seguida

A situação atual é simples: o repositório é real, o método está documentado, as medições não. As três coisas para observar são o lançamento público prometido (o cartão diz "nos próximos dias"), os primeiros números de throughput ou latência específicos do A.X K2 assim que a avaliação da SK Telecom terminar, e se algum provedor de inferência adotar o par — que é o que tornaria o DSpark relevante para equipes que não fazem self-hosting.

Perguntas Frequentes

O A.X K2 DSpark pode substituir o A.X K2?

Não. É um checkpoint apenas para rascunho, sem uso independente — ele existe para tornar a decodificação do A.X K2 mais rápida, não para ser uma alternativa a ele. Você não pode executar o A.X K2 DSpark sem o A.X K2.

O DSpark muda a qualidade de saída do A.X K2?

Não, por construção. Cada token candidato é verificado por A.X K2 antes de ser confirmado, então a distribuição de saída permanece inalterada — o cartão descreve a abordagem como sem perdas.

Preciso de auto-hospedar o A.X K2 para usar o DSpark?

Sim. O DSpark é carregado pelo vLLM junto com o A.X K2, então não há nada para ele gerar, a menos que você esteja executando o alvo 688B. Não há API hospedada para nenhum dos modelos hoje.

O DSpark funciona com outros modelos?

A SK Telecom o projetou para a arquitetura MoE, a estrutura de atenção e o contexto de 256K do A.X K2, e não o validou contra nenhum outro alvo.

O veredito

A.X K2 DSpark vs A.X K2 é um "versus" cuja resposta honesta é "ambos." Se você já executa A.X K2 e os usuários esperam por gerações longas, o modelo de rascunho é um experimento gratuito e de baixo risco: pesos Apache 2.0, no pior caso sem aceleração, e nenhuma regressão de qualidade possível por construção. Se você não está limitado por latência — ou não hospeda um MoE de 688B por conta própria — pode ignorá-lo com segurança até que os números de avaliação da SK Telecom cheguem e o lançamento público prometido torne o modelo oficial. O que você não deve fazer é confundir o número de 60–85% do artigo com uma medição deste modelo: neste momento, tudo que é específico do DSpark no A.X K2 ainda é TBD.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube