Cartão de título hero para um artigo sobre o A.X-K2-DSpark, exibindo 'A.X-K2-DSpark' com o subtítulo 'Modelo de Rascunho de Decodificação Especulativa da SK Telecom' e uma linha de apoio 'Gerando tokens para o A.X K2 de 688B — sem perdas por construção', com um ícone minimalista de linhas planas de camadas empilhadas alimentando uma seta com marca de verificação em um fundo branco com suaves acentos de gradiente azul-ciano.
Guides & Insights

A.X-K2-DSpark: O Modelo de Rascunho de Decodificação Especulativa da SK Telecom Chegou Sem Anúncio

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A.X-K2-DSpark é um modelo que você provavelmente nunca chamará diretamente — e é exatamente por isso que vale a pena ler sobre ele. A SK Telecom o publicou discretamente no Hugging Face, sem post de lançamento e sem press release por trás; o card do modelo simplesmente abre dizendo que o checkpoint está "atualmente em validação final e está planejado para lançamento público nos próximos dias." É um checkpoint somente para draft em decodificação especulativa, construído para uma única função: tornar o carro-chefe A.X K2 de 688B parâmetros da SK Telecom mais rápido e mais barato de servir, propondo tokens que o A.X K2 então verifica. Aqui está o que o repositório realmente nos diz, o que ainda não foi confirmado, e por que um pequeno modelo auxiliar como este é onde a próxima rodada de cortes de custo de servir LLMs está escondida.

O que A.X-K2-DSpark realmente é

A.X-K2-DSpark não é um modelo autônomo em nenhum sentido significativo. O cartão do modelo (model card) afirma isso em suas notas de uso pretendido: é um "checkpoint somente para rascunho" com "nenhum uso autônomo", carregado pela vLLM junto com seu alvo, A.X K2, dentro de um loop de decodificação especulativa. É o estágio de rascunho de um gerador de dois estágios — um modelo pequeno propõe tokens candidatos rapidamente, e o modelo alvo os verifica antes que qualquer token seja confirmado na saída.

O alvo, para contexto, é um dos maiores modelos de peso aberto que existem. O A.X K2 é o modelo Mixture-of-Experts de 688B no total e 33B ativos da SK Telecom, lançado no Hugging Face no final de julho de 2026 sob a licença Apache 2.0, construído sobre uma arquitetura base que combina Multi-head Latent Attention com DeepSeek Sparse Attention e acrescenta a modificação de contexto longo Sparse Gate Attention, desenvolvida pela própria SK Telecom. O A.X-K2-DSpark condiciona os estados ocultos do A.X K2 e adiciona modelagem leve de dependências locais entre posições candidatas, de modo que pode propor vários tokens em paralelo em vez de rascunhar estritamente de forma autorregressiva. Cada candidato é então verificado pelo A.X K2 antes de ser confirmado — é por isso que a ficha do modelo chama o resultado de "lossless by construction": a distribuição de saída não é alterada pelo rascunhador; apenas a velocidade de atendimento muda.

Screenshot of the Hugging Face model card for skt/A.X-K2-DSpark by SK Telecom, showing the release-status note that the checkpoint is currently in final validation and planned for public release within the next few days, the model summary (a DSpark speculative-decoding draft model for A.X K2, SK Telecom's 688B-total / 33B-active Mixture-of-Experts, drafter-only with no standalone use), the Apache 2.0 license, and the 'This model isn't deployed by any inference provider' line.

Como funciona a decodificação especulativa e por que um MoE de 688B precisa dela.

A decodificação especulativa existe porque a geração autoregressiva é serial e limitada pela memória. Gerar cada token significa ler os pesos do modelo da memória e, para um modelo de 688B, isso é um número enorme de bytes a mover para cada token — mesmo quando apenas 33B parâmetros estão ativos em cada passagem direta. O truque é gastar um pouco de computação extra em um pequeno rascunhador que adivinha os próximos vários tokens de uma só vez, e então fazer o modelo grande verificar todas as suposições em uma única passagem direta e manter o prefixo mais longo que corresponda à sua própria distribuição. Quando o rascunhador é bom, você obtém dois ou três tokens por passagem do modelo grande em vez de um, sem alterar a saída final.

O jogo todo gira em torno da taxa de aceitação. Um drafter que faz previsões ruins tem suas propostas rejeitadas, e a passada de verificação ainda custa a mesma largura de banda de memória, então o ganho de velocidade desaparece. É por isso que drafters se tornaram um tema sério de pesquisa por direito próprio: para um modelo do tamanho do A.X K2, a diferença entre um speedup de 1,5x e um de 3x é a diferença entre uma frota de servidores com dez GPUs e uma com cinco. Camadas de eficiência como essa são de onde virá a próxima rodada de cortes de preço em APIs de LLM hospedadas — não dos números de qualidade do modelo base, mas da pilha de servidores que os envolve.

DSpark é o método — e ele vem da equipe DeepSeek

O "DSpark" no nome do modelo é uma técnica específica, e não é uma invenção da SK Telecom. A ficha do modelo cita o artigo "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv 2607.05147), um preprint de 6 de julho de 2026 de uma equipe de 33 autores da DeepSeek que implantou o método no próprio sistema de serving da era V4 dos autores sob tráfego real. A SK Telecom adaptou a mesma técnica para seu próprio modelo alvo.

As duas contribuições do artigo correspondem diretamente ao que o cartão A.X-K2-DSpark descreve. Primeiro, a geração de rascunho semiautorregressiva: um backbone paralelo propõe tokens em uma janela, enquanto um módulo sequencial leve modela as dependências entre as posições candidatas, corrigindo o problema clássico de que as taxas de aceitação dos geradores de rascunho paralelos caem acentuadamente ao longo da sequência proposta. Segundo, a verificação agendada por confiança: em vez de sempre verificar um número fixo de tokens de rascunho, o sistema estima a probabilidade de cada prefixo sobreviver e define o comprimento da verificação por solicitação, ajustado ao perfil de throughput do mecanismo — portanto, o esforço de verificação é sensível à carga, e não uniforme.

Com base nos próprios números do artigo — que são medições dos autores, não verificadas de forma independente — o DSpark entregou geração por usuário 60–85% mais rápida que o baseline de produção MTP-1 com throughput equivalente, e evitou degradação severa de throughput sob restrições estritas de interatividade. Duas ressalvas são importantes ao ler este comunicado. Esses resultados foram medidos na stack e no target dos próprios autores, não no A.X K2; e o model card do A.X-K2-DSpark afirma explicitamente que sua própria avaliação ainda está em andamento. O artigo prova que o método funciona em produção. Ele não prova que o checkpoint da SK Telecom reproduz esses ganhos — essa é exatamente a parte não confirmada.

Screenshot of the arXiv abstract page for the paper 'DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation' (arXiv 2607.05147), submitted July 6 2026 by Xin Cheng and co-authors, showing the abstract on semi-autoregressive drafting and confidence-scheduled verification and the reported 60-85% faster per-user generation than the production MTP-1 baseline at matched throughput.

O que o repo diz — e o que não diz.

Aqui está o que é possível saber do repositório neste momento, tudo vindo do model card:

Função — checkpoint apenas para rascunho do A.X K2; sem uso autônomo; não validado com nenhum outro alvo e "incompatível com modelos não relacionados."

Target — A.X K2, 688B total / 33B ativos Mistura de Especialistas.

Comprimento do contexto — 262.144 tokens (256K), correspondendo à configuração nativa do A.X K2.

Licença — Apache 2.0.

Mecanismo — DSpark: rascunho semi-autorregressivo; cada candidato verificado por A.X K2 antes do commit (sem perdas).

Status — "atualmente em validação final"; lançamento planejado "dentro dos próximos dias."

E aqui está o que ainda não foi explicitamente confirmado:

Precisão e tamanho do checkpoint — ambos listados como TBD no cartão do modelo.

Throughput, TPOT e comprimento médio aceito — os três números que lhe diriam se o redator realmente funciona, todos a definir, com "a avaliação está atualmente em andamento."

Resultados por domínio — o cartão promete análises de coreano, matemática, ciências e código "mais tarde", sem data.

Um anúncio formal — A SK Telecom não anunciou A.X-K2-DSpark em nenhum lugar que possamos encontrar; o repositório é o anúncio.

Avaliações independentes — não existem. Tudo no cartão é alegação da própria SK Telecom, e a maior parte ainda é uma promessa.

Scoreboard for A.X-K2-DSpark across six dimensions: Role drafter-only, no standalone use; Target A.X K2, 688B total / 33B active; Context length 262,144 tokens; License Apache 2.0; Method DSpark semi-autoregressive; Eval in progress, all figures TBD. Footer line reads 'All figures from the SK Telecom model card; no independent scores yet.'

O número não confirmado mais importante é o comprimento médio aceito — o número médio de tokens de rascunho que o A.X K2 aceita por passada de verificação. Esse único número decide se este modelo de rascunho é um detalhe de 1.2x ou um upgrade de 2.5x no serving, e também é o número com maior probabilidade de circular sem procedência assim que o lançamento for ao ar. Trate-o com ceticismo quando ele aparecer: o número de 60–85% do artigo do DSpark foi medido em uma stack de serving de um modelo diferente, e o A.X K2 tem suas próprias características de aceitação de rascunho.

Como você realmente o executaria

Executar o drafter significa servir A.X K2 a partir do fork do vLLM da SK Telecom. O exemplo do model card, levemente reduzido, é:

vllm serve skt/A.X-K2 --tensor-parallel-size 8 --tool-call-parser hermes --reasoning-parser deepseek_v3 --speculative-config '{"method": "dspark", "model": "skt/A.X-K2-DSpark", "num_speculative_tokens": N}'

com o fork instalado a partir do repositório SKT-AI vLLM no branch axk2-v0.23.0. Algumas ressalvas que o card deixa explícitas: o setup tem como alvo a configuração de contexto nativa de 256K do A.X K2, e o ganho de velocidade depende da carga de trabalho — concorrência, comprimento da saída, taxa de aceitação e o custo relativo da geração de rascunhos versus verificação influenciam o resultado. Em outras palavras, isso é infraestrutura de servidor, não um script de baixar e executar. Você precisa dos pesos do A.X K2, de um cluster grande o suficiente para tensor-parallel 8 e de paciência para ajustar num_speculative_tokens contra o seu próprio tráfego. Esse é um projeto significativo para uma equipe que já serve o A.X K2; não é um motivo para criar um do zero.

A economia: camadas de eficiência superam alegações de qualidade

A razão pela qual um modelo de rascunho para um modelo de 688B merece atenção é que a corrida de benchmarks de modelos-base está majoritariamente saturada, enquanto a corrida de custo de serviço ainda não chegou a esse ponto. O próprio lançamento da SK Telecom já apostava na eficiência — a mudança do Sparse Gate Attention foi reivindicada como um aumento de 67,7% na vazão total de tokens em relação à geração anterior com entradas de 120 mil tokens — e um gerador de rascunho é a mesma tese aplicada à decodificação. Cada token de rascunho aceito é uma passagem adiante do modelo grande pela qual você não pagou.

Para {{1}}quem consome esses modelos por uma API em vez de hospedá-los{{/1}}, o rascunhador é invisível — e é exatamente esse o ponto. {{2}}Quando um provedor adiciona decodificação especulativa à sua pilha de serviço{{/2}}, você não vê um modelo novo; {{3}}você vê o mesmo modelo ficar mais rápido e mais barato por token{{/3}}. A camada de preços importa pelo mesmo motivo: {{4}}na OrcaRouter repassamos o preço de tabela do provedor diretamente, com margem de 0%{{/4}}, então {{5}}quando o trabalho de eficiência de serviço de um fornecedor aparece como redução de preço{{/5}}, {{6}}isso entra no ar no nosso lado no mesmo dia — sem renegociação, sem mudança de contrato{{/6}}. E {{7}}para um modelo não comprovado que pode ou não dar certo{{/7}}, {{8}}roteamento com failover automático é a forma de testá-lo sem apostar um caminho de produção nele{{/8}}: {{9}}uma única chave de API, e a requisição cai para outro provedor se o primeiro degradar{{/9}}.

Uma nota de honestidade específica para este lançamento: A.X-K2-DSpark é um checkpoint somente para drafter, portanto não é algo que qualquer API de modelo hospedado possa rotear — incluindo a nossa. Drafters são um componente do lado do servidor, não um produto chamável. Quando o drafter for lançado e os números de avaliação chegarem, o que aparecerá na lista de preços é um A.X K2 mais rápido e mais barato — não um novo endpoint chamado "DSpark".

Algumas perguntas que valem a pena responder

Posso usar o A.X-K2-DSpark sozinho? Não — esse é o fato que define o lançamento. É um checkpoint somente para rascunho, sem uso autônomo e sem API pública; existe apenas como um auxiliar dentro de um loop de decodificação especulativa do vLLM servindo o A.X K2, e a ficha do modelo observa que ele não foi validado com nenhum outro alvo.

O A.X-K2-DSpark é um concorrente do A.X K2?O oposto. É um acelerador para o A.X K2 — o mesmo modelo fica mais rápido, com a distribuição de saída inalterada. Pense nele como uma peça de eficiência acoplável, não uma nova adição à linha.

Quando será realmente lançado?O model card diz que está em validação final e planejado para lançamento público "dentro dos próximos dias". Isso é tudo o que está confirmado. A data para observar é o dia em que os valores TBD — throughput, TPOT e comprimento médio aceito — forem preenchidos, porque é quando o lançamento deixa de ser uma promessa e se torna algo que você pode avaliar.

Preciso me preocupar com isso se usar o A.X K2 por meio de uma API?Provavelmente não diretamente. A pilha de serviço por trás de uma API decide se um modelo de rascunho está no loop; você vê o resultado como um preço e uma latência, não como uma flag. Isso importa principalmente para equipes que hospedam o A.X K2 por conta própria, onde o opt-in é uma mudança de configuração do vLLM que elas controlam.

A história aqui não é o próprio rascunhador — é o que ele sinaliza. O trabalho de eficiência está se tornando silenciosamente uma categoria de lançamento própria, e os modelos mais interessantes deste ano são cada vez mais auxiliares que tornam modelos grandes baratos, em vez de modelos maiores. A.X-K2-DSpark é o exemplo mais claro até agora: um checkpoint sem uso autônomo, postado antes do anúncio, carregando a maior parte de suas próprias evidências como TBD. Fique de olho no número de comprimento aceito quando ele chegar, trate os ganhos do artigo do DSpark como proveniência do método, e não como promessa para este checkpoint, e se você mesmo servir A.X K2, reserve recursos para o benchmark — essa é a única maneira de saber se o rascunhador postado silenciosamente é um detalhe de 1,2x ou a coisa real.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube