
A.X-K2-DSpark: O Modelo de Rascunho de Decodificação Especulativa da SK Telecom Chegou Sem Anúncio
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxNOVOMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2100 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
A.X-K2-DSpark é um modelo que você provavelmente nunca chamará diretamente — e é exatamente por isso que vale a pena ler sobre ele. A SK Telecom o publicou discretamente no Hugging Face, sem post de lançamento e sem press release por trás; o card do modelo simplesmente abre dizendo que o checkpoint está "atualmente em validação final e está planejado para lançamento público nos próximos dias." É um checkpoint somente para draft em decodificação especulativa, construído para uma única função: tornar o carro-chefe A.X K2 de 688B parâmetros da SK Telecom mais rápido e mais barato de servir, propondo tokens que o A.X K2 então verifica. Aqui está o que o repositório realmente nos diz, o que ainda não foi confirmado, e por que um pequeno modelo auxiliar como este é onde a próxima rodada de cortes de custo de servir LLMs está escondida.
O que A.X-K2-DSpark realmente é
A.X-K2-DSpark não é um modelo autônomo em nenhum sentido significativo. O cartão do modelo (model card) afirma isso em suas notas de uso pretendido: é um "checkpoint somente para rascunho" com "nenhum uso autônomo", carregado pela vLLM junto com seu alvo, A.X K2, dentro de um loop de decodificação especulativa. É o estágio de rascunho de um gerador de dois estágios — um modelo pequeno propõe tokens candidatos rapidamente, e o modelo alvo os verifica antes que qualquer token seja confirmado na saída.
O alvo, para contexto, é um dos maiores modelos de peso aberto que existem. O A.X K2 é o modelo Mixture-of-Experts de 688B no total e 33B ativos da SK Telecom, lançado no Hugging Face no final de julho de 2026 sob a licença Apache 2.0, construído sobre uma arquitetura base que combina Multi-head Latent Attention com DeepSeek Sparse Attention e acrescenta a modificação de contexto longo Sparse Gate Attention, desenvolvida pela própria SK Telecom. O A.X-K2-DSpark condiciona os estados ocultos do A.X K2 e adiciona modelagem leve de dependências locais entre posições candidatas, de modo que pode propor vários tokens em paralelo em vez de rascunhar estritamente de forma autorregressiva. Cada candidato é então verificado pelo A.X K2 antes de ser confirmado — é por isso que a ficha do modelo chama o resultado de "lossless by construction": a distribuição de saída não é alterada pelo rascunhador; apenas a velocidade de atendimento muda.

Como funciona a decodificação especulativa e por que um MoE de 688B precisa dela.
A decodificação especulativa existe porque a geração autoregressiva é serial e limitada pela memória. Gerar cada token significa ler os pesos do modelo da memória e, para um modelo de 688B, isso é um número enorme de bytes a mover para cada token — mesmo quando apenas 33B parâmetros estão ativos em cada passagem direta. O truque é gastar um pouco de computação extra em um pequeno rascunhador que adivinha os próximos vários tokens de uma só vez, e então fazer o modelo grande verificar todas as suposições em uma única passagem direta e manter o prefixo mais longo que corresponda à sua própria distribuição. Quando o rascunhador é bom, você obtém dois ou três tokens por passagem do modelo grande em vez de um, sem alterar a saída final.
O jogo todo gira em torno da taxa de aceitação. Um drafter que faz previsões ruins tem suas propostas rejeitadas, e a passada de verificação ainda custa a mesma largura de banda de memória, então o ganho de velocidade desaparece. É por isso que drafters se tornaram um tema sério de pesquisa por direito próprio: para um modelo do tamanho do A.X K2, a diferença entre um speedup de 1,5x e um de 3x é a diferença entre uma frota de servidores com dez GPUs e uma com cinco. Camadas de eficiência como essa são de onde virá a próxima rodada de cortes de preço em APIs de LLM hospedadas — não dos números de qualidade do modelo base, mas da pilha de servidores que os envolve.
DSpark é o método — e ele vem da equipe DeepSeek
O "DSpark" no nome do modelo é uma técnica específica, e não é uma invenção da SK Telecom. A ficha do modelo cita o artigo "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv 2607.05147), um preprint de 6 de julho de 2026 de uma equipe de 33 autores da DeepSeek que implantou o método no próprio sistema de serving da era V4 dos autores sob tráfego real. A SK Telecom adaptou a mesma técnica para seu próprio modelo alvo.
As duas contribuições do artigo correspondem diretamente ao que o cartão A.X-K2-DSpark descreve. Primeiro, a geração de rascunho semiautorregressiva: um backbone paralelo propõe tokens em uma janela, enquanto um módulo sequencial leve modela as dependências entre as posições candidatas, corrigindo o problema clássico de que as taxas de aceitação dos geradores de rascunho paralelos caem acentuadamente ao longo da sequência proposta. Segundo, a verificação agendada por confiança: em vez de sempre verificar um número fixo de tokens de rascunho, o sistema estima a probabilidade de cada prefixo sobreviver e define o comprimento da verificação por solicitação, ajustado ao perfil de throughput do mecanismo — portanto, o esforço de verificação é sensível à carga, e não uniforme.
Com base nos próprios números do artigo — que são medições dos autores, não verificadas de forma independente — o DSpark entregou geração por usuário 60–85% mais rápida que o baseline de produção MTP-1 com throughput equivalente, e evitou degradação severa de throughput sob restrições estritas de interatividade. Duas ressalvas são importantes ao ler este comunicado. Esses resultados foram medidos na stack e no target dos próprios autores, não no A.X K2; e o model card do A.X-K2-DSpark afirma explicitamente que sua própria avaliação ainda está em andamento. O artigo prova que o método funciona em produção. Ele não prova que o checkpoint da SK Telecom reproduz esses ganhos — essa é exatamente a parte não confirmada.

O que o repo diz — e o que não diz.
Aqui está o que é possível saber do repositório neste momento, tudo vindo do model card:
• Função — checkpoint apenas para rascunho do A.X K2; sem uso autônomo; não validado com nenhum outro alvo e "incompatível com modelos não relacionados."
• Target — A.X K2, 688B total / 33B ativos Mistura de Especialistas.
• Comprimento do contexto — 262.144 tokens (256K), correspondendo à configuração nativa do A.X K2.
• Licença — Apache 2.0.
• Mecanismo — DSpark: rascunho semi-autorregressivo; cada candidato verificado por A.X K2 antes do commit (sem perdas).
• Status — "atualmente em validação final"; lançamento planejado "dentro dos próximos dias."
E aqui está o que ainda não foi explicitamente confirmado:
• Precisão e tamanho do checkpoint — ambos listados como TBD no cartão do modelo.
• Throughput, TPOT e comprimento médio aceito — os três números que lhe diriam se o redator realmente funciona, todos a definir, com "a avaliação está atualmente em andamento."
• Resultados por domínio — o cartão promete análises de coreano, matemática, ciências e código "mais tarde", sem data.
• Um anúncio formal — A SK Telecom não anunciou A.X-K2-DSpark em nenhum lugar que possamos encontrar; o repositório é o anúncio.
• Avaliações independentes — não existem. Tudo no cartão é alegação da própria SK Telecom, e a maior parte ainda é uma promessa.

O número não confirmado mais importante é o comprimento médio aceito — o número médio de tokens de rascunho que o A.X K2 aceita por passada de verificação. Esse único número decide se este modelo de rascunho é um detalhe de 1.2x ou um upgrade de 2.5x no serving, e também é o número com maior probabilidade de circular sem procedência assim que o lançamento for ao ar. Trate-o com ceticismo quando ele aparecer: o número de 60–85% do artigo do DSpark foi medido em uma stack de serving de um modelo diferente, e o A.X K2 tem suas próprias características de aceitação de rascunho.
Como você realmente o executaria
Executar o drafter significa servir A.X K2 a partir do fork do vLLM da SK Telecom. O exemplo do model card, levemente reduzido, é:
vllm serve skt/A.X-K2 --tensor-parallel-size 8 --tool-call-parser hermes --reasoning-parser deepseek_v3 --speculative-config '{"method": "dspark", "model": "skt/A.X-K2-DSpark", "num_speculative_tokens": N}'
com o fork instalado a partir do repositório SKT-AI vLLM no branch axk2-v0.23.0. Algumas ressalvas que o card deixa explícitas: o setup tem como alvo a configuração de contexto nativa de 256K do A.X K2, e o ganho de velocidade depende da carga de trabalho — concorrência, comprimento da saída, taxa de aceitação e o custo relativo da geração de rascunhos versus verificação influenciam o resultado. Em outras palavras, isso é infraestrutura de servidor, não um script de baixar e executar. Você precisa dos pesos do A.X K2, de um cluster grande o suficiente para tensor-parallel 8 e de paciência para ajustar num_speculative_tokens contra o seu próprio tráfego. Esse é um projeto significativo para uma equipe que já serve o A.X K2; não é um motivo para criar um do zero.
A economia: camadas de eficiência superam alegações de qualidade
A razão pela qual um modelo de rascunho para um modelo de 688B merece atenção é que a corrida de benchmarks de modelos-base está majoritariamente saturada, enquanto a corrida de custo de serviço ainda não chegou a esse ponto. O próprio lançamento da SK Telecom já apostava na eficiência — a mudança do Sparse Gate Attention foi reivindicada como um aumento de 67,7% na vazão total de tokens em relação à geração anterior com entradas de 120 mil tokens — e um gerador de rascunho é a mesma tese aplicada à decodificação. Cada token de rascunho aceito é uma passagem adiante do modelo grande pela qual você não pagou.
Para {{1}}quem consome esses modelos por uma API em vez de hospedá-los{{/1}}, o rascunhador é invisível — e é exatamente esse o ponto. {{2}}Quando um provedor adiciona decodificação especulativa à sua pilha de serviço{{/2}}, você não vê um modelo novo; {{3}}você vê o mesmo modelo ficar mais rápido e mais barato por token{{/3}}. A camada de preços importa pelo mesmo motivo: {{4}}na OrcaRouter repassamos o preço de tabela do provedor diretamente, com margem de 0%{{/4}}, então {{5}}quando o trabalho de eficiência de serviço de um fornecedor aparece como redução de preço{{/5}}, {{6}}isso entra no ar no nosso lado no mesmo dia — sem renegociação, sem mudança de contrato{{/6}}. E {{7}}para um modelo não comprovado que pode ou não dar certo{{/7}}, {{8}}roteamento com failover automático é a forma de testá-lo sem apostar um caminho de produção nele{{/8}}: {{9}}uma única chave de API, e a requisição cai para outro provedor se o primeiro degradar{{/9}}.
Uma nota de honestidade específica para este lançamento: A.X-K2-DSpark é um checkpoint somente para drafter, portanto não é algo que qualquer API de modelo hospedado possa rotear — incluindo a nossa. Drafters são um componente do lado do servidor, não um produto chamável. Quando o drafter for lançado e os números de avaliação chegarem, o que aparecerá na lista de preços é um A.X K2 mais rápido e mais barato — não um novo endpoint chamado "DSpark".
Algumas perguntas que valem a pena responder
Posso usar o A.X-K2-DSpark sozinho? Não — esse é o fato que define o lançamento. É um checkpoint somente para rascunho, sem uso autônomo e sem API pública; existe apenas como um auxiliar dentro de um loop de decodificação especulativa do vLLM servindo o A.X K2, e a ficha do modelo observa que ele não foi validado com nenhum outro alvo.
O A.X-K2-DSpark é um concorrente do A.X K2?O oposto. É um acelerador para o A.X K2 — o mesmo modelo fica mais rápido, com a distribuição de saída inalterada. Pense nele como uma peça de eficiência acoplável, não uma nova adição à linha.
Quando será realmente lançado?O model card diz que está em validação final e planejado para lançamento público "dentro dos próximos dias". Isso é tudo o que está confirmado. A data para observar é o dia em que os valores TBD — throughput, TPOT e comprimento médio aceito — forem preenchidos, porque é quando o lançamento deixa de ser uma promessa e se torna algo que você pode avaliar.
Preciso me preocupar com isso se usar o A.X K2 por meio de uma API?Provavelmente não diretamente. A pilha de serviço por trás de uma API decide se um modelo de rascunho está no loop; você vê o resultado como um preço e uma latência, não como uma flag. Isso importa principalmente para equipes que hospedam o A.X K2 por conta própria, onde o opt-in é uma mudança de configuração do vLLM que elas controlam.
A história aqui não é o próprio rascunhador — é o que ele sinaliza. O trabalho de eficiência está se tornando silenciosamente uma categoria de lançamento própria, e os modelos mais interessantes deste ano são cada vez mais auxiliares que tornam modelos grandes baratos, em vez de modelos maiores. A.X-K2-DSpark é o exemplo mais claro até agora: um checkpoint sem uso autônomo, postado antes do anúncio, carregando a maior parte de suas próprias evidências como TBD. Fique de olho no número de comprimento aceito quando ele chegar, trate os ganhos do artigo do DSpark como proveniência do método, e não como promessa para este checkpoint, e se você mesmo servir A.X K2, reserve recursos para o benchmark — essa é a única maneira de saber se o rascunhador postado silenciosamente é um detalhe de 1,2x ou a coisa real.
