Gráfico principal para A.X K2 DSpark vs A.X K2: un modelo de borrador que propone cuatro tokens candidatos en paralelo que A.X K2 (688B / 33B activos) verifica, con el título 'misma respuesta, decodificación más rápida.'
Guides & Insights

A.X K2 DSpark vs A.X K2: Lo que realmente te ofrece un modelo solo de borrador

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más extraño de una comparación entre A.X K2 DSpark y A.X K2 es que en realidad no es una comparación. A.X K2 DSpark no puede usarse en lugar de A.X K2; no puede usarse en absoluto por sí solo. Es un "checkpoint solo de borrador" que SK Telecom publicó silenciosamente en Hugging Face a principios de agosto sin ningún anuncio: un modelo de borrador para decodificación especulativa cuyo único trabajo es hacer que A.X K2, el buque insignia de Mixture-of-Experts de peso abierto de 688 mil millones de parámetros de la empresa, genere tokens más rápido sin alterar sus respuestas. Así que la pregunta real de este enfrentamiento no es "cuál es mejor", sino "¿deberías ejecutar A.X K2 con DSpark o sin él?" Todo en este artículo está etiquetado por fuente, porque la brecha entre lo que dice el repositorio y lo que realmente se ha medido es toda la historia.

Qué es realmente A.X K2 DSpark

La ficha del modelo de SK Telecom es inusualmente directa sobre para qué sirve el modelo. {{1}}A.X K2 DSpark «es un modelo borrador de decodificación especulativa de DSpark para A.X K2»{{/1}} y {{2}}«un checkpoint solo de borrador: no tiene uso independiente y está pensado para ser cargado por vLLM junto con {{3}}A.X K2{{/3}} mediante decodificación especulativa».{{/2}} En la práctica, eso significa que lo descargas, apuntas un vLLM compatible tanto a él como a {{3}}A.X K2{{/3}}, y los dos trabajan en equipo: {{4}}DSpark propone tokens candidatos, {{3}}A.X K2{{/3}} los verifica y solo se emiten los tokens verificados.{{/4}}

Dos detalles del mecanismo de borrador se pueden conocer a partir del repositorio. Primero, DSpark propone múltiples tokens candidatos en paralelo en lugar de escribir una secuencia de borrador de un token a la vez, basándose en las representaciones ocultas propias de A.X K2 junto con un modelado ligero de dependencias locales. Segundo, todo está construido para ser sin pérdidas: cada candidato es verificado por el modelo objetivo antes de confirmarse, por lo que la distribución de salida de A.X K2 no cambia por construcción.

La publicación en sí es un preanuncio. La ficha técnica indica que el modelo está "actualmente en validación final y tiene previsto su lanzamiento público en los próximos días", y que la evaluación está "actualmente en curso"; todas las métricas de rendimiento, TPOT y longitud media aceptada en la ficha técnica siguen apareciendo como TBD.

Por qué este "versus" es en realidad "con versus sin"

Debido a que A.X K2 DSpark no tiene uso independiente, no existe ningún escenario en el que lo elijas en lugar de A.X K2. La elección es entre A.X K2 por sí solo y A.X K2 con el modelo de borrador adjunto. En cuanto a la calidad de salida, las dos configuraciones son idénticas por construcción; el único eje que puede variar es la velocidad de decodificación.

Para que conste, esto es lo que es A.X K2: un decodificador de mezcla de expertos (MoE) de 688B en total y 33B activos, con 256 expertos más un experto compartido (8 activos por pasada hacia adelante), 61 capas, 64 cabezas de atención y un vocabulario de 163,840 tokens, publicado con pesos abiertos bajo Apache 2.0 el 29 de julio. Fue preentrenado con aproximadamente 8,2 billones de tokens de forma nativa en MXFP8, utiliza la Sparse Gated Attention de SK Telecom para la eficiencia en contextos largos, y tiene un contexto de 262,144 tokens (128K nativos extendidos a 256K mediante YaRN). SK Telecom informa que promedia +32,2 puntos porcentuales sobre A.X K1 en 14 puntos de referencia, con un aumento de unos 83,9 puntos en las evaluaciones de contexto largo y de agentes; todo ello reportado por el proveedor, sin que se haya publicado aún una puntuación compuesta independiente.

DSpark está diseñado específicamente para esa arquitectura. La tarjeta dice que está emparejado con la estructura MoE de A.X K2, la disposición de atención y la configuración nativa de 256K, y no está validado contra ningún otro objetivo. Hereda el mismo contexto de 262.144 tokens, por lo que ejecutarlo no te cuesta nada en cuanto al tamaño de la ventana.

A comparison scoreboard for A.X K2 DSpark and A.X K2: drafter-only checkpoint vs 688B / 33B-active MoE target; identical output by construction; shared 262,144-token context and Apache 2.0 license; DSpark's 60-85% faster decode labeled as a paper claim not yet measured on A.X K2; A.X K2 live open weights since 7-29.

Leyendo la tarjeta del modelo: conocible, aún no confirmado.

El repo te da una imagen clara de lo que es el modelo, y una breve lista de cosas que no te dice.

Conocible hoy:

Es un checkpoint exclusivo de drafter sin uso independiente, cargado por vLLM junto a A.X K2 mediante decodificación especulativa.

• La licencia es Apache 2.0; los pesos son libres de descargar y usar.

• La longitud de contexto coincide con A.X K2 en 262,144 tokens.

• Se ejecuta a través del fork de vLLM de SK Telecom (el repositorio SKT-AI/vllm, rama axk2-v0.23.0) usando el flag --speculative-config.

• El método está documentado en un artículo, "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, enviado el 6 de julio de 2026) — ese artículo es también la fuente de las cifras de aceleración que verá citadas.

• Ningún proveedor de inferencia lo despliega hoy en día, por lo que no hay una API alojada a la que llamar.

Aún no confirmado:

• Un anuncio oficial — la tarjeta promete un lanzamiento público "dentro de los próximos días."

• Cualquier cifra de aceleración específica de A.X K2. La evaluación está en curso y todas las métricas de rendimiento están por determinar (TBD).

• Cuánto ayuda realmente bajo carga, lo que la tarjeta señala como "dependiente de la carga de trabajo".

• Cualquier medición independiente de terceros del modelo preliminar.

The Hugging Face model card for skt/A.X-K2-DSpark, showing it is a DSpark speculative-decoding draft model and a drafter-only checkpoint for A.X K2 with no standalone use, Apache 2.0 license, a 262,144-token context, release status 'planned for public release within the next few days,' and the note that no inference provider deploys it.

En qué se diferencia DSpark de la decodificación especulativa ordinaria

La decodificación especulativa es un truco muy conocido: un modelo borrador pequeño y rápido adivina los próximos varios tokens, y el modelo grande verifica toda la conjetura en una sola pasada hacia adelante, aceptando el prefijo que supera la verificación antes de dar un paso correctivo. Bien hecho, reduce drásticamente la latencia sin pérdida de calidad.

El inconveniente, como lo plantea el artículo de DSpark, es que los redactores paralelos recientes — que proponen secuencias largas en una sola pasada — sufren una "caída rápida de aceptación" porque los tokens posteriores del borrador no dependen de los anteriores, por lo que se rechazan con mucha más frecuencia. Y verificar a ciegas bloques largos desperdicia capacidad de lote en tokens que probablemente serán rechazados, lo que perjudica el rendimiento precisamente en sistemas de servicio de alta concurrencia.

DSpark aborda ambos problemas:

• Redacción semi-autorregresiva. Acopla un backbone paralelo con un módulo secuencial ligero, añadiendo modelado de dependencias intra-bloque para que los tokens de borrador posteriores dependan de los anteriores — que es lo que mitiga la degradación del sufijo.

• Verificación programada por confianza. En lugar de verificar una longitud de bloque fija, adapta la longitud de verificación por solicitud, basándose en las probabilidades estimadas de supervivencia del prefijo y en el perfil de rendimiento del motor. La verificación se vuelve sensible a la carga.

Los números del artículo — y lo que no te dicen

Aquí está el número que verá citado: DSpark «acelera las velocidades de generación por usuario entre un 60 y un 85 por ciento» con niveles de rendimiento equivalentes, en comparación con la línea base de producción MTP-1. El artículo también informa una longitud aceptada sustancialmente mejorada frente a los borradores autorregresivos y paralelos de última generación en evaluaciones fuera de línea, y afirma que previene una degradación grave del rendimiento bajo restricciones estrictas de interactividad.

Lee la letra pequeña, porque importa para este enfrentamiento específico: esa cifra del 60–85 % se midió en el sistema de servicio de DeepSeek-V4 bajo tráfico real de usuarios, no en A.X K2. Es una afirmación sobre el método DSpark implementado en la pila de otro modelo. La tarjeta DSpark de A.X K2, por el contrario, no tiene todavía ninguna cifra de aceleración. Por lo tanto, el marcador honesto para este emparejamiento es: salida idéntica por construcción, y una aceleración que el artículo del método sugiere que es plausible, pero que la propia SK Telecom aún no ha medido en el modelo para el que se construyó este checkpoint preliminar.

The arXiv abstract page for the DSpark paper (arXiv 2607.05147), stating that DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput against the MTP-1 production baseline, deployed in the DeepSeek-V4 serving system.

Lo que realmente requiere ejecutarlo

El requisito previo es la parte que hará que la mayoría se eche atrás: {{1}}tienes que autoalojar A.X K2{{/1}}. {{2}}No hay una API alojada para el modelo objetivo{{/2}} — {{3}}es de peso abierto, y servir un MoE de 688B/33B activos es un compromiso serio de infraestructura{{/3}}. DSpark solo le importa a los equipos que ya han hecho ese compromiso.

Si ya lo tienes, el costo marginal de añadir el modelo borrador es pequeño:

Descargue el checkpoint preliminar de Apache 2.0 y ejecute el fork de vLLM de SK Telecom (rama axk2-v0.23.0).

• Habilite la decodificación especulativa mediante el indicador --speculative-config, apuntándolo al checkpoint de DSpark.

• Reserve memoria adicional para los pesos del borrador, y acepte que ahora se encuentra en un fork de proveedor de vLLM en lugar de la versión estándar — una consideración de mantenimiento.

Recuerde la advertencia del propio artículo de que la verificación no es gratuita: bajo alta concurrencia, una verificación descuidada devora la capacidad del lote, que es exactamente el modo de fallo que la verificación programada por confianza está diseñada para gestionar.

Una cosa más que vale la pena saber: Hugging Face informa que las descargas "no se rastrean para este modelo", por lo que no hay una señal pública de cuántos equipos lo han probado realmente.

Quién debería elegir cuál

Ejecuta A.X K2 simple si alguno de estos te describe:

Ejecutas vLLM estándar y no quieres un segundo checkpoint ni un fork del proveedor en el camino.

Tus cargas de trabajo están limitadas por el rendimiento, pero no por la latencia, y los usuarios toleran esperar durante generaciones largas.

Preferirías esperar al lanzamiento oficial y a las primeras mediciones independientes.

Ejecuta A.X K2 plus DSpark si eres tú:

• Usted autoaloja A.X K2 y la latencia de generación o el rendimiento de tokens es lo que le está afectando.

• Las cargas de trabajo de contexto largo y agénticas hacen que los usuarios esperen salidas extensas — el régimen para el que está diseñada la decodificación especulativa.

• Te sientes cómodo ejecutando un componente de preanuncio cuyo riesgo a la baja es acotado: en el peor caso no ayuda, y no puede cambiar la calidad de la salida.

No elijas ninguno si no autoalojas un MoE de 688B en absoluto. La soberanía y las fortalezas en idioma coreano de A.X K2 solo te llegan si lo ejecutas, y muchos equipos accederán en su lugar a modelos abiertos de vanguardia a través de un catálogo alojado. Ahí es donde mantener tu integración agnóstica respecto al modelo da resultados: el único endpoint compatible con OpenAI de OrcaRouter abarca más de 200 modelos al precio de lista del proveedor con 0% de margen, conmutación automática por error y un DSL de enrutamiento para componer varios modelos en una sola llamada. (Ni A.X K2 ni A.X K2 DSpark están alojados en ningún lugar hoy — incluido OrcaRouter —, así que esto trata sobre el resto de tu stack, no sobre enrutar este par). La postura sigue siendo válida: prueba un modelo no probado con una fracción del tráfico y conmuta automáticamente por error, en lugar de apostar una ruta de producción por él.

Qué ver a continuación

La situación es simple: el repositorio es real, el método está documentado, las mediciones no. Las tres cosas a observar son el prometido lanzamiento público (la tarjeta dice «dentro de los próximos días»), los primeros números de rendimiento o latencia específicos del A.X K2 una vez que termine la evaluación de SK Telecom, y si algún proveedor de inferencia adopta el par — que es lo que haría que DSpark sea relevante para los equipos que no se autohospedan.

Preguntas frecuentes

¿Puede A.X K2 DSpark reemplazar a A.X K2?

No. Es un punto de control solo de borrador, sin uso independiente: existe para hacer que la decodificación de A.X K2 sea más rápida, no para ser una alternativa a este. No se puede ejecutar A.X K2 DSpark sin A.X K2.

¿DSpark cambia la calidad de salida de A.X K2?

No, por construcción. Cada token candidato es verificado por A.X K2 antes de ser confirmado, por lo que la distribución de salida no cambia — la tarjeta describe el enfoque como sin pérdidas.

¿Necesito autoalojar A.X K2 para usar DSpark?

Sí. DSpark se carga mediante vLLM junto con A.X K2, por lo que no tiene nada que redactar a menos que estés ejecutando el objetivo de 688B. Hoy no hay una API alojada para ninguno de los dos modelos.

¿Funciona DSpark con otros modelos?

SK Telecom lo diseñó para la arquitectura MoE, la estructura de atención y el contexto de 256K de A.X K2, y no lo ha validado contra ningún otro objetivo.

El veredicto

A.X K2 DSpark vs A.X K2 es un "versus" donde la respuesta honesta es "ambos". Si ya ejecutas A.X K2 y los usuarios esperan generaciones largas, el modelo borrador es un experimento gratuito y de bajo riesgo: pesos Apache 2.0, en el peor caso sin aceleración, y sin regresión de calidad posible por construcción. Si no estás limitado por la latencia — o no estás autoalojando un MoE de 688B en absoluto — puedes ignorarlo con seguridad hasta que lleguen los números de evaluación de SK Telecom y la prometida publicación pública haga oficial el modelo. Lo que no deberías hacer es confundir la cifra del 60–85% del artículo con una medición de este modelo: ahora mismo, todo lo específico de DSpark en A.X K2 sigue siendo TBD.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube