Tarjeta de título principal generada para el artículo sobre K-EXAONE-2.0-750B-A37B-DSpark. Texto de título grande 'K-EXAONE-2.0-750B-A37B-DSpark' con una etiqueta tipo píldora que dice 'VLLM PR · FILTRACIÓN / LO QUE SABEMOS HASTA AHORA', subtítulo 'El MoE coreano de 750B de LG incorporará el DSpark de DeepSeek en vLLM', y tres chips de especificaciones: '750B total · 37B activos', '5 capas de borrador de DSpark', 'contexto de 262 144 tokens', en el estilo B2B azul y cian de la casa, con un pequeño motivo de nodos que conecta el modelo de borrador con el modelo grande, y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: El MoE coreano de 750B de LG llega a vLLM

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 9 de agosto de 2026, se abrió una pull request en el repositorio de vLLM para añadir K-EXAONE-2.0-750B-A37B-DSpark — la variante de decodificación especulativa del buque insignia coreano de 750 mil millones de parámetros de LG AI Research. Una línea en un registro de cambios, pero cierra una brecha real. La base K-EXAONE-2.0-750B-A37B se lanzó el 31 de julio bajo Apache 2.0, y en su lanzamiento vLLM podía servirlo con el método de borrador MTP, pero no con DSpark — el borrador que LG también incluye y del que afirma que logra una aceleración de decodificación de 3–5×. Toda la razón de ser de la variante DSpark ha quedado efectivamente atascada en SGLang. DSpark en sí es el método de Deep​Seek, el mismo borrador semi-autorregresivo que se ejecuta en DeepSeek-V4-Pro-DSpark y DeepSeek-V4-Flash-DSpark, por lo que esta PR es también la señal más clara hasta ahora de que la pila de decodificación especulativa de Deep​Seek se está convirtiendo en la opción predeterminada de pesos abiertos.

Esto es una pieza de "lo que sabemos hasta ahora", no una historia de lanzamiento. La PR está abierta y sin fusionar, el checkpoint de DSpark no tiene benchmark independiente, y la cifra de aceleración de LG es una afirmación del proveedor. Todo lo que aparece a continuación está etiquetado en consecuencia. Lo que es real hoy: los pesos están en Hugging Face, el modelo base se lanzó, y el soporte de vLLM para la variante DSpark está ahora en curso.

La versión corta.

• La PR #51558, abierta el 9 de agosto de 2026, añade K-EXAONE-2.0-750B-A37B-DSpark a vLLM; sigue abierta sin aprobaciones todavía.

• DSpark es el borrador de la familia EAGLE que Deep​Seek publicó como código abierto y se incluye en DeepSeek-V4-Pro-DSpark y DeepSeek-V4-Flash-DSpark; LG es la adopción de mayor perfil por parte de otro laboratorio hasta ahora.

La variante DSpark es el MoE de 750B con 78 capas más cinco capas de borrador adicionales; LG afirma que DSpark y MTP ofrecen cada uno aproximadamente una aceleración de decodificación de 3 a 5 veces, dirigido a cargas de trabajo agénticas de largo horizonte.

• En el lanzamiento, vLLM soportaba MTP para K-EXAONE 2.0 pero no para DSpark; esta PR es la que incorpora el soporte para DSpark.

• Ningún proveedor aloja hoy ningún checkpoint de K-EXAONE 2.0, y todos los benchmarks de la ficha son propios de LG.

Qué es la solicitud de extracción (y qué no es)

vLLM PR #51558, "[Model] Add K-EXAONE-2.0-750B-A37B-DSpark," fue abierto por lkm2835 — el mismo colaborador detrás del soporte anterior de K-EXAONE en vLLM (#50524 para el modelo base) y en SGLang (#33648). Es un PR de fork etiquetado con la etiqueta de nuevo modelo, se solicitó revisión a los propietarios del código de vLLM, y aún no tiene aprobaciones. La descripción tiene tres líneas: agrega soporte para el checkpoint DSpark "desarrollado por LG AI Research", enlaza la tarjeta del modelo en Hugging Face y el informe técnico de K-EXAONE 2.0 (arXiv 2608.04505), y hace referencia al trabajo anterior en vLLM en #50524.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

Lee ese estado literalmente. «Se está añadiendo soporte» no es «el soporte está disponible»: hasta que el PR se fusione y se publique en una versión, una compilación estándar de vLLM todavía no cargará la variante DSpark. La propia tarjeta del modelo dice que servir K-EXAONE 2.0 con DSpark no está actualmente soportado en vLLM, que usa MTP en su lugar. Este PR es el paso que cambia esa frase — si y cuando se materialice.

Por qué DSpark es la verdadera historia aquí

El nombre del modelo hace mucho trabajo. "A37B" significa 37 mil millones de parámetros activos por token. "DSpark" es el modelo borrador de decodificación especulativa que Deep​Seek presentó este año: un modelo borrador semi-autorregresivo de la familia EAGLE que propone un bloque de tokens en una sola pasada y permite que el modelo objetivo los verifique, por lo que la calidad de salida no cambia mientras la generación se vuelve más rápida. Deep​Seek lo publicó como código abierto y distribuye el borrador con sus propios checkpoints DeepSeek-V4-Pro-DSpark y DeepSeek-V4-Flash-DSpark, con aceleraciones reportadas por la comunidad en el rango del 60–85% para Flash y del 57–78% para Pro en comparación con una línea base de MTP de un solo token.

K-EXAONE-2.0-750B-A37B-DSpark conserva las 78 capas del modelo base y añade cinco capas de borrador DSpark, y la ficha técnica de LG afirma que tanto DSpark como MTP aceleran la generación en aproximadamente 3–5× — cifras propias, dirigidas a "cargas de trabajo de horizonte largo, como las tareas agénticas," donde la latencia de decodificación es el cuello de botella. De ahí se siguen dos cosas. Primero, la decodificación especulativa se está convirtiendo en una característica de primera clase de los modelos frontera abiertos, y no en un truco de servidor que se añade después. Segundo, es la pila de borrador de Deep​Seek la que se está convirtiendo en la opción por defecto — que es exactamente por lo que un buque insignia soberano respaldado por el gobierno coreano que lo incluya importa más allá de la típica noticia de "nuevo modelo".

El modelo detrás del PR

K-EXAONE-2.0-750B-A37B-DSpark es una variante de K-EXAONE 2.0, la secuela de la línea K-EXAONE de 236B de LG y el modelo fundacional autóctono más grande de Corea del Sur, construido bajo el programa de IA soberana del gobierno. El modelo base — 750B de parámetros totales, 37B activos, Mezcla de Expertos con 256 expertos y 8 activos por token, una ventana de contexto de 262 144 tokens, diez idiomas, Apache 2.0 — se publicó en Hugging Face el 31 de julio de 2026, obtenido mediante upcycling del predecesor de 236B en lugar de entrenado desde cero.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

Los promedios de referencia del propio LG (24 benchmarks, 70,1 en general) muestran la forma esperada para un modelo soberano coreano: sólidos resultados reportados en recuperación de contexto largo, seguridad social coreana y codificación agéntica, junto con cifras que quedan por detrás de las de Alibaba Qwen3.5 en razonamiento general (83,5 frente a 89,8 en MMLU-Pro, por ejemplo). Nada de ello está verificado de forma independiente todavía. La variante DSpark no cambia ninguna de esas puntuaciones: es un artefacto de servicio, una forma más rápida de ejecutar el mismo modelo, que es exactamente la razón por la que aparece en una pull request de un framework de inferencia en lugar de en un anuncio.

La realidad de servir un MoE de 750B

Aquí es donde el soporte de DSpark realmente importa. K-EXAONE-2.0-750B-A37B-DSpark es un checkpoint de 751 mil millones de parámetros en BF16/F32, y la guía de LG recomienda un mínimo de dos nodos de ocho GPUs NVIDIA H200 (16 GPUs, tensor-parallel 16). A esa escala, el rendimiento de decodificación lo es todo — tokens por segundo y el costo de un turno agéntico largo — y eso es precisamente lo que ataca el decodificado especulativo. Una aceleración de decodificación de 3–5×, si se mantiene fuera del banco de pruebas de LG, es la diferencia entre que un clúster de H200 sea económico o no. LG también documenta un problema de colapso de generación en GPUs B200 que requiere la solución alternativa --disable-prefill-cuda-graph hasta que se solucione — un recordatorio de que esto es servir en la vanguardia, no algo llave en mano.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

Lo que cuesta, y cómo puedes probarlo realmente

Ninguna API sirve K-EXAONE 2.0 hoy en día. La tarjeta de Hugging Face para la variante DSpark todavía dice "este modelo no está desplegado por ningún proveedor de inferencia", y una huella de 16×H200 significa que solo llega a una API alojada cuando alguien con ese hardware decide alojarlo. Ese es el verdadero punto de fricción: la frontera de pesos abiertos es cada vez más un problema de servicio, no un problema de disponibilidad.

Cuando un proveedor lo adopte, la aceleración de la decodificación especulativa aparecerá en el precio por token, y el costo de cambiarse para probarlo debería ser casi cero si tu aplicación ya es independiente del modelo. En OrcaRouter — un endpoint compatible con OpenAI que abarca más de 200 modelos, con el precio de lista del proveedor trasladado sin margen (0% de recargo) — un modelo que llegue a cualquier proveedor upstream se convierte en un cambio de enrutamiento en lugar de una reintegración, y la conmutación automática por error significa que un MoE de 750B recién estrenado que resulte lento o inestable cae en un modelo conocido y confiable sin incidente. Para ser explícitos: OrcaRouter no aloja K-EXAONE-2.0-750B-A37B-DSpark hoy, y tampoco lo hace ninguna otra API que hayamos encontrado. El objetivo de la capa de enrutamiento es estar preparada para el día en que uno de ellos lo haga.

Lo que estamos viendo

El merge del PR. #51558 está abierto sin aprobaciones. Merge más release es lo que convierte el "soporte DSpark" de un pull request en un flag que de verdad puedes pasar.

Una primera puntuación independiente. Cada benchmark de la tarjeta lo ejecuta LG. El primer punto de datos de Artificial Analysis o arena en un MoE coreano de 750B será el primer número no impreso por el proveedor.

DSpark más allá de Deep​Seek. Deep​Seek ya publica borradores DSpark para otros objetivos; LG es el adoptante de mayor perfil de otro laboratorio. Merece la pena seguir de cerca si el método se convierte en el estándar por defecto de pesos abiertos.

Servicio cuantizado.LG lanza checkpoints FP8 y NVFP4 del modelo base; una variante cuantizada de DSpark que quepa en menos GPUs cambiaría la economía más rápido que cualquier benchmark.

Preguntas frecuentes

¿Se ha lanzado K-EXAONE-2.0-750B-A37B-DSpark?

Los pesos están en Hugging Face bajo Apache 2.0, pero esto no es una historia de lanzamiento: el soporte de vLLM es una solicitud de extracción abierta y sin fusionar (#51558), la cifra de aceleración es propia de LG, y ningún proveedor aloja el modelo.

¿Cuál es la diferencia entre K-EXAONE-2.0-750B-A37B y la variante DSpark?

Las 78 capas del modelo base más cinco capas de borrador DSpark para decodificación especulativa — los mismos pesos subyacentes, los mismos benchmarks y un artefacto de servicio más rápido de decodificar, en lugar de un modelo diferente.

¿DSpark es de LG o de Deep​Seek?

DSpark es el método de decodificación especulativa de código abierto de Deep​Seek, también incluido en DeepSeek-V4-Pro-DSpark y DeepSeek-V4-Flash-DSpark; LG es el adoptante de mayor perfil hasta ahora, y su tarjeta de modelo afirma el mismo rango de aceleración de 3 a 5 veces.

¿Puedo ejecutar K-EXAONE-2.0-750B-A37B-DSpark en mi propio hardware hoy?

Solo mediante el autoalojamiento: la guía de LG requiere un mínimo de dieciséis GPU NVIDIA H200, y las versiones estándar de vLLM, SGLang y Transformers aún necesitan bifurcaciones sin fusionar para reconocer la arquitectura.

Lo que hace que valga la pena prestar atención no es el pull request en sí — sino lo que el pull request señala. Un buque insignia soberano coreano de 750 mil millones de parámetros, con licencia Apache-2.0, eligió incluir la pila de decodificación especulativa de Deep​Seek, y el ecosistema de inferencia se está poniendo al día capa por capa: SGLang primero, vLLM después. Así es como los modelos abiertos de frontera se hacen realidad — no en el momento en que se publican los pesos, sino en el momento en que se fusionan los modelos borradores.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube