Сгенерирована главная титульная карточка для статьи о K-EXAONE-2.0-750B-A37B-DSpark. Крупный заголовок «K-EXAONE-2.0-750B-A37B-DSpark» с плашкой-ярлыком «VLLM PR · УТЕЧКА / ЧТО МЫ ЗНАЕМ НА ДАННЫЙ МОМЕНТ», подзаголовок «Модель LG с 750B параметров и корейской архитектурой MoE получает DSpark от DeepSeek в vLLM» и три чипа характеристик: «Всего 750B · 37B активных», «5 черновых слоёв DSpark», «контекст 262 144 токена» — в фирменном сине-голубом B2B-стиле с небольшим мотивом в виде узлов связи от черновой модели к большой и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: 750B-параметрическая корейская MoE-модель от LG появится в vLLM

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

9 августа 2026 года в репозитории vLLM был открыт pull request для добавления K-EXAONE-2.0-750B-A37B-DSpark — варианта спекулятивного декодирования флагманской корейской модели LG AI Research с 750 миллиардами параметров. Четыре дня спустя, 13 августа, второй, более фундаментальный PR превратил утечку в реальность: теперь в vLLM есть общий путь конфигурации DSparkDraftModel, который сопоставляет любой чекпойнт Hugging Face, объявляющий architectures=DSparkDraftModel с model_type=qw​en​3, с распознаваемой Qw​en3DSparkModel, а также тестовый план, который фактически обслуживает драфтер RadixArk Qw​en​3.8-2.4T-A95B-DSpark через спекулятивный метод dspark. Базовая модель K-EXAONE-2.0-750B-A37B вышла 31 июля под лицензией Apache 2.0, и на момент запуска vLLM мог обслуживать её с помощью метода чернового декодирования MTP, но не DSpark — драфтера, который LG также поставляет и который, по утверждению LG, обеспечивает ускорение декодирования в 3–5 раз. Сам DSpark — это метод Deep​Seek, тот же полуавторегрессионный драфтер, который работает на Deep​Seek-V4-Pro-DSpark и Deep​Seek-V4-Flash-DSpark, так что два PR вместе — самый яркий на сегодняшний день признак того, что стек спекулятивного декодирования Deep​Seek становится стандартом по умолчанию для моделей с открытыми весами.

Это материал о том, что известно на данный момент, а не анонс запуска. Оба pull request’а открыты и не объединены, у чекпойнта DSpark нет независимых бенчмарков, а показатель ускорения от LG — это заявление вендора. Всё ниже соответствующим образом помечено. Что реально на сегодняшний день: веса доступны на Hugging Face, базовая модель выпущена, спекулятивный декодер DSpark в vLLM уже обслуживает чекпойнты Deep​Seek и Kim​i, а универсальный конфигурационный путь, который позволил бы загружать сторонний драфтер DSpark — та часть, которой ждала эта утечка, — теперь находится в публичном pull request’е: протестирован, но не выпущен.

Краткая версия

• PR #51558, открытый 9 августа 2026 года, добавляет K-EXAONE-2.0-750B-A37B-DSpark в vLLM; он всё ещё открыт и пока без одобрений.

• PR #52197, открытый 13 августа 2026 года, добавляет поддержку общей конфигурации DSparkDraftModel — architectures=DSparkDraftModel с model_type=qw​en​3, нормализованной к Qw​en3DSparkModel — а его тестовый план запускает драфтер RadixArk Qw​en​3.8-2.4T-A95B-DSpark с методом dspark spec и семью spec-токенами. Также открыт и не объединён.

DSpark — это драфтер семейства EAGLE, опубликованный Deep​Seek в открытом доступе и входящий в состав Deep​Seek-V4-Pro-DSpark и Deep​Seek-V4-Flash-DSpark; LG — наиболее заметное на данный момент внедрение другой лабораторией, а драфтер Qw​en​3.8 от RadixArk — второй независимый.

• Вариант DSpark представляет собой 78-слойную модель MoE на 750B параметров плюс пять дополнительных черновых слоёв; LG заявляет, что DSpark и MTP обеспечивают примерно 3–5-кратное ускорение декодирования и ориентированы на длительные агентные рабочие нагрузки.

• При запуске vLLM поддерживал MTP для K-EXAONE 2.0, но не для DSpark; специализированный PR для модели и общий путь конфигурации — это внедрение поддержки DSpark.

• Сегодня ни один провайдер не размещает чекпойнты K-EXAONE 2.0, и все бенчмарки на карточке — собственные разработки LG.

Что такое pull requests (и чем они не являются)

vLLM PR #51558, «[Model] Add K-EXAONE-2.0-750B-A37B-DSpark», был открыт lkm2835 — тем же участником, который ранее добавил поддержку K-EXAONE в vLLM (#50524 для базовой модели) и в SGLang (#33648). Это форк-PR с меткой new-model; было запрошено ревью у владельцев кода vLLM, и пока нет одобрений. Описание состоит из трёх строк: оно добавляет поддержку чекпоинта DSpark, «разработанного LG AI Research», содержит ссылки на карточку модели на Hugging Face и технический отчёт K-EXAONE 2.0 (arXiv 2608.04505), а также ссылается на более раннюю работу vLLM в #50524.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

PR от 13 августа — иного рода. #52197, «Support DSpark configs with architectures=DSparkDraftModel + model_type=qw​en​3», добавляет универсальный слой нормализации: драфт-чекпоинт Hugging Face, объявляющий себя DSparkDraftModel с model_type=qw​en​3, переотображается на Qw​en3DSparkModel, которую может загрузить существующий спек-декодер vLLM. Референсная модель в его тестовом плане — RadixArk/Qw​en​3.8-2.4T-A95B-DSpark — DSpark-спекулятор для целевой модели Qw​en​3.8-2.4T-A95B максимального класса, обслуживаемый спек-методом dspark с окном спекуляции на семь токенов. Сообщение коммита и есть вся идея: «architectures=DSparkDraftModel+model_type=qw​en​3». Смысл изменения: сторонний DSpark-драфтер должен загружаться через конфигурацию, а не через код под каждую модель, — именно так сегодня подключается каждый поддерживаемый DSpark-чекпоинт. Он открыт и не смержен, как и #51558.

Читайте этот статус буквально. «Поддержка добавляется» — это не «поддержка доступна»: пока один из PR не будет смёржен и не выйдет в релизе, стандартная сборка vLLM по-прежнему не загрузит вариант DSpark. В самой карточке модели сказано, что обслуживание K-EXAONE 2.0 с DSpark в настоящее время не поддерживается в vLLM, который вместо этого использует MTP. Эти два PR — шаги, которые изменят эту формулировку, — если и когда они будут приняты.

Почему DSpark — вот в чём здесь настоящая история

Само название модели уже многое говорит. «A37B» означает 37 миллиардов активных параметров на токен. «DSpark» — это драфтер спекулятивного декодирования, представленный DeepSeek в этом году: полуавторегрессионная драфт-модель семейства EAGLE, которая за один проход предлагает блок токенов и позволяет целевой модели проверить их, так что качество вывода не меняется, а генерация ускоряется. DeepSeek открыла исходный код этой модели и поставляет драфтер вместе с собственными чекпоинтами DeepSeek-V4-Pro-DSpark и DeepSeek-V4-Flash-DSpark; по сообщениям сообщества, ускорение составляет 60–85% для Flash и 57–78% для Pro по сравнению с однотокенным MTP-базлайном.

Новый PR ясно показывает, что поддержка DSpark в vLLM никогда не была открытым вопросом. Собственная документация vLLM уже перечисляет модули DSpark для чекпоинтов Deep​Seek-V4, Kimi K3 и Gem​ma​4, и команда описала дизайн в инженерном посте за июль. Каждая из этих интеграций, однако, сделана вручную — это утверждённый список чекпоинтов, а не маршрут, которым может воспользоваться любой. Чекпоинт K-EXAONE просто отсутствует в этом списке. #52197 — это попытка сделать маршрут универсальным: одно конфигурационное сопоставление (DSparkDraftModel плюс qw​en​3) вместо очередного специализированного класса модели, и сторонний драфтер в качестве эталонного тестового случая, а не модель Deep​Seek. Именно поэтому история об утёкшем draft-чекпоинте на самом деле является историей об инфраструктуре.

K-EXAONE-2.0-750B-A37B-DSpark сохраняет 78 слоёв базовой модели и добавляет пять черновых слоёв DSpark, а в карточке модели LG утверждается, что и DSpark, и MTP ускоряют генерацию примерно в 3–5 раз — это собственные цифры LG, ориентированные на «долгосрочные нагрузки, такие как агентные задачи», где узким местом является задержка декодирования. Отсюда следуют два вывода. Во-первых, спекулятивное декодирование становится полноценной функцией открытых передовых моделей, а не серверным трюком, который добавляют задним числом. Во-вторых, именно черновой стек Deep​Seek становится стандартом по умолчанию — и именно поэтому выпуск суверенного флагмана при поддержке корейского правительства с этим стеком важен не просто как очередная новинка.

Модель, стоящая за PR

K-EXAONE-2.0-750B-A37B-DSpark — вариант K-EXAONE 2.0, продолжения линейки K-EXAONE на 236B от LG и крупнейшей отечественной фундаментальной модели Южной Кореи, созданной в рамках государственной программы суверенного ИИ. Базовая модель — 750B суммарных параметров, 37B активных, архитектура Mixture-of-Experts с 256 экспертами и 8 активными на токен, контекстное окно на 262 144 токена, десять языков, лицензия Apache 2.0 — была размещена на Hugging Face 31 июля 2026 года и получена путём апгрейда (upcycling) из предшественника на 236B, а не обучена с нуля.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

Собственные средние показатели LG в бенчмарках (24 бенчмарка, общий результат 70,1) показывают ожидаемый профиль для корейской суверенной модели: сильные заявленные результаты в извлечении информации из длинного контекста, безопасности корейского общества и агентном кодировании, а также показатели, уступающие Qw​en​3.5 от Alibaba в общих рассуждениях (например, 83,5 против 89,8 в MMLU-Pro). Пока это никто независимо не проверил. Вариант DSpark не меняет ни один из этих показателей — это сервисный артефакт, более быстрый способ запуска той же модели, — именно поэтому он всплывает в пулл-реквестах к инференс-фреймворкам, а не в анонсе.

Реальность сервинга модели MoE с 750B параметров

Именно здесь поддержка DSpark действительно важна. K-EXAONE-2.0-750B-A37B-DSpark — это чекпоинт с 751 миллиардом параметров в форматах BF16/F32, и рекомендация LG — минимум два узла по восемь NVIDIA H200 GPU (16 GPU, тензорный параллелизм 16). При таком масштабе всё решает пропускная способность декодирования — токены в секунду и стоимость длительного агентного шага, — и именно на это нацелено спекулятивное декодирование. Ускорение декодирования в 3–5 раз, если оно подтвердится за пределами испытательного стенда LG, — это разница между тем, будет ли кластер H200 экономически оправдан. LG также документирует проблему коллапса генерации на GPU B200, для которой до исправления требуется обходной путь --disable-prefill-cuda-graph, — напоминание о том, что это работа на переднем крае технологий, а не готовое решение под ключ.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

Сколько это стоит и как это на самом деле попробовать

Сегодня ни один API не предоставляет K-EXAONE 2.0. На карточке Hugging Face для варианта DSpark по-прежнему написано: «эта модель не развёрнута ни одним провайдером инференса», а конфигурация 16×H200 означает, что она попадёт в API только тогда, когда кто-то с таким оборудованием решит её развернуть. В этом и заключается настоящая точка трения: фронтир открытых весов всё чаще становится проблемой сервинга, а не доступности.

Когда провайдер всё же подхватит эту модель, ускорение за счёт спекулятивного декодирования проявится в цене за токен, а стоимость переключения для её опробования будет близка к нулю, если ваше приложение уже не привязано к конкретной модели. На OrcaRouter — одной совместимой с Open​AI конечной точке для более чем 200 моделей, с передачей цен провайдеров без наценки — модель, попадающая к любому вышестоящему провайдеру, становится просто изменением маршрутизации, а не повторной интеграцией, а автоматический переход на резервный канал означает, что совершенно новая MoE-модель на 750B параметров, которая окажется медленной или нестабильной, откатится к заведомо рабочей модели без инцидента. Для ясности: сегодня OrcaRouter не размещает K-EXAONE-2.0-750B-A37B-DSpark, как и ни один другой API, который нам удалось найти. Смысл маршрутизирующего слоя — быть готовым к тому дню, когда один из них это сделает.

Что мы смотрим

Два PR, которые нужно смёрджить. #51558 (специфичный для модели) и #52197 (универсальная конфигурация) — оба открыты и без одобрений. Мёрдж и релиз — это то, что превращает «поддержку DSpark» из пул-реквестов во флаги, которые реально можно передать.

• Область применения универсального пути. Если #52197 будет смержен, любая DSparkDraftModel с типом qwen3 на Hugging Face становится загружаемой через конфигурацию — это разница между DSpark как списком одобренных чекпоинтов и DSpark как открытым стандартом.

• Первая независимая оценка. Каждый бенчмарк на карточке выполнен LG. Первый результат Artificial Analysis или arena для корейской MoE на 750B станет первой цифрой, не опубликованной вендором.

• DSpark выходит за пределы Deep​Seek. LG и RadixArk теперь два независимых продуктизатора метода драфта Deep​Seek, а универсальный путь vLLM — третий сигнал того, что стек консолидируется.

• Квантованный инференс. LG выпускает чекпоинты FP8 и NVFP4 базовой модели; квантованный вариант DSpark, умещающийся на меньшем числе GPU, изменил бы экономику быстрее, чем любой бенчмарк.

Часто задаваемые вопросы

Выпущен ли K-EXAONE-2.0-750B-A37B-DSpark?

Веса лежат на Hugging Face под лицензией Apache 2.0, но это не история запуска: поддержка vLLM — это два открытых, необъединённых pull request’а (#51558 и #52197), цифра ускорения принадлежит самой LG, и ни один провайдер не хостит модель. Под «подтверждено» здесь понимается путь сервинга — общая поддержка конфигурации DSparkDraftModel теперь существует в публичном PR с выполнимым тестовым планом — а не то, что какой-либо выпущенный билд vLLM уже умеет её обслуживать.

В чем разница между K-EXAONE-2.0-750B-A37B и вариантом DSpark?

Базовые 78 слоёв модели плюс пять черновых слоёв DSpark для спекулятивного декодирования — те же веса внутри, те же бенчмарки, и артефакт для сервинга, который декодируется быстрее, а не другая модель.

Чей DSpark — LG или DeepSeek?

DSpark — это открытый метод спекулятивного декодирования от Deep​Seek, который также используется в Deep​Seek-V4-Pro-DSpark и Deep​Seek-V4-Flash-DSpark; LG — самый заметный последователь на данный момент, а Qw​en​3.8-2.4T-A95B-DSpark от RadixArk — второй независимый драфтер, построенный на том же методе. Карточка модели LG заявляет тот же диапазон ускорения 3–5×.

Могу ли я запустить K-EXAONE-2.0-750B-A37B-DSpark на собственном оборудовании сегодня?

Только при самостоятельном размещении: рекомендация LG — минимум шестнадцать GPU NVIDIA H200, а стандартные выпуски vLLM, SGLang и Transformers по-прежнему требуют несмерженных форков или ожидающегося универсального пути конфигурации для распознавания архитектуры. Поддержка DSparkDraftModel в #52197 — это самое близкое к общему решению, но она всё ещё остаётся открытым pull request.

Что делает это достойным внимания — не сами пул-реквесты, а то, о чём они сигнализируют. Суверенная корейская флагманская модель с 750 миллиардами параметров под лицензией Apache-2.0 решила включить стек спекулятивного декодирования Deep​Seek в свой релиз, независимая инференс-компания создала драфтер DSpark для Qw​en​3.8 класса max, а vLLM отвечает обобщённым конфигурационным путём вместо отдельного патча для каждой модели. Именно так фронтирные открытые модели становятся реальными — не в момент выхода весов, а в момент, когда драфтеры вливаются в основную ветку.