
K-EXAONE-2.0-750B-A37B-DSpark: 750B-параметрическая корейская MoE-модель от LG появится в vLLM
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
9 августа 2026 года в репозитории vLLM был открыт pull request для добавления K-EXAONE-2.0-750B-A37B-DSpark — варианта спекулятивного декодирования флагманской корейской модели LG AI Research с 750 миллиардами параметров. Четыре дня спустя, 13 августа, второй, более фундаментальный PR превратил утечку в реальность: теперь в vLLM есть общий путь конфигурации DSparkDraftModel, который сопоставляет любой чекпойнт Hugging Face, объявляющий architectures=DSparkDraftModel с model_type=qwen3, с распознаваемой Qwen3DSparkModel, а также тестовый план, который фактически обслуживает драфтер RadixArk Qwen3.8-2.4T-A95B-DSpark через спекулятивный метод dspark. Базовая модель K-EXAONE-2.0-750B-A37B вышла 31 июля под лицензией Apache 2.0, и на момент запуска vLLM мог обслуживать её с помощью метода чернового декодирования MTP, но не DSpark — драфтера, который LG также поставляет и который, по утверждению LG, обеспечивает ускорение декодирования в 3–5 раз. Сам DSpark — это метод DeepSeek, тот же полуавторегрессионный драфтер, который работает на DeepSeek-V4-Pro-DSpark и DeepSeek-V4-Flash-DSpark, так что два PR вместе — самый яркий на сегодняшний день признак того, что стек спекулятивного декодирования DeepSeek становится стандартом по умолчанию для моделей с открытыми весами.
Это материал о том, что известно на данный момент, а не анонс запуска. Оба pull request’а открыты и не объединены, у чекпойнта DSpark нет независимых бенчмарков, а показатель ускорения от LG — это заявление вендора. Всё ниже соответствующим образом помечено. Что реально на сегодняшний день: веса доступны на Hugging Face, базовая модель выпущена, спекулятивный декодер DSpark в vLLM уже обслуживает чекпойнты DeepSeek и Kimi, а универсальный конфигурационный путь, который позволил бы загружать сторонний драфтер DSpark — та часть, которой ждала эта утечка, — теперь находится в публичном pull request’е: протестирован, но не выпущен.
Краткая версия
• PR #51558, открытый 9 августа 2026 года, добавляет K-EXAONE-2.0-750B-A37B-DSpark в vLLM; он всё ещё открыт и пока без одобрений.
• PR #52197, открытый 13 августа 2026 года, добавляет поддержку общей конфигурации DSparkDraftModel — architectures=DSparkDraftModel с model_type=qwen3, нормализованной к Qwen3DSparkModel — а его тестовый план запускает драфтер RadixArk Qwen3.8-2.4T-A95B-DSpark с методом dspark spec и семью spec-токенами. Также открыт и не объединён.
DSpark — это драфтер семейства EAGLE, опубликованный DeepSeek в открытом доступе и входящий в состав DeepSeek-V4-Pro-DSpark и DeepSeek-V4-Flash-DSpark; LG — наиболее заметное на данный момент внедрение другой лабораторией, а драфтер Qwen3.8 от RadixArk — второй независимый.
• Вариант DSpark представляет собой 78-слойную модель MoE на 750B параметров плюс пять дополнительных черновых слоёв; LG заявляет, что DSpark и MTP обеспечивают примерно 3–5-кратное ускорение декодирования и ориентированы на длительные агентные рабочие нагрузки.
• При запуске vLLM поддерживал MTP для K-EXAONE 2.0, но не для DSpark; специализированный PR для модели и общий путь конфигурации — это внедрение поддержки DSpark.
• Сегодня ни один провайдер не размещает чекпойнты K-EXAONE 2.0, и все бенчмарки на карточке — собственные разработки LG.
Что такое pull requests (и чем они не являются)
vLLM PR #51558, «[Model] Add K-EXAONE-2.0-750B-A37B-DSpark», был открыт lkm2835 — тем же участником, который ранее добавил поддержку K-EXAONE в vLLM (#50524 для базовой модели) и в SGLang (#33648). Это форк-PR с меткой new-model; было запрошено ревью у владельцев кода vLLM, и пока нет одобрений. Описание состоит из трёх строк: оно добавляет поддержку чекпоинта DSpark, «разработанного LG AI Research», содержит ссылки на карточку модели на Hugging Face и технический отчёт K-EXAONE 2.0 (arXiv 2608.04505), а также ссылается на более раннюю работу vLLM в #50524.
![Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.](https://cms.orcarouter.ai/api/media/file/2-70.png)
PR от 13 августа — иного рода. #52197, «Support DSpark configs with architectures=DSparkDraftModel + model_type=qwen3», добавляет универсальный слой нормализации: драфт-чекпоинт Hugging Face, объявляющий себя DSparkDraftModel с model_type=qwen3, переотображается на Qwen3DSparkModel, которую может загрузить существующий спек-декодер vLLM. Референсная модель в его тестовом плане — RadixArk/Qwen3.8-2.4T-A95B-DSpark — DSpark-спекулятор для целевой модели Qwen3.8-2.4T-A95B максимального класса, обслуживаемый спек-методом dspark с окном спекуляции на семь токенов. Сообщение коммита и есть вся идея: «architectures=DSparkDraftModel+model_type=qwen3». Смысл изменения: сторонний DSpark-драфтер должен загружаться через конфигурацию, а не через код под каждую модель, — именно так сегодня подключается каждый поддерживаемый DSpark-чекпоинт. Он открыт и не смержен, как и #51558.
Читайте этот статус буквально. «Поддержка добавляется» — это не «поддержка доступна»: пока один из PR не будет смёржен и не выйдет в релизе, стандартная сборка vLLM по-прежнему не загрузит вариант DSpark. В самой карточке модели сказано, что обслуживание K-EXAONE 2.0 с DSpark в настоящее время не поддерживается в vLLM, который вместо этого использует MTP. Эти два PR — шаги, которые изменят эту формулировку, — если и когда они будут приняты.
Почему DSpark — вот в чём здесь настоящая история
Само название модели уже многое говорит. «A37B» означает 37 миллиардов активных параметров на токен. «DSpark» — это драфтер спекулятивного декодирования, представленный DeepSeek в этом году: полуавторегрессионная драфт-модель семейства EAGLE, которая за один проход предлагает блок токенов и позволяет целевой модели проверить их, так что качество вывода не меняется, а генерация ускоряется. DeepSeek открыла исходный код этой модели и поставляет драфтер вместе с собственными чекпоинтами DeepSeek-V4-Pro-DSpark и DeepSeek-V4-Flash-DSpark; по сообщениям сообщества, ускорение составляет 60–85% для Flash и 57–78% для Pro по сравнению с однотокенным MTP-базлайном.
Новый PR ясно показывает, что поддержка DSpark в vLLM никогда не была открытым вопросом. Собственная документация vLLM уже перечисляет модули DSpark для чекпоинтов DeepSeek-V4, Kimi K3 и Gemma4, и команда описала дизайн в инженерном посте за июль. Каждая из этих интеграций, однако, сделана вручную — это утверждённый список чекпоинтов, а не маршрут, которым может воспользоваться любой. Чекпоинт K-EXAONE просто отсутствует в этом списке. #52197 — это попытка сделать маршрут универсальным: одно конфигурационное сопоставление (DSparkDraftModel плюс qwen3) вместо очередного специализированного класса модели, и сторонний драфтер в качестве эталонного тестового случая, а не модель DeepSeek. Именно поэтому история об утёкшем draft-чекпоинте на самом деле является историей об инфраструктуре.
K-EXAONE-2.0-750B-A37B-DSpark сохраняет 78 слоёв базовой модели и добавляет пять черновых слоёв DSpark, а в карточке модели LG утверждается, что и DSpark, и MTP ускоряют генерацию примерно в 3–5 раз — это собственные цифры LG, ориентированные на «долгосрочные нагрузки, такие как агентные задачи», где узким местом является задержка декодирования. Отсюда следуют два вывода. Во-первых, спекулятивное декодирование становится полноценной функцией открытых передовых моделей, а не серверным трюком, который добавляют задним числом. Во-вторых, именно черновой стек DeepSeek становится стандартом по умолчанию — и именно поэтому выпуск суверенного флагмана при поддержке корейского правительства с этим стеком важен не просто как очередная новинка.
Модель, стоящая за PR
K-EXAONE-2.0-750B-A37B-DSpark — вариант K-EXAONE 2.0, продолжения линейки K-EXAONE на 236B от LG и крупнейшей отечественной фундаментальной модели Южной Кореи, созданной в рамках государственной программы суверенного ИИ. Базовая модель — 750B суммарных параметров, 37B активных, архитектура Mixture-of-Experts с 256 экспертами и 8 активными на токен, контекстное окно на 262 144 токена, десять языков, лицензия Apache 2.0 — была размещена на Hugging Face 31 июля 2026 года и получена путём апгрейда (upcycling) из предшественника на 236B, а не обучена с нуля.

Собственные средние показатели LG в бенчмарках (24 бенчмарка, общий результат 70,1) показывают ожидаемый профиль для корейской суверенной модели: сильные заявленные результаты в извлечении информации из длинного контекста, безопасности корейского общества и агентном кодировании, а также показатели, уступающие Qwen3.5 от Alibaba в общих рассуждениях (например, 83,5 против 89,8 в MMLU-Pro). Пока это никто независимо не проверил. Вариант DSpark не меняет ни один из этих показателей — это сервисный артефакт, более быстрый способ запуска той же модели, — именно поэтому он всплывает в пулл-реквестах к инференс-фреймворкам, а не в анонсе.
Реальность сервинга модели MoE с 750B параметров
Именно здесь поддержка DSpark действительно важна. K-EXAONE-2.0-750B-A37B-DSpark — это чекпоинт с 751 миллиардом параметров в форматах BF16/F32, и рекомендация LG — минимум два узла по восемь NVIDIA H200 GPU (16 GPU, тензорный параллелизм 16). При таком масштабе всё решает пропускная способность декодирования — токены в секунду и стоимость длительного агентного шага, — и именно на это нацелено спекулятивное декодирование. Ускорение декодирования в 3–5 раз, если оно подтвердится за пределами испытательного стенда LG, — это разница между тем, будет ли кластер H200 экономически оправдан. LG также документирует проблему коллапса генерации на GPU B200, для которой до исправления требуется обходной путь --disable-prefill-cuda-graph, — напоминание о том, что это работа на переднем крае технологий, а не готовое решение под ключ.

Сколько это стоит и как это на самом деле попробовать
Сегодня ни один API не предоставляет K-EXAONE 2.0. На карточке Hugging Face для варианта DSpark по-прежнему написано: «эта модель не развёрнута ни одним провайдером инференса», а конфигурация 16×H200 означает, что она попадёт в API только тогда, когда кто-то с таким оборудованием решит её развернуть. В этом и заключается настоящая точка трения: фронтир открытых весов всё чаще становится проблемой сервинга, а не доступности.
Когда провайдер всё же подхватит эту модель, ускорение за счёт спекулятивного декодирования проявится в цене за токен, а стоимость переключения для её опробования будет близка к нулю, если ваше приложение уже не привязано к конкретной модели. На OrcaRouter — одной совместимой с OpenAI конечной точке для более чем 200 моделей, с передачей цен провайдеров без наценки — модель, попадающая к любому вышестоящему провайдеру, становится просто изменением маршрутизации, а не повторной интеграцией, а автоматический переход на резервный канал означает, что совершенно новая MoE-модель на 750B параметров, которая окажется медленной или нестабильной, откатится к заведомо рабочей модели без инцидента. Для ясности: сегодня OrcaRouter не размещает K-EXAONE-2.0-750B-A37B-DSpark, как и ни один другой API, который нам удалось найти. Смысл маршрутизирующего слоя — быть готовым к тому дню, когда один из них это сделает.
Что мы смотрим
Два PR, которые нужно смёрджить. #51558 (специфичный для модели) и #52197 (универсальная конфигурация) — оба открыты и без одобрений. Мёрдж и релиз — это то, что превращает «поддержку DSpark» из пул-реквестов во флаги, которые реально можно передать.
• Область применения универсального пути. Если #52197 будет смержен, любая DSparkDraftModel с типом qwen3 на Hugging Face становится загружаемой через конфигурацию — это разница между DSpark как списком одобренных чекпоинтов и DSpark как открытым стандартом.
• Первая независимая оценка. Каждый бенчмарк на карточке выполнен LG. Первый результат Artificial Analysis или arena для корейской MoE на 750B станет первой цифрой, не опубликованной вендором.
• DSpark выходит за пределы DeepSeek. LG и RadixArk теперь два независимых продуктизатора метода драфта DeepSeek, а универсальный путь vLLM — третий сигнал того, что стек консолидируется.
• Квантованный инференс. LG выпускает чекпоинты FP8 и NVFP4 базовой модели; квантованный вариант DSpark, умещающийся на меньшем числе GPU, изменил бы экономику быстрее, чем любой бенчмарк.
Часто задаваемые вопросы
Выпущен ли K-EXAONE-2.0-750B-A37B-DSpark?
Веса лежат на Hugging Face под лицензией Apache 2.0, но это не история запуска: поддержка vLLM — это два открытых, необъединённых pull request’а (#51558 и #52197), цифра ускорения принадлежит самой LG, и ни один провайдер не хостит модель. Под «подтверждено» здесь понимается путь сервинга — общая поддержка конфигурации DSparkDraftModel теперь существует в публичном PR с выполнимым тестовым планом — а не то, что какой-либо выпущенный билд vLLM уже умеет её обслуживать.
В чем разница между K-EXAONE-2.0-750B-A37B и вариантом DSpark?
Базовые 78 слоёв модели плюс пять черновых слоёв DSpark для спекулятивного декодирования — те же веса внутри, те же бенчмарки, и артефакт для сервинга, который декодируется быстрее, а не другая модель.
Чей DSpark — LG или DeepSeek?
DSpark — это открытый метод спекулятивного декодирования от DeepSeek, который также используется в DeepSeek-V4-Pro-DSpark и DeepSeek-V4-Flash-DSpark; LG — самый заметный последователь на данный момент, а Qwen3.8-2.4T-A95B-DSpark от RadixArk — второй независимый драфтер, построенный на том же методе. Карточка модели LG заявляет тот же диапазон ускорения 3–5×.
Могу ли я запустить K-EXAONE-2.0-750B-A37B-DSpark на собственном оборудовании сегодня?
Только при самостоятельном размещении: рекомендация LG — минимум шестнадцать GPU NVIDIA H200, а стандартные выпуски vLLM, SGLang и Transformers по-прежнему требуют несмерженных форков или ожидающегося универсального пути конфигурации для распознавания архитектуры. Поддержка DSparkDraftModel в #52197 — это самое близкое к общему решению, но она всё ещё остаётся открытым pull request.
Что делает это достойным внимания — не сами пул-реквесты, а то, о чём они сигнализируют. Суверенная корейская флагманская модель с 750 миллиардами параметров под лицензией Apache-2.0 решила включить стек спекулятивного декодирования DeepSeek в свой релиз, независимая инференс-компания создала драфтер DSpark для Qwen3.8 класса max, а vLLM отвечает обобщённым конфигурационным путём вместо отдельного патча для каждой модели. Именно так фронтирные открытые модели становятся реальными — не в момент выхода весов, а в момент, когда драфтеры вливаются в основную ветку.
