
A.X K2 DSpark против A.X K2: Что реально дает модель, работающая только как драфтер?
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Самое странное в сравнении A.X K2 DSpark и A.X K2 — это то, что на самом деле это не сравнение. A.X K2 DSpark нельзя использовать вместо A.X K2 — его вообще нельзя использовать самостоятельно. Это «чекпойнт только для драфтинга» (drafter-only checkpoint), который SK Telecom незаметно выложил на Hugging Face в начале августа без анонса: модель-драфтер для спекулятивного декодирования, единственная задача которой — заставить A.X K2 — флагманскую модель компании на 688 миллиардов параметров с открытыми весами и архитектурой Mixture-of-Experts — генерировать токены быстрее, не меняя её ответы. Поэтому настоящий вопрос, вокруг которого строится это противостояние, — не «что лучше», а «стоит ли запускать A.X K2 с DSpark или без него?» Каждое утверждение в этом материале помечено источником, потому что разрыв между тем, что говорит репозиторий, и тем, что было измерено на самом деле, и есть вся суть.
Что такое A.X K2 DSpark на самом деле
Карточка модели SK Telecom необычно прямолинейно описывает назначение модели. A.X K2 DSpark «является черновой моделью для спекулятивного декодирования A.X K2» и «представляет собой чекпоинт только для drafting: у него нет самостоятельного применения, и он предназначен для загрузки через vLLM вместе с A.X K2 с использованием спекулятивного декодирования». На практике это означает, что вы скачиваете её, указываете совместимой vLLM на неё и на A.X K2, и они работают в паре: DSpark предлагает кандидатные токены, A.X K2 проверяет их, и наружу выводятся только проверенные токены.
Две детали механизма черновика можно узнать из репозитория. Во-первых, DSpark предлагает несколько токенов-кандидатов параллельно, а не записывает черновую последовательность по одному токену за раз, опираясь на собственные скрытые представления A.X K2 вместе с лёгким моделированием локальных зависимостей. Во-вторых, весь механизм построен без потерь: каждый кандидат проверяется целевой моделью до того, как он фиксируется, поэтому распределение выходных данных A.X K2 не меняется по построению.
Сам релиз является предварительным объявлением. В карточке указано, что модель «в настоящее время находится на финальной валидации и планируется к публичному выпуску в ближайшие несколько дней», а оценка «в настоящее время выполняется» — все метрики пропускной способности, TPOT и средней длины принятых ответов в карточке по-прежнему указаны как TBD.
Почему это «versus» на самом деле «с versus без»
Поскольку A.X K2 DSpark не имеет самостоятельного применения, не существует сценария, в котором вы выбираете его вместо A.X K2. Выбор стоит между самим A.X K2 и A.X K2 с подключённой черновой моделью. По качеству выходных данных обе конфигурации по построению идентичны; единственный параметр, который может меняться, — это скорость декодирования.
Для протокола: {{1}}A.X K2{{/1}} — это декодер Mixture-of-Experts с 688B суммарных и 33B активных параметров, 256 экспертами плюс одним общим экспертом (8 активных за прямой проход), 61 слоем, 64 головками внимания и словарём на 163 840 токенов, выпущенный с открытыми весами под лицензией {{2}}Apache 2.0{{/2}} 29 июля. Модель предобучена примерно на 8,2 триллиона токенов нативно в формате {{3}}MXFP8{{/3}}, использует {{5}}Sparse Gated Attention{{/5}} от {{4}}SK Telecom{{/4}} для эффективной работы с длинным контекстом и поддерживает контекст в 262 144 токена (нативные 128K, расширенные до 256K через {{6}}YaRN{{/6}}). {{7}}SK Telecom{{/7}} сообщает, что в среднем модель на +32,2 процентных пункта превосходит {{8}}A.X K1{{/8}} по 14 бенчмаркам, причём оценки на длинноконтекстных и агентных задачах выросли примерно на 83,9 пункта — все данные заявлены вендором, независимый сводный показатель пока не опубликован.
DSpark разработан специально для этой архитектуры. В карточке указано, что он соответствует структуре MoE, схеме внимания и родной конфигурации 256K от A.X K2 и не проверен ни для какой другой цели. Он наследует тот же контекст в 262,144 токена, так что его запуск ничего не стоит вам по размеру окна.

Чтение карточки модели: познаваемо, но ещё не подтверждено
Репозиторий даёт вам чёткое представление о том, что представляет собой модель, и краткий список того, о чём он вам не рассказывает.
Познаваемое сегодня:
• Это чекпоинт только для драфтера, не предназначенный для самостоятельного использования; загружается vLLM вместе с A.X K2 посредством спекулятивного декодирования.
• Лицензия Apache 2.0; веса можно свободно скачивать и использовать.
• Длина контекста соответствует A.X K2 при 262 144 токенах.
• Он работает через форк vLLM от SK Telecom (репозиторий SKT-AI/vllm, ветка axk2-v0.23.0) с использованием флага --speculative-config.
• Метод описан в статье «DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation» (arXiv:2607.05147, подана 6 июля 2026 года) — эта же статья служит источником приводимых далее цифр ускорения.
• Ни один провайдер инференса сегодня не разворачивает её, поэтому нет размещённого API для вызова.
Еще не подтверждено:
• Официальное объявление — карта обещает публичный релиз «в ближайшие несколько дней».
• Любой показатель ускорения, специфичный для A.X K2. Оценка в процессе, все показатели производительности — TBD.
• Насколько это на самом деле помогает под нагрузкой, что карточка помечает как «зависящее от нагрузки».
• Любое независимое измерение черновой модели, выполненное третьей стороной.

Чем DSpark отличается от обычного спекулятивного декодирования
Спекулятивное декодирование — известный приём: небольшая быстрая модель-черновик пишет предположение о следующих нескольких токенах, а большая модель проверяет всё предположение за один прямой проход, принимая префикс, который успешно проходит проверку, прежде чем сделать один корректирующий шаг. При правильном применении это значительно снижает задержку без потери качества.
Загвоздка, как её формулирует статья DSpark, в том, что недавние параллельные драфтеры — которые предлагают длинные последовательности за один проход — страдают от «быстрого затухания принятия», поскольку более поздние токены в черновике не зависят от более ранних, и поэтому отклоняются гораздо чаще. А слепая проверка длинных блоков впустую расходует ёмкость батча на токены, которые, скорее всего, будут отклонены, что снижает пропускную способность именно в системах с высокой степенью параллелизма.
DSpark решает обе проблемы:
Полуавторегрессивная генерация черновика. Она сочетает параллельную основу с легковесным последовательным модулем, добавляя моделирование зависимостей внутри блоков, так что более поздние токены черновика зависят от более ранних — что как раз и смягчает деградацию суффикса.
• Проверка с планированием по уровню достоверности. Вместо проверки фиксированной длины блока она подстраивает длину проверки под каждый запрос на основе оценок вероятностей сохранения префикса и профиля пропускной способности движка. Проверка становится адаптивной к нагрузке.
Цифры в статье — и о чём они умалчивают
Вот цифра, которую вы увидите в цитатах: DSpark «ускоряет скорость генерации в расчёте на пользователя на 60–85 процентов» при сопоставимых уровнях пропускной способности по сравнению с производственным базовым уровнем MTP-1. В статье также сообщается о существенно улучшенной длине принятых токенов по сравнению с современными авторегрессионными и параллельными драфтерами на офлайн-бенчмарках, и утверждается, что он предотвращает серьёзную деградацию пропускной способности при строгих ограничениях интерактивности.
Вчитайтесь в мелкий шрифт — это важно для данного конкретного сравнения: {{1}}эти 60–85% были измерены в серверной системе DeepSeek-V4 в условиях живого пользовательского трафика, а не на A.X K2.{{/1}} Это утверждение о методе DSpark, развёрнутом на стеке другой модели. Карта DSpark для A.X K2, напротив, пока вообще не имеет никакой цифры ускорения. Поэтому честная картина для этой пары такова: {{2}}идентичный по построению выход и ускорение, которое, согласно статье о методе, выглядит правдоподобным, но которое сама SK Telecom ещё не измеряла на модели, для которой создавался этот черновой чекпойнт.{{/2}}

Что на самом деле нужно для его запуска
Предпосылка — это та часть, о которую большинство споткнётся: вам придётся самостоятельно хостить A.X K2. Для целевой модели нет размещённого API — у неё открытые веса, и обслуживание MoE с 688B/33B активными параметрами — это серьёзные инфраструктурные обязательства. DSpark имеет значение только для команд, которые уже взяли на себя эти обязательства.
Если у вас есть такая модель, предельные издержки добавления черновой модели невелики:
• Скачайте черновой чекпоинт Apache 2.0 и запустите форк vLLM от SK Telecom (ветка axk2-v0.23.0).
• Включите спекулятивное декодирование с помощью флага --speculative-config, указав его на контрольную точку DSpark.
Зарезервируйте дополнительную память для черновых весов и примите тот факт, что теперь вы используете вендорский форк vLLM, а не стандартную версию, — это аспект, который следует учитывать при сопровождении.
• Помните о собственной оговорке авторов статьи, что верификация не бесплатна: при высокой конкурентности небрежная верификация съедает пропускную способность пакетов — это именно тот режим отказа, для управления которым предназначена верификация с планированием по уровню доверия.
Ещё одна деталь, которую стоит знать: Hugging Face сообщает, что загрузки «не отслеживаются для этой модели», поэтому нет публичных данных о том, сколько команд на самом деле её попробовали.
Кто должен выбирать
Запустите plain A.X K2, если что-либо из этого относится к вам:
• Вы используете стандартный vLLM и не хотите второго чекпойнта или вендорского форка на пути.
Ваши рабочие нагрузки ограничены пропускной способностью, а не задержкой, и пользователи готовы ждать длительных генераций.
• Вы предпочли бы дождаться официального релиза и первых независимых измерений.
Запустите A.X K2 плюс DSpark, если это вы:
• Вы самостоятельно хостите A.X K2, и именно задержка генерации или пропускная способность токенов является узким местом.
• Рабочие нагрузки с длинным контекстом и агентные сценарии заставляют пользователей ждать длинных выводов — тот самый режим, для которого и создано спекулятивное декодирование.
• Вам комфортно запускать компонент предварительного анонса, чей недостаток ограничен: в худшем случае он не поможет и не сможет изменить качество вывода.
Не выбирайте ни тот, ни другой вариант, если вы вообще не размещаете 688B MoE самостоятельно. Суверенность A.X K2 и её преимущества в корейском языке доступны вам только при её запуске, а многие команды вместо этого получат доступ к передовым открытым моделям через каталог размещённых моделей. Именно здесь окупается независимость вашей интеграции от конкретной модели: единый OpenAI-совместимый эндпоинт OrcaRouter охватывает 200+ моделей по ценам провайдера с 0% наценкой, автоматическим переключением при сбоях и DSL для маршрутизации, позволяющим объединять несколько моделей в один вызов. (Ни A.X K2, ни A.X K2 DSpark сегодня нигде не размещены — включая OrcaRouter — так что речь идёт об остальной части вашего стека, а не о маршрутизации этой пары.) Этот подход по-прежнему применим: пробуйте непроверенную модель на доле трафика и автоматически переключайтесь при сбоях, а не ставьте на неё производственный маршрут.
Что посмотреть дальше
Ситуация проста: репозиторий настоящий, метод задокументирован, измерения — нет. Стоит следить за тремя вещами: обещанным публичным релизом (на карточке сказано «в течение ближайших нескольких дней»), первыми показателями пропускной способности или задержки для A.X K2 после завершения оценки SK Telecom, и тем, подхватит ли какой-либо инференс-провайдер эту пару — именно это сделало бы DSpark актуальным для команд, которые не используют самостоятельный хостинг.
Часто задаваемые вопросы
Может ли A.X K2 DSpark заменить A.X K2?
Нет. Это чекпоинт только для драфтера, без самостоятельного использования — он существует, чтобы ускорить декодирование A.X K2, а не быть его альтернативой. Вы не можете запустить A.X K2 DSpark без A.X K2.
Изменяет ли DSpark качество вывода A.X K2?
Нет, по построению. Каждый токен-кандидат проверяется A.X K2 перед тем, как он фиксируется, поэтому распределение выходных данных не меняется — в описании подход назван без потерь.
Нужно ли мне самостоятельно размещать A.X K2, чтобы использовать DSpark?
Да. DSpark загружается vLLM вместе с A.X K2, так что ему не для чего создавать черновик, если только вы не запускаете целевую модель 688B. На сегодняшний день ни у одной из моделей нет размещённого API.
Работает ли DSpark с другими моделями?
SK Telecom разработала его для архитектуры MoE, структуры внимания и контекста в 256K модели A.X K2 и не проводила его валидацию на других целевых объектах.
Вердикт
A.X K2 DSpark против A.X K2 — это «сравнение», где честный ответ — «оба». Если вы уже запускаете A.X K2 и пользователи ждут долгих генераций, модель-черновик — это бесплатный эксперимент с низким риском: веса Apache 2.0, в худшем случае отсутствие ускорения, и регресс качества невозможен по построению. Если вы не ограничены задержкой — или вообще не хостите 688B MoE самостоятельно — вы можете спокойно игнорировать её, пока не появятся результаты оценки от SK Telecom и обещанный публичный релиз не сделает модель официальной. Чего вам не следует делать — так это принимать цифру 60–85% из статьи за измерение этой модели: прямо сейчас всё, специфичное для DSpark в A.X K2, всё ещё TBD.
