
A.X-K2-DSpark: черновая модель спекулятивного декодирования SK Telecom появилась без анонса.
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxНОВИНКАMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2100 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
A.X-K2-DSpark — это модель, которую вы, вероятно, никогда не будете вызывать напрямую, и именно поэтому о ней стоит почитать. SK Telecom тихо опубликовал её на Hugging Face — без поста о запуске и без пресс-релиза; карточка модели просто начинается с фразы о том, что чекпойнт «сейчас находится на финальной валидации и планируется к публичному релизу в ближайшие несколько дней». Это чекпойнт, предназначенный только для роли драфтера при спекулятивном декодировании, и создан он для одной задачи: сделать обслуживание флагмана SK Telecom A.X K2 с 688 миллиардами параметров быстрее и дешевле, предлагая токены, которые затем проверяет A.X K2. Вот что репозиторий на самом деле нам сообщает, что ещё не подтверждено и почему такая маленькая вспомогательная модель — это то место, где прячется следующий виток сокращения расходов на обслуживание LLM.
Что такое A.X-K2-DSpark на самом деле
A.X-K2-DSpark не является самостоятельной моделью в каком-либо значимом смысле. В карточке модели это указано в примечаниях о целевом использовании: это «чекпоинт только для драфтинга» с пометкой «без самостоятельного использования», загружаемый vLLM вместе с целевой моделью A.X K2 внутри цикла спекулятивного декодирования. Это стадия черновика двухстадийного генератора — небольшая модель быстро предлагает кандидатные токены, а целевая модель проверяет их, прежде чем какой-либо токен будет зафиксирован в выходных данных.
Для контекста: целевая модель — одна из крупнейших моделей с открытыми весами из существующих. A.X K2 — это модель Mixture-of-Experts от SK Telecom с суммарным объёмом 688 млрд параметров и 33 млрд активных, выпущенная на Hugging Face в конце июля 2026 года под лицензией Apache 2.0. Она построена на базовой архитектуре, которая сочетает Multi-head Latent Attention с DeepSeek Sparse Attention и добавляет собственную модификацию Sparse Gate Attention от SK Telecom для работы с длинным контекстом. A.X-K2-DSpark опирается на скрытые состояния A.X K2 и добавляет лёгкое моделирование локальных зависимостей между позициями кандидатов, благодаря чему может предлагать несколько токенов параллельно, а не генерировать черновик строго авторегрессионно. Каждый кандидат затем проверяется моделью A.X K2 перед фиксацией — именно поэтому в карточке модели результат назван «без потерь по построению»: распределение выходных данных не изменяется моделью-черновиком; меняется только скорость обслуживания.

Как работает спекулятивное декодирование и зачем оно нужно MoE-модели на 688B параметров.
Спекулятивное декодирование существует потому, что авторегрессивная генерация последовательна и ограничена пропускной способностью памяти. Генерация каждого токена означает чтение весов модели из памяти, и для модели с 688B параметрами это огромное количество байт, которые нужно переместить для каждого отдельного токена — даже когда в каждом прямом проходе активны только 33B параметров. Хитрость в том, чтобы потратить немного дополнительных вычислений на небольшую модель-драфтер, которая за один раз предсказывает несколько следующих токенов, а затем большая модель проверяет все предсказания за один прямой проход и сохраняет самый длинный префикс, соответствующий её собственному распределению. Когда драфтер хорош, вы получаете два или три токена за проход большой модели вместо одного, без изменений в конечном результате.
Вся суть в {{1}}коэффициенте принятия{{/1}}. Если драфтер плохо угадывает, его предложения отклоняются, а этап верификации по-прежнему требует той же пропускной способности памяти, так что ускорение сходит на нет. {{2}}Именно поэтому драфтеры сами по себе стали серьезным предметом исследований{{/2}}: для модели масштаба A.X K2 разница между ускорением в 1.5 раза и в 3 раза — это разница между серверным парком из десяти GPU и парком из пяти. Подобные уровни эффективности — вот откуда возьмется следующий раунд снижения цен на размещенные LLM API: не из показателей качества базовой модели, а из серверного стека, который их обслуживает.
DSpark — это метод, и он исходит от команды DeepSeek.
«DSpark» в названии модели — это конкретная техника, и она не является изобретением SK Telecom. В карточке модели цитируется статья «DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation» (arXiv 2607.05147) — препринт от 6 июля 2026 года, подготовленный командой из 33 авторов в DeepSeek, которые внедрили этот метод в собственную систему обслуживания эпохи V4 под нагрузкой реального трафика. SK Telecom адаптировала ту же технику под свою собственную целевую модель.
Два вклада статьи напрямую соответствуют тому, что описывает карта A.X-K2-DSpark. Во-первых, полуавторегрессионный драфтинг: параллельная базовая сеть предлагает токены в пределах окна, а лёгкий последовательный модуль моделирует зависимости между позициями кандидатов, устраняя классическую проблему, при которой уровень принятия у параллельных драфтеров резко падает по мере продвижения по предлагаемой последовательности. Во-вторых, верификация с планированием по уверенности: вместо того чтобы всегда проверять фиксированное количество драфт-токенов, система оценивает вероятность того, что каждый префикс сохранится, и задаёт длину проверки для каждого запроса с учётом профиля пропускной способности движка — так что объём проверки зависит от нагрузки, а не является единообразным.
По цифрам из самой статьи — которые представляют собой измерения авторов и не были независимо проверены — DSpark обеспечил на 60–85% более быструю генерацию на пользователя, чем производственный базовый уровень MTP-1, при сопоставимой пропускной способности, а также предотвратил серьёзное падение пропускной способности при строгих ограничениях интерактивности. При чтении этого релиза важно учитывать две оговорки. Эти результаты были получены на собственном стеке и целевой платформе авторов, а не на A.X K2; кроме того, в карточке модели A.X-K2-DSpark прямо указано, что её оценка всё ещё продолжается. Статья доказывает, что метод работает в производстве. Она не доказывает, что контрольная точка SK Telecom воспроизводит эти улучшения — именно это и остаётся неподтверждённым.

Что говорит репозиторий — и о чём умалчивает
Вот что на данный момент можно узнать из репозитория, и всё это — из карточки модели:
• Роль — чекпоинт только для драфтера A.X K2; не для самостоятельного использования; не проверен ни с какой другой целевой моделью и «несовместим с посторонними моделями».
• Target — A.X K2, 688B всего / 33B активных, смесь экспертов.
• Длина контекста — 262,144 токена (256K), что соответствует нативной конфигурации A.X K2.
• Лицензия — Apache 2.0.
• Механизм — полуавторегрессивное формирование черновика DSpark; каждый кандидат проверяется A.X K2 перед фиксацией (без потерь).
• Статус — "в настоящее время проходит финальную проверку"; релиз запланирован "в течение ближайших нескольких дней."
И вот что пока точно не подтверждено:
• Точность и размер чекпоинта — оба указаны как TBD в карточке модели.
• Пропускная способность, TPOT и средняя принятая длина — три числа, которые показали бы, действительно ли работает составитель черновика, все TBD, с пометкой «оценка в настоящее время продолжается».
• Результаты по предметам — карточка обещает разбивку по корейскому языку, математике, естественным наукам и программированию «позже», без указания даты.
• Официальное объявление — SK Telecom нигде не анонсировал A.X-K2-DSpark, насколько нам удалось найти; репозиторий и есть объявление.
• Независимые оценки — их не существует. Всё, что указано на карте, — это собственные заявления SK Telecom, и большая часть из них — пока лишь обещания.

Самое важное неподтверждённое число — это средняя принятая длина, то есть среднее количество черновых токенов, которые A.X K2 принимает за один проход верификации. Это единственное число определяет, является ли этот драфтер приятным бонусом с ускорением 1.2x или серьёзным апгрейдом инференса с 2.5x. Кроме того, это число с наибольшей вероятностью начнёт распространяться без указания источника, как только выйдет релиз. Относитесь к нему скептически, когда оно появится: цифра 60–85% из статьи DSpark была получена на стеке обслуживания другой модели, а у A.X K2 свои собственные характеристики принятия черновиков.
Как бы вы на самом деле это запускали
Запуск драфтера означает развёртывание A.X K2 из форка vLLM от SK Telecom. Пример из карточки модели, слегка сокращённый, выглядит так:
vllm serve skt/A.X-K2 --tensor-parallel-size 8 --tool-call-parser hermes --reasoning-parser deepseek_v3 --speculative-config '{"method": "dspark", "model": "skt/A.X-K2-DSpark", "num_speculative_tokens": N}'
с установленным форком из репозитория SKT-AI vLLM на ветке axk2-v0.23.0. Карточка честно предупреждает о нескольких оговорках: настройка рассчитана на нативную конфигурацию контекста в 256K для A.X K2, а ускорение зависит от рабочей нагрузки — параллелизм, длина выходных данных, коэффициент принятия и относительная стоимость генерации черновика по сравнению с проверкой — всё это влияет на результат. Иными словами, это серверная инфраструктура, а не скрипт «скачай и запусти». Вам понадобятся веса A.X K2, кластер достаточного размера для тензорного параллелизма 8 и терпение, чтобы настроить num_speculative_tokens под собственный трафик. Это значимый проект для команды, которая уже обслуживает A.X K2, но не повод собирать такую команду с нуля.
Экономика: уровни эффективности побеждают заявления о качестве
Причина, по которой стоит следить за драфтовой моделью для 688B-модели, заключается в том, что гонка эталонных тестов для базовых моделей в основном достигла насыщения, а гонка за стоимость обслуживания — нет. Собственный запуск SK Telecom уже делал ставку на эффективность — изменение Sparse Gate Attention, как утверждалось, повышало общую пропускную способность токенов на 67,7% по сравнению с предыдущим поколением при входах в 120K токенов, — и драфтер — это та же самая идея, применённая к декодированию. Каждый принятый драфтовый токен — это прямой проход большой модели, за который вы не платили.
{{1}}Для тех, кто потребляет эти модели через API, а не хостит их самостоятельно, драфтер невидим — и в этом весь смысл.{{/1}} {{2}}Когда провайдер добавляет спекулятивное декодирование в свой стек обслуживания, вы видите не новую модель; вы видите, как та же модель становится быстрее и дешевле за токен.{{/2}} {{3}}Уровень ценообразования важен по той же причине: в OrcaRouter мы пропускаем цену из прайс-листа провайдера напрямую с нулевой наценкой, поэтому, когда работа вендора по повышению эффективности обслуживания приводит к снижению цены, она вступает в силу у нас в тот же день — без пересмотра условий и изменения контракта.{{/3}} {{4}}А для непроверенной модели, которая может выстрелить, а может и нет, маршрутизация с автоматическим переключением — это способ попробовать её, не ставя на кон продакшн-путь: один API-ключ, и запрос переключается на другого провайдера, если первый деградирует.{{/4}}
Одно честное замечание, касающееся именно этого релиза: A.X-K2-DSpark — это чекпоинт только для драфтера, поэтому ни один API хостируемых моделей — включая наш — не может его маршрутизировать. Драфтеры — это серверный компонент, а не вызываемый продукт. Когда драфтер выйдет и появятся показатели оценки, в прайс-листе появится более быстрый и дешёвый A.X K2 — а не новый эндпоинт под названием «DSpark».
Несколько вопросов, на которые стоит ответить
Могу ли я использовать A.X-K2-DSpark сам по себе? Нет — это определяющий факт релиза. Это чекпоинт, предназначенный только для роли драфтера: у него нет самостоятельного применения и публичного API; он существует только как вспомогательный компонент внутри цикла спекулятивного декодирования vLLM, обслуживающего A.X K2, и в карточке модели отмечено, что он не был валидирован ни с какой другой целевой моделью.
Является ли A.X-K2-DSpark конкурентом A.X K2? Наоборот. Это ускоритель для A.X K2 — та же модель работает быстрее, при неизменном распределении выходных данных. Воспринимайте его как дополнительный модуль повышения эффективности, а не как новую модель в линейке.
Когда же на самом деле состоится релиз? В карточке модели сказано, что она проходит финальную валидацию, и публичный релиз запланирован «в ближайшие несколько дней». Это всё, что подтверждено. Следить нужно за днём, когда появятся значения TBD — пропускная способность, TPOT и средняя принятая длина, — потому что именно тогда релиз перестанет быть обещанием и станет тем, что можно оценить.
Нужно ли мне думать об этом, если я использую A.X K2 через API?Скорее всего, не напрямую. Стек, стоящий за API, определяет, задействован ли драфтер в цикле; вы видите результат в виде цены и задержки, а не флага. Это важнее всего для команд, которые сами хостят A.X K2, где включение — это изменение конфигурации vLLM, которое они контролируют.
Дело здесь не в самом драфтере, а в том, что он сигнализирует. Работа по повышению эффективности тихо становится отдельной категорией релизов, и самые интересные новые модели в этом году — это всё чаще помощники, которые удешевляют большие модели, а не более крупные модели. A.X-K2-DSpark — самый яркий на данный момент пример: чекпоинт без самостоятельного применения, опубликованный до анонса, большая часть собственных доказательств которого помечена как TBD. Следите за показателем accepted-length, когда он появится, рассматривайте результаты статьи DSpark как подтверждение метода, а не как обещание для этого чекпоинта, и если вы сами обслуживаете A.X K2, заложите бюджет на бенчмарк — это единственный способ узнать, является ли тихо опубликованный драфтер приятной мелочью на 1.2x или реальной ценностью.
