
LFM2.5-2.6B-DSpark: драфтер на 328M, который ускоряет агента Liquid на устройстве в 2,3 раза
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Никто за пределами Liquid AI ещё не запускал LFM2.5-2.6B-DSpark на собственном оборудовании и не публиковал результатов. Это честная отправная точка для разговора об этой модели, потому что вся её суть — это заявление о производительности: это не улучшенная версия 2.6B, а черновая модель на 328M параметров, которая стоит перед агентной моделью LFM2.5-2.6B и предлагает ей токены для проверки, благодаря чему агент работает примерно в два раза быстрее, не меняя своего вывода.
Выпущенная 20 августа 2026 года с техническим описанием на Hugging Face и сопутствующим постом в блоге Liquid, LFM2.5-2.6B-DSpark — флагман небольшого семейства черновых чекпоинтов для спекулятивного декодирования, которые Liquid опубликовала в тот же день. Всё, что ниже в колонке скорости, измерено производителем и пока не подтверждено независимо; всё в репозитории, форматы и поддержка фреймворков просто можно проверить.
Что такое DSpark, вкратце
Спекулятивное декодирование — это трюк, заключающийся в запуске дешёвой модели-черновика перед основной: черновик угадывает следующие несколько токенов, целевая модель проверяет весь пакет за один прямой проход и сохраняет токены, с которыми согласна. Когда догадки верны, вы продвигаетесь на несколько токенов по цене одного, поэтому пропускная способность растёт без изменения весов целевой модели. DSpark — метод, первоначально предложенный исследователями DeepSeek в июле 2026 года и уже развёрнутый в DeepSeek-V4, — это версия этого трюка, адаптированная для небольших моделей на устройстве. Liquid называет это спекулятивным декодированием с планированием по уверенности, и у него есть три составные части: параллельный базовый блок, который создаёт скрытые состояния для всех токенов-черновиков за один проход; лёгкая последовательная головка, которая моделирует зависимость между соседними токенами, чтобы вероятность принятия не падала в конце блока; и верификатор, который отсекает малодостоверные суффиксы, когда проверка их обошлась бы дороже, чем экономия.

Это последнее отличие и делает DSpark непохожим на обычного драфтера: он не всегда прогоняет целый блок через проверку. Когда уверенность самого драфтера говорит, что суффикс вряд ли будет принят, он сокращает блок и экономит потраченные впустую вычисления. Блок драфтера состоит из девяти токенов, поэтому целевая модель проверяет до десяти за раз.
Составитель в цифрах
Контрольная точка LFM2.5-2.6B-DSpark — это черновая модель с 0,3 млрд параметров, основанная только на внимании: пять полных слоёв внимания (размер скрытого состояния 2048, групповое запросное внимание с 32 головками и 8 головками ключ-значение), словарь из 128 тысяч токенов, марковская голова ранга 256 и голова уверенности. Liquid обучила её 15 эпох на смеси данных инструкций, диалогов, кода и вызовов функций — на оборудовании AMD — и выбрала эпоху по наибольшему коэффициенту принятия, а не по наименьшей потере.
Этот показатель принятия — число, которое определяет, насколько ценен драфтер. На пяти бенчмарках с размером батча 1 и температурой 0 LFM2.5-2.6B-DSpark в среднем выдавал 4,83 принятых токена за шаг декодирования на H100 и 4,42 на M4 Max — принималась примерно половина блока, что и даёт двукратное ускорение.
Ускорения, помеченные
Все следующие показатели получены из собственных измерений Liquid AI — SGLang на одном H100 80GB в BF16, и llama.cpp с бэкендом Metal на M4 Max MacBook Pro в FP16 GGUF, размер пакета 1, температура 0 — и ни один из них не был воспроизведён независимой стороной на момент написания:
• Среднее H100 — 2.67×, от 323 до 864 токенов/с. По бенчмаркам: MATH500 3.06×, HumanEval 2.56×, MBPP 2.64×, GSM8K 2.22×, MT-Bench 2.87×.
• Среднее значение M4 Max — 2.27×, от 61 до 139 токенов/с. По бенчмаркам: MATH500 2.25×, HumanEval 2.63×, MBPP 2.11×, GSM8K 2.36×, MT-Bench 1.99×.
{{1}}• Вызов инструментов — в сценариях вызова функций с несколькими инструментами средняя задержка снизилась на 57%.
• Семейный контекст — самый крупный драфтер в семействе, LFM2.5-8B-A1B-DSpark, достигал до 3.18× на H100, а драфтер 1.2B — до 2.87× на M4 Max; приведённые выше цифры для 2.6B — это середина спектра.

Помимо средних значений, важны две вещи. Во-первых, они измерены при температуре 0 и размере батча 1 — конфигурации, которая благоприятствует спекулятивному декодированию, и конфигурации, в которой по большей части работает интерактивный агент на устройстве. Гарантия идентичности сохраняется и здесь: спекулятивное декодирование проверяет каждый предложенный токен, поэтому при жадном декодировании выданный текст будет точно таким, какой целевая модель произвела бы сама. Во-вторых, разрыв сокращается с ростом параллелизма: на одном H100 Liquid сообщает, что преимущество DSpark сходится к размеру батча около 128, так что драфтер — это выигрыш по задержке для интерактивных и инструментально-нагруженных нагрузок, а не серебряная пуля для пропускной способности на максимально загруженном сервере.
Что подтверждено, а что нет
Подтверждено, в том смысле, что репозиторий публичный и его можно проверить: драфтер поставляется в форматах Safetensors (BF16) и GGUF; он работает в паре с пост-обученной LFM2.5-2.6B, а не с базовой; поддержка с первого дня появилась в апстриме llama.cpp (с экспериментальными ядрами Metal) и в SGLang; он лицензирован на условиях LFM Open License v1.0 от Liquid; и — что важно для тех, кто строит планы с его учётом — в карточке модели указано, что ни один инференс-провайдер его не обслуживает, так что это компонент для самостоятельного запуска.
Пока не подтверждено: что ускорения воспроизводятся на другом оборудовании и конфигурациях (никто за пределами Liquid не публиковал измерений), как ведёт себя драфтер при сэмплировании, а не при жадном декодировании, и сохраняется ли показатель задержки вызова инструментов в 57% в реальных агентных средах помимо бенчмарк-окружения, которое использовал Liquid. Ни одно из этих замечаний не является обвинением — релизу всего день — но именно они отличают многообещающую цифру от проверенной.

его запуск
В SGLang вы используете сборку с поддержкой DSpark, запускаете сервер для целевой модели и указываете драфтер: спекулятивный алгоритм — DSPARK, путь к модели драфтера указывает на LiquidAI/LFM2.5-2.6B-DSpark, а размер блока считывается из config.json драфтера. В llama.cpp вы загружаете целевой GGUF, используя GGUF драфтера в качестве модели драфтера, и устанавливаете тип спекуляции в draft-dspark, при этом размер блока считывается из sidecar-метаданных. Обе интеграции уже в апстриме, так что форки не нужны — достаточно сборки, достаточно свежей, чтобы они в неё входили.
Когда стоит добавить
LFM2.5-2.6B-DSpark оправдывает свои дополнительные ~0,3 ГБ памяти, когда вы действительно разворачиваете агента 2.6B там, где Liquid спроектировал его для работы — на телефоне, ноутбуке или edge-устройстве — для интерактивных нагрузок или нагрузок с вызовом инструментов, которые ограничены задержкой и работают в жадном режиме. Именно в этом профиле показатели 2,27× на устройстве и снижение задержки вызова инструментов на 57% дают результат. Это менее интересно, если вы обслуживаете запросы при большом батче на сервере (ускорение стремится к 1×) или если ваша нагрузка работает при температуре выше нуля, где приведённые цифры перестают действовать. И если вы используете вариант семейства 8B-A1B, обратите внимание на крайний случай: его ускорение на устройстве сегодня составляет всего около 1,18×, поскольку проверка черновых токенов активирует больше экспертов в Metal-бэкенде llama.cpp — Liquid отмечает это как известную проблему.
Ничто в DSpark не меняет того, где работает агент 2.6B — по замыслу это история про самостоятельный хостинг, и он будет располагаться рядом с размещенными моделями, к которым вы уже обращаетесь. Такое сочетание локального драфтера и дюжины API-эндпоинтов — это ровно та инфраструктура, которую призван устранить слой маршрутизации: один API-ключ для 200+ моделей, автоматическое переключение при деградации провайдера и прейскурантные цены провайдера без наценки (0%), — чтобы сравнение затрат между локальным и размещенным агентом класса 2.6B оставалось наглядным, а не пряталось в электронных таблицах.
Правильно воспринимать LFM2.5-2.6B-DSpark сегодня — как перспективное, измеренное вендором и пока не получившее независимого подтверждения заявление о скорости, привязанное к реальному, загружаемому и запускаемому чекпойнту. Если вы разворачиваете агента 2.6B на устройстве, драфтер недорого попробовать и легко убрать — добавьте два спекулятивных флага в команду SGLang, сохраните жадное декодирование и измеряйте на своей собственной нагрузке, прежде чем доверять 2.3×. Репозиторий на месте; независимая проверка — открытый вопрос.
