Титульная карточка для LFM2.5-2.6B-DSpark — черновой модели Liquid AI на 328M параметров для спекулятивного декодирования, выпущенной 20 августа 2026 года, с подзаголовком «Черновик на 328M, который ускоряет работу on-device-агента Liquid в 2,3 раза»: диаграмма небольшого чипа «Draft 328M», отправляющего ряд токен-чипов в более крупный блок «LFM2.5-2.6B verifies», спидометр и иконка телефона, символизирующие скорость на устройстве, а также логотип OrcaRouter в правом нижнем углу.
Guides & Insights

LFM2.5-2.6B-DSpark: драфтер на 328M, который ускоряет агента Liquid на устройстве в 2,3 раза

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Никто за пределами Liquid AI ещё не запускал LFM2.5-2.6B-DSpark на собственном оборудовании и не публиковал результатов. Это честная отправная точка для разговора об этой модели, потому что вся её суть — это заявление о производительности: это не улучшенная версия 2.6B, а черновая модель на 328M параметров, которая стоит перед агентной моделью LFM2.5-2.6B и предлагает ей токены для проверки, благодаря чему агент работает примерно в два раза быстрее, не меняя своего вывода.

Выпущенная 20 августа 2026 года с техническим описанием на Hugging Face и сопутствующим постом в блоге Liquid, LFM2.5-2.6B-DSpark — флагман небольшого семейства черновых чекпоинтов для спекулятивного декодирования, которые Liquid опубликовала в тот же день. Всё, что ниже в колонке скорости, измерено производителем и пока не подтверждено независимо; всё в репозитории, форматы и поддержка фреймворков просто можно проверить.

Что такое DSpark, вкратце

Спекулятивное декодирование — это трюк, заключающийся в запуске дешёвой модели-черновика перед основной: черновик угадывает следующие несколько токенов, целевая модель проверяет весь пакет за один прямой проход и сохраняет токены, с которыми согласна. Когда догадки верны, вы продвигаетесь на несколько токенов по цене одного, поэтому пропускная способность растёт без изменения весов целевой модели. DSpark — метод, первоначально предложенный исследователями DeepSeek в июле 2026 года и уже развёрнутый в DeepSeek-V4, — это версия этого трюка, адаптированная для небольших моделей на устройстве. Liquid называет это спекулятивным декодированием с планированием по уверенности, и у него есть три составные части: параллельный базовый блок, который создаёт скрытые состояния для всех токенов-черновиков за один проход; лёгкая последовательная головка, которая моделирует зависимость между соседними токенами, чтобы вероятность принятия не падала в конце блока; и верификатор, который отсекает малодостоверные суффиксы, когда проверка их обошлась бы дороже, чем экономия.

A diagram titled 'How DSpark decodes in one pass': a small box labeled 'Draft model - 328M, 5 layers' on the left with an arrow '9 draft tokens proposed' pointing to a larger box labeled 'Target LFM2.5-2.6B verifies in one pass' in the center, an output arrow labeled '~4.8 tokens accepted on average', and a note card reading 'Greedy output is identical to the target alone'.

Это последнее отличие и делает DSpark непохожим на обычного драфтера: он не всегда прогоняет целый блок через проверку. Когда уверенность самого драфтера говорит, что суффикс вряд ли будет принят, он сокращает блок и экономит потраченные впустую вычисления. Блок драфтера состоит из девяти токенов, поэтому целевая модель проверяет до десяти за раз.

Составитель в цифрах

Контрольная точка LFM2.5-2.6B-DSpark — это черновая модель с 0,3 млрд параметров, основанная только на внимании: пять полных слоёв внимания (размер скрытого состояния 2048, групповое запросное внимание с 32 головками и 8 головками ключ-значение), словарь из 128 тысяч токенов, марковская голова ранга 256 и голова уверенности. Liquid обучила её 15 эпох на смеси данных инструкций, диалогов, кода и вызовов функций — на оборудовании AMD — и выбрала эпоху по наибольшему коэффициенту принятия, а не по наименьшей потере.

Этот показатель принятия — число, которое определяет, насколько ценен драфтер. На пяти бенчмарках с размером батча 1 и температурой 0 LFM2.5-2.6B-DSpark в среднем выдавал 4,83 принятых токена за шаг декодирования на H100 и 4,42 на M4 Max — принималась примерно половина блока, что и даёт двукратное ускорение.

Ускорения, помеченные

Все следующие показатели получены из собственных измерений Liquid AI — SGLang на одном H100 80GB в BF16, и llama.cpp с бэкендом Metal на M4 Max MacBook Pro в FP16 GGUF, размер пакета 1, температура 0 — и ни один из них не был воспроизведён независимой стороной на момент написания:

• Среднее H100 — 2.67×, от 323 до 864 токенов/с. По бенчмаркам: MATH500 3.06×, HumanEval 2.56×, MBPP 2.64×, GSM8K 2.22×, MT-Bench 2.87×.

• Среднее значение M4 Max — 2.27×, от 61 до 139 токенов/с. По бенчмаркам: MATH500 2.25×, HumanEval 2.63×, MBPP 2.11×, GSM8K 2.36×, MT-Bench 1.99×.

{{1}}• Вызов инструментов — в сценариях вызова функций с несколькими инструментами средняя задержка снизилась на 57%.

• Семейный контекст — самый крупный драфтер в семействе, LFM2.5-8B-A1B-DSpark, достигал до 3.18× на H100, а драфтер 1.2B — до 2.87× на M4 Max; приведённые выше цифры для 2.6B — это середина спектра.

A scoreboard titled 'LFM2.5-2.6B-DSpark - the scoreboard': H100 mean speedup 2.67x (323 to 864 tok/s), M4 Max mean speedup 2.27x (61 to 139 tok/s), multi-tool latency -57%, draft params 328M (0.3B), formats Safetensors + GGUF, served by providers none (self-host), with a footer reading 'All speed figures vendor-measured Aug 20 2026; not independently reproduced.'

Помимо средних значений, важны две вещи. Во-первых, они измерены при температуре 0 и размере батча 1 — конфигурации, которая благоприятствует спекулятивному декодированию, и конфигурации, в которой по большей части работает интерактивный агент на устройстве. Гарантия идентичности сохраняется и здесь: спекулятивное декодирование проверяет каждый предложенный токен, поэтому при жадном декодировании выданный текст будет точно таким, какой целевая модель произвела бы сама. Во-вторых, разрыв сокращается с ростом параллелизма: на одном H100 Liquid сообщает, что преимущество DSpark сходится к размеру батча около 128, так что драфтер — это выигрыш по задержке для интерактивных и инструментально-нагруженных нагрузок, а не серебряная пуля для пропускной способности на максимально загруженном сервере.

Что подтверждено, а что нет

Подтверждено, в том смысле, что репозиторий публичный и его можно проверить: драфтер поставляется в форматах Safetensors (BF16) и GGUF; он работает в паре с пост-обученной LFM2.5-2.6B, а не с базовой; поддержка с первого дня появилась в апстриме llama.cpp (с экспериментальными ядрами Metal) и в SGLang; он лицензирован на условиях LFM Open License v1.0 от Liquid; и — что важно для тех, кто строит планы с его учётом — в карточке модели указано, что ни один инференс-провайдер его не обслуживает, так что это компонент для самостоятельного запуска.

Пока не подтверждено: что ускорения воспроизводятся на другом оборудовании и конфигурациях (никто за пределами Liquid не публиковал измерений), как ведёт себя драфтер при сэмплировании, а не при жадном декодировании, и сохраняется ли показатель задержки вызова инструментов в 57% в реальных агентных средах помимо бенчмарк-окружения, которое использовал Liquid. Ни одно из этих замечаний не является обвинением — релизу всего день — но именно они отличают многообещающую цифру от проверенной.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-DSpark, showing the description of the LFM2.5-DSpark speculative-decoding draft family, the target model LFM2.5-2.6B, 327.7M draft parameters, and the lfm1.0 license.

его запуск

В SGLang вы используете сборку с поддержкой DSpark, запускаете сервер для целевой модели и указываете драфтер: спекулятивный алгоритм — DSPARK, путь к модели драфтера указывает на LiquidAI/LFM2.5-2.6B-DSpark, а размер блока считывается из config.json драфтера. В llama.cpp вы загружаете целевой GGUF, используя GGUF драфтера в качестве модели драфтера, и устанавливаете тип спекуляции в draft-dspark, при этом размер блока считывается из sidecar-метаданных. Обе интеграции уже в апстриме, так что форки не нужны — достаточно сборки, достаточно свежей, чтобы они в неё входили.

Когда стоит добавить

LFM2.5-2.6B-DSpark оправдывает свои дополнительные ~0,3 ГБ памяти, когда вы действительно разворачиваете агента 2.6B там, где Liquid спроектировал его для работы — на телефоне, ноутбуке или edge-устройстве — для интерактивных нагрузок или нагрузок с вызовом инструментов, которые ограничены задержкой и работают в жадном режиме. Именно в этом профиле показатели 2,27× на устройстве и снижение задержки вызова инструментов на 57% дают результат. Это менее интересно, если вы обслуживаете запросы при большом батче на сервере (ускорение стремится к 1×) или если ваша нагрузка работает при температуре выше нуля, где приведённые цифры перестают действовать. И если вы используете вариант семейства 8B-A1B, обратите внимание на крайний случай: его ускорение на устройстве сегодня составляет всего около 1,18×, поскольку проверка черновых токенов активирует больше экспертов в Metal-бэкенде llama.cpp — Liquid отмечает это как известную проблему.

Ничто в DSpark не меняет того, где работает агент 2.6B — по замыслу это история про самостоятельный хостинг, и он будет располагаться рядом с размещенными моделями, к которым вы уже обращаетесь. Такое сочетание локального драфтера и дюжины API-эндпоинтов — это ровно та инфраструктура, которую призван устранить слой маршрутизации: один API-ключ для 200+ моделей, автоматическое переключение при деградации провайдера и прейскурантные цены провайдера без наценки (0%), — чтобы сравнение затрат между локальным и размещенным агентом класса 2.6B оставалось наглядным, а не пряталось в электронных таблицах.

Правильно воспринимать LFM2.5-2.6B-DSpark сегодня — как перспективное, измеренное вендором и пока не получившее независимого подтверждения заявление о скорости, привязанное к реальному, загружаемому и запускаемому чекпойнту. Если вы разворачиваете агента 2.6B на устройстве, драфтер недорого попробовать и легко убрать — добавьте два спекулятивных флага в команду SGLang, сохраните жадное декодирование и измеряйте на своей собственной нагрузке, прежде чем доверять 2.3×. Репозиторий на месте; независимая проверка — открытый вопрос.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube