
LFM2.5-VL-3B-DSpark: 279,5-миллионный Drafter от Liquid AI вышел за шесть дней до того, как кто-либо о нём объявил
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Есть версия этой истории, в которой LFM2.5-VL-3B-DSpark — новая модель. Это не так. Это черновая модель спекулятивного декодирования с 279,5 млн параметров, существующая ровно для одной цели — ускорить декодирование собственной визуально-языковой модели Liquid AI LFM2.5-VL-3B — и она не способна самостоятельно сгенерировать пригодный ответ. Причина, по которой о ней всё же стоит прочитать, — это хронология: веса появились на Hugging Face 18 сентября 2026 года без какого-либо анонса, пролежали там шесть дней и лишь 24 сентября получили пост в блоге вендора. Radar заметил репозиторий в этот промежуток.
Этот разрыв — ещё и граница того, что можно знать прямо сейчас. Всё в репозитории — разбивка параметров, размер блока, интеграции с фреймворками, лицензия — это файл на диске, который можем открыть и вы, и я. Каждый показатель ускорения измерен вендором, с помощью собственного стенда для бенчмарков Liquid, и никто за пределами компании не опубликовал воспроизведение. В этом материале эти две категории намеренно разделены.
Что на самом деле содержит репозиторий
Откройте карточку модели — и суть становится однозначной. LFM2.5-VL-3B-DSpark — это draft-модель, целевая модель которой жёстко задана в её метаданных: base_model: LiquidAI/LFM2.5-VL-3B. Вы не нацеливаете её на другую модель и не обслуживаете её отдельно.
• Общее число параметров черновика — 279,5 млн, BF16, из которых 193,0 млн — это 4-слойный стек декодера, 65,5 млн — марковская головка, 21,0 млн — проекция скрытого состояния, а 6,4 тыс. — нормы плюс головка уверенности
• Основа — 4 слоя полного внимания, размер скрытого слоя 2 048, размер промежуточного слоя 6 144 с SiLU/SwiGLU, внимание с группированными запросами при 32 головах внимания и 8 головах ключ-значение, размерность головы 64
• Дополнительные головы — марковская голова ранга 256 и голова уверенности; именно это отличает драфтинг DSpark от обычного параллельного драфтера
• Размер блока — 9 во время обучения; 8 или 9 при инференсе в зависимости от оборудования, а на Apple silicon — именно 8
• Словарный запас — 128 000, привязан к целевому тексту, а не переносится из черновика
• Вес в развёрнутом стеке — Liquid заявляет, что драфтер увеличивает количество развёрнутых параметров на 8,9%

8,9% — это число, за которое стоит держаться. Посыл для этого класса моделей никогда не звучит как «более быстрый инференс — бесплатно»; он звучит как «за более быстрый инференс вы платите примерно десятой долей объёма памяти модели». При 279,5 млн дополнительных параметров к целевой модели на 3,1 млрд это меньший налог, чем можно было бы предположить по размеру одного лишь драфтера, потому что эмбеддинги и LM-голова привязаны к целевой модели и не дублируются.
DSpark — это прежде всего техника DeepSeek, а уже потом модель Liquid
Название вводит в заблуждение, поэтому стоит внести ясность. DSpark — это не изобретение Liquid AI и не семейство моделей. Это фреймворк спекулятивного декодирования из отдельного исследовательского направления, описанный в статье за июль 2026 года как спекулятивное декодирование с планированием по уверенности и полуавторегрессионной генерацией. Его три идеи: параллельная магистраль, которая создаёт черновик целого блока за один прямой проход; лёгкий последовательный модуль, который восстанавливает некоторую зависимость между соседними черновыми токенами, чтобы принятие не падало в конце блока; и верификатор, который сокращает окно проверки для каждого запроса, когда собственная уверенность черновика указывает на то, что хвост будет отклонён.
То, что сделала Liquid, — это применила этот рецепт к визуально-языковым моделям и выпустила чекпойнт. Карточка модели честно признаёт, что этот перенос не так драматичен, как звучит: с точки зрения драфтера модальность не имеет значения, потому что к тому моменту, как токены доходят до скрытых слоёв, патч изображения и текстовый токен — просто тензоры. Именно поэтому метод, разработанный на текстовых моделях, переносится на VLM, а не изобретается заново, — и именно поэтому драфтер нельзя продать как новую возможность.
Liquid уже выпустила текстовые драфтеры DSpark — компаньоны 2.6B, 8B-A1B и 1.2B-Instruct появились в августе 2026 года, а экспорты GGUF последовали 19 августа. Визуальный драфтер — это та же идея, распространённая на мультимодальную ветвь, и четвёртая или пятая запись в линейке, а не дебют.
Показатели ускорения и кто их измерял
Все приведённые ниже цифры — собственные данные Liquid, собранные на инфраструктуре Liquid для бенчмаркинга, и ни одна из них не имеет независимого воспроизведения. Считайте их верхней планкой от вендора, а не ожидаемым результатом. В карточке ускорение декодирования отделено от сквозного ускорения, и это важнее, чем цифра в заголовке.
• Лучшее ускорение декодирования — 3.13× на COCO, измерено с MLX-VLM на Apple M5 Max при размере блока 8, FP16, размере батча 1, температуре 0
• Лучшее ускорение декодирования на GPU — 2,66× на COCO, SGLang на одном H100 80GB, BF16, размер блока 9
• Лучшее ускорение декодирования llama.cpp — 2,14× на COCO, Apple M3 Ultra, размер блока 8
• Диапазон декодирования на H100 по шести задачам компьютерного зрения — от 2,04× до 2,66×, а сквозной показатель — от 1,64× до 2,27×
• M5 Max, диапазон декодирования — от 2,30× до 3,13×, сквозной — от 1,56× до 2,62×
• Диапазон декодирования M3 Ultra — от 1,57× до 2,14×, сквозной — от 1,30× до 1,77×
• Принятие черновика — примерно 3,2–4,5 принятых токенов за один проход проверки целевого варианта, на всех трёх стеках
Закономерность в этих диапазонах — это честная часть. Сквозной выигрыш неизменно составляет меньшую половину каждой пары, потому что драфтер ускоряет только декодирование и ничего больше. Также обратите внимание, что один и тот же драфтер при одном и том же размере блока показывает 3,13× на одном стеке и 1,57× на другом — доля принятия — это свойство драфтера и рабочей нагрузки, а выигрыш по реальному времени — свойство аппаратного обеспечения и накладных расходов среды выполнения. Утверждение «в 2,66× быстрее» без указания стека — это не утверждение, на основании которого можно что-то предпринимать.
Два момента корректности из карточки стоит изложить прямо, потому что именно они делают драфтер приемлемым в продакшене вообще. При жадном декодировании спекулятивное декодирование точно: целевая модель проверяет каждый предложенный токен, поэтому текст — это то, что целевая модель произвела бы сама по себе. При согласованных настройках сэмплирования при ненулевой температуре оно сохраняет распределение выхода целевой модели. Формулировка Liquid — вы получаете ускорение, а не другую модель — точна в тех пределах, в которых она применима, и в карточке честно признаётся, что повышение температуры снижает принятие и, следовательно, подрывает выигрыш в пропускной способности.
Что признаёт собственный пост Liquid

Пост в блоге от 24 сентября полезнее карточки модели по одной причине: в нём называется ограничение. Вывод визуально-языковых моделей несёт затраты на префилл, которых нет у текстового вывода — изображение должно пройти через визуальный энкодер, а языковой бэкбон затем должен обработать сотни визуальных токенов, которые создаёт этот энкодер. На устройстве этот префилл доминирует в сквозной задержке. Спекулятивное декодирование ускоряет только декодирование. Кодирование изображений и префилл остаются незатронутыми. Liquid применяет закон Амдала к собственному продукту и отмечает, что там, где префилл составляет большую долю общего времени, большое ускорение декодирования даёт лишь скромное улучшение сквозной производительности.
Это реальное ограничение при принятии решения о покупке, и это объясняет, почему время до первого токена не входит в список того, что улучшает этот драфтер. Это также подразумевает, что наибольшую выгоду получают рабочие нагрузки, которые генерируют длинные выходные данные из скромного изображения — подпись к изображению, длинную OCR-расшифровку, многоходовой диалог с одним изображением, переносимым из хода в ход, — а не те, которые отвечают на короткий вопрос о большом изображении.
В посте добавляются ещё два ограничения по области применения. Все числовые результаты получены с использованием 16-битной обработки как для визуального энкодера, так и для языкового бэкбона, а ускорение квантованных моделей не входит в рамки этого релиза. Учитывая, что главный аргумент в пользу 3B edge VLM — это работа в паре гигабайт, «ускорения измеряются на FP16» — существенная оговорка для всех, кто планировал сочетать его с 4-битным экспортом. Liquid также отмечает, что драфтер обучался полностью на оборудовании AMD.
его запуск

Поддержка с первого дня — это реальность, и она охватывает три среды выполнения, что больше, чем достаётся большинству драфтеров. SGLang на NVIDIA требует v0.5.19 или новее и принимает драфтер через --speculative-algorithm DSPARK с указанием пути к драфту и размером блока 9. MLX-VLM на Apple silicon требует v0.7.2 или новее и распознаёт драфтер, когда его передают с помощью --draft-model; тут есть один острый момент — декодирование DSpark в MLX-VLM сейчас использует жадную выборку, поэтому temperature нужно установить в 0. Для llama.cpp есть отдельный репозиторий GGUF с единственным экспортом F16 объёмом примерно 567 МБ, и в карточке прямо сказано, что квантованный драфтер нужно сочетать с квантованной целевой моделью, а не с исходным чекпоинтом safetensors.
Слой маршрутизации оправдывает себя здесь не на этой модели — OrcaRouter не маршрутизирует LFM2.5-VL-3B-DSpark или LFM2.5-VL-3B, а это пара с самостоятельно размещаемым драфтером, который вы скачиваете и обслуживаете сами. Он нужен для остальной части стека вокруг неё. То же приложение, которое запускает небольшую открытую vision-модель на устройстве, обычно имеет резервный путь для запросов, с которыми небольшая модель не справляется, и направить этот путь на единую конечную точку, охватывающую более 200 моделей — с оплатой по прейскурантной цене каждого провайдера без какой-либо наценки и с автоматическим переключением при деградации провайдера — это меньшая по объёму интеграция, чем заключение второго договора с вендором. Драфтер улучшает одну составляющую этой архитектуры; роутер не даёт другой её составляющей превратиться в отдельный проект.
Что ещё неизвестно
У репозитория на момент написания 37 загрузок и 6 лайков. Нет записи об этом драфтере ни в одном публичном агрегаторе бенчмарков, нет воспроизведения ни одного из диапазонов ускорения третьими сторонами и нет независимых измерений доли принятия на оборудовании, которое Liquid не тестировала. На карточке также нет бенчмарков качества по очевидным причинам — драфтер по построению сохраняет выход, так что показатели качества относятся к LFM2.5-VL-3B, и карточка указывает на бенчмарки этой модели, а не придумывает собственные.
Одна деталь в метаданных слегка выдаёт, насколько это ново: модель несёт тег библиотеки SGLang и флаг алгоритма SGLang, который существует специально для её вызова. Поддержка во фреймворке должна была появиться раньше самого анонса — это согласуется с шестидневным промежутком между репозиторием и постом в блоге.
Итак: настоящая, полезная, узконаправленная инженерная работа, анонсированная через неделю после выпуска, всё ценностное предложение которой — измеренное вендором число на оборудовании, которым вы, возможно, не владеете. Если вы обслуживаете LFM2.5-VL-3B на H100 или Mac серии M и ваша рабочая нагрузка в основном приходится на декодирование, затраты памяти составляют 8,9%, а минус почти нулевой, потому что выход доказуемо совпадает с целевым. Если ваша задержка определяется в основном prefill, или вы рассчитывали на 4-битный экспорт, собственный пост Liquid говорит, что это не поможет. Воспроизведение, когда оно появится, — вот чего стоит дождаться.
OrcaRouter объединяет более 200 моделей за одним ключом по прайс-листовой цене провайдера с наценкой 0% и представляет резервный путь как слой маршрутизации, а не код приложения. Драфтер в любом случае развёрнут на своих мощностях — именно роутер не даёт тому плечу, на которое ваша небольшая модель передаёт управление, превратиться во второй проект.
