Титульная карточка hero-секции с надписью «LFM2.5-VL-3B-DSpark» под кикером «VISION-LANGUAGE DRAFTER» и подзаголовком «Драфтер на 279,5 млн параметров для LFM2.5-VL-3B от Liquid AI — веса выложены 18 сентября 2026 года, за шесть дней до того, как их кто-либо анонсировал». Три карточки ниже гласят: «279,5 млн параметров драфтера — 4 слоя, марковская голова, голова уверенности», «Размер блока 9 — 8 на Apple silicon; 3,2–4,5 токена принимается за проход» и «На 8,9% больше памяти — выход доказуемо совпадает с целевым, без изменений». В футере написано: «Все показатели ускорения измерены самим производителем, Liquid AI; независимых воспроизведений пока нет». Логотип OrcaRouter вкомпонован в правый нижний угол.
Engineering & Research

LFM2.5-VL-3B-DSpark: 279,5-миллионный Drafter от Liquid AI вышел за шесть дней до того, как кто-либо о нём объявил

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Есть версия этой истории, в которой LFM2.5-VL-3B-DSpark — новая модель. Это не так. Это черновая модель спекулятивного декодирования с 279,5 млн параметров, существующая ровно для одной цели — ускорить декодирование собственной визуально-языковой модели Liquid AI LFM2.5-VL-3B — и она не способна самостоятельно сгенерировать пригодный ответ. Причина, по которой о ней всё же стоит прочитать, — это хронология: веса появились на Hugging Face 18 сентября 2026 года без какого-либо анонса, пролежали там шесть дней и лишь 24 сентября получили пост в блоге вендора. Radar заметил репозиторий в этот промежуток.

Этот разрыв — ещё и граница того, что можно знать прямо сейчас. Всё в репозитории — разбивка параметров, размер блока, интеграции с фреймворками, лицензия — это файл на диске, который можем открыть и вы, и я. Каждый показатель ускорения измерен вендором, с помощью собственного стенда для бенчмарков Liquid, и никто за пределами компании не опубликовал воспроизведение. В этом материале эти две категории намеренно разделены.

Что на самом деле содержит репозиторий

Откройте карточку модели — и суть становится однозначной. LFM2.5-VL-3B-DSpark — это draft-модель, целевая модель которой жёстко задана в её метаданных: base_model: LiquidAI/LFM2.5-VL-3B. Вы не нацеливаете её на другую модель и не обслуживаете её отдельно.

• Общее число параметров черновика — 279,5 млн, BF16, из которых 193,0 млн — это 4-слойный стек декодера, 65,5 млн — марковская головка, 21,0 млн — проекция скрытого состояния, а 6,4 тыс. — нормы плюс головка уверенности

• Основа — 4 слоя полного внимания, размер скрытого слоя 2 048, размер промежуточного слоя 6 144 с SiLU/SwiGLU, внимание с группированными запросами при 32 головах внимания и 8 головах ключ-значение, размерность головы 64

• Дополнительные головы — марковская голова ранга 256 и голова уверенности; именно это отличает драфтинг DSpark от обычного параллельного драфтера

• Размер блока — 9 во время обучения; 8 или 9 при инференсе в зависимости от оборудования, а на Apple silicon — именно 8

• Словарный запас — 128 000, привязан к целевому тексту, а не переносится из черновика

• Вес в развёрнутом стеке — Liquid заявляет, что драфтер увеличивает количество развёрнутых параметров на 8,9%

A single-column infographic titled 'LFM2.5-VL-3B-DSpark - the numbers' with the subtitle 'Every figure below was measured by Liquid AI, on Liquid AI's hardware'. Six rows read: 'Decode speedup, single H100 80GB - SGLang' at '2.04x - 2.66x'; 'Decode speedup, Apple M5 Max - MLX-VLM' at '2.30x - 3.13x'; 'End-to-end speedup across all three stacks' at '1.30x - 2.62x'; 'Draft tokens accepted per verification pass' at '3.2 - 4.5'; 'Extra memory in the deployed stack' at '8.9%'; and 'Repository interest at time of writing' at '37 downloads, 6 likes'. The footer reads 'Vendor-measured. No third-party reproduction of any figure in this table exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

8,9% — это число, за которое стоит держаться. Посыл для этого класса моделей никогда не звучит как «более быстрый инференс — бесплатно»; он звучит как «за более быстрый инференс вы платите примерно десятой долей объёма памяти модели». При 279,5 млн дополнительных параметров к целевой модели на 3,1 млрд это меньший налог, чем можно было бы предположить по размеру одного лишь драфтера, потому что эмбеддинги и LM-голова привязаны к целевой модели и не дублируются.

DSpark — это прежде всего техника DeepSeek, а уже потом модель Liquid

Название вводит в заблуждение, поэтому стоит внести ясность. DSpark — это не изобретение Liquid AI и не семейство моделей. Это фреймворк спекулятивного декодирования из отдельного исследовательского направления, описанный в статье за июль 2026 года как спекулятивное декодирование с планированием по уверенности и полуавторегрессионной генерацией. Его три идеи: параллельная магистраль, которая создаёт черновик целого блока за один прямой проход; лёгкий последовательный модуль, который восстанавливает некоторую зависимость между соседними черновыми токенами, чтобы принятие не падало в конце блока; и верификатор, который сокращает окно проверки для каждого запроса, когда собственная уверенность черновика указывает на то, что хвост будет отклонён.

То, что сделала Liquid, — это применила этот рецепт к визуально-языковым моделям и выпустила чекпойнт. Карточка модели честно признаёт, что этот перенос не так драматичен, как звучит: с точки зрения драфтера модальность не имеет значения, потому что к тому моменту, как токены доходят до скрытых слоёв, патч изображения и текстовый токен — просто тензоры. Именно поэтому метод, разработанный на текстовых моделях, переносится на VLM, а не изобретается заново, — и именно поэтому драфтер нельзя продать как новую возможность.

Liquid уже выпустила текстовые драфтеры DSpark — компаньоны 2.6B, 8B-A1B и 1.2B-Instruct появились в августе 2026 года, а экспорты GGUF последовали 19 августа. Визуальный драфтер — это та же идея, распространённая на мультимодальную ветвь, и четвёртая или пятая запись в линейке, а не дебют.

Показатели ускорения и кто их измерял

Все приведённые ниже цифры — собственные данные Liquid, собранные на инфраструктуре Liquid для бенчмаркинга, и ни одна из них не имеет независимого воспроизведения. Считайте их верхней планкой от вендора, а не ожидаемым результатом. В карточке ускорение декодирования отделено от сквозного ускорения, и это важнее, чем цифра в заголовке.

• Лучшее ускорение декодирования — 3.13× на COCO, измерено с MLX-VLM на Apple M5 Max при размере блока 8, FP16, размере батча 1, температуре 0

• Лучшее ускорение декодирования на GPU — 2,66× на COCO, SGLang на одном H100 80GB, BF16, размер блока 9

• Лучшее ускорение декодирования llama.cpp — 2,14× на COCO, Apple M3 Ultra, размер блока 8

• Диапазон декодирования на H100 по шести задачам компьютерного зрения — от 2,04× до 2,66×, а сквозной показатель — от 1,64× до 2,27×

• M5 Max, диапазон декодирования — от 2,30× до 3,13×, сквозной — от 1,56× до 2,62×

• Диапазон декодирования M3 Ultra — от 1,57× до 2,14×, сквозной — от 1,30× до 1,77×

• Принятие черновика — примерно 3,2–4,5 принятых токенов за один проход проверки целевого варианта, на всех трёх стеках

Закономерность в этих диапазонах — это честная часть. Сквозной выигрыш неизменно составляет меньшую половину каждой пары, потому что драфтер ускоряет только декодирование и ничего больше. Также обратите внимание, что один и тот же драфтер при одном и том же размере блока показывает 3,13× на одном стеке и 1,57× на другом — доля принятия — это свойство драфтера и рабочей нагрузки, а выигрыш по реальному времени — свойство аппаратного обеспечения и накладных расходов среды выполнения. Утверждение «в 2,66× быстрее» без указания стека — это не утверждение, на основании которого можно что-то предпринимать.

Два момента корректности из карточки стоит изложить прямо, потому что именно они делают драфтер приемлемым в продакшене вообще. При жадном декодировании спекулятивное декодирование точно: целевая модель проверяет каждый предложенный токен, поэтому текст — это то, что целевая модель произвела бы сама по себе. При согласованных настройках сэмплирования при ненулевой температуре оно сохраняет распределение выхода целевой модели. Формулировка Liquid — вы получаете ускорение, а не другую модель — точна в тех пределах, в которых она применима, и в карточке честно признаётся, что повышение температуры снижает принятие и, следовательно, подрывает выигрыш в пропускной способности.

Что признаёт собственный пост Liquid

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62', noting the model 'is available on Hugging Face, with support in llama.cpp, SGLang, and MLX-VLM'.

Пост в блоге от 24 сентября полезнее карточки модели по одной причине: в нём называется ограничение. Вывод визуально-языковых моделей несёт затраты на префилл, которых нет у текстового вывода — изображение должно пройти через визуальный энкодер, а языковой бэкбон затем должен обработать сотни визуальных токенов, которые создаёт этот энкодер. На устройстве этот префилл доминирует в сквозной задержке. Спекулятивное декодирование ускоряет только декодирование. Кодирование изображений и префилл остаются незатронутыми. Liquid применяет закон Амдала к собственному продукту и отмечает, что там, где префилл составляет большую долю общего времени, большое ускорение декодирования даёт лишь скромное улучшение сквозной производительности.

Это реальное ограничение при принятии решения о покупке, и это объясняет, почему время до первого токена не входит в список того, что улучшает этот драфтер. Это также подразумевает, что наибольшую выгоду получают рабочие нагрузки, которые генерируют длинные выходные данные из скромного изображения — подпись к изображению, длинную OCR-расшифровку, многоходовой диалог с одним изображением, переносимым из хода в ход, — а не те, которые отвечают на короткий вопрос о большом изображении.

В посте добавляются ещё два ограничения по области применения. Все числовые результаты получены с использованием 16-битной обработки как для визуального энкодера, так и для языкового бэкбона, а ускорение квантованных моделей не входит в рамки этого релиза. Учитывая, что главный аргумент в пользу 3B edge VLM — это работа в паре гигабайт, «ускорения измеряются на FP16» — существенная оговорка для всех, кто планировал сочетать его с 4-битным экспортом. Liquid также отмечает, что драфтер обучался полностью на оборудовании AMD.

его запуск

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention (32 attention heads, 8 key-value heads, head_dim 64), a Markov head of rank 256 plus a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'. A related-papers panel lists 'MMSpec: Benchmarking Speculative Decoding for Vision-Language' (arXiv 2603.14989).

Поддержка с первого дня — это реальность, и она охватывает три среды выполнения, что больше, чем достаётся большинству драфтеров. SGLang на NVIDIA требует v0.5.19 или новее и принимает драфтер через --speculative-algorithm DSPARK с указанием пути к драфту и размером блока 9. MLX-VLM на Apple silicon требует v0.7.2 или новее и распознаёт драфтер, когда его передают с помощью --draft-model; тут есть один острый момент — декодирование DSpark в MLX-VLM сейчас использует жадную выборку, поэтому temperature нужно установить в 0. Для llama.cpp есть отдельный репозиторий GGUF с единственным экспортом F16 объёмом примерно 567 МБ, и в карточке прямо сказано, что квантованный драфтер нужно сочетать с квантованной целевой моделью, а не с исходным чекпоинтом safetensors.

Слой маршрутизации оправдывает себя здесь не на этой модели — OrcaRouter не маршрутизирует LFM2.5-VL-3B-DSpark или LFM2.5-VL-3B, а это пара с самостоятельно размещаемым драфтером, который вы скачиваете и обслуживаете сами. Он нужен для остальной части стека вокруг неё. То же приложение, которое запускает небольшую открытую vision-модель на устройстве, обычно имеет резервный путь для запросов, с которыми небольшая модель не справляется, и направить этот путь на единую конечную точку, охватывающую более 200 моделей — с оплатой по прейскурантной цене каждого провайдера без какой-либо наценки и с автоматическим переключением при деградации провайдера — это меньшая по объёму интеграция, чем заключение второго договора с вендором. Драфтер улучшает одну составляющую этой архитектуры; роутер не даёт другой её составляющей превратиться в отдельный проект.

Что ещё неизвестно

У репозитория на момент написания 37 загрузок и 6 лайков. Нет записи об этом драфтере ни в одном публичном агрегаторе бенчмарков, нет воспроизведения ни одного из диапазонов ускорения третьими сторонами и нет независимых измерений доли принятия на оборудовании, которое Liquid не тестировала. На карточке также нет бенчмарков качества по очевидным причинам — драфтер по построению сохраняет выход, так что показатели качества относятся к LFM2.5-VL-3B, и карточка указывает на бенчмарки этой модели, а не придумывает собственные.

Одна деталь в метаданных слегка выдаёт, насколько это ново: модель несёт тег библиотеки SGLang и флаг алгоритма SGLang, который существует специально для её вызова. Поддержка во фреймворке должна была появиться раньше самого анонса — это согласуется с шестидневным промежутком между репозиторием и постом в блоге.

Итак: настоящая, полезная, узконаправленная инженерная работа, анонсированная через неделю после выпуска, всё ценностное предложение которой — измеренное вендором число на оборудовании, которым вы, возможно, не владеете. Если вы обслуживаете LFM2.5-VL-3B на H100 или Mac серии M и ваша рабочая нагрузка в основном приходится на декодирование, затраты памяти составляют 8,9%, а минус почти нулевой, потому что выход доказуемо совпадает с целевым. Если ваша задержка определяется в основном prefill, или вы рассчитывали на 4-битный экспорт, собственный пост Liquid говорит, что это не поможет. Воспроизведение, когда оно появится, — вот чего стоит дождаться.

OrcaRouter объединяет более 200 моделей за одним ключом по прайс-листовой цене провайдера с наценкой 0% и представляет резервный путь как слой маршрутизации, а не код приложения. Драфтер в любом случае развёрнут на своих мощностях — именно роутер не даёт тому плечу, на которое ваша небольшая модель передаёт управление, превратиться во второй проект.