Главная карточка с надзаголовком «ОДНА МОДЕЛЬ, ДВЕ КОНФИГУРАЦИИ» и заголовком «DSpark против LFM2.5-VL-3B», с подзаголовком: «Это не две модели, между которыми нужно выбирать, а одна визуально-языковая модель на 3,1 млрд параметров и драфтер на 279,5 млн, который вы подключаете перед ней». На трёх карточках написано: «Целевая модель 3,1 млрд — генерирует текст и отвечает по изображениям», «Драфтер 279,5 млн — предлагает токены; сам по себе не выдаёт ничего пригодного к использованию» и «Вывод не меняется — точен при жадном декодировании, по построению». В нижнем колонтитуле указано: «Показатели ускорения измерены производителем — Liquid AI; независимого воспроизведения ни одной из этих цифр пока не существует». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

LFM2.5-VL-3B-DSpark против LFM2.5-VL-3B: не выбираешь один — прикрепляешь один

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поисковый запрос, который приводит людей сюда, — это сравнение, но честный ответ таков: LFM2.5-VL-3B-DSpark и LFM2.5-VL-3B — не две вещи, между которыми вы выбираете. Вторая — это визуально-языковая модель на 3.1B, которую можно скачать и обслуживать. Первая — это draft-модель с 279.5M параметров, которая существует только для того, чтобы стоять перед второй и заставлять её декодировать быстрее. Уберите драфтера из стека — и она не выдаст ничего; вы не можете протестировать её отдельно, потому что «отдельно» — это не поддерживаемая ею конфигурация. Настоящее сравнение — это LFM2.5-VL-3B, работающая сама по себе, против той же модели, работающей с подключённым драфтером.

Читайте это так, и решение сводится к одному вопросу: окупаются ли дополнительная память и дополнительная сложность во время выполнения достаточным выигрышем по задержке, чтобы это имело значение для вашей рабочей нагрузки? Собственные цифры Liquid AI говорят «да» для задач с преобладанием декодирования и явно говорят «нет», когда доминирует предзаполнение. Ни то, ни другое не было воспроизведено за пределами компании.

Две контрольные точки, бок о бок

То, чем они различаются, и есть вся суть, поэтому стоит поставить оба репозитория рядом, прежде чем начнётся спор о скорости.

• Роль — LFM2.5-VL-3B генерирует текст и отвечает на вопросы об изображениях; LFM2.5-VL-3B-DSpark предлагает токены, которые тот проверяет, и сам по себе не создаёт ничего пригодного для использования

• Параметры — 3,1 млрд для целевой модели, 279,5 млн в BF16 для драфтера, что Liquid оценивает как увеличение количества параметров при развёртывании на 8,9%

• Архитектура — целевая модель представляет собой гибридную модель на базе бэкбона LFM2.5-2.6B с визуальным кодировщиком SigLIP2 NaFlex; драфтер — это 4 слоя полного внимания при размере скрытого слоя 2 048 с вниманием с группированными запросами, а также голова Маркова и голова уверенности

• Контекстное окно — 32 768 токенов для целевой модели; драфтер не имеет собственного контекста и наследует контекст целевой модели.

• Визуальный энкодер — SigLIP2 NaFlex 400M на стороне целевой модели; у драфтера его нет, и он никогда не видит изображение напрямую

• Словарь — 128 000, а эмбеддинг драфтера и LM-голова привязаны к целевой модели, а не дублируются, поэтому затраты памяти меньше, чем можно было бы предположить по 279,5 млн параметров

• Лицензия — оба поставляются под лицензией Liquid LFM1.0, которая на Hugging Face классифицируется как «other», а не как лицензия OSI, поэтому перед коммерческим развёртыванием ознакомьтесь с условиями

• Форматы — целевая модель поставляется в квантизациях safetensors, GGUF, ONNX и MLX; драфтер поставляется в виде safetensors и одного F16 GGUF размером примерно 567 МБ

A two-panel comparison card titled 'One model, two configurations', subtitled 'You do not choose between them - you attach one to the other'. The left panel is 'LFM2.5-VL-3B alone' with rows: Role 'Generates text and image answers', Parameters '3.1B', Context '32,768 tokens', Vision 'SigLIP2 NaFlex 400M', Runtime 'Any supported stack'. The right panel is 'With DSpark attached' with rows: Role 'Same model, drafted', Parameters '3.1B + 279.5M', Context 'Unchanged, inherited', Vision 'Unchanged, drafter sees no image', Runtime 'SGLang 0.5.19+, MLX-VLM 0.7.2+'. A strip beneath reads 'The target's weights are untouched. Nothing about quality changes - only the wall-clock cost of a decoded token.' The OrcaRouter logo is composited in the bottom-right corner.

Одна строка в этом списке заслуживает особого внимания, потому что это механическая причина, по которой такое сочетание вообще работает: драфтер — не маленькая визуальная модель. У него нет визуального энкодера, и он никогда не касается изображения. К тому времени, когда токены доходят до скрытых слоёв, из которых он строит черновик, патч изображения и текстовый токен — это просто тензоры, поэтому модальность невидима для вычислений драфтера. Именно это позволило Liquid перенести технику, разработанную для текстовых моделей, на VLM, не переделывая её.

Что изменяет составитель, а что оставляет без изменений

Целевая модель не меняется. Это не маркетинг — это свойство корректности спекулятивного декодирования. При жадном декодировании каждый черновой токен проверяется целевой моделью, поэтому вывод в точности совпадает с тем, что целевая модель выдала бы сама по себе. При согласованных настройках сэмплирования с ненулевой температурой распределение вывода совпадает с распределением целевой модели. Черновая модель обменивает память на время и не затрагивает ничего другого.

Это означает, что все показатели качества, которые вы можете найти для LFM2.5-VL-3B, без изменений применимы к спаренной конфигурации. В собственной оценке Liquid целевая модель набирает 80,7 на ScreenSpot-v2, 61,5 на BLINK, 58,3 на MuirBench, 73,1 на MME, 63,3 на MMStar, 81,3 на ChartQA и 88,7 на POPE — все данные сообщены производителем, ни один не был независимо воспроизведён, и все они в равной степени верны независимо от того, подключён драфтер или нет. Здесь нет компромисса между качеством и скоростью, который нужно было бы взвешивать, и любая страница сравнения, где он представлен, неверно истолковала модель.

Что действительно меняется, так это стоимость одного токена по реальному времени. Liquid измеряет ускорение декодирования от 2,04× до 2,66× на одном H100 в BF16 через SGLang при размере блока 9, от 2,30× до 3,13× на Apple M5 Max через MLX-VLM при размере блока 8 и от 1,57× до 2,14× на M3 Ultra через llama.cpp. В сквозном режиме те же запуски дают 1,64×–2,27×, 1,56×–2,62× и 1,30×–1,77× соответственно. Эти пары и есть весь аргумент: декодирование улучшается примерно вдвое сильнее, чем сквозной показатель, а разрыв — это та часть рабочей нагрузки, которую драфтер не может затронуть.

Проблема предварительного заполнения в формулировке поставщика

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62'.

Самое полезное предложение в собственном анонсе Liquid — то, которое выступает против неограниченного толкования его заголовка. Визуально-языковой инференс несёт затраты на префилл, которых нет при текстовом инференсе: изображение проходит через визуальный энкодер, а затем языковой бэкбон обрабатывает сотни визуальных токенов, которые выдаёт этот энкодер. На периферийном устройстве этот префилл составляет большую долю сквозной задержки. Спекулятивное декодирование ускоряет только декодирование — визуальное кодирование и префилл остаются без изменений. Там, где доминирует префилл, ускорение декодирования в 3 раза превращается в гораздо меньший выигрыш по сквозной задержке.

Это закон Амдала, применённый вендором к собственному продукту, и он должен определять, кто будет читать эту страницу. Длинная расшифровка одной отсканированной страницы, подпись к изображению, многоходовой диалог, в котором одно изображение передаётся дальше, — с преобладанием декодирования, и драфтер оправдывает свои 279,5 млн параметров. Короткий вопрос о большом изображении с высоким разрешением — с преобладанием префилла, и здесь это не так. Поместите ту же целевую модель на сервер при высокой конкурентности — и картина снова меняется: Liquid измеряет границу компромисса между пропускной способностью и интерактивностью, а не одно число, и сообщает, что DSpark сохраняет преимущество на каждом протестированном уровне конкурентности, хотя разрыв сужается по мере роста конкурентности.

Два менее значительных уточнения по области применения из того же источника. Все измерения выполнялись с использованием 16-битной обработки как для визуального энкодера, так и для языкового бэкбона, а ускорение квантованных моделей не входит в область применения этого релиза. Если вы планировали объединить 4-битный экспорт целевой модели с драфтером, потому что вся привлекательность 3B VLM в том, что она помещается в несколько гигабайт, то именно эта комбинация не измерялась.

Во что вам на самом деле обходится его прикрепление

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B showing 'Like 211' and 'Downloads last month 24,660', the license 'lfm1.0', and 'Model size 3B params  Tensor type BF16'. The model card prose describes LFM2.5-VL-3B as the multimodal variant of LFM2.5, building on LFM2-VL-3B with an LFM2.5-2.6B language backbone and a SigLIP2 NaFlex vision encoder, reporting 228 tokens per second on an Apple M5 Max and 116 tokens per second on an AMD Ryzen AI Max+ 395 while running in under 3.3 GB, and noting it requires a recent Transformers build ('Model tree for LiquidAI/LFM2.5-VL-3B' is visible in the file listing).

Память — это видимая цена, и карточка её количественно оценивает: на 8,9% больше параметров в развёрнутом стеке. Сложность во время выполнения — невидимая. SGLang требует версии v0.5.19 или новее и строку запуска, содержащую --speculative-algorithm DSPARK, путь к черновой модели и размер блока; в собственном примере карточки также отключается radix-кэш и фиксируется статическая доля памяти — это решения по обслуживанию, о которых теперь придётся подумать. MLX-VLM требует версии v0.7.2 или новее и принимает драфтер через --draft-model, но декодирование DSpark там сейчас использует жадную выборку, поэтому температуру приходится принудительно устанавливать на 0 — реальное ограничение, если ваше приложение полагается на разнообразие выборки. llama.cpp работает через GGUF-драфтер в паре с целевой GGUF-моделью, а не с исходным safetensors-чекпоинтом.

Есть ещё одна издержка, которая проявляется в продакшене, а не в бенчмарке: драфтер и целевая модель должны идти вместе. Расхождение версий между ними — это режим отказа, которого не существует при развёртывании с одной моделью, а раскатка любой из них по отдельности теперь становится проблемой двух артефактов.

Это пара моделей на собственном хостинге. OrcaRouter не маршрутизирует ни LFM2.5-VL-3B, ни её draft-модель — вы скачиваете обе и обслуживаете их сами, — поэтому вопрос маршрутизации касается всего, чему малая модель передаёт управление. В большинстве развёртываний, где 3B edge-VLM работает в паре с draft-моделью, всё ещё есть запросы, на которые малая модель отвечать не должна, и отправка их в единый эндпоинт, охватывающий более 200 моделей по прайсовой цене каждого провайдера, с автоматическим переключением при деградации провайдера, — это одна интеграция вместо отдельной для каждого вендора. Это также означает, что как только провайдер снижает цену, ваш тариф отражает это в тот же день, а не при следующем продлении контракта.

Какой из них скачать?

Если ваша нагрузка смещена в сторону декодирования и ваше оборудование — одно из трёх, протестированных Liquid, подключите драфтер: минус ограничен, потому что выход доказуемо совпадает с выходом целевой модели, а затраты памяти составляют менее одной десятой модели. Если ваша задержка в основном определяется предзаполнением, или вы запускаете квантованную целевую модель, или полагаетесь на нежадную выборку в среде выполнения, в которой это ограничение ещё не снято, запускайте только LFM2.5-VL-3B. Она быстра сама по себе: 228 токенов в секунду на M5 Max, 116 на AMD Ryzen AI Max+ 395 и 20 на Galaxy S26 Ultra — все показатели от производителя — укладываясь примерно в 3 ГБ памяти.

Чего пока никто не может вам сказать, так это того, сохранятся ли показатели Liquid на вашем оборудовании. На момент написания у драфтера было 37 загрузок на Hugging Face, и ни одна цифра из его таблиц не была независимо воспроизведена. Инженерная часть сделана надёжно, а аргумент корректности — это доказательство, а не заявление, но величина — это измерение, а измерения из одной лаборатории на одном наборе машин — это ровно те цифры, которые стоит проверить самостоятельно, прежде чем включать их в план по мощностям.

OrcaRouter открывает доступ к более чем 200 моделям через один ключ: прайс-листовая цена каждого провайдера передаётся напрямую с наценкой 0% и автоматическим переключением при сбоях между провайдерами. прайс-листовая цена провайдера передаётся с наценкой 0% Связка на этой странице в любом случае размещается на ваших собственных серверах — роутер нужен для всего, что ему передаёт небольшая модель, и благодаря этому снижение цены у провайдера отражается в вашем тарифе в тот же день.