
LFM2.5-VL-3B-DSpark против LFM2.5-VL-3B: не выбираешь один — прикрепляешь один
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Поисковый запрос, который приводит людей сюда, — это сравнение, но честный ответ таков: LFM2.5-VL-3B-DSpark и LFM2.5-VL-3B — не две вещи, между которыми вы выбираете. Вторая — это визуально-языковая модель на 3.1B, которую можно скачать и обслуживать. Первая — это draft-модель с 279.5M параметров, которая существует только для того, чтобы стоять перед второй и заставлять её декодировать быстрее. Уберите драфтера из стека — и она не выдаст ничего; вы не можете протестировать её отдельно, потому что «отдельно» — это не поддерживаемая ею конфигурация. Настоящее сравнение — это LFM2.5-VL-3B, работающая сама по себе, против той же модели, работающей с подключённым драфтером.
Читайте это так, и решение сводится к одному вопросу: окупаются ли дополнительная память и дополнительная сложность во время выполнения достаточным выигрышем по задержке, чтобы это имело значение для вашей рабочей нагрузки? Собственные цифры Liquid AI говорят «да» для задач с преобладанием декодирования и явно говорят «нет», когда доминирует предзаполнение. Ни то, ни другое не было воспроизведено за пределами компании.
Две контрольные точки, бок о бок
То, чем они различаются, и есть вся суть, поэтому стоит поставить оба репозитория рядом, прежде чем начнётся спор о скорости.
• Роль — LFM2.5-VL-3B генерирует текст и отвечает на вопросы об изображениях; LFM2.5-VL-3B-DSpark предлагает токены, которые тот проверяет, и сам по себе не создаёт ничего пригодного для использования
• Параметры — 3,1 млрд для целевой модели, 279,5 млн в BF16 для драфтера, что Liquid оценивает как увеличение количества параметров при развёртывании на 8,9%
• Архитектура — целевая модель представляет собой гибридную модель на базе бэкбона LFM2.5-2.6B с визуальным кодировщиком SigLIP2 NaFlex; драфтер — это 4 слоя полного внимания при размере скрытого слоя 2 048 с вниманием с группированными запросами, а также голова Маркова и голова уверенности
• Контекстное окно — 32 768 токенов для целевой модели; драфтер не имеет собственного контекста и наследует контекст целевой модели.
• Визуальный энкодер — SigLIP2 NaFlex 400M на стороне целевой модели; у драфтера его нет, и он никогда не видит изображение напрямую
• Словарь — 128 000, а эмбеддинг драфтера и LM-голова привязаны к целевой модели, а не дублируются, поэтому затраты памяти меньше, чем можно было бы предположить по 279,5 млн параметров
• Лицензия — оба поставляются под лицензией Liquid LFM1.0, которая на Hugging Face классифицируется как «other», а не как лицензия OSI, поэтому перед коммерческим развёртыванием ознакомьтесь с условиями
• Форматы — целевая модель поставляется в квантизациях safetensors, GGUF, ONNX и MLX; драфтер поставляется в виде safetensors и одного F16 GGUF размером примерно 567 МБ

Одна строка в этом списке заслуживает особого внимания, потому что это механическая причина, по которой такое сочетание вообще работает: драфтер — не маленькая визуальная модель. У него нет визуального энкодера, и он никогда не касается изображения. К тому времени, когда токены доходят до скрытых слоёв, из которых он строит черновик, патч изображения и текстовый токен — это просто тензоры, поэтому модальность невидима для вычислений драфтера. Именно это позволило Liquid перенести технику, разработанную для текстовых моделей, на VLM, не переделывая её.
Что изменяет составитель, а что оставляет без изменений
Целевая модель не меняется. Это не маркетинг — это свойство корректности спекулятивного декодирования. При жадном декодировании каждый черновой токен проверяется целевой моделью, поэтому вывод в точности совпадает с тем, что целевая модель выдала бы сама по себе. При согласованных настройках сэмплирования с ненулевой температурой распределение вывода совпадает с распределением целевой модели. Черновая модель обменивает память на время и не затрагивает ничего другого.
Это означает, что все показатели качества, которые вы можете найти для LFM2.5-VL-3B, без изменений применимы к спаренной конфигурации. В собственной оценке Liquid целевая модель набирает 80,7 на ScreenSpot-v2, 61,5 на BLINK, 58,3 на MuirBench, 73,1 на MME, 63,3 на MMStar, 81,3 на ChartQA и 88,7 на POPE — все данные сообщены производителем, ни один не был независимо воспроизведён, и все они в равной степени верны независимо от того, подключён драфтер или нет. Здесь нет компромисса между качеством и скоростью, который нужно было бы взвешивать, и любая страница сравнения, где он представлен, неверно истолковала модель.
Что действительно меняется, так это стоимость одного токена по реальному времени. Liquid измеряет ускорение декодирования от 2,04× до 2,66× на одном H100 в BF16 через SGLang при размере блока 9, от 2,30× до 3,13× на Apple M5 Max через MLX-VLM при размере блока 8 и от 1,57× до 2,14× на M3 Ultra через llama.cpp. В сквозном режиме те же запуски дают 1,64×–2,27×, 1,56×–2,62× и 1,30×–1,77× соответственно. Эти пары и есть весь аргумент: декодирование улучшается примерно вдвое сильнее, чем сквозной показатель, а разрыв — это та часть рабочей нагрузки, которую драфтер не может затронуть.
Проблема предварительного заполнения в формулировке поставщика

Самое полезное предложение в собственном анонсе Liquid — то, которое выступает против неограниченного толкования его заголовка. Визуально-языковой инференс несёт затраты на префилл, которых нет при текстовом инференсе: изображение проходит через визуальный энкодер, а затем языковой бэкбон обрабатывает сотни визуальных токенов, которые выдаёт этот энкодер. На периферийном устройстве этот префилл составляет большую долю сквозной задержки. Спекулятивное декодирование ускоряет только декодирование — визуальное кодирование и префилл остаются без изменений. Там, где доминирует префилл, ускорение декодирования в 3 раза превращается в гораздо меньший выигрыш по сквозной задержке.
Это закон Амдала, применённый вендором к собственному продукту, и он должен определять, кто будет читать эту страницу. Длинная расшифровка одной отсканированной страницы, подпись к изображению, многоходовой диалог, в котором одно изображение передаётся дальше, — с преобладанием декодирования, и драфтер оправдывает свои 279,5 млн параметров. Короткий вопрос о большом изображении с высоким разрешением — с преобладанием префилла, и здесь это не так. Поместите ту же целевую модель на сервер при высокой конкурентности — и картина снова меняется: Liquid измеряет границу компромисса между пропускной способностью и интерактивностью, а не одно число, и сообщает, что DSpark сохраняет преимущество на каждом протестированном уровне конкурентности, хотя разрыв сужается по мере роста конкурентности.
Два менее значительных уточнения по области применения из того же источника. Все измерения выполнялись с использованием 16-битной обработки как для визуального энкодера, так и для языкового бэкбона, а ускорение квантованных моделей не входит в область применения этого релиза. Если вы планировали объединить 4-битный экспорт целевой модели с драфтером, потому что вся привлекательность 3B VLM в том, что она помещается в несколько гигабайт, то именно эта комбинация не измерялась.
Во что вам на самом деле обходится его прикрепление

Память — это видимая цена, и карточка её количественно оценивает: на 8,9% больше параметров в развёрнутом стеке. Сложность во время выполнения — невидимая. SGLang требует версии v0.5.19 или новее и строку запуска, содержащую --speculative-algorithm DSPARK, путь к черновой модели и размер блока; в собственном примере карточки также отключается radix-кэш и фиксируется статическая доля памяти — это решения по обслуживанию, о которых теперь придётся подумать. MLX-VLM требует версии v0.7.2 или новее и принимает драфтер через --draft-model, но декодирование DSpark там сейчас использует жадную выборку, поэтому температуру приходится принудительно устанавливать на 0 — реальное ограничение, если ваше приложение полагается на разнообразие выборки. llama.cpp работает через GGUF-драфтер в паре с целевой GGUF-моделью, а не с исходным safetensors-чекпоинтом.
Есть ещё одна издержка, которая проявляется в продакшене, а не в бенчмарке: драфтер и целевая модель должны идти вместе. Расхождение версий между ними — это режим отказа, которого не существует при развёртывании с одной моделью, а раскатка любой из них по отдельности теперь становится проблемой двух артефактов.
Это пара моделей на собственном хостинге. OrcaRouter не маршрутизирует ни LFM2.5-VL-3B, ни её draft-модель — вы скачиваете обе и обслуживаете их сами, — поэтому вопрос маршрутизации касается всего, чему малая модель передаёт управление. В большинстве развёртываний, где 3B edge-VLM работает в паре с draft-моделью, всё ещё есть запросы, на которые малая модель отвечать не должна, и отправка их в единый эндпоинт, охватывающий более 200 моделей по прайсовой цене каждого провайдера, с автоматическим переключением при деградации провайдера, — это одна интеграция вместо отдельной для каждого вендора. Это также означает, что как только провайдер снижает цену, ваш тариф отражает это в тот же день, а не при следующем продлении контракта.
Какой из них скачать?
Если ваша нагрузка смещена в сторону декодирования и ваше оборудование — одно из трёх, протестированных Liquid, подключите драфтер: минус ограничен, потому что выход доказуемо совпадает с выходом целевой модели, а затраты памяти составляют менее одной десятой модели. Если ваша задержка в основном определяется предзаполнением, или вы запускаете квантованную целевую модель, или полагаетесь на нежадную выборку в среде выполнения, в которой это ограничение ещё не снято, запускайте только LFM2.5-VL-3B. Она быстра сама по себе: 228 токенов в секунду на M5 Max, 116 на AMD Ryzen AI Max+ 395 и 20 на Galaxy S26 Ultra — все показатели от производителя — укладываясь примерно в 3 ГБ памяти.
Чего пока никто не может вам сказать, так это того, сохранятся ли показатели Liquid на вашем оборудовании. На момент написания у драфтера было 37 загрузок на Hugging Face, и ни одна цифра из его таблиц не была независимо воспроизведена. Инженерная часть сделана надёжно, а аргумент корректности — это доказательство, а не заявление, но величина — это измерение, а измерения из одной лаборатории на одном наборе машин — это ровно те цифры, которые стоит проверить самостоятельно, прежде чем включать их в план по мощностям.
OrcaRouter открывает доступ к более чем 200 моделям через один ключ: прайс-листовая цена каждого провайдера передаётся напрямую с наценкой 0% и автоматическим переключением при сбоях между провайдерами. прайс-листовая цена провайдера передаётся с наценкой 0% Связка на этой странице в любом случае размещается на ваших собственных серверах — роутер нужен для всего, что ему передаёт небольшая модель, и благодаря этому снижение цены у провайдера отражается в вашем тарифе в тот же день.
