Титульная карточка для сравнения LFM2.5-8B-A1B-DSpark с Qwen3-8B, с подзаголовком «Черновик, который ускоряет модель, против 8B, которые уже запускают все»: слева — блок «Draft 327M», отправляющий чипы-токены в карточку MoE «LFM2.5-8B-A1B» в виде стопки плиток, со стрелкой спидометра на высоком значении под надписью «СПЕКУЛЯТИВНОЕ ДЕКОДИРОВАНИЕ»; справа — карточка в виде облачка чата с подписью «Qwen3-8B», с иконками искры и часов под надписью «УНИВЕРСАЛЬНАЯ МОДЕЛЬ»; с тегом даты «август 2026 года» и логотипом OrcaRouter, размещённым в правом нижнем углу.
Guides & Insights

LFM2.5-8B-A1B-DSpark против Qwen3-8B: черновик, ускоряющий модель, против 8B, которую уже все запускают

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Liquid AI выпустила черновой чекпоинт LFM2.5-8B-A1B-DSpark 20 августа 2026 года — вспомогательный механизм спекулятивного декодирования с 327,7 млн параметров, который ускоряет генерацию LFM2.5-8B-A1B edge MoE до 3,18 раза на одном H100. Прежде чем это сравнение станет честным, один факт должен лежать на столе: чекпоинт DSpark — это не модель, к которой можно обратиться напрямую. Он лишь ускоряет другую модель. Таким образом, реальный вопрос развёртывания, который поднимает этот релиз, — тот самый, который большинство команд взвешивают весь год: LFM2.5-8B-A1B или Qwen3-8B, две модели с открытым весом класса 8B, находящиеся на очень разных этапах своего жизненного цикла.

Здесь рамка важнее обычного, потому что две стороны — это не одно и то же. Qwen3-8B — это полноценная, готовая к развёртыванию модель, которую можно разместить на собственном сервере или купить токены уже сегодня. LFM2.5-8B-A1B — тоже полноценная, готовая к развёртыванию модель: черновик DSpark — это дополнение к ней, а не её версия. Всё, что обещает черновик, измерено поставщиком и датировано вчерашним днём; всё, что касается репозиториев и форматов, можно просто проверить. Этот материал держит эти две категории раздельно.

Во-первых, слово "DSpark" не является существительным в этом предложении.

Спекулятивное декодирование запускает дешевую черновую модель перед настоящей: черновик предсказывает следующие несколько токенов, целевая модель проверяет весь блок за один прямой проход и сохраняет то, с чем согласна. Когда предсказания удачны, вы получаете несколько токенов по цене одного прохода с загрузкой весов, так что пропускная способность растёт, не затрагивая веса целевой модели — а поскольку целевая модель проверяет каждый предложенный токен, результат при жадном декодировании идентичен запуску одной LFM2.5-8B-A1B. Liquid называет это «без потерь по построению», и именно поэтому черновик безопасно подключать.

LFM2.5-8B-A1B-DSpark от Liquid — это намеренно небольшая модель-драфтер: пять слоёв только с вниманием, блок из девяти предлагаемых токенов за шаг и марковская голова поверх словаря целевой модели на 128 000 токенов, обученная 15 эпох на смеси данных чатов, кода и вызова функций, с контрольными точками, выбранными по коэффициенту принятия, а не по loss. Это одна из трёх моделей-драфтеров, выпущенных поставщиком в тот день, наряду с LFM2.5-1.2B-Instruct и LFM2.5-2.6B, каждая в форматах Safetensors и GGUF, с поддержкой SGLang и llama.cpp с первого дня. Это также, что важно для любого, кто читает сравнение с моделью класса 8B: она не предоставляется ни одним инференс-провайдером и не имеет цены за токен. Она живёт только внутри вашего собственного стека спекулятивного декодирования.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Две модели, которые действительно развертываются

Уберите черновик в сторону — и реальное сравнение происходит между моделью, которую он ускоряет, и действующей моделью. Обе имеют открытые веса и относятся примерно к классу 8B, и на этом сходство заканчивается:

• Архитектура — LFM2.5-8B-A1B — это разреженная модель MoE с 8.3 млрд параметров, но лишь ~1.5 млрд активных на каждый токен; Qwen3-8B — плотная модель на 8.2 млрд параметров, которая активирует все параметры на каждом токене.

• Релиз — LFM2.5-8B-A1B выпущена 28 мая 2026 г.; Qwen3-8B выпущена в апреле 2025 г., ей уже больше года, и на некоторых платформах она признана устаревшей.

• Контекст — LFM2.5-8B-A1B обеспечивает нативный контекст в 128K токенов с словарём на 128K токенов; Qwen3-8B предлагает 32K нативных, расширяемых примерно до 128K с помощью YaRN.

• Рассуждение — LFM2.5-8B-A1B — это модель рассуждения, которая выдает явную цепочку мыслей; Qwen3-8B переключается между режимами мышления и без мышления по запросу.

• Интеллект — по данным Artificial Analysis, LFM2.5-8B-A1B набирает 8 баллов по индексу интеллекта, а Qwen3-8B — 8–8.3, что ниже медианы 9 для сопоставимых моделей с открытым весом; ни одна из них не является фронтирным интеллектом, и обе честно это признают.

• Скорость — по данным Artificial Analysis, LFM2.5-8B-A1B выдаёт примерно 340 токенов в секунду у разных провайдеров; Qwen3-8B — около 37–40 токенов в секунду, один из самых медленных в своём классе.

• Лицензия — LFM2.5-8B-A1B распространяется по лицензии Liquid's LFM Open License v1.0; Qwen3-8B — Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Скорость — вот где борьба перестаёт быть близкой.

Самая главная причина, по которой разговор о моделях с открытыми весами класса 8B сместился, — это скорость на единицу памяти. Qwen3-8B — плотная модель: каждый сгенерированный токен прогоняет все 8,2 млрд весов через шину памяти, поэтому она медленная для своего размера и требует настоящей видеопамяти. LFM2.5-8B-A1B направляет каждый токен через примерно 1,5 млрд активных параметров — это и есть вся суть конструкции: MoE на устройстве, который остаётся быстрым и компактным. Заявления самой Liquid идут дальше: примерно 253 токена в секунду на процессоре M5 Max при использовании менее 6 ГБ памяти — по данным производителя. Что касается сырой пропускной способности развёртываемой модели, черновик здесь даже не имеет значения — MoE уже в несколько раз быстрее плотной модели 8B ещё до добавления спекуляции.

По цене обе модели имеют открытые веса, так что самостоятельный хостинг любой из них стоит ровно столько, сколько стоит ваше оборудование. Сравнение хостингов по доступности явно не в пользу Liquid: Qwen3-8B доступен через API Alibaba по цене $0,18 за миллион входных токенов и $2,10 за миллион выходных токенов, а также у широкого круга сторонних хостингов открытых моделей; у LFM2.5-8B-A1B нет значимого собственного хостинга с ценами на токены, а у черновика нет его вообще. Это означает, что на практике большинство команд сегодня будут запускать edge MoE от Liquid на собственном хостинге — на ноутбуке, периферийном устройстве или собственном GPU, — и именно в такой конфигурации черновик DSpark становится ключевой переменной.

Что на самом деле меняет проект в этом решении

Черновая модель меняет лишь один аспект: насколько быстро LFM2.5-8B-A1B генерирует токены в serving-стеке, которым вы управляете. Она не делает модель умнее и не меняет её ответы — жадный вывод побитово идентичен выводу одной лишь целевой модели. Помогает она при GPU-инференсе с пропускной способностью на один запрос: Liquid измерила средний прирост 2,54× на одной H100 по пяти бенчмаркам (с 418 до 1 074 токенов в секунду), с лучшим результатом 3,18× на MATH500, при размере батча 1 и температуре 0. Почти не помогает она на Apple silicon: та же модель показала в среднем всего 1,18× на M4 Max (90 → 106 ток/с), потому что проверка блока черновых токенов активирует больше экспертов в текущем Metal MoE-бэкенде llama.cpp и увеличивает пересылку весов — ровно те издержки, которые спекулятивное декодирование и призвано амортизировать. Всё это цифры вендора, зафиксированные в день релиза и независимо не воспроизведённые.

Это разделение напрямую соответствует правилу принятия решения. Если вы запускаете LFM2.5-8B-A1B на собственном GPU, черновик — реальный рычаг экономии: примерно в 2,5 раза больше токенов в секунду на том же кремнии, без изменения выходных данных, и вам нужна лишь сборка с интеграциями DSpark от 20 августа. Если же вы обращаетесь к модели через API, ускорение остаётся у провайдера, и черновик для вас не имеет значения. А если устройство — ноутбук или телефон, черновик для этой конкретной модели сегодня практически не даёт эффекта; выигрыш на устройстве дают родственные черновики для плотных моделей LFM2.5-1.2B-Instruct и LFM2.5-2.6B — в 2,54 и 2,27 раза соответственно. Qwen3-8B, со своей стороны, вообще не нуждается в черновике — это просто более медленная и плотная модель, которая для развёртывания не требует спекулятивной декодировки.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Выбор спустя год с момента выхода Qwen3-8B

Qwen3-8B — это скучный, но правильный выбор по умолчанию: зрелая модель, Apache-2.0, 119 языков, режимы с рассуждением и без, доступна везде и по-прежнему отлично справляется с чатом, кодом и структурированным текстом. Её проблемы — возраст и скорость: плотная модель на 8B, которой 16 месяцев, она медленная для своего класса и уже устарела на некоторых платформах, что является серьёзным сигналом для поддержки, если вы начинаете проект с нуля сегодня.

LFM2.5-8B-A1B — это более новая и узкая ставка: MoE, ориентированный на периферийные устройства, созданный для вызова инструментов и следования инструкциям на высокой скорости на потребительском оборудовании, с драфт-моделью DSpark в качестве опционального ускорения обслуживания для сценария самостоятельного хостинга на GPU. Это не более умная модель — обе находятся ниже медианы открытых весов на Artificial Analysis, — но она значительно быстрее и требует лишь малую долю памяти на токен, а это тот компромисс, который важен для агентов на устройствах. Её ограничения — зеркальное отражение ограничений Qwen3-8B: более свежий релиз, отсутствие собственных хостинговых тарифов и история со спекулятивным декодированием, чьи цифры пока не воспроизвёл никто, кроме вендора.

Базовый слой маршрутизации в любом случае остаётся тем же. Ни LFM2.5-8B-A1B, ни Qwen3-8B сегодня нет в хостинговом каталоге OrcaRouter, поэтому честная формулировка — что роутер делает для этой комбинации: один API для 200+ хостинговых моделей с ценами провайдера без наценки (0%), так что снижение цены вендором вступает в силу на платформе в тот же день, когда о нём объявляют; автоматическое переключение при сбоях, благодаря которому непроверенную новую модель можно опробовать на реальном трафике, а не доверять ей продакшен-маршрут; и DSL для маршрутизации, который может стоять перед моделью, которую вы обслуживаете сами, — именно так самостоятельно развёрнутый стек LFM2.5-8B-A1B сосуществует с хостинговыми эндпоинтами за одним ключом.

Если вы собираете систему для ноутбука или edge-устройства и вам важна скорость вызова инструментов, LFM2.5-8B-A1B — то направление, которое стоит протестировать, а черновая модель даёт бесплатные 2.5× на пути GPU-инференса, когда придёт время. Если же вам нужна универсальная модель, о которой можно не думать, Qwen3-8B по-прежнему работает — просто знайте, что это модель начала 2025 года, от которой экосистема начинает отказываться. Единственное, чего не меняют ни черновая, ни целевая модель, — это честное состояние доказательной базы: всё, что звучит быстро в релизе DSpark, — это замер одного вендора за один день, и независимые бенчмарки остаются открытым вопросом, который определяет, насколько вы этому вообще доверяете.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube