Главная титульная карточка для сравнения LFM2.5-8B-A1B-DSpark и LFM2.5-2.6B-Base с подзаголовком «Скоростная часть против исходного материала»: слева небольшой блок «Draft 327M» отправляет токен-чипы по стрелке в плиточную карточку «LFM2.5-8B-A1B проверяет» с дугой-спидометром под ней, справа — блок «2.6B Base» со стрелкой к пустой карточке модели «ваш файн-тюн», с тегом даты «Август 2026» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

LFM2.5-8B-A1B-DSpark против LFM2.5-2.6B-Base: скорость против сырья

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Если отсортировать семейство LFM2.5 по тому, на что каждая контрольная точка способна сама по себе, LFM2.5-8B-A1B-DSpark и LFM2.5-2.6B-Base окажутся на противоположных концах шкалы — и ни один из концов не может ответить на вопрос. Первая — это черновая модель с 327,7 млн параметров, которая существует исключительно для того, чтобы edge-модель смеси экспертов Liquid AI генерировала токены быстрее. Вторая — это необработанная предобученная контрольная точка с 2,69 млрд параметров, которая существует исключительно для того, чтобы быть дообученной во что-то другое. Обе были выпущены в августе 2026 года под лицензией LFM Open License v1.0 от Liquid, обе находятся в одном скачивании на Hugging Face, и обе чрезвычайно легко скачать по ошибке — потому что их названия заставляют их звучать как две версии одного и того же.

The names are the trap. "DSpark" reads like the family's sparky new flagship, and "Base" reads like the plain default you can actually run. Neither is true. The DSpark checkpoint cannot answer anything on its own — it only proposes tokens for the LFM2.5-8B-A1B to verify. The Base cannot answer anything either, but for the opposite reason — it is an untuned foundation that predicts text but was never post-trained into a chat or agent model. This is not a rivalry; it is a pipeline. One checkpoint sits at the very end of a serving stack, the other at the very beginning of a training run.

Два контрольных пункта, у которых общее название, но не назначение.

LFM2.5-8B-A1B-DSpark (выпущен 20 августа 2026 года) — это черновая модель спекулятивного декодирования: сеть только с вниманием из пяти слоёв, блок из девяти предлагаемых токенов за шаг и марковская голова поверх словаря целевой модели из 128 000 токенов. Вы загружаете её рядом с LFM2.5-8B-A1B — моделью MoE с 8,3 млрд параметров всего и ~1,5 млрд активных, выпущенной ещё 28 мая — черновик предсказывает несколько следующих токенов, а целевая модель проверяет весь блок за один прямой проход, оставляя всё, что принимает. Поскольку целевая модель проверяет каждый токен, выход при жадном декодировании идентичен работе LFM2.5-8B-A1B в одиночку: «без потерь по построению», как выражается Liquid. Черновик — это деталь для скорости, а не мозг. Он был выпущен вместе с родственными черновиками для LFM2.5-1.2B-Instruct и LFM2.5-2.6B, каждый в форматах Safetensors и GGUF, с поддержкой с первого дня в SGLang и llama.cpp.

LFM2.5-2.6B-Base (выпущена 4 августа 2026 года) — это другой конец конвейера: фундаментальная модель с 2,69 млрд параметров на гибридном стеке из 30 слоёв — 22 блока с двойным гейтингом и короткой свёрткой плюс 8 блоков внимания с группированными запросами — предобученная на примерно 34 триллионах токенов, с промежуточным этапом обучения, расширяющим контекст до 128K. У неё нет чат-шаблона, нет дообучения по инструкциям и опубликованных бенчмарков, а собственная карточка модели Liquid рекомендует её только для обширной тонкой настройки. Её единственное предназначение — быть исходным материалом, который четырёхэтапный конвейер пост-обучения — два раунда SFT, специализация учителя, дистилляция on-policy и затем агентное обучение с подкреплением — превращает в агента с вызовом инструментов LFM2.5-2.6B. Та же семья, та же лицензия, та же страница загрузки. Совершенно разные задачи.

Бок о бок: семь измерений, две должности

Поскольку эти два чекпоинта служат разным целям, честное сравнение не путает роли обеих сторон:

• Что это — LFM2.5-8B-A1B-DSpark, драфт-модель спекулятивного декодирования объёмом 0,3B параметров; LFM2.5-2.6B-Base — сырая предобученная фундаментальная модель объёмом 2,69B параметров.

• С чем это работает — драфт-модель DSpark работает в паре с LFM2.5-8B-A1B MoE (всего 8.3B, ~1.5B активных на токен); Base работает самостоятельно, но только как ненастроенное предсказание текста.

• Автономное использование — DSpark сам по себе ничего не создаёт; он лишь ускоряет целевую модель. Базовая модель генерирует текст, но не обеспечивает полезного поведения продукта: ни следования инструкциям, ни вызова инструментов, ни чат-шаблона.

• Качество вывода — DSpark наследует точный жадный вывод целевой модели, поскольку каждый предложенный токен проверяется; Base, по замыслу, не имеет опубликованных бенчмарков ни для одной задачи.

• Скорость — DSpark добавляет к своей цели измеренное вендором среднее ускорение 2.54× на H100 (до 3.18× на MATH500) и 1.18× на M4 Max, но оно не воспроизведено; у Base вообще нет заявления о скорости вывода.

Потребление памяти — DSpark добавляет примерно 0,3 ГБ черновых весов в дополнение к целевой модели; Base — это полная версия на 2,69B, работающая менее чем в 2,5 ГБ, самая компактная серьёзная базовая модель в семействе.

• Форматы и доступность — DSpark поставляется в Safetensors и GGUF с поддержкой SGLang и llama.cpp с первого дня; Base поставляется в Safetensors плюс GGUF, ONNX и MLX и работает на Transformers, vLLM, SGLang, llama.cpp и MLX. Ни одна из них сегодня не обслуживается ни одним инференс-провайдером — обе являются self-hosted чекпоинтами.

A comparison scoreboard for LFM2.5-8B-A1B-DSpark and LFM2.5-2.6B-Base. The left column shows the draft as a 0.3B speculative-decoding draft, running with the LFM2.5-8B-A1B MoE (1.5B active), no standalone output, a 2.54x mean H100 speedup up to 3.18x, a 1.18x mean on M4 Max, and Safetensors + GGUF self-host formats. The right column shows the Base as a 2.69B raw pre-trained foundation, run with your own fine-tune, untuned text with no chat template, no published benchmarks, 128K context under 2.5GB, and Safetensors + GGUF + ONNX + MLX formats, with a footer reading 'Speed figures vendor-measured Aug 20 2026, unreproduced; Base has no benchmarks by design' and the OrcaRouter logo in the bottom-right corner.

Единственные цифры в этом матче пришли из одной лаборатории.

Все количественные данные здесь — это измерения одного вендора, сделанные в день публикации черновика и ещё не воспроизведённые независимо; воспринимайте их как многообещающие, а не как подтверждённые. Liquid измерила LFM2.5-8B-A1B-DSpark при batch size 1, температуре 0, на одном H100 с 80 ГБ в BF16 под SGLang и на M4 Max MacBook Pro в FP16 GGUF на экспериментальных Metal-ядрах llama.cpp. На H100 пара в среднем показала 2,54× (418 → 1 074 токена в секунду), с лучшим отдельным результатом 3,18× на MATH500 (428 → 1 362 ток/с) и средним принятием около 7 из 10 предложенных токенов. На M4 Max та же пара в среднем дала всего 1,18× (90 → 106 ток/с) — тот самый пограничный случай на устройстве, на который указала сама Liquid, потому что проверка блока активирует больше экспертов в текущем MoE-бэкенде Metal и перемещает больший объём весов по шине памяти.

Базовая сторона этого сравнения не имеет вообще никаких числовых показателей, и само это отсутствие является спецификацией. LFM2.5-2.6B-Base была предобучена, а не дообучена; её никогда не оценивали на чат, использование инструментов или агентное поведение, потому что никто и не предполагал использовать её таким образом. Её значимые цифры — архитектурные: 2,69 млрд параметров, контекст 128K, токенизатор на 16 языков, менее 2,5 ГБ для запуска. Фундамент не бенчмаркают; бенчмаркают то, во что ты его дообучаешь.

Есть одна семейная ирония, которую стоит назвать, прежде чем вы что-либо решите. Черновик, о котором эта статья, — вариант для 8B-A1B — как раз тот, что даёт наименьший прирост на ноутбуке (1.18×), тогда как родственный черновик для семейства 2.6B, ускоряющий пост-обученного родственника этой самой базовой модели, в среднем показывает 2.27× на M4 Max и снижает задержку многоинструментального вызова функций на 57%. Если речь об устройстве вроде телефона или ноутбука, а не о GPU-боксе, история о скорости — это путь 2.6B.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Так какую же из них скачивать?

Вам никогда не приходится выбирать между этими двумя напрямую, потому что они не являются альтернативами — но вы должны знать, в какой роли вы находитесь:

Если вы обслуживаете LFM2.5-8B-A1B на собственных GPU и хотите получать больше токенов в секунду с того же железа, LFM2.5-8B-A1B-DSpark — это обратимая надстройка: соберите SGLang или llama.cpp с интеграциями DSpark от 20 августа, укажите драфт в команде запуска, сохраните жадное декодирование — и размер блока будет считываться автоматически из конфигурации драфта. Плюс — примерно 2.5× пропускной способности без изменения результатов; минус — 0.3GB дополнительных весов и сборка, достаточно свежая, чтобы содержать PR. Уберите два спекулятивных флага — и вы вернётесь к обычной целевой модели.

Если вы хотите создать собственного специалиста — доменную модель, ассистента для кастомного языка, дообучение на проприетарных данных — LFM2.5-2.6B-Base является одной из самых дешёвых серьёзных отправных точек в экосистеме открытых весов: 2.6B, менее 2.5GB, контекст 128K, многоязычный токенизатор. Чекпойнт DSpark вам в этом вообще не поможет, потому что это не базовая модель.

Если вам действительно нужен локальный агент Liquid — вызов инструментов, многошаговые задачи — то вам не нужен ни один из этих двух. Вам нужна пост-обученная LFM2.5-2.6B, и уже потом вы можете решить, прикручивать ли к ней собственный драфт. Base — это исходный материал для тех, кто хочет обучать; драфт 8B-A1B — это ускоряющий компонент для тех, кто уже развернул MoE. Ошибка — скачать Base, потому что вам нужен был более быстрый агент, или драфтер, потому что вам нужна была основа для обучения.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-2.6B-Base, showing the TextGeneration tag, Transformers and Safetensors formats, '16 languages', and the model card describing LFM2.5-2.6B-Base as the pre-trained text-only checkpoint used to create the post-trained agentic LFM2.5-2.6B, with a model table listing 'LFM2.5-2.6B-Base 2.6B Pre-trained base model for fine-tuning' (captured August 21, 2026).

Где эти два соединяются — и где место маршрутизатору.

Оба чекпоинта — это истории про самостоятельный хостинг. Draft — это аксессуар serving-слоя, который существует только внутри вашего собственного стека SGLang или llama.cpp; Base — артефакт обучения. Ни один из них не появляется ни в одном хостинг-каталоге, и ни у одного нет указанной цены за токен. На практике это означает, что любой из путей оказывается рядом с хостинг-моделями, к которым вы уже обращаетесь, — и именно эту смесь и призван устранить маршрутизирующий слой.

На стороне обслуживания экономика черновой модели проста и реальна: 2.5× больше токенов в секунду на том же GPU — это 2.5× меньше времени и примерно 2.5× меньше GPU для той же нагрузки, без изменения качества. Но этот рычаг существует только если вы владеете инференсом. Как только вы вызываете 8B-A1B через API, провайдер забирает ускорение себе — и именно тогда ключевым становится сравнение на стороне API: сколько провайдер берёт за запрос и доходит ли снижение цены до вас в тот же день, когда его объявили. В этом и смысл маршрутизатора с прямой передачей цен: один API для более чем 200 моделей, цены провайдеров передаются без наценки (0%), так что скидка вендора мгновенно отражается у вас, плюс автоматическое переключение, из-за которого всплеск задержки у одного провайдера не становится вашей задержкой. Вы также можете подключить собственный self-hosted стек LFM к той же конечной точке — так вы проверяете совершенно новую черновую модель на реальном трафике, не ставя на неё продакшен-путь.

LFM2.5-8B-A1B-DSpark и LFM2.5-2.6B-Base — родственники по названию и противоположны по задачам: одна — это ускоряющая деталь, прикрученная к краю MoE, другая — необученный мозг, из которого вырастает агент на 2.6B. Ни одна не работает сама по себе. Выбирайте драфтера, чтобы ускорить MoE, который вы уже обслуживаете на GPU, выбирайте Base, чтобы дообучить основу 2.6B во что-то своё, и пропускайте обе, если вам нужен работающий агент — потому что единственное, что есть общего у обоих чекпоинтов, — это то, что ни один из них сам по себе не делает ничего, чем можно воспользоваться.

Часто задаваемые вопросы

Могу ли я запустить LFM2.5-8B-A1B-DSpark самостоятельно?

Нет. Это черновая модель без самостоятельного вывода — она предлагает кандидатные токены, которые затем проверяет целевая модель LFM2.5-8B-A1B, поэтому она существует только внутри стека обслуживания спекулятивного декодирования, построенного на интеграциях SGLang или llama.cpp от 20 августа. Загрузка только её не даст вам ничего, что можно запросить.

LFM2.5-2.6B-Base — это чекпоинт, который работает на устройстве как агент?

Не как есть. Base — это сырая предобученная основа без точной настройки на инструкции и без чат-шаблона. Модель, работающая как агент Liquid на устройстве, — это пост-обученная LFM2.5-2.6B, получаемая из Base с помощью четырёхэтапного конвейера пост-обучения, — и, если нужно быстрее, в паре с черновой моделью LFM2.5-2.6B-DSpark.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube