Сгенерированная титульная карточка с текстом «Ember-1 против LFM2.5 2.6B Base» и подзаголовком «Готовое поведение против сырого субстрата», над двумя карточками: Ember-1 — «дообученный Kimi K3» и «обслуживается, а не скачивается»; LFM2.5 2.6B Base — «плотный чекпоинт 2.69B» и «без дообучения на инструкциях».
Guides & Insights

Ember-1 против LFM2.5 2.6B Base: готовое поведение против необработанного субстрата

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ни Ember-1, ни LFM2.5 2.6B Base — это не модели, которые можно взять и сразу использовать, и они непригодны по противоположным причинам. Ember-1, опубликованная Fireworks Research 23 сентября 2026 года, — специализированная производная Kimi K3 от Moonshot AI, которую лаборатория переобучила для достижения точности K3 примерно на 40% меньшем количестве токенов — завершённое поведение, доступное только как исследовательский предпросмотр на собственной бессерверной платформе производителя, без весов и без опубликованной цены. LFM2.5 2.6B Base, опубликованная Liquid AI 4 августа 2026 года, — это предобученный чекпоинт с 2,69 млрд параметров под лицензией LFM Open License v1.0, который вообще не проходил инструкционную настройку и будет продолжать ваш текст, а не отвечать на ваш вопрос — сырой субстрат, доступный для скачивания уже сегодня, намеренно незавершённый. Сопоставление их бок о бок — хороший способ увидеть два аргумента о том, откуда теперь происходят выигрыши в эффективности.

Вопрос, на который отвечают обе модели

Оба релиза исходят из одной и той же предпосылки: дешёвые победы от увеличения модели в основном уже получены, а интересная работа сместилась к тому, как модель расходует то, что у неё уже есть. Две лаборатории отвечают на это по-разному. Fireworks Research взяла существующую передовую модель и изменила её поведение. Liquid AI создала небольшую модель с нуля и изменила масштаб. Ни один из них не является историей о новой архитектуре, и ни один не пытается возглавить таблицу лидеров.

Ответ Ember-1: сохранить модель, переобучить поведение

Ember-1 не трогает архитектуру Kimi K3 и атакует одну конкретную неэффективность. Модели рассуждений могут сжигать более 90% сгенерированных токенов на внутренние размышления, и в многоходовом цикле агента эти следы воспроизводятся и повторно оплачиваются на каждом последующем ходу — Fireworks Research описывает результирующий рост контекста как примерно квадратичный по числу ходов. Лаборатория утверждает, что рассуждения K3 длиннее, чем требуется для задачи, и что избыток можно удалить без изменения ответов. Сообщается о проведении более 50 обучающих экспериментов и более 200 оценок на собственном бессерверном стеке обучения, и говорится, что длина рассуждений снизилась на 35–50% без потери точности на семи бенчмарках и двух наборах производственного трафика клиентов. Всё это со слов вендора и не воспроизведено.

Результаты неравномерны — эту неравномерность скрывает главная цифра. Сокращение числа токенов у Ember-1 составляет от 51,9% на Terminal Bench 2.1 до 5,9% на τ-2 Bench Airline. В одном производственном A/B-тесте по кодингу у заказчика число выходных токенов упало с 49,3 тыс. до 29,9 тыс., при этом оценка удержалась на уровне 0,753 против 0,751 — сокращение токенов рассуждений на 71,3%. Это большой эффект для одного типа рабочей нагрузки и почти незаметный для другого, что и следовало ожидать от модели, обученной перестать переобдумывать, а не думать меньше.

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

Ответ LFM2.5 2.6B Base: измените масштаб, сохраните рецепт

LFM2.5 2.6B Base — это ставка иного рода. Это гибридная архитектура Liquid AI в небольшом масштабе: 30 слоёв, из которых 22 — блоки коротких свёрток с двойным гейтированием, а 8 — слои grouped-query attention, обученная примерно на 34 триллионах токенов на 16 языках, с контекстным окном в 131 072 токена. Весь чекпоинт — это 2,69 млрд плотных параметров: достаточно мало, чтобы разговор о стоимости перестал быть разговором о токенах и стал разговором о том, какая одна GPU у вас свободна.

Необычной её делает то, чего она намеренно не делает. В ней нет дообучения на инструкциях — в этом и заключается весь смысл суффикса «Base»: дайте ей вопрос, и она продолжит текст в стиле вопроса, а не ответит на него. В собственной карточке модели Liquid AI её рекомендуют для задач, требующих интенсивного дообучения. Для неё также нет опубликованной оценки, и это не упущение — оценка базового чекпоинта на бенчмарках следования инструкциям ничего бы не измерила, потому что измеряемое поведение ещё не было сформировано обучением.

Контраст, по одной строке на измерение

• Что это — Ember-1: переобученная производная Kimi K3 с сокращённым рассуждением. LFM2.5 2.6B Base: предварительно обученный с нуля чекпоинт без инструкционной настройки.

• Параметры — Ember-1: не раскрыты; унаследованы от Kimi K3. LFM2.5 2.6B Base: 2,69 млрд, плотная.

• Веса — Ember-1: не опубликованы. LFM2.5 2.6B Base: доступны по лицензии LFM Open License v1.0.

• Цена — Ember-1: не опубликована; для расчёта стоимости бенчмарков используется тарифная сетка Kimi K3. LFM2.5 2.6B Base: бесплатно для скачивания; оборудование предоставляете вы.

• Контекст — Ember-1: не опубликовано для предпросмотра. LFM2.5 2.6B Base: 131 072 токена.

• Опубликованная оценка — Ember-1: семь бенчмарков и два A/B-теста, все проведены вендором. LFM2.5 2.6B Base: отсутствуют, намеренно.

• Что вы получаете в итоге — Ember-1: эндпоинт, который выдаёт более короткие рассуждения с точностью уровня K3. LFM2.5 2.6B Base: отправная точка, поведение которой определяется тем, чему вы её обучите.

Два разных вида отсутствия

Разрывы в этих двух релизах выглядят симметричными, но таковыми не являются. Отсутствие оценки у LFM2.5 2.6B Base — это свойство самого артефакта: у базового чекпоинта нет поведения, которое можно было бы оценить, а отсутствие инструкционной настройки — это задокументированная особенность, а не недостаток. Это отсутствие не создаёт коммерческой неопределённости, потому что вы покупаете файл с прилагаемой лицензией, и поставка считается выполненной в тот момент, когда завершается загрузка.

Недостающие элементы Ember-1 действительно остаются нерешёнными. Опубликованной цены нет, поэтому заявление о стоимости — это арифметика по тарифной сетке Kimi K3, а не тариф, на который можно закладывать бюджет. Выпуска весов нет, поэтому модель не сможет пережить решение вендора продолжать её обслуживать. А окно доступа описывается как временное: Fireworks Research представляет свои исследовательские релизы как двухнедельные бессерверные окна, постоянство которых зависит от спроса сообщества. Предварительная версия, которой может не быть в следующем месяце, — это не то же самое, что предварительная версия, которая всего лишь не доказала себя, а второй клиентский A/B-тест в анонсе — примерно на 35% меньше токенов на задачу — говорит о том, чего ожидает лаборатория, а не о том, что всё ещё будет доступно в ноябре.

Эта асимметрия — честный ответ на вопрос «что из этого более готово». Ни то, ни другое не готово в смысле готовой к использованию зависимости для продакшена. LFM2.5 2.6B Base завершён как сырьё и не завершён как модель. Ember-1 завершён как модель и не завершён как сервис.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

Что делать с каждым в этом квартале

Если у вас есть конвейер дообучения и узкая задача с чистыми метками, LFM2.5 2.6B Base — более предсказуемый из двух. Контрольная точка небольшая, лицензия разрешительная, архитектура спроектирована для эффективного инференса, а работа по превращению её во что-то полезное — дообучение с учителем, оценочный набор, стек для обслуживания — это работа, которой вы уже владеете от начала до конца. В любом случае вы будете запускать собственные оценки, потому что Liquid AI не опубликовала ни одной.

Если у вас есть рабочая нагрузка хостируемого агента, в счёте за которую преобладают токены рассуждений, Ember-1 имеет дело с реальным слагаемым в вашем уравнении затрат, и это стоит тех двух недель. Правильный тест — теневой трафик в сравнении с вашим текущим решением: отправляйте часть реальных запросов обоим, сравнивайте выходные данные, а боевые результаты оставьте как есть. Это также тот совет, который дало независимое критическое освещение релиза, наряду со справедливым предостережением: при сжатии рассуждений есть риск потерять шаг, необходимый модели, а в агенте это позже проявляется как неверный вызов инструмента, а не как неверная фраза.

Ни одна из этих моделей не представлена на OrcaRouter. Если вы хотите протестировать сам паттерн, а не эти два конкретных артефакта — небольшую дообучаемую модель и большую размещённую модель-рассуждатель в одном пайплайне — именно для этого и предназначен DSL маршрутизации: объединить несколько моделей в один вызов и позволить каждой обрабатывать ту часть, в которой она хороша, за одним ключом и одним счётом. Это сравнение стоит проводить на уровне архитектуры, даже пока оба конкретных эндпоинта остаются недоступными.

Сделка, изложенная один раз

Ember-1 продаёт определённость поведения и неопределённость доступности: модель, качество которой тщательно обосновывают, а доступность которой явно обусловлена. LFM2.5 2.6B Base продаёт определённость доступности и неопределённость поведения: файл, который у вас будет всегда, а его компетентность полностью зависит от обучения, которое вы в него вложите. Командам с проблемой обслуживания и без ресурсов на обучение стоит следить за превью и надеяться, что оно станет постоянным. Командам с ресурсами на обучение и узкой задачей стоит скачать Base и перестать ждать чью-либо дорожную карту.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Что на самом деле показывает это сопоставление, так это то, что «эффективность» перестала означать что-то одно. Для Ember-1 это означает меньше токенов при том же качестве на чужом оборудовании. Для LFM2.5 2.6B Base это означает достаточно маленькую модель, чтобы оборудование вообще перестало быть чужим. Оба этих ответа хороши, и они не взаимозаменяемы.