Сгенерированная титульная карточка для «ARTEMIS vs LFM2.5-2.6B-Base» с подзаголовком «Готовый харнесс, незавершённый чекпоинт», противопоставляющая ARTEMIS как Apache 2.0-харнесс для автоматизации Android и LFM2.5-2.6B-Base как 2,69 млрд предобученных весов без дообучения на инструкциях и без бенчмарков, со сноской о том, что базовая модель поставляется под LFM Open License, а не под Apache 2.0.
Guides & Insights

ARTEMIS против LFM2.5-2.6B-Base: чекпойнт, который не может выполнить задачу, и стенд, которому нужно, чтобы он её выполнил

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В дорожной карте ARTEMIS от Google значатся четыре пункта, и ровно один из них требует модели, которой явно ещё не существует: лёгкие визуально-языковые модели на устройстве для автоматизации с низкой задержкой и приоритетом приватности. Очевидный кандидат для такой задачи — нечто в размерном классе LFM2.5-2.6B-Base: предобученный чекпойнт Liquid AI на 2,69 млрд параметров, опубликованный как открытые веса с контекстом в 131 072 токена и объёмом, достаточно малым для телефона. Но в том виде, в каком он поставляется, он также не способен занять это место, и причины стоит понять, прежде чем кто-либо поставит эти две вещи в таблицу сравнения. ARTEMIS от Google — это инструмент автоматизации Android на естественном языке, выпущенный с открытым исходным кодом под лицензией Apache 2.0 в августе 2026 года, который управляет реальным смартфоном через ADB и заявляет о доле успешных завершений 99%+ в бенчмарке AndroidWorld от Google Research. LFM2.5-2.6B-Base — это сырой предобученный материал без инструкционной настройки, без шаблона чата и — намеренно — без опубликованных бенчмарков, предназначенный для команд, которые сами будут проводить его пост-обучение. Один — готовое ПО с нерешённой проблемой модели. Другой — незавершённые веса с решённой проблемой лицензии. Ни один из них не заменяет другой, и место, где они действительно встречаются, не там, где вы могли бы предположить.

Что на самом деле представляет собой LFM2.5-2.6B-Base

Отбросьте брендинг — и останется тщательно выстроенная основа для работы на устройстве, со спецификациями, которые читаются так, будто кто-то оптимизировал под пропускную способность памяти, а не под позицию в таблице лидеров.

Размер — 2,69 млрд параметров в bfloat16 в одном шарде объёмом ~5,39 ГБ, позиционируется как «2,6 млрд».

Архитектура — 30 слоёв в гибридном разбиении: 22 блока коротких свёрток с двойным гейтированием поверх 8 слоёв внимания с группированными запросами, скрытая размерность 2048, 32 головы внимания против 8 голов KV, связанные эмбеддинги. Тот же code>Lfm2ForCausalLM/code> класс, что и в предыдущем поколении, поэтому пользовательский код моделирования не требуется.

Обучение — примерно 34 триллиона токенов, с отдельной фазой промежуточного обучения для расширения контекста.

Словарь — 128 000 токенов; в этом поколении их число удвоено, чтобы лучше обрабатывать нелатинские письменности. Около 262 млн параметров — примерно десятая часть модели — находятся в связанном эмбеддинге.

Контекст — здесь карточка модели и конфигурация расходятся, и об этом стоит знать: в документации заявлено 131 072 токена, тогда как code>config.json/code> задаёт code>max_position_embeddings/code> равным 128 000. Рассчитывайте на 128K и считайте всё, что выше, непроверенным.

Языки — шестнадцать: английский, арабский, китайский, французский, немецкий, хинди, индонезийский, итальянский, японский, корейский, польский, португальский, русский, испанский, тайский, вьетнамский.

Бенчмарки — отсутствуют. Liquid не публикует никаких оценок для базового чекпоинта, и карточка модели трактует это упущение как намеренное: данный артефакт существует для дообучения, а не для измерения в его исходном состоянии.

Эта последняя строка — суть всего релиза, и именно поэтому сравнение «X vs LFM2.5-2.6B-Base» нужно проводить осторожно. У базового чекпоинта нет собственного мнения ни о чём. Попросите его спланировать рабочий процесс для Android — и он вероятностно продолжит ваш текст, потому что его никогда не учили отвечать. В карточке он рекомендуется только для случаев, требующих серьёзного дообучения: ассистент под конкретный язык, ассистент под конкретную нишу в регулируемой отрасли, обучение на проприетарных данных или роль ученика при дистилляции. Для всего, что должно работать «из коробки», включая вызов инструментов, Liquid направляет вас к дообученной LFM2.5-2.6B.

A screenshot of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the lfm1.0 licence, 16 languages, the lfm2.5, liquid and edge tags, BF16 tensor type, 27,908 downloads in the last month, 13 finetunes and 10 quantizations, and a model table listing the base as a pre-trained base model for fine-tuning alongside its post-trained sibling for agentic workloads.

Что ARTEMIS нужно от модели — то, чего не даёт базовый чекпоинт

ARTEMIS — это контур управления с двумя режимами. Flash — реактивный цикл «наблюдай и действуй» примерно 3–5 секунд на шаг. Pro — многоагентный граф примерно 15–40 секунд на шаг: Планировщик ведёт живой план в Markdown, Оператор располагает полным набором инструментов, а Checker только для чтения проверяет контрольные точки на четырёх уровнях — от code>off/code> до code>strict/code>. Оба режима требуют от лежащей в основе модели одного и того же: посмотреть на скриншот, выбрать одно действие из фиксированного набора инструментов и снова сделать это через секунду-другую — сто раз, не потеряв нить.

Это очень сложная задача — следование инструкциям в рамках жёсткой схемы, визуальное понимание с опорой на реальность и связность на длинных горизонтах — и это именно тот набор навыков, которого базовый чекпойнт не получил. Протестированные самой ARTEMIS бэкенды — это хостируемые модели: Gemini, Claude, GPT-4o, Qwen-VL. Каждая из них дообучена на инструкциях для использования инструментов, и каждая из них крупная.

Так что разрыв не в размере. Модель на 2,6 млрд параметров, прошедшая постобучение, способна поддерживать цикл вызова инструментов — собственная прошедшая постобучение модель-собрат от Liquid утверждает, что превосходит Gemma 4 E2B-it и E4B-it во всех своих оценках следования инструкциям и почти во всех оценках использования инструментов, хотя это заявленные производителем цифры без независимой проверки. Разрыв в том, что базовый чекпоинт не проходил ничего из этого обучения, поэтому его вообще нельзя поместить в тестовую обвязку.

Лицензия — это более резкое отличие.

Именно здесь на самом деле решается исход противостояния, и это та часть, которую большинство сравнений пропускает.

ARTEMIS — Apache 2.0. Используйте его коммерчески, форкайте, поставляйте в составе продукта — никаких условий по выручке. Единственная обязанность — сохранять уведомления и указывать свои изменения; эту обязанность сам проект был вынужден публично урегулировать в сентябре 2026 года после того, как Minitap заявила, что 228 из 229 файлов ARTEMIS совпадали с её собственным проектом Apache-2.0 code>mobile-use/code> и что имена авторов были удалены с помощью force-push. Теперь в репозитории есть строка с упоминанием Minitap.

LFM2.5-2.6B-Base — лицензия LFM Open License, собственная лицензия, а не Apache или MIT. При годовой выручке ниже $10 млн предоставляемые права широки, бессрочны и не требуют роялти. На этом пороге или выше лицензия вообще не распространяется на коммерческое использование, и вам необходимо связаться с Liquid. Важная деталь для всех, кто строит на её основе: производные произведения наследуют те же условия. Чекпойнт, который вы дообучаете, — это не новая вещь, которой вы владеете безраздельно: он переносит дальше лицензию, обусловленную уровнем выручки, с исключением для соответствующих критериям некоммерческих организаций.

Сопоставьте эти два факта — и решение переворачивается в зависимости от того, кто вы. Компания, получившая финансирование и желающая выпустить агента на стороне телефона, располагает каркасом под Apache-2.0, который может свободно использовать, и чекпойнтом, который, возможно, вообще не сможет использовать коммерчески. У отдельного разработчика или стартапа ниже порога есть и то и другое, а лицензия — всего лишь сноска. Ни один из вендоров не ведёт себя неразумно — Liquid — компания, защищающая свой коммерческий тариф, Google открывает исходный код тестовых инструментов, — но «открытые веса» и «открытые веса» — это не одно и то же разрешение, и сравнение, которое ограничивается числом параметров, не скажет вам, какое именно у вас.

A generated licence comparison: ARTEMIS under Apache 2.0 with commercial use, no revenue gate, freedom to fork and ship, and a keep-notices obligation, against LFM2.5-2.6B-Base under the LFM Open License, where commercial use applies below $10M revenue, derivatives inherit the same terms, and organisations above the threshold must contact Liquid.

Семейство, потому что базовый чекпоинт — это неправильная дверь в него.

Если цель — Android-агент, работающий на устройстве, три «собрата» важнее базовой модели, а тот, который действительно нужен дорожной карте ARTEMIS, — не самый очевидный.

LFM2.5-2.6B — дообученный агентный собрат. Заявленная производителем пропускная способность составляет около 30 токенов в секунду на оборудовании класса смартфонов, 113 на Ryzen AI Max+ 395 и 220 на Apple M5 Max, при работе с менее чем 2,5 ГБ.

LFM2.5-VL-3B — визуально-языковая edge-модель, построенная на той же базе с энкодером SigLIP2 400M NaFlex; заявленный производителем показатель grounding precision@1 вырос с 57,1 до 87,9 на RefCOCO, а по словам Liquid, её производительность на экранных элементах интерфейса превосходит гораздо более крупные модели Gemma и лишь на 0,7% уступает 4,7B Qwen 3.5. Не подтверждено, но это единственный представитель этого семейства, который способен видеть экран.

LFM2.5-230M — уровень извлечения и классификации, явно не рекомендуется для задач, требующих интенсивных рассуждений.

Каков неудобный вывод для базового чекпоинта в этом сравнении: пункт дорожной карты ARTEMIS — это требование, связанное с компьютерным зрением, базовый чекпоинт работает только с текстом, а член семейства, занимающий этот слот, — это VL-вариант, к которому уже применены и визуальный энкодер, и постобучение. Роль базового чекпоинта в стеке автоматизации Android заключается не в том, чтобы управлять телефоном. Она заключается в том, чтобы быть исходным материалом в основе любой небольшой модели, которая в конечном итоге этим займётся.

Где они всё-таки сходятся: маховик, который ещё никто не построил

Вот единственная связь, которая реальна, а не риторична, и она работает в направлении, обратном обычному. Самая недооценённая функция ARTEMIS — не агент, а выхлоп. Каждый запуск фиксирует стеки сбоев, скриншоты ключевых кадров, журнал сессии из сжатых шагов и диагностический отчёт, а Pro открывает «инцидент выполнения» всякий раз, когда действие терпит неудачу, и держит его в контексте, пока его не разрешит более поздний успех. Это размеченный корпус именно тех моментов, когда восприятие UI-агента было ошибочным.

Соедините это с чекпоинтом, единственное назначение которого — постобучение, и получите очевидный цикл: запустите харнесс на хостируемой модели, соберите трейсы, где она споткнулась на вашем приложении, и дообучите модель на 2,6 млрд параметров ровно на этих фреймах. Именно такой проприетарный датасет сама Liquid в своей карточке приводит в качестве обоснования выпуска базового чекпоинта вообще — «обучение на собственных данных», — а лицензия с порогом по выручке означает, что это путь, который имеет смысл для команд ниже порога и требует отдельного разговора для команд выше него.

Чтобы прямо сказать о статусе этой идеи: никто не публиковал этот цикл, ни один из вендоров его не предлагает, и нет доказательств, что хотя бы одна сторона его тестировала. Это предложение, а не результат, и читать его следует именно так. Но это единственная рамка, в которой эти два артефакта сотрудничают, а не являются категориальной ошибкой.

Если вы доберётесь до тонкой настройки, набор для сравнения — это другая половина проблемы. LFM2.5-2.6B-Base нет в нашем каталоге — как и любого варианта LFM2.5 — поэтому этот чекпойнт берётся из собственного дистрибутива Liquid и обычных сторонних хостингов. Маршрутизируемый каталог оправдывает себя тем, что позволяет провести бенчмарк вашего файнтюна против моделей, которые он должен обойти в использовании инструментов, с одним ключом и одним счётом, с отказоустойчивым переключением, чтобы неудачный день провайдера не стал неудачным днём вашей оценки. Это действительно полезно иметь, когда весь смысл упражнения — прямое сравнение, по результатам которого вы намерены действовать.

A generated scoreboard comparing ARTEMIS and LFM2.5-2.6B-Base across six dimensions: type (Android automation harness vs pre-trained text checkpoint), whether it runs a phone (yes through ADB vs no), instruction tuning (not applicable vs none), vision (from the configured model vs none, text only), context (compressed session history vs 128,000 tokens) and licence (Apache 2.0 vs LFM Open License with a revenue threshold).

Так какая из них твоя проблема?

Если у вас есть Android-приложение и вы хотите, чтобы его автоматически протестировали в этом квартале, вам нужен ARTEMIS, а LFM2.5-2.6B-Base не является частью ответа — вы будете запускать ARTEMIS против размещённой в облаке vision-модели, платить за каждый шаг, а пункт дорожной карты про VLM на устройстве со временем появится и решит проблему стоимости, которую вы ещё не измерили.

Если вы делаете продукт, который должен работать на телефоне без сети, вам нужен путь малой модели, и LFM2.5-2.6B-Base — это начало этого проекта, а не какая-либо часть его решения: вы будете дообучать её, вы прочитаете LFM Open License, сопоставив с прогнозом выручки, прежде чем напишете первый скрипт обучения, а если вашему агенту нужно видеть экран, то в итоге вы окажетесь на варианте VL.

Единственное, чего делать не стоит, — это ставить эти две вещи бок о бок, объявлять харнесс более способным и идти дальше. Полезное сравнение — между двумя полными стеками: хостируемая модель плюс харнесс против дообученной небольшой модели плюс фреймворк, который вы строите, — и только у одного из них есть опубликованный показатель успеха на публичном бенчмарке, а это стоит ровно столько же, сколько и тот факт, что у другого вообще нет счёта за облако.

Маршрутизируемый каталог оправдывает себя, когда вы проводите бенчмарк вашей дообученной модели против моделей, которые она должна превзойти по использованию инструментов, с одним ключом и одним счётом, с переключением при сбое, чтобы неудачный день провайдера не стал неудачным днём для вашей оценки.

LFM2.5-2.6B-Base отсутствует в нашем каталоге — ни один вариант LFM2.5 не представлен — поэтому этот чекпоинт поступает из собственного дистрибутива Liquid и обычных сторонних хостингов.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно