
ARTEMIS против LFM2.5-2.6B-Base: чекпойнт, который не может выполнить задачу, и стенд, которому нужно, чтобы он её выполнил
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
В дорожной карте ARTEMIS от Google значатся четыре пункта, и ровно один из них требует модели, которой явно ещё не существует: лёгкие визуально-языковые модели на устройстве для автоматизации с низкой задержкой и приоритетом приватности. Очевидный кандидат для такой задачи — нечто в размерном классе LFM2.5-2.6B-Base: предобученный чекпойнт Liquid AI на 2,69 млрд параметров, опубликованный как открытые веса с контекстом в 131 072 токена и объёмом, достаточно малым для телефона. Но в том виде, в каком он поставляется, он также не способен занять это место, и причины стоит понять, прежде чем кто-либо поставит эти две вещи в таблицу сравнения. ARTEMIS от Google — это инструмент автоматизации Android на естественном языке, выпущенный с открытым исходным кодом под лицензией Apache 2.0 в августе 2026 года, который управляет реальным смартфоном через ADB и заявляет о доле успешных завершений 99%+ в бенчмарке AndroidWorld от Google Research. LFM2.5-2.6B-Base — это сырой предобученный материал без инструкционной настройки, без шаблона чата и — намеренно — без опубликованных бенчмарков, предназначенный для команд, которые сами будут проводить его пост-обучение. Один — готовое ПО с нерешённой проблемой модели. Другой — незавершённые веса с решённой проблемой лицензии. Ни один из них не заменяет другой, и место, где они действительно встречаются, не там, где вы могли бы предположить.
Что на самом деле представляет собой LFM2.5-2.6B-Base
Отбросьте брендинг — и останется тщательно выстроенная основа для работы на устройстве, со спецификациями, которые читаются так, будто кто-то оптимизировал под пропускную способность памяти, а не под позицию в таблице лидеров.
• Размер — 2,69 млрд параметров в bfloat16 в одном шарде объёмом ~5,39 ГБ, позиционируется как «2,6 млрд».
• Архитектура — 30 слоёв в гибридном разбиении: 22 блока коротких свёрток с двойным гейтированием поверх 8 слоёв внимания с группированными запросами, скрытая размерность 2048, 32 головы внимания против 8 голов KV, связанные эмбеддинги. Тот же code>Lfm2ForCausalLM/code> класс, что и в предыдущем поколении, поэтому пользовательский код моделирования не требуется.
• Обучение — примерно 34 триллиона токенов, с отдельной фазой промежуточного обучения для расширения контекста.
• Словарь — 128 000 токенов; в этом поколении их число удвоено, чтобы лучше обрабатывать нелатинские письменности. Около 262 млн параметров — примерно десятая часть модели — находятся в связанном эмбеддинге.
• Контекст — здесь карточка модели и конфигурация расходятся, и об этом стоит знать: в документации заявлено 131 072 токена, тогда как code>config.json/code> задаёт code>max_position_embeddings/code> равным 128 000. Рассчитывайте на 128K и считайте всё, что выше, непроверенным.
• Языки — шестнадцать: английский, арабский, китайский, французский, немецкий, хинди, индонезийский, итальянский, японский, корейский, польский, португальский, русский, испанский, тайский, вьетнамский.
• Бенчмарки — отсутствуют. Liquid не публикует никаких оценок для базового чекпоинта, и карточка модели трактует это упущение как намеренное: данный артефакт существует для дообучения, а не для измерения в его исходном состоянии.
Эта последняя строка — суть всего релиза, и именно поэтому сравнение «X vs LFM2.5-2.6B-Base» нужно проводить осторожно. У базового чекпоинта нет собственного мнения ни о чём. Попросите его спланировать рабочий процесс для Android — и он вероятностно продолжит ваш текст, потому что его никогда не учили отвечать. В карточке он рекомендуется только для случаев, требующих серьёзного дообучения: ассистент под конкретный язык, ассистент под конкретную нишу в регулируемой отрасли, обучение на проприетарных данных или роль ученика при дистилляции. Для всего, что должно работать «из коробки», включая вызов инструментов, Liquid направляет вас к дообученной LFM2.5-2.6B.

Что ARTEMIS нужно от модели — то, чего не даёт базовый чекпоинт
ARTEMIS — это контур управления с двумя режимами. Flash — реактивный цикл «наблюдай и действуй» примерно 3–5 секунд на шаг. Pro — многоагентный граф примерно 15–40 секунд на шаг: Планировщик ведёт живой план в Markdown, Оператор располагает полным набором инструментов, а Checker только для чтения проверяет контрольные точки на четырёх уровнях — от code>off/code> до code>strict/code>. Оба режима требуют от лежащей в основе модели одного и того же: посмотреть на скриншот, выбрать одно действие из фиксированного набора инструментов и снова сделать это через секунду-другую — сто раз, не потеряв нить.
Это очень сложная задача — следование инструкциям в рамках жёсткой схемы, визуальное понимание с опорой на реальность и связность на длинных горизонтах — и это именно тот набор навыков, которого базовый чекпойнт не получил. Протестированные самой ARTEMIS бэкенды — это хостируемые модели: Gemini, Claude, GPT-4o, Qwen-VL. Каждая из них дообучена на инструкциях для использования инструментов, и каждая из них крупная.
Так что разрыв не в размере. Модель на 2,6 млрд параметров, прошедшая постобучение, способна поддерживать цикл вызова инструментов — собственная прошедшая постобучение модель-собрат от Liquid утверждает, что превосходит Gemma 4 E2B-it и E4B-it во всех своих оценках следования инструкциям и почти во всех оценках использования инструментов, хотя это заявленные производителем цифры без независимой проверки. Разрыв в том, что базовый чекпоинт не проходил ничего из этого обучения, поэтому его вообще нельзя поместить в тестовую обвязку.
Лицензия — это более резкое отличие.
Именно здесь на самом деле решается исход противостояния, и это та часть, которую большинство сравнений пропускает.
• ARTEMIS — Apache 2.0. Используйте его коммерчески, форкайте, поставляйте в составе продукта — никаких условий по выручке. Единственная обязанность — сохранять уведомления и указывать свои изменения; эту обязанность сам проект был вынужден публично урегулировать в сентябре 2026 года после того, как Minitap заявила, что 228 из 229 файлов ARTEMIS совпадали с её собственным проектом Apache-2.0 code>mobile-use/code> и что имена авторов были удалены с помощью force-push. Теперь в репозитории есть строка с упоминанием Minitap.
• LFM2.5-2.6B-Base — лицензия LFM Open License, собственная лицензия, а не Apache или MIT. При годовой выручке ниже $10 млн предоставляемые права широки, бессрочны и не требуют роялти. На этом пороге или выше лицензия вообще не распространяется на коммерческое использование, и вам необходимо связаться с Liquid. Важная деталь для всех, кто строит на её основе: производные произведения наследуют те же условия. Чекпойнт, который вы дообучаете, — это не новая вещь, которой вы владеете безраздельно: он переносит дальше лицензию, обусловленную уровнем выручки, с исключением для соответствующих критериям некоммерческих организаций.
Сопоставьте эти два факта — и решение переворачивается в зависимости от того, кто вы. Компания, получившая финансирование и желающая выпустить агента на стороне телефона, располагает каркасом под Apache-2.0, который может свободно использовать, и чекпойнтом, который, возможно, вообще не сможет использовать коммерчески. У отдельного разработчика или стартапа ниже порога есть и то и другое, а лицензия — всего лишь сноска. Ни один из вендоров не ведёт себя неразумно — Liquid — компания, защищающая свой коммерческий тариф, Google открывает исходный код тестовых инструментов, — но «открытые веса» и «открытые веса» — это не одно и то же разрешение, и сравнение, которое ограничивается числом параметров, не скажет вам, какое именно у вас.

Семейство, потому что базовый чекпоинт — это неправильная дверь в него.
Если цель — Android-агент, работающий на устройстве, три «собрата» важнее базовой модели, а тот, который действительно нужен дорожной карте ARTEMIS, — не самый очевидный.
• LFM2.5-2.6B — дообученный агентный собрат. Заявленная производителем пропускная способность составляет около 30 токенов в секунду на оборудовании класса смартфонов, 113 на Ryzen AI Max+ 395 и 220 на Apple M5 Max, при работе с менее чем 2,5 ГБ.
• LFM2.5-VL-3B — визуально-языковая edge-модель, построенная на той же базе с энкодером SigLIP2 400M NaFlex; заявленный производителем показатель grounding precision@1 вырос с 57,1 до 87,9 на RefCOCO, а по словам Liquid, её производительность на экранных элементах интерфейса превосходит гораздо более крупные модели Gemma и лишь на 0,7% уступает 4,7B Qwen 3.5. Не подтверждено, но это единственный представитель этого семейства, который способен видеть экран.
• LFM2.5-230M — уровень извлечения и классификации, явно не рекомендуется для задач, требующих интенсивных рассуждений.
Каков неудобный вывод для базового чекпоинта в этом сравнении: пункт дорожной карты ARTEMIS — это требование, связанное с компьютерным зрением, базовый чекпоинт работает только с текстом, а член семейства, занимающий этот слот, — это VL-вариант, к которому уже применены и визуальный энкодер, и постобучение. Роль базового чекпоинта в стеке автоматизации Android заключается не в том, чтобы управлять телефоном. Она заключается в том, чтобы быть исходным материалом в основе любой небольшой модели, которая в конечном итоге этим займётся.
Где они всё-таки сходятся: маховик, который ещё никто не построил
Вот единственная связь, которая реальна, а не риторична, и она работает в направлении, обратном обычному. Самая недооценённая функция ARTEMIS — не агент, а выхлоп. Каждый запуск фиксирует стеки сбоев, скриншоты ключевых кадров, журнал сессии из сжатых шагов и диагностический отчёт, а Pro открывает «инцидент выполнения» всякий раз, когда действие терпит неудачу, и держит его в контексте, пока его не разрешит более поздний успех. Это размеченный корпус именно тех моментов, когда восприятие UI-агента было ошибочным.
Соедините это с чекпоинтом, единственное назначение которого — постобучение, и получите очевидный цикл: запустите харнесс на хостируемой модели, соберите трейсы, где она споткнулась на вашем приложении, и дообучите модель на 2,6 млрд параметров ровно на этих фреймах. Именно такой проприетарный датасет сама Liquid в своей карточке приводит в качестве обоснования выпуска базового чекпоинта вообще — «обучение на собственных данных», — а лицензия с порогом по выручке означает, что это путь, который имеет смысл для команд ниже порога и требует отдельного разговора для команд выше него.
Чтобы прямо сказать о статусе этой идеи: никто не публиковал этот цикл, ни один из вендоров его не предлагает, и нет доказательств, что хотя бы одна сторона его тестировала. Это предложение, а не результат, и читать его следует именно так. Но это единственная рамка, в которой эти два артефакта сотрудничают, а не являются категориальной ошибкой.
Если вы доберётесь до тонкой настройки, набор для сравнения — это другая половина проблемы. LFM2.5-2.6B-Base нет в нашем каталоге — как и любого варианта LFM2.5 — поэтому этот чекпойнт берётся из собственного дистрибутива Liquid и обычных сторонних хостингов. Маршрутизируемый каталог оправдывает себя тем, что позволяет провести бенчмарк вашего файнтюна против моделей, которые он должен обойти в использовании инструментов, с одним ключом и одним счётом, с отказоустойчивым переключением, чтобы неудачный день провайдера не стал неудачным днём вашей оценки. Это действительно полезно иметь, когда весь смысл упражнения — прямое сравнение, по результатам которого вы намерены действовать.

Так какая из них твоя проблема?
Если у вас есть Android-приложение и вы хотите, чтобы его автоматически протестировали в этом квартале, вам нужен ARTEMIS, а LFM2.5-2.6B-Base не является частью ответа — вы будете запускать ARTEMIS против размещённой в облаке vision-модели, платить за каждый шаг, а пункт дорожной карты про VLM на устройстве со временем появится и решит проблему стоимости, которую вы ещё не измерили.
Если вы делаете продукт, который должен работать на телефоне без сети, вам нужен путь малой модели, и LFM2.5-2.6B-Base — это начало этого проекта, а не какая-либо часть его решения: вы будете дообучать её, вы прочитаете LFM Open License, сопоставив с прогнозом выручки, прежде чем напишете первый скрипт обучения, а если вашему агенту нужно видеть экран, то в итоге вы окажетесь на варианте VL.
Единственное, чего делать не стоит, — это ставить эти две вещи бок о бок, объявлять харнесс более способным и идти дальше. Полезное сравнение — между двумя полными стеками: хостируемая модель плюс харнесс против дообученной небольшой модели плюс фреймворк, который вы строите, — и только у одного из них есть опубликованный показатель успеха на публичном бенчмарке, а это стоит ровно столько же, сколько и тот факт, что у другого вообще нет счёта за облако.
Маршрутизируемый каталог оправдывает себя, когда вы проводите бенчмарк вашей дообученной модели против моделей, которые она должна превзойти по использованию инструментов, с одним ключом и одним счётом, с переключением при сбое, чтобы неудачный день провайдера не стал неудачным днём для вашей оценки.
LFM2.5-2.6B-Base отсутствует в нашем каталоге — ни один вариант LFM2.5 не представлен — поэтому этот чекпоинт поступает из собственного дистрибутива Liquid и обычных сторонних хостингов.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
