Сгенерированная титульная карточка для «ARTEMIS vs Gemma 4 12B» с подзаголовком «Обвязка и мозг — это не одна и та же покупка», с двумя карточками, где ARTEMIS представлен как харнесс для автоматизации Android без собственной модели, а Gemma 4 12B — как плотный 12B мультимодальный чекпойнт, не имеющий возможности действовать.
Guides & Insights

ARTEMIS против Gemma 4 12B: обвязка и мозг — это не одна и та же покупка

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

ARTEMIS от Google и Gemma 4 12B не конкурируют, и самый быстрый способ впустую потратить неделю — поставить их в сравнительную таблицу и выбрать победителя. ARTEMIS, открытый Google в августе 2026 года под лицензией Apache 2.0, — это инструментальная обвязка для автоматизации Android: она принимает фразу, управляет реальным телефоном через ADB и сообщает, что произошло. Gemma 4 12B, выпущенная Google DeepMind 3 июня 2026 года, — это плотная мультимодальная модель с 12 млрд параметров и открытыми весами — мозг, который можно запустить на ноутбуке, а не система, способная нажимать на экран. Один из этих проектов не может видеть, решать или действовать без подключённого к нему компонента другого рода; другой вообще не может держать устройство. Но сравнение всё же стоит провести, потому что вопрос под ним — тот самый, который сейчас задаёт каждая мобильная команда: может ли небольшая открытая модель, которой вы владеете полностью, выполнять автоматизацию Android, или нужна хостируемая фронтирная модель за такой обвязкой, как ARTEMIS? У этого вопроса есть реальный ответ, и это не тот ответ, который подразумевается в анонсе запуска любого из вендоров.

Сначала — категориальная ошибка, изложенная прямо.

ARTEMIS не содержит модели. На его собственном бейдже написано «Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL», а файл, который определяет, какую из них вы используете, — это code>config/artemis.jsonc/code>. Это цикл управления: локатор с приоритетом доступности, проверка безопасности, которая закрывает всплывающие окна до того, как ваш тап сработает, журнал сессий, который сжимает старые скриншоты в визуальные сводки, и два профиля выполнения — Flash — примерно 3–5 секунд на шаг, Pro — примерно 15–40 секунд на шаг с планировщиком, оператором и проверяющим, работающим в режиме только для чтения. Всё, что он знает о мире, поступает через визуально-языковую модель, которую он не писал.

Gemma 4 12B — это объект противоположного типа. Это чекпойнт. У него нет подключения к устройству, нет ADB, нет службы специальных возможностей, нет представления о том, что нажатие — это нечто, что можно выполнить. Дайте ему скриншот и спросите, что делать дальше, — он ответит, возможно, даже хорошо, — но ответ — это и есть вся его агентность. Всё, что находится между «модель сказала: нажать в (540, 1180)» и «телефон нажал в (540, 1180)», — это работа ARTEMIS, и это большая часть работы.

Итак, честная формулировка этого противостояния — не «ARTEMIS против Gemma». Она такова: что даёт вам открытая модель на 12B в роли слоя рассуждений Android-агента и когда нужно платить за что-то большее?

Что на самом деле даёт Gemma 4 12B

Для модели среднего размера она необычно хорошо специфицирована, и три её свойства важны для всего, что связано с мобильными устройствами.

Она действительно мультимодальна на уровне входных данных. На входе — текст, изображение, аудио и видео; на выходе — текст. Это первая Gemma среднего размера без отдельных мультимодальных энкодеров и первая в семействе, которая нативно принимает аудио, — что не является функцией UI-автоматизации, но представляет собой реальную возможность, если ваши тестовые сценарии включают голосовые заметки, озвучиваемые уведомления или сценарии доступности, основанные на аудиосигналах.

Это 12B, который можно подержать в руках. Artificial Analysis указывает 12B общих параметров под Apache 2.0 — без порога по выручке, без исследовательской оговорки, лицензия, на которой можно строить продукт, ни у кого не спрашивая, — с контекстным окном 256K, включённым режимом рассуждений и измеренной скоростью вывода 109,2 токена в секунду. По сообщениям сообщества, веса занимают примерно 13,4 ГБ в SFP8 и около 6,7 ГБ в Q4_0 — а это ноутбук с 16 ГБ памяти.

Он недорогой, но не самый дешёвый в своём классе. Artificial Analysis указывает цену $0.10 за миллион входных токенов и $0.30 за миллион выходных — и в той же панели отмечает, что это дороговато для модели с открытыми весами сопоставимого размера, где медиана составляет $0.05 на входе и $0.15 на выходе. Чтение из кэша обходится примерно в $0.03.

Картина с бенчмарками — это обычная неразбериха для моделей среднего размера, и её стоит излагать аккуратно, потому что цифры на сайтах-трекерах расходятся между собой. Artificial Analysis оценивает конфигурацию для рассуждений в 14 баллов по Intelligence Index, ставя её на 21-е место среди 142 моделей с открытыми весами в своём классе — это почтенная позиция в середине таблицы и очень далеко от переднего края. Сама Google позиционирует 12B так: она почти не уступает более крупной Gemma 4 26B-A4B и превосходит Gemma 3 27B предыдущего поколения в задачах на рассуждение, науку и работу с документами. Сторонние агрегаторы ставят её примерно на 72% в LiveCodeBench v6 и 77,2% в MMLU-Pro, а GPQA Diamond варьируется от 66% до 79% в зависимости от того, какой трекер и какую конфигурацию вы смотрите. Для 12B это почтенные цифры. Но это также непроверенные агрегаты, основанные на самоотчётах, и когда четыре сайта расходятся на тринадцать пунктов, следует держаться диапазона, а не точечного значения.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a measured speed of 109.2 output tokens per second, $0.10 per million input tokens and $0.30 per million output, a 256k-token context window, 12B total parameters, an Apache 2.0 licence and reasoning enabled.

Что приносит ARTEMIS — в одном абзаце, поскольку здесь речь не об этом.

ARTEMIS даёт всё то, чего не может модель: динамический локатор, который в первую очередь использует индексы элементов доступности, когда они есть, и откатывается к компьютерному зрению и координатам, когда их нет, — а значит, не нужно поддерживать никаких XPath и никакие ID не устаревают на поверхностях Compose или Flutter. Он приносит Safety Net, который перехватывает системное всплывающее окно, на которое вот-вот должен был прийтись ваш тап, проверку по контрольным точкам с четырьмя уровнями от code>off/code> до code>strict/code>, автоматические стеки сбоев, скриншоты ключевых кадров и диагностические отчёты, веб-консоль, Python SDK для pytest и CI, и — причина, по которой он распространился так быстро, — нативный MCP-сервер, который открывает всё это Antigravity, Claude Code, Codex и любому другому ассистенту с поддержкой MCP в виде пяти инструментов. Его заявленный показатель завершения 99%+ на бенчмарке AndroidWorld от Google Research даёт ему 99,1% в публичном лидерборде по состоянию на 11 сентября 2026 года против 80% у человека. Этот показатель заявлен самим разработчиком, и лидерборд не проверяет поданные результаты, так что относитесь к нему как к сильному заявлению вендора, а не как к аудиту.

Единственное место, где эти двое действительно пересекаются

Существует реальная архитектура, в которой небольшая Gemma выполняет всю работу, и на неё стоит взглянуть, потому что она показывает, за что на самом деле платит облачная модель. Открытый фреймворк для Android-агентов под названием Orion работает полностью на устройстве: MediaProjection захватывает экран, квантованная Gemma-4-E4B-it работающая на Qualcomm Hexagon NPU через LiteRT-LM, выбирает следующее действие, а Android Accessibility Service выполняет нажатия. Никакого облачного API, никаких счетов за токены, и экран никогда не покидает устройство. Она протестирована на Galaxy S25 Ultra и, по собственному описанию, имеет смысл только на оборудовании с Hexagon NPU — модель требует около 3 ГБ памяти и фреймворк нацелен на QNN HTP v79 на arm64.

Вот как выглядит работающий сегодня Android-агент на малой модели, и обратите внимание, чего стоит до него добраться. Модель квантована и отображена на NPU. Пространство действий — это пиксели, потому что модель, работающая только со скриншотами, не может интерпретировать «индекс элемента 12». Вся конструкция — это вертикальный стек: модель, среда выполнения, кремний, фреймворк, — поэтому это фреймворк, а не drop-in-замена для вашего набора тестов. Gemma 4 12B имеет примерно в три раза больше параметров, чем E4B в этом стеке, и не поставляется в формате, пригодном для запуска на телефоне; 12B при четырёхбитной квантизации — это рабочая станция или обслуживаемый эндпоинт, а не резидент NPU.

A generated diagram of a four-layer Android agent stack - assistant (Antigravity, Claude Code, Codex) on top, then the ARTEMIS harness with locator, Safety Net, checkpoints and traces, then the vision-language reasoning layer, then the Android device via ADB - with a callout beside the reasoning layer noting that Gemma 4 12B could sit there but is untested with ARTEMIS.

Где каждый на самом деле выигрывает

Стоимость при масштабировании — у развёрнутой на своих серверах Gemma 4 12B вообще нет платы за токен, в отличие от вызова vision-модели на каждом шаге прогона ARTEMIS. В наборе регрессионных тестов из 500 тестов, запускаемом каждую ночь, эта разница накапливается быстрее, чем любое отставание в бенчмарках.

Конфиденциальность — Gemma 4 12B на вашем собственном оборудовании никогда никуда не отправляет снимок экрана; вспомогательный модуль ARTEMIS для специальных возможностей явно работает на устройстве и ничего не отправляет, но вызов модели, который он выполняет с каждым снимком экрана, идёт к тому провайдеру, которого вы настроили.

Надёжность выполнения задач в реальном приложении — ARTEMIS, со значительным отрывом, потому что это стенд с системой подстраховки, проверкой контрольных точек и восстановлением. Никакая более совершенная модель этого не заменит.

Аудио и длинные документы — Gemma 4 12B, с нативным аудиовходом в технической спецификации и контекстным окном на 256K токенов. У ARTEMIS нет мнения ни о том, ни о другом.

Время до первого пройденного теста — ARTEMIS, с огромным отрывом. Клонируйте, code>./start.sh/code>, подключите устройство с включённой отладкой по USB, дождитесь, пока первая задача установит вспомогательный модуль доступности. Создание эквивалента на голом чекпоинте — это проект на много месяцев, и пример Orion выше — это то, как выглядит такой проект, когда он завершён.

Свобода изменять слой рассуждений — Gemma 4 12B, это веса под лицензией Apache 2.0, которые вы можете дообучить на собственном словаре UI. Код ARTEMIS распространяется под Apache 2.0, но рассуждения находятся там, где живёт ваша модель.

Версии этой пары, которые действительно доступны сегодня

Чётко определите, что вы можете развернуть на этой неделе. В списке протестированных бэкендов ARTEMIS — Gemini, Claude, GPT-4o и Qwen-VL; Gemma 4 12B в нём не значится, и нет опубликованной оценки того, как Gemma 4 12B ведёт сессию ARTEMIS. Конфигурационный файл принимает эндпоинт модели, поэтому такое сочетание правдоподобно, но не доказано, и если вы попробуете его, вы будете заниматься оригинальной работой, а не следовать документации. Стоит сказать прямо: в дорожной карте ARTEMIS есть пункт «лёгкие VLM, работающие на устройстве», и модель, которая его закроет, не будет 12B.

Gemma 4 12B тоже нет в нашем каталоге — мы маршрутизируем другие размеры Gemma 4, Gemma 4 26B-A4B и Gemma 4 31B, а не 12B, так что если это тот чекпойнт, который вам нужен, вы получаете его из собственного дистрибутива вендора и с обычных сторонних хостов. Маршрутизируемый каталог нужен для другой половины этой задачи: если ваш план — ARTEMIS на хостинговой vision-модели, эта модель — статья расходов, которая масштабируется с каждым шагом каждого запуска, и полезный рычаг здесь не отпускная цена, а цена кэша. Запуск уровня Pro на каждом шаге заново читает растущий контекст, поэтому модель с дешёвым чтением кэша меняет арифметику гораздо сильнее, чем модель с дешёвым свежим вводом. Вот почему отказоустойчивость провайдеров должна быть в конфиге, а не в журнале инцидентов — долгая сессия Android держит свой контекст на одной конечной точке, и сбой провайдера на шаге 74 стоит вам запуска.

A generated scoreboard comparing ARTEMIS and Gemma 4 12B across six dimensions: category (harness vs open-weights VLM checkpoint), ability to drive a phone (yes via ADB vs no), parameter count (not a model vs 12B dense, about 6.7GB at Q4), price (per-step model call vs $0.10 in / $0.30 out per 1M), AndroidWorld (99.1% self-reported vs not published) and licence (Apache 2.0 for both).

Какой из них — ваш следующий ход?

Если у вас есть мобильное приложение и набор регрессионных тестов, вам нужен ARTEMIS, и Gemma 4 12B не заменяет ни одну из его частей — в лучшем случае это движок, который вы, возможно, позже подставите, недокументированный, в своё свободное время. Если вы создаёте продукт, который должен работать на телефоне без сети и без платы за каждый вызов, вам нужна небольшая модель, и Gemma 4 12B, вероятно, слишком велика для того форм-фактора, который у вас реально есть; посмотрите, что Orion сделал с Gemma класса 4B на NPU, прежде чем предполагать, что 12B поместится.

Два этих решения сталкиваются лишь в одном месте, и это вопрос стоимости, а не возможностей: сколько вызовов зрения в день вы готовы оплачивать? Ответьте на него честно — посчитайте свои тесты, посчитайте свои шаги, посчитайте свои ночные прогоны — и выбор между обвязкой на облачной модели и самостоятельно размещённым стеком сделается сам собой.

То, для чего маршрутизируемый каталог нужен, — это другая половина этой проблемы: если вы планируете использовать ARTEMIS на размещённой модели компьютерного зрения, эта модель — статья расходов, которая растёт с каждым шагом каждого запуска

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно