
ARTEMIS от Google открывает исходный код автоматизации Android: что на самом деле охватывает заявление о 99% в AndroidWorld
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Новейший коммит в google/artemis — не новая функция. Это строка с указанием авторства — «fix: дополнить README и заголовки соответствующих файлов согласно требованиям Apache 2.0», отправленная 12 сентября 2026 года, через три дня после того, как Minitap опубликовала пост под названием «Я ожидал большего от Google». ARTEMIS от Google — это недавно выложенный компанией в открытый доступ Android-агент автоматизации: он превращает инструкцию на простом английском в реальные нажатия, свайпы, ввод текста и проверку на физическом Android-устройстве или эмуляторе, попутно собирает логи и скриншоты, а также сообщает о более чем 99 % успешного выполнения задач в бенчмарке AndroidWorld от Google Research. Он был опубликован в августе этого года командой Pixel Test Engineering Fusion компании Google под лицензией Apache 2.0, и он действительно стоит того, чтобы посвятить ему вторую половину дня. Кроме того, по состоянию на середину сентября он находится в центре спора об указании авторства в open source, который больше говорит о том, как создаются мобильные агенты, чем цифра в бенчмарке. Обе истории — правда. И только одна из них объясняет, почему последний коммит в репозитории был правкой лицензии.
Что на самом деле было выпущено
ARTEMIS — это не модель и не обёртка для чат-бота. Это управляющая обвязка — система на Python 3.12+, которая находится между визуально-языковой моделью и реальным телефоном. Вы даёте ей задачу на английском; она наблюдает за экраном, решает, какое действие выполнить, выполняет его через ADB, проверяет, что произошло, и продолжает работу. В комплекте было пять вещей:
• CLI и Python SDK. code>./start.sh/code> разворачивает ADB, scrcpy, FFmpeg и окружение uv; code>uv run artemis run "…" --profile flash/code> выполняет задачу в headless-режиме; code>artemis-client/code> SDK оборачивает тот же вызов для pytest и CI, возвращая code>succeeded/code>, code>status/code>, code>device_serial/code> и code>trace_id/code>, за которым можно проследить позже.
• Веб-консоль. code>uv run artemis ui/code> запускает визуальную тестовую консоль на code>localhost:8000/code>, где вы наблюдаете за циклом шаг за шагом.
• Нативный MCP-сервер. Именно эта часть и обеспечила ему распространение. code>uv run artemis mcp --install all/code> открывает code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> и code>mobile_diagnose/code> любому ассистенту с поддержкой MCP, со штатными способами установки для Antigravity, Claude Code и Codex, а также с генерацией конфигураций для Cursor, Windsurf, VS Code и Cline/Roo. Для ассистента, к которому подключён этот сервер, «собери APK, установи его, открой настройки, включи режим полёта, сделай скриншот результата» перестаёт быть скриптом и становится одной фразой.
• Помощник по специальным возможностям. Первая задача устанавливает Artemis Accessibility Helper, который считывает разметку экрана, не удерживая соединение UiAutomation — намеренно, чтобы другие инструменты на базе UiAutomator на том же устройстве не подавлялись. Он работает на телефоне и ничего с него не отправляет, а если не может подключиться, переключается на UIAutomator2; информация об этом резервном варианте отображается во временной шкале задачи.
• Захват журналов и трассировок.Стеки сбоев, скриншоты ключевых кадров и диагностический отчёт собираются автоматически, а не прикручиваются вызывающей стороной — именно поэтому это можно использовать как набор регрессионных тестов, а не просто как демонстрацию.

Flash и Pro — два разных продукта с одним названием.
Самое важное, что нужно понять, прежде чем сравнивать ARTEMIS с чем бы то ни было, — это то, что code>--profile flash/code> и code>--profile pro/code> не являются настройкой скорости для одного агента. Это два агента.
• Flash — реактивный цикл «наблюдай и действуй» примерно 3–5 секунд на шаг, без плана, без заметок, без проверки безопасности перед выполнением, без проверки на контрольных точках, без итогового отчёта и без ADB shell. Цикл по умолчанию неограничен, поскольку история сжимается, а не накапливается.
• Pro — мультиагентный граф, выполняющий шаг примерно за 15–40 секунд, построенный из Планировщика, который ведёт живой Markdown-план с явными code>verify/code> и code>assert/code> пунктами, Оператора с полным набором инструментов и Чекера, работающего только на чтение, который проверяет контрольные точки и запускает итоговую проверку. code>--verification-level/code> принимает code>off/code>, code>final/code> (по умолчанию), code>checkpoints/code> или code>strict/code>.
Это разница в задержке в пять–десять раз для одного и того же описания задачи — и это разница между дымовым тестом и исследовательским прогоном на 100+ шагов. Собственная формулировка Google такова: Pro — для долгосрочной работы и непрерывного code>[Loop:continuous]/code> мониторинга; Flash — для рутинных, детерминированных задач интерфейса. Если вы читаете обзор, в котором приводится время выполнения шагов без указания того, какой профиль их дал, он вам ничего не сообщает.

Стратегия локализации — это настоящая инженерия.
Большинство фреймворков для автоматизации мобильных тестов умирают на селекторах. ARTEMIS построен с приоритетом динамики: когда существует индекс элементов доступности, он использует его; когда нет — Canvas, поверхность Compose, представление Flutter, игра — он переключается на координаты и компьютерное зрение. Здесь нет слоя XPath, который нужно поддерживать, и нет ID, который может устареть, а это важно, потому что приложения, которые вы больше всего хотите тестировать, — это те, что выпускают новые сборки каждую неделю.
Профиль Pro добавляет «страховочную сеть»: каждое действие проходит предполётную проверку — сначала XML, с откатом к пикселям, — которая перехватывает системное всплывающее окно, готовое поглотить ваш тап. Сбои открывают «инцидент выполнения», который остаётся в контексте, пока более поздний успех его не закроет, а не порождают отдельного агента-ремонтника. Долгие сессии сжимаются — старые скриншоты превращаются в визуальные сводки, завершённые шаги нарезаются на recallable-эры, которые code>search_history/code> и code>replay_steps/code> могут вернуть обратно, — и именно это не даёт контексту на 100 шагов стать неподъёмно дорогим.
99,1% в таблице лидеров — и оговорка, которую пропускают посты о запуске
Главное утверждение ARTEMIS — показатель завершения 99%+ в AndroidWorld, бенчмарке Google Research, состоящем из 116 реалистичных задач в двадцати с лишним приложениях и оцениваемом по метрике Pass@1. По состоянию на 11 сентября 2026 года в таблице лидеров AndroidWorld ARTEMIS указана с 99,1% против 91,4% у mobile-use от Minitap, при этом результат человека составляет 80%. Судя по таблице, это передовой результат среди публично сообщённых результатов.
Рядом с этой цифрой нужно поставить две вещи. Во-первых, таблица лидеров AndroidWorld явно не проводит независимой проверки отправленных результатов — каждый показатель в ней, включая показатель ARTEMIS, заявлен самой командой, которая его получила, а анализ устойчивости показал, что одни только вариации задач могут существенно изменить оценку агента. Рассматривайте 99,1% как сильное заявление вендора на публичном, проверяемом бенчмарке — это реальная и полезная вещь, — а не как проаудированное измерение, которым оно не является. Во-вторых, важна структура сравнения: бенчмарк — это фиксированный набор задач, и, как сообщается, опубликованная ARTEMIS сравнительная диаграмма пропустила mobile-use, включив другие позиции. Бенчмарк, в котором самый сильный из предыдущих результатов отсутствует на диаграмме, — это более слабое утверждение, чем предполагает сырой процент.
Спор, который и является настоящей новостью этого месяца
В своём блоге и в публичном issue в репозитории Minitap — стартап в области мобильного тестирования, чей проектmobile-use с открытым исходным кодом делает то же самое для Android и iOS, — заявил, что 228 из 229 файлов ARTEMIS идентичны его собственным. Опубликованные им подробности необычайно конкретны: код подключения устройств Android, совпадающий с его реализацией, дословное заимствование инструкций, принадлежащих агенту по имени «Hopper», и пример с WhatsApp, который отправляет новогодние сообщения Алисе, Бобу и Чарли, воспроизведённый с теми же комментариями, теми же шагами очистки и той же ошибкой. Далее он утверждает, что файл, содержавший имена трёх авторов Minitap — Пьера-Луи Фавро, Жан-Пьера Ло и Николя Деандсхуверкера, — был заменён в августе через force-push: имена удалили, а вместо них подставили другого автора.
Вопрос о лицензии не так уж и тёмен. mobile-use распространяется под Apache 2.0, а Apache 2.0 допускает именно такое повторное использование — коммерческое, производное, закрытое — при условии, что вы сохраняете уведомления об авторских правах и указываете, что именно изменили. Чего она не допускает, так это поставки кода с удалёнными уведомлениями. С тех пор как появились эти обвинения, в репозитории присутствует строка "This project includes source code developed by Minitap, Inc." и ссылка на minitap-ai/mobile-use, а коммит от 12 сентября, завершающий оформление этого указания авторства, на момент написания является последним изменением в code>main/code>. Minitap не опубликовала никаких доказательств, связывающих удаление указания авторства с её собственными оставшимися без ответа заявками в таблицу лидеров, а Google не выпустила подробного публичного ответа. Честное прочтение таково: код, которым делятся, легитимен и всегда был допустим; а вот с оформлением какое-то время было не так, и теперь это исправлено.
Та часть, которую никто не просчитывает: счёт за модель
ARTEMIS поставляется со значком с надписью «Мультимодельный — Gemini | Claude | GPT-4o | Qwen-VL», и его файл конфигурации по адресу code>config/artemis.jsonc/code> — это место, где вы указываете любую модель компьютерного зрения, для которой у вас есть учётные данные. Ничто в этом файле не видно пользователю, пока вы не запустите Pro на реальном рабочем процессе и не понаблюдаете, во сколько на самом деле обходится длинный агент.
Посчитайте по профилям. Запуск Pro на 100 шагов при 15–40 секундах на шаг — это где-то от 25 минут до чуть больше часа реального времени, и каждый из этих шагов — это как минимум один вызов vision-модели с передачей скриншота. Flash дешевле на шаг, но зацикливается сильнее, и поскольку его контекст сжимается, а не обрезается, он спокойно выйдет за предел числа ходов, который вы считали потолком. Какой бы профиль вы ни выбрали, именно модель — это та статья расходов, которая масштабируется вместе с вашим набором тестов, а не лицензия или оборудование.
Здесь слой маршрутизации перестаёт быть абстракцией. Модель зрения, ведущая долгую сессию Android, — это нагрузка с двумя неудобными свойствами: она долгоживущая и нетерпима к сбою провайдера на середине 74-го шага, потому что контекст запуска находится на эндпоинте этого провайдера. Направить ARTEMIS на один базовый URL, совместимый с OpenAI, и позволить нашему механизму отказоустойчивости перенести запуск к другому провайдеру той же модели — это разница между нестабильным тестом и потерянным днём. Qwen3.8-Flash — интересный кандидат, с которого стоит начать — мультимодальная MoE с 6B активных параметров и контекстом в 1M токенов, указанная в нашем каталоге по цене $0.15 за миллион входных токенов и $0.47 за миллион выходных, при чтении из кэша — $0.018, при записи в кэш — $0.230. Именно цена чтения из кэша здесь важна, потому что запуск Pro перечитывает растущий контекст на каждом шаге.
Впрочем, будьте точны в том, что это значит: Qwen3.8-Flash отсутствует в списке протестированных бэкендов ARTEMIS, в котором перечислены Gemini, Claude, GPT-4o и Qwen-VL. Это модель, которая правдоподобно подходит для этого тестового стенда, а сам тестовый стенд явно создан для того, чтобы принимать такую модель. Никто не публиковал бенчмарк для такого сочетания, и к любому, кто заявляет, что такой бенчмарк существует, следует относиться как к тому, кто его выдумал.
Дорожная карта, и насколько велика её несущая часть
В опубликованной дорожной карте указаны четыре пункта: интеграция с Android Studio с отладкой прямо в редакторе, записью тестов и управлением устройствами; поддержка iOS; локальные облегчённые визуально-языковые модели для работы с низкой задержкой и приоритетом конфиденциальности; а также дуплексное голосовое взаимодействие в реальном времени.
Первый — это тот, в который стоит верить, потому что это естественный следующий артефакт от команды тест-инженеров Pixel, и с ним не связано никакого исследовательского риска — агент уже управляет устройством, ему просто нужна панель в IDE. iOS — это гораздо более масштабное заявление, чем кажется со стороны: вся стратегия поиска опирается на службу доступности Android, а в iOS нет эквивалентной поверхности с такой же моделью разрешений, так что ожидайте переписывания слоя восприятия, а не портирования. Пункт о VLM на устройстве — это тот, за которым стоит внимательно следить, потому что это единственный пункт в списке, который устранил бы пошаговую стоимость API, которая сейчас доминирует в большом наборе тестов — и это подразумевает маленькую, быструю модель, способную работать со зрением, которая может удерживать задачу UI в целостности, что является гораздо более узкой целью, чем «маленькая модель, которая хорошо справляется с использованием инструментов».

Что с ним делать на этой неделе
Склонируйте его, запустите code>./start.sh/code> на одном эмуляторе и дайте Flash задачу, которую покрывает ваш существующий набор тестов Espresso. Это в течение часа покажет, выживет ли локатор с приоритетом динамики на Compose-поверхностях вашего приложения — именно этот вопрос решает, имеет ли значение всё остальное. Затем запустите ту же задачу на Pro и сравните две трассировки — разрыв между 3–5 и 15–40 секундами на шаг — это то, где живёт ваш бюджет, и без него нельзя рассуждать о стоимости ARTEMIS.
Пока вы читаете код, читайте и заголовки. Коммит от 12 сентября, добавивший атрибуцию Minitap, — самый свежий в репозитории, а значит, заголовкам файлов, которые вы читаете, четыре дня, и проект активно чинят на глазах у всех. Это не повод его избегать. Это повод проверить, какая версия истории у вас в руках, прежде чем называть процент успеха на слайде.
Направить ARTEMIS на один OpenAI-совместимый базовый URL и позволить нашему механизму отказоустойчивости перенести запуск к другому провайдеру той же модели — это разница между нестабильным тестом и потерянным днём.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
