Сгенерированная титульная карточка для «ARTEMIS против Qwen3.8» с подзаголовком «Один и тот же бенчмарк, две разные задачи», противопоставляющая заявленный самой ARTEMIS результат 99,1% в AndroidWorld заявленному производителем приросту Qwen3.8-Flash на 22,5 пункта по сравнению с Opus 4.6 на том же бенчмарке, со сноской о том, что AndroidWorld не проводит независимую проверку представленных результатов.
Guides & Insights

ARTEMIS против Qwen3.8: один и тот же бенчмарк, две разные задачи

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

ARTEMIS от Google и Qwen3.8 измеряются на AndroidWorld, и это совпадение — самый вводящий в заблуждение факт во всём освещении запуска любого из этих проектов. ARTEMIS — это инструмент автоматизации Android: открытый Google в августе 2026 года под лицензией Apache 2.0, он принимает инструкцию на естественном языке, управляет реальным телефоном через ADB и заявляет о более чем 99% успешных выполнений в бенчмарке AndroidWorld от Google Research, состоящем из 116 задач, показывая 99,1% в публичной таблице лидеров по состоянию на 11 сентября 2026 года. Qwen3.8-Flash — это мультимодальная модель Alibaba со смесью экспертов, выпущенная с открытым исходным кодом 26 августа 2026 года, в материалах о запуске которой утверждается, что она опережает Claude Opus 4.6 на 22,5 пункта на AndroidWorld. Одно из этих чисел — оценка системы. Другое — вклад модели в систему, которую написал кто-то другой. Рассматривайте их как соперников — и вы сделаете неверный вывод об обоих; рассматривайте их как две половины одного стека — и у интересного вопроса — сколько на самом деле стоит долгий прогон Android — наконец появляется ответ.

Что такое Qwen3.8, по размерам

«Qwen3.8» — это семейство, а не отдельный чекпойнт, и важный здесь представитель — не флагман.

Qwen3.8-Max — флагманский уровень, позиционируемый в противовес передовым облачным моделям.

Qwen3.8-27B — открытый среднеразмерный собрат с плотной архитектурой.

Qwen3.8-Flash — мультимодальная MoE на новой архитектуре «Next»: 125 млрд параметров трансформера, из которых на каждый токен активируется лишь 6 млрд, Qwen Sparse Attention, объединённое с GDN в гибридной схеме внимания для ускорения обработки длинного контекста при попадании в кэш, Gated Residual, разделяющий информационный канал на четыре части, и 51 млрд параметров N-gram-эмбеддингов. Alibaba описывает архитектуру Next как прототип Qwen4 следующего поколения.

Контекст — изначально большой: в большинстве описаний указано 1 млн токенов, а некоторые источники описывают 262 тыс. нативных с расширением до 1 млн. Максимальный вывод — около 131 тыс.

Цена — опубликованная ставка API составляет ¥1 за миллион входных токенов и ¥3 за миллион выходных, что в нашем каталоге соответствует $0,15 / $0,47, при этом чтение из кэша — $0,018, а запись в кэш — $0,230. Сама Alibaba формулирует это так: именно цена при попадании в кэш, опускающаяся до ¥0,1 за миллион, делает рабочие процессы агентов с длинным вводом жизнеспособными, и цифры это подтверждают: чтение из кэша стоит примерно двенадцатую часть свежего входного токена.

Вопрос открытых весов — веса Flash были опубликованы на Hugging Face и ModelScope в день релиза. Обратите внимание, как считается семейство: Alibaba заявляет, что серия Qwen3.8 открыла три размера — Max, 27B и Flash — в общей сложности на 2,4 трлн параметров, причём это совокупный показатель по всей серии, а не количество параметров какой-либо одной модели.

Утверждения о бенчмарках носят широкий характер и, согласно собственным материалам Alibaba о запуске, все являются приростами, а не абсолютными значениями: SWE-bench Pro +9,1 к Opus 4.6, JobBench около +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Приросты относительно неназванной конфигурации конкурирующей модели — это не та же категория доказательств, что и позиция в таблице лидеров, и ни один из них не был независимо воспроизведён. Ключевая формулировка компании — переопределение отраслевой стоимостной «линии отсечения» с цены за токен на полную стоимость за выполненную задачу — это то утверждение, которое действительно имеет значение для данного сравнения, и именно его вы можете проверить сами.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

Что вносит ARTEMIS и почему эти два числа несопоставимы

ARTEMIS не содержит модели. На его значке написано «Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL», а его конфигурация находится в code>config/artemis.jsonc/code>. Он приносит ту часть, которая превращает догадку модели в проверенное действие: динамический локатор, который читает дерево доступности, когда может, и переключается на зрение и координаты, когда поверхность Compose или Flutter не даёт ему ничего, Safety Net, который убирает мешающие системные всплывающие окна до того, как произойдёт нажатие, проверку контрольных точек на четырёх уровнях от code>off/code> до code>strict/code>, и журнал сессии, который сжимает старые скриншоты в визуальные сводки, чтобы контекст из сотни шагов оставался приемлемым по стоимости.

Он также включает нативный MCP-сервер. code>uv run artemis mcp --install all/code> предоставляет code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> и code>mobile_diagnose/code> для Antigravity, Claude Code, Codex и всего остального, что поддерживает MCP — именно это обеспечило проекту такое быстрое распространение, и это — самое чёткое утверждение о том, для чего он предназначен. ARTEMIS — это инструмент, который вызывает агент. Модель — тоже, поэтому помещать их в одну колонку — категориальная ошибка.

Единственное, о чём стоит помнить, читая показатель ARTEMIS в 99,1%: таблица лидеров AndroidWorld прямо не проводит независимую проверку поданных материалов. Каждая цифра в ней, включая цифру ARTEMIS, заявлена самой командой, которая её подготовила. Та же оговорка с ещё большей силой применима к дельте, процитированной в посте о запуске.

Чтение «vs» двумя способами

Есть две честные трактовки этого противостояния, и они указывают в противоположных направлениях.

Как соперники, сравнение на самом деле сводится к: «стоит ли мне использовать размещённую модель плюс обвязку или стоит использовать модель, которая достаточно хороша в мобильных задачах, чтобы я мог написать обвязку сам?» При таком прочтении ARTEMIS побеждает автоматически, потому что модель — это не обвязка, — а разница в +22,5 пункта на AndroidWorld не говорит вам, сможет ли Qwen3.8-Flash пережить шаг 74 в прогоне из ста шагов, когда системное всплывающее окно съедает его нажатие. Ничто в таблице бенчмарков не измеряет Safety Net.

Как стек, это сравнение оказывается полезным: ARTEMIS — это контур управления, Qwen3.8-Flash — правдоподобный движок для него, и вопрос сводится к стоимости и надёжности на длинных горизонтах. Весь посыл Alibaba относительно уровня Flash — что важное число — это общая стоимость на выполненную задачу, а не цена за токен, — и есть именно та метрика, по которой оценивается набор для автоматизации Android, и эту метрику можно измерить на своём тестовом наборе за день.

Неудобная деталь, которая стоит на пути: Qwen3.8-Flash отсутствует в списке протестированных бэкендов ARTEMIS, где перечислены Gemini, Claude, GPT-4o и Qwen-VL. Qwen-VL — это другая модель. Стенд принимает конечную точку модели, и такое сочетание технически правдоподобно, но никто не публиковал результатов его оценки, и если вы запустите его, вы будете выполнять оригинальную работу, а не следовать документации.

Арифметика, которая решает исход

Вот расчёт, который стоит сделать, прежде чем любой из двух постов о запуске убедит вас хоть в чём-то. Это модель с указанными допущениями, а не измерение, и вам стоит подставить собственные числа — но суть именно в её форме.

Возьмём запуск Pro на 100 шагов. Pro выполняется примерно за 15–40 секунд на шаг, поэтому по реальному времени это где-то от 25 минут до часа, и каждый шаг отправляет скриншот плюс растущий промпт. Предположим 8 000 токенов промпта и 300 выходных токенов на шаг — консервативный бюджет на скриншоты и инструкции, намного меньше того, что стоит один необработанный полноразмерный кадр. Это 800 000 входных токенов и 30 000 выходных токенов на один тест.

• При показателях Qwen3.8-Flash $0,15 / $0,47 такой запуск стоит примерно $0,12 за входные данные и $0,014 за выходные — около тринадцати центов.

• При тарифе на передовую модель через хостинг в несколько долларов за миллион входных токенов и около пятнадцати долларов за миллион выходных тот же запуск обходится в доллары, а не в центы. Эти две ставки здесь намеренно указаны приблизительно, потому что точная сумма зависит от того, какую передовую модель вы выберете, а важно именно соотношение: это порядок величины — в каждом тесте, при каждом запуске.

• А поскольку ARTEMIS заново считывает растущий контекст на каждом шаге, соотношение ещё больше улучшается для той модели, у которой чтение из кэша дешевле. Чтение из кэша у Qwen3.8-Flash стоит $0,018 за миллион против $0,15 за свежий ввод — двенадцатая часть цены, и именно поэтому Alibaba постоянно указывает на показатели попаданий в кэш, когда говорит о рабочих нагрузках агентов.

Теперь умножьте это на ваш набор тестов. Ночной прогон регрессии из 500 тестов — это 400 миллионов входных токенов за ночь, а разница между тринадцатью центами и тремя долларами за тест — это разница между тестовым стендом, который вы можете позволить себе запускать непрерывно, и тем, который вы запускаете раз в неделю.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Запускаем, и где важна начинка

Если вы хотите проверить эту арифметику на собственном приложении, честный путь — направить ARTEMIS на конечную точку модели и измерить.Qwen3.8-Flash есть в нашем каталоге по опубликованным $0.15 / $0.47 при чтении из кэша за $0.018 и записи в кэш за $0.230, на том же ключе и по тому же счёту, что и другие размеры Qwen3.8 и всё остальное, что мы маршрутизируем, — а это как раз то, что имеет значение, когда оцениваемый вами рабочий процесс — это тестовый стенд, делающий сотню вызовов на один тест, а не человек, делающий один вызов. На странице модели также приведены эксплуатационные показатели, которые нужны вам прежде, чем вы доверите ей целый набор тестов: контекст на 1 млн токенов при максимальном выводе 131K, p50 времени до первого токена — 7,12 секунды, а p95 — 10,00, и примерно 2,3 млрд токенов трафика через неё за последние семь дней. Последняя цифра — наша, а не вендорская, и это разумный косвенный показатель того, запускают ли другие люди уже длительные агентные нагрузки на этой конечной точке.

Деталь инфраструктуры, которая перестаёт быть теоретической в таком масштабе, — это то, что происходит на шаге 74. Pro-запуск удерживает свой контекст на одном эндпоинте большую часть часа; инцидент у провайдера в середине не ухудшает запуск, а завершает его, и вы платите за 73 шага, которые не дали результата. Маршрутизация длительной сессии агента через слой, который переключается на другого провайдера той же модели, — это разница между нестабильным набором и прерванным. Это обычное инженерное свойство, и именно оно решает, выживет ли ваша измеренная стоимость за выполненную задачу при столкновении с неделей реальных запусков.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

Для чего на самом деле нужен каждый из них

Если у вас есть Android-приложение и тестовый набор, вам нужен ARTEMIS, а Qwen3.8-Flash — это движок-кандидат для него, а не альтернатива ему: недокументированный, стоящий эксперимента на полдня, с такой ценой, что эксперимент не будет стоить вам ничего ощутимого. Если вы выбираете модель для мобильного агента, которого пишете сами, прирост +22,5 пункта в AndroidWorld — это повод присмотреться к Qwen3.8-Flash, а не повод в него верить, потому что это заявленный вендором прирост без приложенной абсолютной оценки и без независимого воспроизведения.

Оба проекта втихую спорят об одном и том же, и ни один не говорит об этом прямо. Google утверждает, что именно обвязка делает мобильного агента надёжным, и открывает её исходный код, чтобы это утверждение можно было проверить. Alibaba утверждает, что стоимость выполнения одной задачи — единственный показатель, который имеет значение, и соответствующим образом устанавливает цены. Оба, вероятно, правы, поэтому интересная конфигурация — не ARTEMIS или Qwen3.8, а ARTEMIS на Qwen3.8-Flash, измеренная на вашем собственном приложении, с включённой трассировкой.

И поскольку ARTEMIS перечитывает растущий контекст на каждом шаге, соотношение улучшается ещё сильнее для той модели, у которой чтение кэша дешевле.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно