
ARTEMIS против Qwen3.8: один и тот же бенчмарк, две разные задачи
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
ARTEMIS от Google и Qwen3.8 измеряются на AndroidWorld, и это совпадение — самый вводящий в заблуждение факт во всём освещении запуска любого из этих проектов. ARTEMIS — это инструмент автоматизации Android: открытый Google в августе 2026 года под лицензией Apache 2.0, он принимает инструкцию на естественном языке, управляет реальным телефоном через ADB и заявляет о более чем 99% успешных выполнений в бенчмарке AndroidWorld от Google Research, состоящем из 116 задач, показывая 99,1% в публичной таблице лидеров по состоянию на 11 сентября 2026 года. Qwen3.8-Flash — это мультимодальная модель Alibaba со смесью экспертов, выпущенная с открытым исходным кодом 26 августа 2026 года, в материалах о запуске которой утверждается, что она опережает Claude Opus 4.6 на 22,5 пункта на AndroidWorld. Одно из этих чисел — оценка системы. Другое — вклад модели в систему, которую написал кто-то другой. Рассматривайте их как соперников — и вы сделаете неверный вывод об обоих; рассматривайте их как две половины одного стека — и у интересного вопроса — сколько на самом деле стоит долгий прогон Android — наконец появляется ответ.
Что такое Qwen3.8, по размерам
«Qwen3.8» — это семейство, а не отдельный чекпойнт, и важный здесь представитель — не флагман.
• Qwen3.8-Max — флагманский уровень, позиционируемый в противовес передовым облачным моделям.
• Qwen3.8-27B — открытый среднеразмерный собрат с плотной архитектурой.
• Qwen3.8-Flash — мультимодальная MoE на новой архитектуре «Next»: 125 млрд параметров трансформера, из которых на каждый токен активируется лишь 6 млрд, Qwen Sparse Attention, объединённое с GDN в гибридной схеме внимания для ускорения обработки длинного контекста при попадании в кэш, Gated Residual, разделяющий информационный канал на четыре части, и 51 млрд параметров N-gram-эмбеддингов. Alibaba описывает архитектуру Next как прототип Qwen4 следующего поколения.
• Контекст — изначально большой: в большинстве описаний указано 1 млн токенов, а некоторые источники описывают 262 тыс. нативных с расширением до 1 млн. Максимальный вывод — около 131 тыс.
• Цена — опубликованная ставка API составляет ¥1 за миллион входных токенов и ¥3 за миллион выходных, что в нашем каталоге соответствует $0,15 / $0,47, при этом чтение из кэша — $0,018, а запись в кэш — $0,230. Сама Alibaba формулирует это так: именно цена при попадании в кэш, опускающаяся до ¥0,1 за миллион, делает рабочие процессы агентов с длинным вводом жизнеспособными, и цифры это подтверждают: чтение из кэша стоит примерно двенадцатую часть свежего входного токена.
• Вопрос открытых весов — веса Flash были опубликованы на Hugging Face и ModelScope в день релиза. Обратите внимание, как считается семейство: Alibaba заявляет, что серия Qwen3.8 открыла три размера — Max, 27B и Flash — в общей сложности на 2,4 трлн параметров, причём это совокупный показатель по всей серии, а не количество параметров какой-либо одной модели.
Утверждения о бенчмарках носят широкий характер и, согласно собственным материалам Alibaba о запуске, все являются приростами, а не абсолютными значениями: SWE-bench Pro +9,1 к Opus 4.6, JobBench около +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Приросты относительно неназванной конфигурации конкурирующей модели — это не та же категория доказательств, что и позиция в таблице лидеров, и ни один из них не был независимо воспроизведён. Ключевая формулировка компании — переопределение отраслевой стоимостной «линии отсечения» с цены за токен на полную стоимость за выполненную задачу — это то утверждение, которое действительно имеет значение для данного сравнения, и именно его вы можете проверить сами.

Что вносит ARTEMIS и почему эти два числа несопоставимы
ARTEMIS не содержит модели. На его значке написано «Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL», а его конфигурация находится в code>config/artemis.jsonc/code>. Он приносит ту часть, которая превращает догадку модели в проверенное действие: динамический локатор, который читает дерево доступности, когда может, и переключается на зрение и координаты, когда поверхность Compose или Flutter не даёт ему ничего, Safety Net, который убирает мешающие системные всплывающие окна до того, как произойдёт нажатие, проверку контрольных точек на четырёх уровнях от code>off/code> до code>strict/code>, и журнал сессии, который сжимает старые скриншоты в визуальные сводки, чтобы контекст из сотни шагов оставался приемлемым по стоимости.
Он также включает нативный MCP-сервер. code>uv run artemis mcp --install all/code> предоставляет code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> и code>mobile_diagnose/code> для Antigravity, Claude Code, Codex и всего остального, что поддерживает MCP — именно это обеспечило проекту такое быстрое распространение, и это — самое чёткое утверждение о том, для чего он предназначен. ARTEMIS — это инструмент, который вызывает агент. Модель — тоже, поэтому помещать их в одну колонку — категориальная ошибка.
Единственное, о чём стоит помнить, читая показатель ARTEMIS в 99,1%: таблица лидеров AndroidWorld прямо не проводит независимую проверку поданных материалов. Каждая цифра в ней, включая цифру ARTEMIS, заявлена самой командой, которая её подготовила. Та же оговорка с ещё большей силой применима к дельте, процитированной в посте о запуске.
Чтение «vs» двумя способами
Есть две честные трактовки этого противостояния, и они указывают в противоположных направлениях.
Как соперники, сравнение на самом деле сводится к: «стоит ли мне использовать размещённую модель плюс обвязку или стоит использовать модель, которая достаточно хороша в мобильных задачах, чтобы я мог написать обвязку сам?» При таком прочтении ARTEMIS побеждает автоматически, потому что модель — это не обвязка, — а разница в +22,5 пункта на AndroidWorld не говорит вам, сможет ли Qwen3.8-Flash пережить шаг 74 в прогоне из ста шагов, когда системное всплывающее окно съедает его нажатие. Ничто в таблице бенчмарков не измеряет Safety Net.
Как стек, это сравнение оказывается полезным: ARTEMIS — это контур управления, Qwen3.8-Flash — правдоподобный движок для него, и вопрос сводится к стоимости и надёжности на длинных горизонтах. Весь посыл Alibaba относительно уровня Flash — что важное число — это общая стоимость на выполненную задачу, а не цена за токен, — и есть именно та метрика, по которой оценивается набор для автоматизации Android, и эту метрику можно измерить на своём тестовом наборе за день.
Неудобная деталь, которая стоит на пути: Qwen3.8-Flash отсутствует в списке протестированных бэкендов ARTEMIS, где перечислены Gemini, Claude, GPT-4o и Qwen-VL. Qwen-VL — это другая модель. Стенд принимает конечную точку модели, и такое сочетание технически правдоподобно, но никто не публиковал результатов его оценки, и если вы запустите его, вы будете выполнять оригинальную работу, а не следовать документации.
Арифметика, которая решает исход
Вот расчёт, который стоит сделать, прежде чем любой из двух постов о запуске убедит вас хоть в чём-то. Это модель с указанными допущениями, а не измерение, и вам стоит подставить собственные числа — но суть именно в её форме.
Возьмём запуск Pro на 100 шагов. Pro выполняется примерно за 15–40 секунд на шаг, поэтому по реальному времени это где-то от 25 минут до часа, и каждый шаг отправляет скриншот плюс растущий промпт. Предположим 8 000 токенов промпта и 300 выходных токенов на шаг — консервативный бюджет на скриншоты и инструкции, намного меньше того, что стоит один необработанный полноразмерный кадр. Это 800 000 входных токенов и 30 000 выходных токенов на один тест.
• При показателях Qwen3.8-Flash $0,15 / $0,47 такой запуск стоит примерно $0,12 за входные данные и $0,014 за выходные — около тринадцати центов.
• При тарифе на передовую модель через хостинг в несколько долларов за миллион входных токенов и около пятнадцати долларов за миллион выходных тот же запуск обходится в доллары, а не в центы. Эти две ставки здесь намеренно указаны приблизительно, потому что точная сумма зависит от того, какую передовую модель вы выберете, а важно именно соотношение: это порядок величины — в каждом тесте, при каждом запуске.
• А поскольку ARTEMIS заново считывает растущий контекст на каждом шаге, соотношение ещё больше улучшается для той модели, у которой чтение из кэша дешевле. Чтение из кэша у Qwen3.8-Flash стоит $0,018 за миллион против $0,15 за свежий ввод — двенадцатая часть цены, и именно поэтому Alibaba постоянно указывает на показатели попаданий в кэш, когда говорит о рабочих нагрузках агентов.
Теперь умножьте это на ваш набор тестов. Ночной прогон регрессии из 500 тестов — это 400 миллионов входных токенов за ночь, а разница между тринадцатью центами и тремя долларами за тест — это разница между тестовым стендом, который вы можете позволить себе запускать непрерывно, и тем, который вы запускаете раз в неделю.

Запускаем, и где важна начинка
Если вы хотите проверить эту арифметику на собственном приложении, честный путь — направить ARTEMIS на конечную точку модели и измерить.Qwen3.8-Flash есть в нашем каталоге по опубликованным $0.15 / $0.47 при чтении из кэша за $0.018 и записи в кэш за $0.230, на том же ключе и по тому же счёту, что и другие размеры Qwen3.8 и всё остальное, что мы маршрутизируем, — а это как раз то, что имеет значение, когда оцениваемый вами рабочий процесс — это тестовый стенд, делающий сотню вызовов на один тест, а не человек, делающий один вызов. На странице модели также приведены эксплуатационные показатели, которые нужны вам прежде, чем вы доверите ей целый набор тестов: контекст на 1 млн токенов при максимальном выводе 131K, p50 времени до первого токена — 7,12 секунды, а p95 — 10,00, и примерно 2,3 млрд токенов трафика через неё за последние семь дней. Последняя цифра — наша, а не вендорская, и это разумный косвенный показатель того, запускают ли другие люди уже длительные агентные нагрузки на этой конечной точке.
Деталь инфраструктуры, которая перестаёт быть теоретической в таком масштабе, — это то, что происходит на шаге 74. Pro-запуск удерживает свой контекст на одном эндпоинте большую часть часа; инцидент у провайдера в середине не ухудшает запуск, а завершает его, и вы платите за 73 шага, которые не дали результата. Маршрутизация длительной сессии агента через слой, который переключается на другого провайдера той же модели, — это разница между нестабильным набором и прерванным. Это обычное инженерное свойство, и именно оно решает, выживет ли ваша измеренная стоимость за выполненную задачу при столкновении с неделей реальных запусков.

Для чего на самом деле нужен каждый из них
Если у вас есть Android-приложение и тестовый набор, вам нужен ARTEMIS, а Qwen3.8-Flash — это движок-кандидат для него, а не альтернатива ему: недокументированный, стоящий эксперимента на полдня, с такой ценой, что эксперимент не будет стоить вам ничего ощутимого. Если вы выбираете модель для мобильного агента, которого пишете сами, прирост +22,5 пункта в AndroidWorld — это повод присмотреться к Qwen3.8-Flash, а не повод в него верить, потому что это заявленный вендором прирост без приложенной абсолютной оценки и без независимого воспроизведения.
Оба проекта втихую спорят об одном и том же, и ни один не говорит об этом прямо. Google утверждает, что именно обвязка делает мобильного агента надёжным, и открывает её исходный код, чтобы это утверждение можно было проверить. Alibaba утверждает, что стоимость выполнения одной задачи — единственный показатель, который имеет значение, и соответствующим образом устанавливает цены. Оба, вероятно, правы, поэтому интересная конфигурация — не ARTEMIS или Qwen3.8, а ARTEMIS на Qwen3.8-Flash, измеренная на вашем собственном приложении, с включённой трассировкой.
И поскольку ARTEMIS перечитывает растущий контекст на каждом шаге, соотношение улучшается ещё сильнее для той модели, у которой чтение кэша дешевле.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
