Une carte de titre générée pour « ARTEMIS vs Qwen3.8 », sous-titrée « Le même benchmark, deux tâches différentes », mettant en contraste le résultat AndroidWorld de 99,1 % auto-déclaré par ARTEMIS avec le gain de 22,5 points annoncé par le fournisseur de Qwen3.8-Flash par rapport à Opus 4.6 sur le même benchmark, avec une note de bas de page précisant qu’AndroidWorld ne vérifie pas indépendamment les soumissions.
Guides & Insights

ARTEMIS vs Qwen3.8 : le même benchmark, deux tâches différentes

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'ARTEMIS de Google et Qwen3.8 sont tous deux évalués sur AndroidWorld, et cette coïncidence est le fait le plus trompeur dans la couverture du lancement de l'un ou l'autre projet. ARTEMIS est un harnais d'automatisation Android — rendu open source par Google en août 2026 sous Apache 2.0, il prend une instruction en langage naturel, pilote un véritable téléphone via ADB, et revendique un taux d'achèvement de plus de 99 % sur le benchmark AndroidWorld à 116 tâches de Google Research, affichant 99,1 % dans le classement public au 11 septembre 2026. Qwen3.8-Flash est le modèle multimodal à mélange d'experts d'Alibaba, publié et rendu open source le 26 août 2026, dont les documents de lancement affirment qu'il dépasse Claude Opus 4.6 de 22,5 points sur AndroidWorld. L'un de ces chiffres est le score d'un système. L'autre est la contribution d'un modèle à un système écrit par quelqu'un d'autre. Lisez-les comme des rivaux et vous en tirerez une conclusion erronée sur les deux ; lisez-les comme les deux moitiés d'une même stack et la question intéressante — combien coûte réellement une longue exécution Android — a enfin une réponse.

Ce qu'est Qwen3.8, par taille

« Qwen3.8 » est une famille, pas un point de contrôle, et le membre qui compte ici n’est pas le modèle phare.

Qwen3.8-Max — le niveau phare, positionné face aux modèles hébergés de pointe.

Qwen3.8-27B — l’homologue dense ouvert de taille moyenne.

Qwen3.8-Flash — un MoE multimodal sur une nouvelle architecture « Next » : 125 milliards de paramètres de transformeur avec seulement 6 milliards activés par token, Qwen Sparse Attention fusionnée avec GDN dans un schéma d’attention hybride pour accélérer le traitement des contextes longs en cas de succès du cache, un Gated Residual divisant le canal d’information en quatre, et 51 milliards de paramètres de plongements de N-grammes. Alibaba décrit l’architecture Next comme le prototype de la prochaine génération de Qwen4.

Contexte — nativement de grande taille, avec la plupart des fiches à 1 M de tokens et certaines sources décrivant 262 K natifs étendus à 1 M. La sortie maximale est d'environ 131 K.

Prix — le tarif API publié est de 1 ¥ par million de jetons d’entrée et de 3 ¥ par million de jetons de sortie, ce qui correspond à 0,15 $ / 0,47 $ dans notre catalogue, avec les lectures de cache à 0,018 $ et les écritures de cache à 0,230 $. La présentation d’Alibaba elle-même indique qu’une tarification des cache hits aussi basse que 0,1 ¥ par million est ce qui rend viables les workflows d’agents à entrée longue, et les chiffres le confirment : une lecture de cache coûte environ un douzième d’un nouveau jeton d’entrée.

La question des poids ouverts — les poids de Flash ont été publiés sur Hugging Face et ModelScope le jour de la sortie. Notez la façon dont la famille est comptabilisée : Alibaba indique que la série Qwen3.8 a mis en open source trois tailles — Max, 27B et Flash — pour un total de 2,4 T de paramètres, un chiffre cumulé sur l'ensemble de la série plutôt que le nombre de paramètres d'un modèle donné.

Les affirmations sur les benchmarks sont générales et, d’après le propre matériel de lancement d’Alibaba, il s’agit uniquement d’écarts plutôt que de valeurs absolues : SWE-bench Pro +9,1 par rapport à Opus 4.6, JobBench environ +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Des écarts par rapport à une configuration non nommée d’un modèle concurrent ne relèvent pas de la même catégorie de preuves qu’une entrée dans un classement, et aucun de ces chiffres n’a été reproduit indépendamment. La formulation phare de l’entreprise — une redéfinition de la « ligne rouge » des coûts du secteur, du prix par token au coût total par tâche accomplie — est l’affirmation qui compte vraiment pour cette comparaison, et c’est aussi celle que vous pouvez tester vous-même.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

Ce qu’apporte ARTEMIS, et pourquoi les deux chiffres ne sont pas comparables

ARTEMIS ne contient aucun modèle. Son badge indique « Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL » et sa configuration se trouve dans code>config/artemis.jsonc/code>. Ce qu'il apporte, c'est la partie qui transforme l'estimation d'un modèle en action vérifiée : un localisateur privilégiant le dynamique qui lit l'arbre d'accessibilité quand il le peut et se rabat sur la vision et les coordonnées quand une surface Compose ou Flutter ne lui fournit rien, un Safety Net qui élimine les pop-ups système intempestifs avant que le tap n'aboutisse, une vérification par points de contrôle à quatre niveaux, de code>off/code> à code>strict/code>, et un registre de session qui compresse les anciennes captures d'écran en résumés visuels afin qu'un contexte de cent étapes reste abordable.

Il est également livré avec un serveur MCP natif. code>uv run artemis mcp --install all/code> expose code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> et code>mobile_diagnose/code> à Antigravity, Claude Code, Codex et à tout ce qui parle MCP — ce qui a permis au projet de se diffuser aussi vite qu'il l'a fait, et ce qui dit le plus clairement à quoi il sert. ARTEMIS est un outil qu'un agent appelle. Un modèle aussi, et c'est pourquoi les ranger dans la même colonne relève d'une erreur de catégorie.

La seule chose à laquelle il faut faire attention en lisant les 99,1 % d’ARTEMIS : le classement d’AndroidWorld indique explicitement qu’il ne vérifie pas les soumissions de manière indépendante. Chaque chiffre qui y figure, y compris celui d’ARTEMIS, est auto-déclaré par l’équipe qui l’a produit. La même mise en garde s’applique avec encore plus de force à un delta cité dans un article de lancement.

Lire « vs » de deux manières

Il existe deux lectures honnêtes de cette confrontation et elles pointent dans des directions opposées.

En tant que rivaux, la comparaison est en réalité : « dois-je utiliser un modèle hébergé plus un harnais, ou dois-je utiliser un modèle suffisamment bon pour les tâches mobiles pour pouvoir écrire moi-même le harnais ? » Dans cette lecture, ARTEMIS l'emporte par défaut, parce qu'un modèle n'est pas un harnais — et l'écart de +22,5 points sur AndroidWorld ne vous dit pas si Qwen3.8-Flash peut survivre à l'étape 74 d'une exécution de cent étapes lorsqu'une pop-up système mange son tap. Rien dans un tableau de benchmark ne mesure le Safety Net.

En tant que stack, la comparaison est celle qui est utile : ARTEMIS est la boucle de contrôle, Qwen3.8-Flash est un moteur plausible pour celle-ci, et la question devient celle du coût et de la fiabilité lorsque la longueur augmente. Tout l'argumentaire d'Alibaba pour le niveau Flash — à savoir que le chiffre important est le coût total par tâche accomplie plutôt que le prix par token — est précisément la métrique sur laquelle une suite d'automatisation Android est évaluée, et c'est une métrique que vous pouvez mesurer sur votre propre jeu de test en une journée.

Le détail gênant qui fait obstacle : Qwen3.8-Flash ne figure pas sur la liste des backends testés d’ARTEMIS, qui mentionne Gemini, Claude, GPT-4o et Qwen-VL. Qwen-VL est un modèle différent. Le harnais prend un endpoint de modèle et l’appariement est techniquement plausible, mais personne n’en a publié d’évaluation, et si vous l’exécutez, vous faites un travail original plutôt que de suivre la documentation.

L'arithmétique qui en décide

Voici le calcul qui vaut la peine d’être fait avant que l’un ou l’autre des articles de lancement ne vous persuade de quoi que ce soit. C’est un modèle assorti d’hypothèses explicites, pas une mesure, et vous devriez y remplacer les chiffres par les vôtres — mais c’est sa forme qui est l’essentiel.

Prenons une exécution Pro de 100 étapes. Pro s'exécute en environ 15 à 40 secondes par étape, donc le temps d'horloge se situe quelque part entre 25 minutes et une heure, et chaque étape envoie une capture d'écran ainsi qu'un prompt qui s'allonge. Supposons 8 000 tokens de prompt et 300 tokens de sortie par étape — un budget prudent pour la capture d'écran et les instructions, bien en dessous de ce que coûte une image brute en pleine résolution. Cela représente 800 000 tokens d'entrée et 30 000 tokens de sortie pour un seul test.

• Avec les tarifs de Qwen3.8-Flash, à 0,15 $ / 0,47 $, cette exécution coûte environ 0,12 $ en entrée et 0,014 $ en sortie — soit environ 0,13 $.

• À un tarif hébergé de pointe de quelques unités basses par million de jetons d’entrée et d’une quinzaine par million de jetons de sortie, la même exécution se chiffre en dollars, pas en cents. Les deux tarifs sont volontairement laissés dans le flou ici, car le chiffre exact dépend du modèle de pointe que vous choisissez et c’est le ratio qui compte : c’est un ordre de grandeur, à chaque test, à chaque exécution.

• Et comme ARTEMIS relit un contexte croissant à chaque étape, le ratio s’améliore encore pour le modèle dont la lecture du cache est la moins chère. La lecture du cache de Qwen3.8-Flash coûte 0,018 $ par million, contre 0,15 $ pour une entrée fraîche — soit un douzième du prix, et la raison pour laquelle Alibaba ne cesse d’insister sur les taux de réussite du cache lorsqu’il évoque les charges de travail des agents.

Maintenant, multipliez par votre suite. Une exécution de régression de 500 tests chaque nuit représente 400 millions de jetons d'entrée par nuit, et la différence entre treize cents et trois dollars par test est la différence entre un harnais que vous pouvez vous permettre de faire tourner en continu et un que vous planifiez chaque semaine.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Le faire tourner, et là où la plomberie compte

Si vous voulez tester cette arithmétique sur votre propre application, la voie honnête consiste à pointer ARTEMIS vers un point de terminaison de modèle et à mesurer. Qwen3.8-Flash figure dans notre catalogue au tarif publié de 0,15 $ / 0,47 $ avec les lectures de cache à 0,018 $ et les écritures de cache à 0,230 $, sur la même clé et la même facture que les autres tailles de Qwen3.8 et tout ce que nous routons — c'est là ce qui compte lorsque le workflow que vous chiffrez est un harnais effectuant une centaine d'appels par test plutôt qu'une personne qui n'en fait qu'un. La page du modèle contient aussi les chiffres opérationnels qu'il vous faut avant d'y engager une suite : un contexte de 1 M de tokens avec une sortie maximale de 131 K, un temps jusqu'au premier token p50 de 7,12 secondes et un p95 de 10,00, et environ 2,3 milliards de tokens de trafic qui l'ont traversé ces sept derniers jours. Ce dernier chiffre est le nôtre, et non celui d'un fournisseur, et il constitue un indicateur raisonnable pour savoir si d'autres personnes exécutent déjà de longues charges de travail d'agents sur ce point de terminaison.

Le détail d’infrastructure qui cesse d’être théorique à cette échelle, c’est ce qui se passe à l’étape 74. Une exécution Pro conserve son contexte sur un seul point de terminaison pendant la majeure partie d’une heure ; un incident chez un fournisseur en plein milieu ne dégrade pas l’exécution, il y met fin, et vous payez pour les 73 étapes qui n’ont pas produit de résultat. Router une longue session d’agent via une couche qui bascule vers un autre fournisseur du même modèle fait la différence entre une suite instable et une suite interrompue. C’est une propriété d’ingénierie banale, et c’est celle qui décide si votre coût mesuré par tâche terminée survit au contact d’une semaine d’exécutions réelles.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

À quoi chacun sert réellement

Si vous avez une application Android et une suite de tests, vous voulez ARTEMIS, et Qwen3.8-Flash est un moteur candidat pour celui-ci plutôt qu'une alternative à celui-ci — non documenté, qui vaut l'expérience d'un après-midi, à un prix tel que l'expérience ne vous coûte rien de mesurable. Si vous choisissez un modèle pour un agent mobile que vous écrivez vous-même, le delta de +22,5 points sur AndroidWorld est une raison de s'intéresser à Qwen3.8-Flash et non une raison d'y croire, car il s'agit d'un delta rapporté par le fournisseur, sans score absolu associé et sans reproduction indépendante.

Ce dont les deux projets débattent à mots couverts est la même chose, et aucun ne le dit ouvertement. Google affirme que c’est le harness qui rend un agent mobile fiable, et le publie en open source pour que cette affirmation puisse être vérifiée. Alibaba affirme que le coût par tâche accomplie est le seul chiffre qui compte, et fixe ses prix en conséquence. Les deux ont probablement raison, et c’est pourquoi la configuration intéressante n’est ni ARTEMIS ni Qwen3.8 — c’est ARTEMIS sur Qwen3.8-Flash, mesurée sur votre propre application, avec la trace laissée activée.

Et comme ARTEMIS relit un contexte croissant à chaque étape, le ratio s'améliore encore, quel que soit le modèle dont la lecture du cache est la moins coûteuse.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement