
ARTEMIS vs Qwen3.8 : le même benchmark, deux tâches différentes
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
L'ARTEMIS de Google et Qwen3.8 sont tous deux évalués sur AndroidWorld, et cette coïncidence est le fait le plus trompeur dans la couverture du lancement de l'un ou l'autre projet. ARTEMIS est un harnais d'automatisation Android — rendu open source par Google en août 2026 sous Apache 2.0, il prend une instruction en langage naturel, pilote un véritable téléphone via ADB, et revendique un taux d'achèvement de plus de 99 % sur le benchmark AndroidWorld à 116 tâches de Google Research, affichant 99,1 % dans le classement public au 11 septembre 2026. Qwen3.8-Flash est le modèle multimodal à mélange d'experts d'Alibaba, publié et rendu open source le 26 août 2026, dont les documents de lancement affirment qu'il dépasse Claude Opus 4.6 de 22,5 points sur AndroidWorld. L'un de ces chiffres est le score d'un système. L'autre est la contribution d'un modèle à un système écrit par quelqu'un d'autre. Lisez-les comme des rivaux et vous en tirerez une conclusion erronée sur les deux ; lisez-les comme les deux moitiés d'une même stack et la question intéressante — combien coûte réellement une longue exécution Android — a enfin une réponse.
Ce qu'est Qwen3.8, par taille
« Qwen3.8 » est une famille, pas un point de contrôle, et le membre qui compte ici n’est pas le modèle phare.
• Qwen3.8-Max — le niveau phare, positionné face aux modèles hébergés de pointe.
• Qwen3.8-27B — l’homologue dense ouvert de taille moyenne.
• Qwen3.8-Flash — un MoE multimodal sur une nouvelle architecture « Next » : 125 milliards de paramètres de transformeur avec seulement 6 milliards activés par token, Qwen Sparse Attention fusionnée avec GDN dans un schéma d’attention hybride pour accélérer le traitement des contextes longs en cas de succès du cache, un Gated Residual divisant le canal d’information en quatre, et 51 milliards de paramètres de plongements de N-grammes. Alibaba décrit l’architecture Next comme le prototype de la prochaine génération de Qwen4.
• Contexte — nativement de grande taille, avec la plupart des fiches à 1 M de tokens et certaines sources décrivant 262 K natifs étendus à 1 M. La sortie maximale est d'environ 131 K.
• Prix — le tarif API publié est de 1 ¥ par million de jetons d’entrée et de 3 ¥ par million de jetons de sortie, ce qui correspond à 0,15 $ / 0,47 $ dans notre catalogue, avec les lectures de cache à 0,018 $ et les écritures de cache à 0,230 $. La présentation d’Alibaba elle-même indique qu’une tarification des cache hits aussi basse que 0,1 ¥ par million est ce qui rend viables les workflows d’agents à entrée longue, et les chiffres le confirment : une lecture de cache coûte environ un douzième d’un nouveau jeton d’entrée.
• La question des poids ouverts — les poids de Flash ont été publiés sur Hugging Face et ModelScope le jour de la sortie. Notez la façon dont la famille est comptabilisée : Alibaba indique que la série Qwen3.8 a mis en open source trois tailles — Max, 27B et Flash — pour un total de 2,4 T de paramètres, un chiffre cumulé sur l'ensemble de la série plutôt que le nombre de paramètres d'un modèle donné.
Les affirmations sur les benchmarks sont générales et, d’après le propre matériel de lancement d’Alibaba, il s’agit uniquement d’écarts plutôt que de valeurs absolues : SWE-bench Pro +9,1 par rapport à Opus 4.6, JobBench environ +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Des écarts par rapport à une configuration non nommée d’un modèle concurrent ne relèvent pas de la même catégorie de preuves qu’une entrée dans un classement, et aucun de ces chiffres n’a été reproduit indépendamment. La formulation phare de l’entreprise — une redéfinition de la « ligne rouge » des coûts du secteur, du prix par token au coût total par tâche accomplie — est l’affirmation qui compte vraiment pour cette comparaison, et c’est aussi celle que vous pouvez tester vous-même.

Ce qu’apporte ARTEMIS, et pourquoi les deux chiffres ne sont pas comparables
ARTEMIS ne contient aucun modèle. Son badge indique « Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL » et sa configuration se trouve dans code>config/artemis.jsonc/code>. Ce qu'il apporte, c'est la partie qui transforme l'estimation d'un modèle en action vérifiée : un localisateur privilégiant le dynamique qui lit l'arbre d'accessibilité quand il le peut et se rabat sur la vision et les coordonnées quand une surface Compose ou Flutter ne lui fournit rien, un Safety Net qui élimine les pop-ups système intempestifs avant que le tap n'aboutisse, une vérification par points de contrôle à quatre niveaux, de code>off/code> à code>strict/code>, et un registre de session qui compresse les anciennes captures d'écran en résumés visuels afin qu'un contexte de cent étapes reste abordable.
Il est également livré avec un serveur MCP natif. code>uv run artemis mcp --install all/code> expose code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> et code>mobile_diagnose/code> à Antigravity, Claude Code, Codex et à tout ce qui parle MCP — ce qui a permis au projet de se diffuser aussi vite qu'il l'a fait, et ce qui dit le plus clairement à quoi il sert. ARTEMIS est un outil qu'un agent appelle. Un modèle aussi, et c'est pourquoi les ranger dans la même colonne relève d'une erreur de catégorie.
La seule chose à laquelle il faut faire attention en lisant les 99,1 % d’ARTEMIS : le classement d’AndroidWorld indique explicitement qu’il ne vérifie pas les soumissions de manière indépendante. Chaque chiffre qui y figure, y compris celui d’ARTEMIS, est auto-déclaré par l’équipe qui l’a produit. La même mise en garde s’applique avec encore plus de force à un delta cité dans un article de lancement.
Lire « vs » de deux manières
Il existe deux lectures honnêtes de cette confrontation et elles pointent dans des directions opposées.
En tant que rivaux, la comparaison est en réalité : « dois-je utiliser un modèle hébergé plus un harnais, ou dois-je utiliser un modèle suffisamment bon pour les tâches mobiles pour pouvoir écrire moi-même le harnais ? » Dans cette lecture, ARTEMIS l'emporte par défaut, parce qu'un modèle n'est pas un harnais — et l'écart de +22,5 points sur AndroidWorld ne vous dit pas si Qwen3.8-Flash peut survivre à l'étape 74 d'une exécution de cent étapes lorsqu'une pop-up système mange son tap. Rien dans un tableau de benchmark ne mesure le Safety Net.
En tant que stack, la comparaison est celle qui est utile : ARTEMIS est la boucle de contrôle, Qwen3.8-Flash est un moteur plausible pour celle-ci, et la question devient celle du coût et de la fiabilité lorsque la longueur augmente. Tout l'argumentaire d'Alibaba pour le niveau Flash — à savoir que le chiffre important est le coût total par tâche accomplie plutôt que le prix par token — est précisément la métrique sur laquelle une suite d'automatisation Android est évaluée, et c'est une métrique que vous pouvez mesurer sur votre propre jeu de test en une journée.
Le détail gênant qui fait obstacle : Qwen3.8-Flash ne figure pas sur la liste des backends testés d’ARTEMIS, qui mentionne Gemini, Claude, GPT-4o et Qwen-VL. Qwen-VL est un modèle différent. Le harnais prend un endpoint de modèle et l’appariement est techniquement plausible, mais personne n’en a publié d’évaluation, et si vous l’exécutez, vous faites un travail original plutôt que de suivre la documentation.
L'arithmétique qui en décide
Voici le calcul qui vaut la peine d’être fait avant que l’un ou l’autre des articles de lancement ne vous persuade de quoi que ce soit. C’est un modèle assorti d’hypothèses explicites, pas une mesure, et vous devriez y remplacer les chiffres par les vôtres — mais c’est sa forme qui est l’essentiel.
Prenons une exécution Pro de 100 étapes. Pro s'exécute en environ 15 à 40 secondes par étape, donc le temps d'horloge se situe quelque part entre 25 minutes et une heure, et chaque étape envoie une capture d'écran ainsi qu'un prompt qui s'allonge. Supposons 8 000 tokens de prompt et 300 tokens de sortie par étape — un budget prudent pour la capture d'écran et les instructions, bien en dessous de ce que coûte une image brute en pleine résolution. Cela représente 800 000 tokens d'entrée et 30 000 tokens de sortie pour un seul test.
• Avec les tarifs de Qwen3.8-Flash, à 0,15 $ / 0,47 $, cette exécution coûte environ 0,12 $ en entrée et 0,014 $ en sortie — soit environ 0,13 $.
• À un tarif hébergé de pointe de quelques unités basses par million de jetons d’entrée et d’une quinzaine par million de jetons de sortie, la même exécution se chiffre en dollars, pas en cents. Les deux tarifs sont volontairement laissés dans le flou ici, car le chiffre exact dépend du modèle de pointe que vous choisissez et c’est le ratio qui compte : c’est un ordre de grandeur, à chaque test, à chaque exécution.
• Et comme ARTEMIS relit un contexte croissant à chaque étape, le ratio s’améliore encore pour le modèle dont la lecture du cache est la moins chère. La lecture du cache de Qwen3.8-Flash coûte 0,018 $ par million, contre 0,15 $ pour une entrée fraîche — soit un douzième du prix, et la raison pour laquelle Alibaba ne cesse d’insister sur les taux de réussite du cache lorsqu’il évoque les charges de travail des agents.
Maintenant, multipliez par votre suite. Une exécution de régression de 500 tests chaque nuit représente 400 millions de jetons d'entrée par nuit, et la différence entre treize cents et trois dollars par test est la différence entre un harnais que vous pouvez vous permettre de faire tourner en continu et un que vous planifiez chaque semaine.

Le faire tourner, et là où la plomberie compte
Si vous voulez tester cette arithmétique sur votre propre application, la voie honnête consiste à pointer ARTEMIS vers un point de terminaison de modèle et à mesurer. Qwen3.8-Flash figure dans notre catalogue au tarif publié de 0,15 $ / 0,47 $ avec les lectures de cache à 0,018 $ et les écritures de cache à 0,230 $, sur la même clé et la même facture que les autres tailles de Qwen3.8 et tout ce que nous routons — c'est là ce qui compte lorsque le workflow que vous chiffrez est un harnais effectuant une centaine d'appels par test plutôt qu'une personne qui n'en fait qu'un. La page du modèle contient aussi les chiffres opérationnels qu'il vous faut avant d'y engager une suite : un contexte de 1 M de tokens avec une sortie maximale de 131 K, un temps jusqu'au premier token p50 de 7,12 secondes et un p95 de 10,00, et environ 2,3 milliards de tokens de trafic qui l'ont traversé ces sept derniers jours. Ce dernier chiffre est le nôtre, et non celui d'un fournisseur, et il constitue un indicateur raisonnable pour savoir si d'autres personnes exécutent déjà de longues charges de travail d'agents sur ce point de terminaison.
Le détail d’infrastructure qui cesse d’être théorique à cette échelle, c’est ce qui se passe à l’étape 74. Une exécution Pro conserve son contexte sur un seul point de terminaison pendant la majeure partie d’une heure ; un incident chez un fournisseur en plein milieu ne dégrade pas l’exécution, il y met fin, et vous payez pour les 73 étapes qui n’ont pas produit de résultat. Router une longue session d’agent via une couche qui bascule vers un autre fournisseur du même modèle fait la différence entre une suite instable et une suite interrompue. C’est une propriété d’ingénierie banale, et c’est celle qui décide si votre coût mesuré par tâche terminée survit au contact d’une semaine d’exécutions réelles.

À quoi chacun sert réellement
Si vous avez une application Android et une suite de tests, vous voulez ARTEMIS, et Qwen3.8-Flash est un moteur candidat pour celui-ci plutôt qu'une alternative à celui-ci — non documenté, qui vaut l'expérience d'un après-midi, à un prix tel que l'expérience ne vous coûte rien de mesurable. Si vous choisissez un modèle pour un agent mobile que vous écrivez vous-même, le delta de +22,5 points sur AndroidWorld est une raison de s'intéresser à Qwen3.8-Flash et non une raison d'y croire, car il s'agit d'un delta rapporté par le fournisseur, sans score absolu associé et sans reproduction indépendante.
Ce dont les deux projets débattent à mots couverts est la même chose, et aucun ne le dit ouvertement. Google affirme que c’est le harness qui rend un agent mobile fiable, et le publie en open source pour que cette affirmation puisse être vérifiée. Alibaba affirme que le coût par tâche accomplie est le seul chiffre qui compte, et fixe ses prix en conséquence. Les deux ont probablement raison, et c’est pourquoi la configuration intéressante n’est ni ARTEMIS ni Qwen3.8 — c’est ARTEMIS sur Qwen3.8-Flash, mesurée sur votre propre application, avec la trace laissée activée.
Et comme ARTEMIS relit un contexte croissant à chaque étape, le ratio s'améliore encore, quel que soit le modèle dont la lecture du cache est la moins coûteuse.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
