
ARTEMIS vs Gemma 4 12B : un harnais et un cerveau ne sont pas le même achat
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
ARTEMIS et Gemma 4 12B de Google ne sont pas en concurrence, et la façon la plus rapide de perdre une semaine est de les mettre dans un tableau comparatif et de désigner un gagnant. ARTEMIS, publié en open source par Google en août 2026 sous Apache 2.0, est un harnais d’automatisation Android : il prend une phrase, pilote un vrai téléphone via ADB et rapporte ce qui s’est passé. Gemma 4 12B, publié par Google DeepMind le 3 juin 2026, est un modèle multimodal dense à 12 milliards de paramètres et à poids ouverts — un cerveau que l’on peut exécuter sur un ordinateur portable, pas un système capable de toucher un écran. L’un des deux ne peut ni voir, ni décider, ni agir sans que l’autre type d’élément lui soit attaché ; l’autre ne peut pas du tout tenir un appareil. Mais la comparaison vaut la peine d’être faite, car la question qui la sous-tend est celle que chaque équipe mobile se pose actuellement : un petit modèle ouvert que vous possédez entièrement peut-il faire de l’automatisation Android, ou avez-vous besoin d’un modèle frontière hébergé derrière un harnais comme ARTEMIS ? Cette question a une vraie réponse, et ce n’est pas celle que sous-entend l’article de lancement de l’un ou l’autre fournisseur.
Premièrement, l’erreur de catégorie, exprimée simplement.
ARTEMIS ne contient aucun modèle. Son propre badge indique « Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL », et le fichier qui détermine lequel vous utilisez est code>config/artemis.jsonc/code>. C'est une boucle de contrôle : un localisateur axé d'abord sur l'accessibilité, une vérification de sécurité qui élimine les pop-ups avant que votre appui n'aboutisse, un registre de session qui compresse les anciennes captures d'écran en résumés visuels, et deux profils d'exécution — Flash à environ 3 à 5 secondes par étape, Pro à environ 15 à 40 secondes par étape avec un Planner, un Operator et un Checker en lecture seule. Tout ce qu'il sait du monde lui parvient par l'intermédiaire d'un modèle vision-langage qu'il n'a pas écrit.
Gemma 4 12B est l’exact opposé comme type d’objet. C’est un checkpoint. Il n’a pas de connexion à un appareil, pas d’ADB, pas de service d’accessibilité, aucune notion qu’un tap soit une chose qui peut être exécutée. Donnez-lui une capture d’écran et demandez-lui quoi faire ensuite, et il vous répondra — peut-être même bien — mais cette réponse constitue toute l’étendue de son agentivité. Tout ce qui se trouve entre « le modèle a dit de taper à (540, 1180) » et « le téléphone a tapé à (540, 1180) » relève du travail d’ARTEMIS, et c’est l’essentiel du travail.
Ainsi, la présentation honnête de cette confrontation n’est pas ARTEMIS contre Gemma. C’est : qu’est-ce qu’un modèle ouvert de 12B vous apporte comme couche de raisonnement d’un agent Android, et quand devez-vous payer pour quelque chose de plus grand ?
Ce que Gemma 4 12B apporte réellement
Pour un modèle de taille moyenne, il est exceptionnellement bien spécifié, et trois de ses propriétés importent pour tout ce qui est mobile.
• Il est véritablement multimodal au niveau de la couche d’entrée. Du texte, des images, de l’audio et de la vidéo entrent ; du texte sort. C’est le premier Gemma de taille moyenne sans encodeurs multimodaux séparés, et le premier de la famille à ingérer nativement de l’audio — ce qui n’est pas une fonctionnalité d’automatisation de l’interface utilisateur, mais qui en est une véritable si vos scénarios de test impliquent des notes vocales, des notifications qui parlent ou des parcours d’accessibilité fondés sur des signaux audio.
• C'est un 12B que l'on peut tenir dans la main. Artificial Analysis le classe à 12B de paramètres totaux sous Apache 2.0 — sans seuil de revenus, sans clause de recherche, une licence sur laquelle bâtir un produit sans demander l'autorisation à qui que ce soit — avec une fenêtre de contexte de 256K, le raisonnement activé, et une vitesse de sortie mesurée de 109,2 jetons par seconde. Des retours de la communauté situent les poids à environ 13,4 Go en SFP8 et à environ 6,7 Go en Q4_0, soit un ordinateur portable doté de 16 Go de mémoire.
• Il est bon marché, mais ce n’est pas l’option la moins chère de sa catégorie. Artificial Analysis le répertorie à 0,10 $ par million de tokens d’entrée et 0,30 $ par million de tokens de sortie — et indique dans le même panneau que c’est plutôt cher pour un modèle à poids ouverts de taille similaire, où la médiane se situe à 0,05 $ en entrée et 0,15 $ en sortie. Les lectures de cache avoisinent 0,03 $.
Le tableau des benchmarks est le fouillis habituel des modèles de taille moyenne, et il vaut la peine de le présenter avec prudence, car les chiffres des sites de suivi ne concordent pas entre eux. Artificial Analysis attribue à la configuration de raisonnement un indice d’intelligence de 14, la classant 21e sur les 142 modèles à poids ouverts de sa catégorie — une position respectable en milieu de tableau, très loin de la frontière. Selon le positionnement de Google lui-même, le 12B rivalise presque avec le plus grand Gemma 4 26B-A4B et dépasse le Gemma 3 27B de la génération précédente sur les tâches de raisonnement, de science et de documents. Les agrégateurs tiers le situent à environ 72 % sur LiveCodeBench v6 et à 77,2 % sur MMLU-Pro, avec GPQA Diamond allant de 66 % à 79 % selon le tracker et la configuration consultés. Ce sont des chiffres respectables pour un 12B. Ce sont aussi des agrégats auto-déclarés et non audités, et lorsque quatre sites divergent de treize points, il faut retenir la fourchette plutôt que le point précis.

Ce qu'ARTEMIS apporte, en un paragraphe, car ce n'est pas le sujet ici.
ARTEMIS apporte tout ce que le modèle ne peut pas : un localisateur « dynamic-first » qui utilise les indices d'éléments d'accessibilité lorsqu'ils existent et se rabat sur la vision et les coordonnées lorsqu'ils n'existent pas, ce qui signifie aucun XPath à maintenir et aucun ID qui se périme sur une surface Compose ou Flutter. Il apporte un filet de sécurité qui intercepte la popup système sur laquelle votre tap allait atterrir, une vérification par points de contrôle à quatre niveaux, de code>off/code> à code>strict/code>, des piles de crash automatiques, des captures d'écran d'images clés et des rapports de diagnostic, une console web, un SDK Python pour pytest et la CI, et — la raison pour laquelle il s'est répandu aussi vite — un serveur MCP natif qui expose tout cela à Antigravity, Claude Code, Codex et tout autre assistant compatible MCP sous la forme de cinq outils. Son taux d'achèvement annoncé de plus de 99 % sur le benchmark AndroidWorld de Google Research le place à 99,1 % dans le classement public au 11 septembre 2026, contre 80 % pour la performance humaine. Ce chiffre est auto-déclaré et le classement ne vérifie pas les soumissions ; considérez-le donc comme une affirmation forte du fournisseur plutôt que comme un audit.
Le seul endroit où les deux se chevauchent véritablement
Il existe une architecture réelle dans laquelle un petit Gemma fait tout le travail, et elle vaut la peine d'être examinée parce qu'elle montre ce pour quoi on paie réellement le modèle cloud. Un framework d'agent Android open source appelé Orion s'exécute entièrement sur l'appareil : MediaProjection capture l'écran, un modèle quantifié Gemma-4-E4B-it fonctionnant sur le NPU Qualcomm Hexagon via LiteRT-LM choisit l'action suivante, et le service d'accessibilité Android transmet les appuis. Pas d'API cloud, pas de facture par token, et l'écran ne quitte jamais le téléphone. Il est validé sur un Galaxy S25 Ultra et, selon sa propre description, n'a de sens que sur du matériel doté d'un NPU Hexagon — le modèle nécessite environ 3 Go de stockage et le framework cible QNN HTP v79 sur arm64.
Voilà à quoi ressemble aujourd’hui un agent Android à petit modèle qui fonctionne, et notez ce que cela coûte pour en arriver là. Le modèle est quantifié et mappé sur NPU. L’espace d’action est en pixels, car un modèle qui ne voit que des captures d’écran ne peut pas interpréter « indice d’élément 12 ». L’ensemble de la conception est une pile verticale — modèle, environnement d’exécution, silicium, framework —, c’est pourquoi il s’agit d’un framework et non d’une solution clé en main pour votre suite de tests. Gemma 4 12B compte environ trois fois le nombre de paramètres de l’E4B de cette pile et n’est pas distribué dans un format exécutable sur téléphone ; un modèle 12B en quantification 4 bits, c’est un poste de travail ou un point de terminaison servi, et non un modèle résident sur un NPU.

Là où chacun gagne réellement
• Coût à l'échelle — un Gemma 4 12B auto-hébergé n'a aucun prix par token, contre un appel de vision par étape pour chaque étape d'une exécution ARTEMIS. Sur une suite de régression de 500 tests exécutée chaque nuit, cette différence se creuse plus vite que n'importe quel écart de benchmark.
• Confidentialité — Gemma 4 12B sur votre propre matériel n'envoie jamais de capture d'écran où que ce soit ; l'assistant d'accessibilité d'ARTEMIS est explicitement en local et n'envoie rien, mais l'appel au modèle qu'il effectue à chaque capture d'écran est transmis au fournisseur que vous avez configuré.
• Fiabilité des tâches sur une application réelle — ARTEMIS, et de loin, parce qu'il s'agit d'un harnais doté d'un filet de sécurité, d'une vérification par points de contrôle et d'une reprise. Aucun modèle plus performant ne saurait remplacer cela.
• Audio et documents longs — Gemma 4 12B, avec une entrée audio native sur la fiche technique et une fenêtre de contexte de 256K tokens. ARTEMIS n'a d'avis sur aucun des deux.
• Temps jusqu'au premier test réussi — ARTEMIS, avec une avance énorme. Clonez, code>./start.sh/code>, connectez un appareil avec le débogage USB, attendez que la première tâche installe l'assistant d'accessibilité. Construire l'équivalent avec un checkpoint brut est un projet de plusieurs mois, et l'exemple Orion ci-dessus montre à quoi ressemble ce projet une fois terminé.
• Liberté de modifier la couche de raisonnement — Gemma 4 12B, dont les poids Apache 2.0 peuvent être affinés sur votre propre vocabulaire d'interface utilisateur. ARTEMIS est un code Apache 2.0, mais le raisonnement se trouve là où vit votre modèle.
Les versions de cet appairage qui sont réellement disponibles aujourd'hui
Soyez clair sur ce que vous pouvez déployer cette semaine. La liste des backends testés d’ARTEMIS comprend Gemini, Claude, GPT-4o et Qwen-VL — Gemma 4 12B n’y figure pas, et il n’existe aucune évaluation publiée de Gemma 4 12B pilotant une session ARTEMIS. Le fichier de configuration accepte un point de terminaison de modèle, donc l’association est plausible plutôt que prouvée, et si vous l’essayez, vous faites un travail original plutôt que de suivre une documentation. Autant le dire sans détour : la feuille de route d’ARTEMIS comporte un élément « VLM légers embarqués », et le modèle qui l’occupera ne sera pas un 12B.
Gemma 4 12B ne figure pas non plus dans notre catalogue — nous routons les autres tailles de Gemma 4, Gemma 4 26B-A4B et Gemma 4 31B, et non le 12B, donc si c’est le checkpoint que vous voulez, vous l’obtenez auprès de la distribution propre du fournisseur et des hébergeurs tiers habituels. Ce à quoi sert un catalogue routé, c’est l’autre moitié de ce problème : si votre plan est ARTEMIS sur un modèle de vision hébergé, ce modèle est un poste de coût qui évolue avec chaque étape de chaque exécution, et le levier utile n’est pas le prix affiché mais le prix du cache. Une exécution Pro relit un contexte qui s’allonge à chaque étape, donc un modèle avec une lecture de cache bon marché change l’arithmétique bien plus qu’un modèle avec une entrée fraîche bon marché. C’est aussi pourquoi le basculement de fournisseur doit figurer dans la configuration plutôt que dans votre journal d’incidents — une longue session Android conserve son contexte sur un seul point de terminaison, et un hoquet du fournisseur à l’étape 74 vous coûte l’exécution.

Quel est votre prochain coup ?
Si vous avez une application mobile et une suite de tests de régression, vous voulez ARTEMIS, et Gemma 4 12B ne peut remplacer aucune de ses parties — au mieux, c’est le moteur non documenté que vous pourriez intégrer plus tard, sur votre temps libre. Si vous construisez un produit qui doit tourner sur un téléphone sans réseau et sans coût par appel, vous voulez un petit modèle, et Gemma 4 12B est probablement trop grand pour le facteur de forme dont vous disposez réellement ; regardez ce qu’Orion a fait avec un Gemma de classe 4B sur un NPU avant de supposer qu’un 12B conviendra.
Les deux décisions ne se heurtent qu’en un seul endroit, et il s’agit d’une question de coût plutôt que de capacité : combien d’appels de vision par jour êtes-vous prêt à acheter ? Répondez honnêtement — comptez vos tests, comptez vos étapes, comptez vos exécutions nocturnes — et le choix entre un harnais sur un modèle hébergé et une pile auto-hébergée se fait de lui-même.
À quoi sert un catalogue routé, voilà l'autre moitié de ce problème : si votre plan est ARTEMIS sur un modèle de vision hébergé, ce modèle est un poste de coût qui évolue à chaque étape de chaque exécution
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
