Una tarjeta de título generada para 'ARTEMIS vs Gemma 4 12B' con el subtítulo 'Un arnés y un cerebro no son la misma compra', con dos tarjetas que contrastan ARTEMIS como un arnés de automatización de Android sin modelo propio frente a Gemma 4 12B como un checkpoint multimodal denso de 12B sin forma de actuar.
Guides & Insights

ARTEMIS vs Gemma 4 12B: un arnés y un cerebro no son la misma compra

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

ARTEMIS y Gemma 4 12B de Google no compiten, y la forma más rápida de desperdiciar una semana es ponerlos en una tabla comparativa y elegir un ganador. ARTEMIS, publicado como código abierto por Google en agosto de 2026 bajo Apache 2.0, es un arnés de automatización de Android: toma una frase, controla un teléfono real mediante ADB e informa lo que ocurrió. Gemma 4 12B, lanzado por Google DeepMind el 3 de junio de 2026, es un modelo multimodal denso de pesos abiertos y 12 mil millones de parámetros: un cerebro que puedes ejecutar en un portátil, no un sistema que pueda tocar una pantalla. Uno de ellos no puede ver, decidir ni actuar sin que se le conecte el otro tipo de componente; el otro no puede sostener un dispositivo en absoluto. Pero vale la pena hacer la comparación, porque la pregunta que subyace es la que todo equipo móvil se hace actualmente: ¿puede un modelo abierto pequeño que posees por completo hacer automatización de Android, o necesitas un modelo frontera alojado detrás de un arnés como ARTEMIS? Esa pregunta tiene una respuesta real, y no es la que insinúa la publicación de lanzamiento de ninguno de los dos proveedores.

Primero, el error de categoría, expresado sin rodeos.

ARTEMIS no contiene ningún modelo. Su propia insignia dice «Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL», y el archivo que decide cuál usas es code>config/artemis.jsonc/code>. Es un bucle de control: un localizador centrado en la accesibilidad, una verificación de seguridad que despeja las ventanas emergentes antes de que tu toque se registre, un registro de sesión que comprime las capturas de pantalla antiguas en resúmenes visuales, y dos perfiles de ejecución — Flash a unos 3–5 segundos por paso, Pro a unos 15–40 segundos por paso con un Planner, un Operator y un Checker de solo lectura. Todo lo que sabe sobre el mundo llega a través de un modelo de visión y lenguaje que no escribió.

Gemma 4 12B es el tipo opuesto de objeto. Es un checkpoint. No tiene conexión con dispositivos, ni ADB, ni servicio de accesibilidad, ni noción de que un toque sea algo que pueda ejecutarse. Dale una captura de pantalla y pregúntale qué hacer a continuación, y te responderá —posiblemente bien—, pero responder constituye todo el alcance de su capacidad de acción. Todo lo que hay entre «el modelo dijo toca en (540, 1180)» y «el teléfono tocó en (540, 1180)» es trabajo de ARTEMIS, y es la mayor parte del trabajo.

Así que el planteamiento honesto de este enfrentamiento no es ARTEMIS contra Gemma. Es: ¿qué te aporta un modelo abierto de 12B como capa de razonamiento de un agente de Android, y cuándo necesitas pagar por algo más grande?

Lo que Gemma 4 12B realmente aporta

Para un modelo de tamaño medio, está inusualmente bien especificado, y tres de sus propiedades son importantes para cualquier cosa móvil.

Es genuinamente multimodal en la capa de entrada. Texto, imagen, audio y vídeo entran; sale texto. Es el primer Gemma de tamaño medio sin codificadores multimodales separados, y el primero de la familia en ingerir audio de forma nativa, lo cual no es una función de automatización de la interfaz de usuario, pero sí es una función real si tus escenarios de prueba involucran notas de voz, notificaciones que hablan o rutas de accesibilidad basadas en señales de audio.

Es un 12B que puedes tener en tus manos.Artificial Analysis lo lista con 12B de parámetros totales bajo Apache 2.0 —sin barrera de ingresos, sin cláusula de investigación, una licencia sobre la que puedes construir un producto sin preguntarle a nadie—, con una ventana de contexto de 256K, razonamiento habilitado y una velocidad de salida medida de 109,2 tokens por segundo. Los informes de la comunidad sitúan los pesos en aproximadamente 13,4 GB en SFP8 y unos 6,7 GB en Q4_0, lo que corresponde a un portátil con 16 GB de memoria.

Es barato, pero no es lo más barato de su clase.Artificial Analysis lo sitúa en 0,10 $ por millón de tokens de entrada y 0,30 $ por millón de salida, y señala en el mismo panel que esto está en el lado caro para un modelo de pesos abiertos de tamaño similar, donde la mediana se sitúa en 0,05 $ de entrada y 0,15 $ de salida. Las lecturas de caché rondan los 0,03 $.

El panorama de los benchmarks es el habitual embrollo de los modelos de tamaño medio y merece la pena formularlo con cuidado, porque las cifras de los sitios de seguimiento no coinciden entre sí. Artificial Analysis puntúa la configuración de razonamiento con un Índice de Inteligencia de 14, lo que la sitúa en el puesto 21 de los 142 modelos de pesos abiertos de su clase — una posición respetable en mitad de la tabla y muy lejos de la frontera. El posicionamiento del propio Google es que el 12B casi iguala al Gemma 4 26B-A4B, de mayor tamaño, y supera al Gemma 3 27B de la generación anterior en tareas de razonamiento, ciencia y documentos. Los agregadores de terceros lo sitúan en torno al 72 % en LiveCodeBench v6 y al 77,2 % en MMLU-Pro, con GPQA Diamond entre el 66 % y el 79 %, según el tracker y la configuración que se consulte. Son cifras respetables para un 12B. También son agregados autodeclarados y no auditados, y cuando cuatro sitios discrepan en trece puntos, conviene quedarse con el intervalo en lugar del dato puntual.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a measured speed of 109.2 output tokens per second, $0.10 per million input tokens and $0.30 per million output, a 256k-token context window, 12B total parameters, an Apache 2.0 licence and reasoning enabled.

Lo que aporta ARTEMIS, en un solo párrafo, porque aquí no es el tema

ARTEMIS aporta todo lo que el modelo no puede: un localizador que prioriza lo dinámico y que usa índices de elementos de accesibilidad cuando existen y recurre a la visión y a las coordenadas cuando no, lo que significa que no hay XPath que mantener ni IDs que queden obsoletos en una superficie de Compose o Flutter. Aporta una Safety Net que intercepta el popup del sistema en el que estaba a punto de aterrizar tu toque, verificación con checkpoints de cuatro niveles desde code>off/code> hasta code>strict/code>, pilas de fallos automáticas, capturas de pantalla de fotogramas clave e informes de diagnóstico, una consola web, un SDK de Python para pytest y CI y —la razón por la que se extendió tan rápido— un servidor MCP nativo que expone todo el conjunto a Antigravity, Claude Code, Codex y cualquier otro asistente compatible con MCP como cinco herramientas. Su tasa de finalización declarada del 99 %+ en el benchmark AndroidWorld de Google Research lo sitúa en el 99,1 % en la tabla de clasificación pública a 11 de septiembre de 2026, frente al 80 % del rendimiento humano. Esa cifra es autodeclarada y la tabla de clasificación no verifica los envíos, así que trátala como una afirmación sólida del proveedor y no como una auditoría.

El único lugar donde los dos realmente se superponen

Existe una arquitectura real en la que un Gemma pequeño hace todo el trabajo, y vale la pena echarle un vistazo porque muestra qué se está pagando en realidad con el modelo en la nube. Un framework de agentes para Android de código abierto llamado Orion se ejecuta por completo en el dispositivo: MediaProjection captura la pantalla, un Gemma-4-E4B-it cuantizado que se ejecuta en la NPU Hexagon de Qualcomm mediante LiteRT-LM elige la siguiente acción, y el Servicio de Accesibilidad de Android envía los toques. Sin API en la nube, sin factura por token, y la pantalla nunca sale del teléfono. Está validado en un Galaxy S25 Ultra y, según su propia descripción, solo tiene sentido en hardware con una NPU Hexagon — el modelo necesita unos 3 GB de almacenamiento y el framework está orientado a QNN HTP v79 en arm64.

Esa es la forma de un agente Android de modelo pequeño que funciona hoy, y fíjate en lo que cuesta llegar hasta ahí. El modelo está cuantizado y mapeado a la NPU. El espacio de acciones son los píxeles, porque un modelo que solo trabaja con capturas de pantalla no puede interpretar «índice de elemento 12». Todo el diseño es una pila vertical —modelo, runtime, silicio, framework—, por eso es un framework y no algo que se pueda integrar directamente en tu suite de pruebas. Gemma 4 12B tiene aproximadamente el triple de parámetros que el E4B de esa pila y no se distribuye en un formato ejecutable en un teléfono; un 12B con cuantización de cuatro bits es una estación de trabajo o un endpoint servido, no algo residente en una NPU.

A generated diagram of a four-layer Android agent stack - assistant (Antigravity, Claude Code, Codex) on top, then the ARTEMIS harness with locator, Safety Net, checkpoints and traces, then the vision-language reasoning layer, then the Android device via ADB - with a callout beside the reasoning layer noting that Gemma 4 12B could sit there but is untested with ARTEMIS.

Dónde gana realmente cada uno

Costo a escala — un Gemma 4 12B autoalojado no tiene ningún precio por token, en comparación con una llamada de visión por paso para cada paso de una ejecución de ARTEMIS. En una suite de regresión de 500 pruebas ejecutada cada noche, esa diferencia se acumula más rápido que cualquier brecha de benchmark.

Privacidad — Gemma 4 12B en tu propio hardware nunca envía una captura de pantalla a ningún sitio; el asistente de accesibilidad de ARTEMIS es explícitamente local y no envía nada, pero la llamada al modelo que realiza con cada captura de pantalla va al proveedor que hayas configurado.

Fiabilidad de tareas en una app real — ARTEMIS, por un amplio margen, porque es un arnés con red de seguridad, verificación de puntos de control y recuperación. Ningún modelo mejor sustituye eso.

Audio y documentos largos — Gemma 4 12B, con entrada de audio nativa en la ficha de especificaciones técnicas y una ventana de contexto de 256K tokens. ARTEMIS no tiene opinión sobre ninguna de las dos cosas.

Tiempo hasta la primera prueba superada — ARTEMIS, por un margen enorme. Clona, code>./start.sh/code>, conecta un dispositivo con depuración USB, espera a que la primera tarea instale el asistente de accesibilidad. Construir el equivalente con un checkpoint básico es un proyecto de varios meses, y el ejemplo de Orion de arriba es cómo se ve ese proyecto cuando está terminado.

Libertad para modificar la capa de razonamiento — Gemma 4 12B, cuyos pesos son Apache 2.0 y puedes ajustar con el vocabulario de tu propia interfaz. ARTEMIS es código Apache 2.0, pero el razonamiento reside donde viva tu modelo.

Las versiones de este emparejamiento que realmente están disponibles hoy

Ten claro qué puedes desplegar esta semana. La lista de backends probados de ARTEMIS es Gemini, Claude, GPT-4o y Qwen-VL; Gemma 4 12B no aparece en ella, y no hay ninguna evaluación publicada de Gemma 4 12B ejecutando una sesión de ARTEMIS. El archivo de configuración acepta un endpoint de modelo, así que el emparejamiento es plausible en lugar de estar probado, y si lo intentas, estarás haciendo trabajo original en lugar de seguir la documentación. Vale la pena decirlo claramente: la hoja de ruta de ARTEMIS tiene un elemento de "VLM ligeros en el dispositivo", y el modelo que cubra ese punto no será un 12B.

Gemma 4 12B tampoco está en nuestro catálogo — enrutamos los otros tamaños de Gemma 4, Gemma 4 26B-A4B y Gemma 4 31B, y no el 12B, así que si ese es el checkpoint que quieres, lo estás obteniendo de la distribución propia del proveedor y de los hosts de terceros habituales. La finalidad de un catálogo enrutado es la otra mitad de este problema: si tu plan es ARTEMIS sobre un modelo de visión alojado, ese modelo es una partida de costo que escala con cada paso de cada ejecución, y la palanca útil no es el precio de etiqueta sino el precio de caché. Una ejecución Pro vuelve a leer un contexto creciente en cada paso, así que un modelo con una lectura de caché barata cambia la aritmética mucho más que un modelo con una entrada nueva barata. Por eso también la conmutación por error del proveedor debe ir en la configuración y no en tu registro de incidentes: una sesión larga de Android mantiene su contexto en un solo endpoint, y un contratiempo del proveedor en el paso 74 te cuesta la ejecución.

A generated scoreboard comparing ARTEMIS and Gemma 4 12B across six dimensions: category (harness vs open-weights VLM checkpoint), ability to drive a phone (yes via ADB vs no), parameter count (not a model vs 12B dense, about 6.7GB at Q4), price (per-step model call vs $0.10 in / $0.30 out per 1M), AndroidWorld (99.1% self-reported vs not published) and licence (Apache 2.0 for both).

¿Cuál es tu siguiente movimiento?

Si tienes una aplicación móvil y una suite de regresión, quieres ARTEMIS, y Gemma 4 12B no sustituye ninguna parte de ARTEMIS; en el mejor de los casos, es el motor que podrías integrar más adelante, sin documentación y por tu cuenta. Si estás creando un producto que debe ejecutarse en un teléfono móvil sin red y sin costo por llamada, quieres un modelo pequeño, y Gemma 4 12B probablemente sea demasiado grande para el factor de forma que realmente tienes; mira lo que hizo Orion con un Gemma de clase 4B en una NPU antes de asumir que un 12B cabrá.

Las dos decisiones solo chocan en un punto, y es una cuestión de costo, no de capacidad: ¿cuántas llamadas de visión al día estás dispuesto a comprar? Responde eso con sinceridad —cuenta tus pruebas, cuenta tus pasos, cuenta tus ejecuciones nocturnas— y la elección entre un arnés sobre un modelo alojado y una pila autoalojada se hace sola.

El propósito de un catálogo enrutado es la otra mitad de este problema: si tu plan es ARTEMIS sobre un modelo de visión alojado, ese modelo es una partida que escala con cada paso de cada ejecución

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario