
ARTEMIS vs Qwen3.8: el mismo benchmark, dos trabajos diferentes
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
El ARTEMIS de Google y el Qwen3.8 se miden ambos en AndroidWorld, y esa coincidencia es el hecho más engañoso de cuantos aparecen en la cobertura del lanzamiento de cualquiera de los dos proyectos. ARTEMIS es un harness de automatización para Android —Google lo publicó como código abierto en agosto de 2026 bajo Apache 2.0—: recibe una instrucción en lenguaje natural, controla un teléfono real a través de ADB y afirma una tasa de finalización superior al 99% en el benchmark AndroidWorld de 116 tareas de Google Research, con un 99,1% en la tabla de clasificación pública a 11 de septiembre de 2026. Qwen3.8-Flash es el modelo multimodal de mezcla de expertos de Alibaba, publicado y liberado como código abierto el 26 de agosto de 2026, cuyo material de lanzamiento afirma que supera a Claude Opus 4.6 por 22,5 puntos en AndroidWorld. Una de esas cifras es la puntuación de un sistema. La otra es la contribución de un modelo a un sistema que escribió otra persona. Si los lees como rivales, sacarás una conclusión equivocada sobre ambos; si los lees como las dos mitades de un mismo stack, la pregunta interesante —cuánto cuesta realmente una ejecución larga en Android— por fin tiene respuesta.
Qué es Qwen3.8, según el tamaño
«Qwen3.8» es una familia, no un checkpoint, y el miembro que importa aquí no es el insignia.
• Qwen3.8-Max — el nivel insignia, posicionado frente a modelos alojados de vanguardia.
• Qwen3.8-27B — el hermano abierto de tamaño medio y denso.
• Qwen3.8-Flash — un MoE multimodal sobre una nueva arquitectura "Next": 125B parámetros transformer con solo 6B activados por token, Qwen Sparse Attention fusionada con GDN en un esquema de atención híbrida para acelerar el contexto largo cuando la caché acierta, un Gated Residual que divide el canal de información en cuatro vías, y 51B parámetros de embeddings de N-gramas. Alibaba describe la arquitectura Next como el prototipo para la próxima generación Qwen4.
• Contexto — de gran tamaño nativo, con la mayoría de las especificaciones en 1M de tokens y algunas fuentes que describen 262K nativos ampliados a 1M. La salida máxima es de alrededor de 131K.
• Precio — la tarifa de API publicada es de ¥1 por millón de tokens de entrada y ¥3 por millón de salida, lo que se traduce en $0,15 / $0,47 en nuestro catálogo, con lecturas de caché a $0,018 y escrituras de caché a $0,230. El propio planteamiento de Alibaba es que un precio de acierto de caché de tan solo ¥0,1 por millón es lo que hace viables los flujos de trabajo de agentes con entradas largas, y los números lo respaldan: una lectura de caché cuesta aproximadamente una doceava parte de un token de entrada nuevo.
• La cuestión de los pesos abiertos — los pesos de Flash se publicaron en Hugging Face y ModelScope el día del lanzamiento. Observa cómo se cuenta la familia: Alibaba dice que la serie Qwen3.8 ha publicado como código abierto tres tamaños —Max, 27B y Flash— para un total de 2,4 billones de parámetros, que es una cifra acumulada de toda la serie y no la cantidad de parámetros de un solo modelo.
Las afirmaciones sobre los benchmarks son amplias y, según el propio material de lanzamiento de Alibaba, todos son deltas en lugar de valores absolutos: SWE-bench Pro +9,1 sobre Opus 4.6, JobBench alrededor de +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Los deltas frente a una configuración sin nombre de un modelo competidor no son la misma categoría de evidencia que una entrada en una tabla de clasificación, y ninguno de estos ha sido reproducido de forma independiente. El encuadre principal de la empresa —una redefinición de la "línea de corte" de costos de la industria, de precio por token a costo total por tarea completada— es la afirmación que realmente importa para esta comparación, y también es la que puedes probar tú mismo.

Qué aporta ARTEMIS y por qué las dos cifras no son comparables
ARTEMIS no contiene ningún modelo. Su insignia dice «Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL» y su configuración reside en code>config/artemis.jsonc/code>. Lo que aporta es la parte que convierte la conjetura de un modelo en una acción verificada: un localizador que prioriza lo dinámico, que lee el árbol de accesibilidad cuando puede y recurre a la visión y a las coordenadas cuando una superficie de Compose o Flutter no le ofrece nada, una Red de Seguridad que elimina los popups del sistema que interfieren antes de que se efectúe el toque, verificación de puntos de control en cuatro niveles, desde code>off/code> hasta code>strict/code>, y un registro de sesión que comprime las capturas de pantalla antiguas en resúmenes visuales para que un contexto de cien pasos siga siendo asequible.
También incluye un servidor MCP nativo. code>uv run artemis mcp --install all/code> expone code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> y code>mobile_diagnose/code> a Antigravity, Claude Code, Codex y cualquier otra cosa que hable MCP — que es lo que hizo que el proyecto se difundiera tan rápido, y que es la declaración más clara de para qué sirve. ARTEMIS es una herramienta que un agente llama. Un modelo también lo es, por lo que ponerlos en la misma columna es un error de categoría.
Lo único con lo que hay que tener cuidado al leer el 99,1 % de ARTEMIS: la tabla de clasificación de AndroidWorld no verifica de forma independiente los envíos, y lo dice explícitamente. Todas las cifras que aparecen en ella, incluida la de ARTEMIS, son autoinformadas por el equipo que las produjo. La misma advertencia se aplica con aún más razón a un delta citado en una publicación de lanzamiento.
Leer «vs» de dos maneras
Hay dos lecturas honestas de este enfrentamiento y apuntan en direcciones opuestas.
Como rivales, la comparación es en realidad: «¿debería usar un modelo alojado más un arnés, o debería usar un modelo que sea lo suficientemente bueno en tareas móviles como para poder escribir yo mismo el arnés?». Según esa lectura, ARTEMIS gana por defecto, porque un modelo no es un arnés — y la diferencia de +22,5 puntos en AndroidWorld no te dice si Qwen3.8-Flash puede sobrevivir al paso 74 de una ejecución de cien pasos cuando una ventana emergente del sistema se come su toque. Nada en una tabla de benchmarks mide la Red de Seguridad.
Como stack, la comparación es la útil: ARTEMIS es el bucle de control, Qwen3.8-Flash es un motor plausible para él, y la cuestión pasa a ser el coste y la fiabilidad en contextos largos. Todo el argumento de venta de Alibaba para el nivel Flash —que el número importante es el coste total por tarea completada en lugar del precio por token— es precisamente la métrica según la cual se puntúa una suite de automatización de Android, y es una métrica que puedes medir en tu propio conjunto de pruebas en un día.
El detalle incómodo que se interpone: Qwen3.8-Flash no está en la lista de backends probados de ARTEMIS, que incluye a Gemini, Claude, GPT-4o y Qwen-VL. Qwen-VL es un modelo diferente. El arnés acepta un endpoint de modelo y el emparejamiento es técnicamente plausible, pero nadie ha publicado una evaluación de él, y si lo ejecutas, estás haciendo trabajo original en lugar de seguir la documentación.
La aritmética que lo decide
Este es el cálculo que conviene hacer antes de que cualquiera de las dos publicaciones de lanzamiento te convenza de algo. Es un modelo con supuestos declarados, no una medición, y deberías sustituir tus propias cifras, pero su forma es lo importante.
Realiza una ejecución Pro de 100 pasos. Pro se ejecuta a aproximadamente 15–40 segundos por paso, así que el tiempo real está en algún punto entre 25 minutos y una hora, y cada paso envía una captura de pantalla más un prompt que va creciendo. Supón 8,000 tokens de prompt y 300 tokens de salida por paso — un presupuesto conservador de capturas de pantalla e instrucciones, muy por debajo de lo que cuesta un fotograma sin procesar a resolución completa. Eso es 800,000 tokens de entrada y 30,000 tokens de salida para una prueba.
• Con los $0.15 / $0.47 de Qwen3.8-Flash, esa ejecución cuesta alrededor de $0.12 en entrada y $0.014 en salida — aproximadamente trece centavos.
• Con una tarifa de un modelo de frontera alojado de un dígito bajo por millón de entrada y de quince y tantos por millón de salida, la misma ejecución termina costando dólares, no centavos. Las dos tarifas se mencionan aquí de forma vaga a propósito, porque la cifra exacta depende de qué modelo de frontera elijas, y lo que importa es la proporción: es un orden de magnitud, en cada prueba, en cada ejecución.
• Y como ARTEMIS vuelve a leer un contexto cada vez mayor en cada paso, la proporción mejora aún más para el modelo que tenga la lectura de caché más barata. La lectura de caché de Qwen3.8-Flash es de $0.018 por millón frente a $0.15 de entrada nueva —una duodécima parte del precio, y la razón por la que Alibaba sigue señalando las tasas de aciertos de caché cuando habla de cargas de trabajo de agentes.
Ahora multiplica eso por tu suite. Una regresión de 500 pruebas ejecutada cada noche son 400 millones de tokens de entrada por noche, y la diferencia entre trece centavos y tres dólares por prueba es la diferencia entre un arnés que puedes permitirte ejecutar de forma continua y uno que programas semanalmente.

Ejecutarlo, y dónde importa la plomería
Si quieres probar esa aritmética en tu propia aplicación, la vía honesta es apuntar ARTEMIS a un endpoint de modelo y medir. Qwen3.8-Flash está en nuestro catálogo al precio publicado de $0.15 / $0.47 con lecturas de caché a $0.018 y escrituras de caché a $0.230, con la misma clave y la misma factura que los demás tamaños de Qwen3.8 y todo lo demás que enrutamos — que es la parte que importa cuando el flujo de trabajo que estás presupuestando es un harness que hace cien llamadas por prueba en lugar de una persona haciendo una sola. La página del modelo también incluye los números operativos que quieres conocer antes de comprometer una suite con él: un contexto de 1M de tokens con 131K de salida máxima, un p50 de tiempo hasta el primer token de 7.12 segundos y un p95 de 10.00, y aproximadamente 2.3 mil millones de tokens de tráfico a través de él en los últimos siete días. Esa última cifra es nuestra y no de un proveedor, y es un proxy razonable para saber si otras personas ya están ejecutando cargas de trabajo de agentes largas en este endpoint.
El detalle de fontanería que deja de ser teórico a esta escala es lo que ocurre en el paso 74. Una ejecución Pro mantiene su contexto en un único endpoint durante la mayor parte de una hora; un incidente de proveedor en medio de ella no degrada la ejecución, la termina, y pagas por los 73 pasos que no produjeron un resultado. Enrutar una sesión larga de agente a través de una capa que conmuta por error a otro proveedor del mismo modelo es la diferencia entre una suite inestable y una interrumpida. Esa es una propiedad de ingeniería mundana, y es la que decide si tu coste medido por tarea completada sobrevive al contacto con una semana de ejecuciones reales.

Para qué sirve realmente cada uno
Si tienes una app de Android y una suite de pruebas, lo que quieres es ARTEMIS, y Qwen3.8-Flash es un motor candidato para ella más que una alternativa a ella —uno no documentado, que bien merece el experimento de una tarde, a un precio tal que el experimento no te cuesta nada medible. Si estás eligiendo un modelo para un agente móvil que estás escribiendo tú mismo, el delta de +22.5 puntos en AndroidWorld es una razón para fijarte en Qwen3.8-Flash, no una razón para creer en él, porque es un delta reportado por el proveedor, sin puntuación absoluta adjunta y sin reproducción independiente.
Aquello sobre lo que ambos proyectos discuten en silencio es lo mismo, y ninguno lo dice sin rodeos. Google sostiene que el arnés es lo que hace que un agente móvil sea fiable, y lo publica como código abierto para que se pueda comprobar esa afirmación. Alibaba sostiene que el coste por tarea completada es el único número que importa, y fija sus precios en consecuencia. Probablemente ambos tengan razón, por eso la configuración interesante no es ARTEMIS ni Qwen3.8 — es ARTEMIS sobre Qwen3.8-Flash, medida en tu propia app, con la traza activada.
Y como ARTEMIS vuelve a leer un contexto que no deja de crecer en cada paso, la proporción mejora aún más para el modelo que tenga la lectura de caché más barata.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
