
ARTEMIS vs Qwen3.8: o mesmo benchmark, dois trabalhos diferentes
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O ARTEMIS do Google e o Qwen3.8 são ambos medidos no AndroidWorld, e essa coincidência é o fato mais enganoso na cobertura de lançamento de qualquer um dos dois projetos. O ARTEMIS é um arnês de automação para Android — disponibilizado como código aberto pelo Google em agosto de 2026 sob a licença Apache 2.0, ele recebe uma instrução em linguagem natural, controla um aparelho real via ADB e alega uma taxa de conclusão superior a 99% no benchmark AndroidWorld de 116 tarefas do Google Research, exibindo 99,1% no ranking público em 11 de setembro de 2026. O Qwen3.8-Flash é o modelo multimodal de mistura de especialistas da Alibaba, lançado e disponibilizado como código aberto em 26 de agosto de 2026, cujo material de lançamento alega que ele supera o Claude Opus 4.6 em 22,5 pontos no AndroidWorld. Um desses números é a pontuação de um sistema. O outro é a contribuição de um modelo para um sistema que outra pessoa escreveu. Leia-os como rivais e você concluirá a coisa errada sobre ambos; leia-os como duas metades de uma mesma pilha e a pergunta interessante — quanto custa de fato uma execução longa no Android — finalmente tem resposta.
O que é o Qwen3.8, por tamanho
"Qwen3.8" é uma família, não um checkpoint, e o integrante que importa aqui não é o carro-chefe.
• Qwen3.8-Max — o nível principal, posicionado frente aos modelos hospedados de fronteira.
• Qwen3.8-27B — o irmão denso de porte médio e aberto.
• Qwen3.8-Flash — um MoE multimodal numa nova arquitetura "Next": 125B de parâmetros de transformer, com apenas 6B ativados por token, Qwen Sparse Attention fundida com GDN num esquema de atenção híbrido para ganhos de velocidade em contextos longos quando há acerto de cache, um Gated Residual que divide o canal de informação em quatro vias, e 51B de parâmetros de embeddings de N-gramas. A Alibaba descreve a arquitetura Next como o protótipo para o Qwen4 da próxima geração.
• Contexto — nativamente grande, com a maioria das listagens em 1M de tokens e algumas fontes descrevendo 262K nativos estendidos para 1M. A saída máxima é de cerca de 131K.
• Preço — a tarifa publicada da API é ¥1 por milhão de tokens de entrada e ¥3 por milhão de tokens de saída, o que corresponde a $0,15 / $0,47 no nosso catálogo, com leituras de cache a $0,018 e gravações de cache a $0,230. A própria formulação da Alibaba é que preços de acerto no cache tão baixos quanto ¥0,1 por milhão são o que torna viáveis os fluxos de trabalho de agentes com entradas longas, e os números comprovam: uma leitura de cache custa cerca de um doze avos de um token de entrada novo.
• A questão dos pesos abertos — os pesos do Flash foram publicados no Hugging Face e no ModelScope no dia do lançamento. Repare como a família é contabilizada: a Alibaba diz que a série Qwen3.8 disponibilizou em código aberto três tamanhos — Max, 27B e Flash — num total de 2,4T de parâmetros, o que é um número cumulativo de toda a série, e não a contagem de parâmetros de qualquer modelo individual.
As alegações sobre benchmarks são amplas e, conforme o próprio material de lançamento da Alibaba, todas são diferenças relativas, e não valores absolutos: SWE-bench Pro +9,1 em relação ao Opus 4.6, JobBench cerca de +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Diferenças em relação a uma configuração não nomeada de um modelo concorrente não pertencem à mesma categoria de evidência que uma entrada em um leaderboard, e nenhuma delas foi reproduzida de forma independente. O enquadramento de manchete da empresa — uma redefinição da "linha de corte" de custo do setor, de preço por token para custo total por tarefa concluída — é a alegação que realmente importa para esta comparação, e também é aquela que você mesmo pode testar.

O que o ARTEMIS contribui, e por que os dois números não são comparáveis
O ARTEMIS não contém nenhum modelo. Seu selo diz "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" e sua configuração fica em code>config/artemis.jsonc/code>. O que ele traz é a parte que transforma o palpite de um modelo em uma ação verificada: um localizador que prioriza o dinâmico, que lê a árvore de acessibilidade quando pode e recorre à visão e às coordenadas quando uma superfície Compose ou Flutter não lhe dá nada, uma Safety Net que limpa pop-ups do sistema que estejam interferindo antes que o toque aconteça, verificação por checkpoint em quatro níveis, de code>off/code> a code>strict/code>, e um registro de sessão que comprime capturas de tela antigas em resumos visuais para que um contexto de cem etapas continue a ter um custo acessível.
Ele também traz um servidor MCP nativo. code>uv run artemis mcp --install all/code> expõe code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> e code>mobile_diagnose/code> ao Antigravity, ao Claude Code, ao Codex e a qualquer outra coisa que fale MCP — e é isso que fez o projeto se espalhar tão rápido quanto se espalhou, e é a declaração mais clara do que ele é feito para ser. ARTEMIS é uma ferramenta que um agente chama. Um modelo também é, e é por isso que colocá-los na mesma coluna é um erro de categoria.
A única coisa com que se deve ter cuidado ao ler os 99,1% da ARTEMIS: o ranking do AndroidWorld explicitamente não verifica as submissões de forma independente. Todos os números nele, incluindo os da ARTEMIS, são autodeclarados pela equipe que os produziu. A mesma ressalva se aplica com ainda mais força a um delta citado em um post de lançamento.
Lendo "vs" de duas maneiras
Há duas leituras honestas deste confronto e elas apontam em direções opostas.
Como rivais, a comparação na verdade é: "devo usar um modelo hospedado mais um harness, ou devo usar um modelo que seja bom o suficiente em tarefas móveis para que eu mesmo possa escrever o harness?" Nessa leitura, o ARTEMIS vence por padrão, porque um modelo não é um harness — e o delta de +22,5 pontos no AndroidWorld não diz se o Qwen3.8-Flash consegue sobreviver ao passo 74 de uma execução de cem passos quando um popup do sistema engole o toque dele. Nada numa tabela de benchmark mede a Safety Net.
Como uma stack, a comparação é a que importa: o ARTEMIS é o loop de controle, o Qwen3.8-Flash é um mecanismo plausível para ele, e a questão passa a ser de custo e confiabilidade em execuções prolongadas. Todo o argumento da Alibaba para o nível Flash — de que o número importante é o custo total por tarefa concluída, e não o preço por token — é precisamente a métrica pela qual uma suíte de automação para Android é avaliada, e é uma métrica que você consegue medir no seu próprio conjunto de testes em um dia.
O detalhe incômodo que está no caminho: o Qwen3.8-Flash não está na lista de backends testados da ARTEMIS, que inclui Gemini, Claude, GPT-4o e Qwen-VL. O Qwen-VL é um modelo diferente. O harness aceita um endpoint de modelo e o emparelhamento é tecnicamente plausível, mas ninguém publicou uma avaliação dele, e se você executá-lo, estará fazendo trabalho original em vez de seguir a documentação.
A aritmética que decide isso
Aqui está o cálculo que vale a pena fazer antes que qualquer um dos posts de lançamento convença você de alguma coisa. É um modelo com premissas declaradas, não uma medição, e você deve substituir os seus próprios números — mas o que importa é o formato dele.
Considere uma execução Pro de 100 etapas. O Pro é executado a cerca de 15–40 segundos por etapa, então o tempo real fica entre 25 minutos e uma hora, e cada etapa envia uma captura de tela mais um prompt crescente. Suponha 8.000 tokens de prompt e 300 tokens de saída por etapa — um orçamento conservador de captura de tela e instruções, bem abaixo do que custa um frame bruto em resolução total. Isso é 800.000 tokens de entrada e 30.000 tokens de saída para um teste.
• Com o preço de US$ 0,15 / US$ 0,47 do Qwen3.8-Flash, essa execução custa cerca de US$ 0,12 em entrada e US$ 0,014 em saída — aproximadamente treze centavos.
• A uma tarifa de hospedagem de um modelo de fronteira na casa de poucos dólares por milhão de tokens de entrada e na casa dos quinze por milhão de tokens de saída, a mesma execução chega aos dólares, não aos centavos. As duas tarifas são deixadas intencionalmente vagas aqui, porque o valor exato depende de qual modelo de fronteira você escolhe, e o que importa é a proporção: é uma ordem de magnitude, em todos os testes, todas as execuções.
E porque a ARTEMIS relê um contexto crescente a cada passo, a proporção melhora ainda mais para o modelo que tiver a leitura de cache mais barata. A leitura de cache do Qwen3.8-Flash é de US$ 0,018 por milhão contra US$ 0,15 de entrada nova — um doze avos do preço, e a razão pela qual a Alibaba continua apontando para as taxas de acerto de cache quando fala sobre cargas de trabalho de agentes.
Agora multiplique pela sua suíte. Uma execução de regressão de 500 testes todas as noites é 400 milhões de tokens de entrada por noite, e a diferença entre treze centavos e três dólares por teste é a diferença entre um harness que você pode se dar ao luxo de executar continuamente e um que você agenda semanalmente.

Executando-o, e onde o encanamento importa
Se você quiser testar essa aritmética no seu próprio aplicativo, o caminho honesto é apontar o ARTEMIS para um endpoint de modelo e medir. O Qwen3.8-Flash está no nosso catálogo pelo preço publicado de $0.15 / $0.47 com leituras de cache a $0.018 e gravações de cache a $0.230, na mesma chave e na mesma fatura dos outros tamanhos do Qwen3.8 e de tudo o mais que roteamos — que é a parte que importa quando o fluxo de trabalho que você está precificando é um harness fazendo cem chamadas por teste, e não uma pessoa fazendo uma. A página do modelo também traz os números operacionais que você quer antes de comprometer uma suíte com ele: um contexto de 1M de tokens com saída máxima de 131K, um tempo p50 até o primeiro token de 7,12 segundos e um p95 de 10,00, e aproximadamente 2,3 bilhões de tokens de tráfego por ele nos últimos sete dias. Esse último número é nosso, e não de um fornecedor, e é um proxy razoável para saber se outras pessoas já estão executando cargas de trabalho longas de agentes nesse endpoint.
O detalhe de infraestrutura que deixa de ser teórico nessa escala é o que acontece no passo 74. Uma execução do Pro mantém seu contexto em um único endpoint por boa parte de uma hora; um incidente do provedor no meio disso não degrada a execução, ele a encerra, e você paga pelos 73 passos que não produziram resultado. Encaminhar uma sessão longa de agente por uma camada que faz failover para outro provedor do mesmo modelo é a diferença entre uma suíte instável e uma interrompida. Essa é uma propriedade de engenharia banal, e é ela que decide se o seu custo medido por tarefa concluída sobrevive ao contato com uma semana de execuções reais.

Para que cada um realmente serve
Se você tem um app Android e uma suíte de testes, você quer o ARTEMIS, e o Qwen3.8-Flash é um motor candidato para ele, e não uma alternativa a ele — um motor não documentado, que vale a pena testar em uma tarde de experimentos, com um preço que faz esse experimento não custar nada mensurável. Se você está escolhendo um modelo para um agente móvel que você mesmo está escrevendo, o delta de +22,5 pontos no AndroidWorld é um motivo para olhar o Qwen3.8-Flash, e não um motivo para acreditar nele, porque é um delta relatado pelo fornecedor, sem pontuação absoluta associada e sem reprodução independente.
O que ambos os projetos discutem em surdina é a mesma coisa, e nenhum dos dois o diz abertamente. A Google afirma que é o harness que torna um agente móvel confiável, e o disponibiliza em código aberto para que a afirmação possa ser verificada. A Alibaba afirma que o custo por tarefa concluída é o único número que importa, e define os preços em conformidade. Ambos provavelmente têm razão, e é por isso que a configuração interessante não é o ARTEMIS nem o Qwen3.8 — é o ARTEMIS sobre o Qwen3.8-Flash, medido no seu próprio app, com o trace mantido ativado.
E como o ARTEMIS relê um contexto crescente a cada passo, a proporção melhora ainda mais para o modelo que tiver a leitura de cache mais barata.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
