一张为“ARTEMIS vs Qwen3.8”生成的标题卡,副标题为“同一个基准,两种不同的任务”,将ARTEMIS自报的99.1% AndroidWorld结果,与Qwen3.8-Flash厂商报告的在同一基准上相对Opus 4.6提升22.5个百分点的成绩作对比,并附脚注说明AndroidWorld并不独立核验提交结果。
Guides & Insights

ARTEMIS vs Qwen3.8:同一个基准,两项不同的任务

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

谷歌的 ARTEMIS 和 Qwen3.8 都是在 AndroidWorld 上测出来的,而这一巧合正是这两个项目发布报道中最具误导性的一点。ARTEMIS 是一套 Android 自动化框架——谷歌于 2026 年 8 月以 Apache 2.0 协议将其开源,它接收自然语言指令,通过 ADB 驱动一台真机,并宣称在 Google Research 的 116 项任务 AndroidWorld 基准测试上达到 99% 以上的完成率,截至 2026 年 9 月 11 日,在公开排行榜上显示为 99.1%。Qwen3.8-Flash 是阿里巴巴的多模态混合专家模型,于 2026 年 8 月 26 日发布并开源,其发布材料声称它在 AndroidWorld 上以 22.5 分的优势击败了 Claude Opus 4.6。这两个数字中,有一个是整套系统的得分,另一个则是模型对别人所写系统的一份贡献。若把它们当作竞争对手来解读,你会对两者都得出错误的结论;而若把它们看作同一个技术栈的两半,那个真正有意思的问题——一次长时间的 Android 运行到底要花多少钱——才终于有了答案。

Qwen3.8 是什么,按规模划分

"Qwen3.8"是一个系列,而不是一个检查点,而这里真正重要的成员并非旗舰。

Qwen3.8-Max——旗舰级别,对标前沿托管模型。

Qwen3.8-27B——开源的中等规模稠密同系列型号。

Qwen3.8-Flash —— 一个采用全新“Next”架构的多模态 MoE:125B transformer 参数,但每个 token 仅激活 6B;Qwen Sparse Attention 与 GDN 融合于混合注意力方案中,在缓存命中时可实现长上下文加速;门控残差将信息通道一分为四;另有 51B 参数的 N-gram 嵌入。阿里巴巴将 Next 架构描述为下一代 Qwen4 的原型。

上下文——原生即拥有超大容量,大多数产品说明为 1M tokens,部分资料则称 262K 原生可扩展至 1M。最大输出约为 131K。

价格 —— 公布的 API 费率为每百万输入 token ¥1、每百万输出 token ¥3,在我们的目录中对应 $0.15 / $0.47,其中缓存读取为 $0.018,缓存写入为 $0.230。阿里巴巴自己的说法是,缓存命中价格低至每百万 ¥0.1,正是这一点让长输入的智能体工作流变得可行,而数据也印证了这一点:一次缓存读取的成本大约只是一个全新输入 token 的十二分之一。

开放权重之问——Flash 的权重在发布当天就已在 Hugging Face 和 ModelScope 上公布。注意这个系列是怎么计数的:阿里巴巴称 Qwen3.8 系列已开源三个规模——Max、27B 和 Flash——合计 2.4T 参数,这是整个系列的累计数字,而不是任何单一模型的参数量。

这些基准测试宣称的范围很广,而且按照阿里巴巴自家发布材料的说法,它们全都是相对差值而非绝对数值:SWE-bench Pro 比 Opus 4.6 高 +9.1,JobBench 约为 +20,MathVision +25.1,ERQA +31.5,AndroidWorld +22.5。针对某个竞争对手模型未具名配置得出的差值,与排行榜上的成绩不属于同一类证据,而且这些结果没有一个被独立复现。该公司最醒目的宣传口径——把行业的成本“生死线”从每 token 价格重新定义为每完成一项任务的总成本——才是这一比较中真正重要的主张,而且也是你自己可以检验的那一条。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

ARTEMIS 贡献了什么,以及为什么这两个数字不可比

ARTEMIS 本身不包含任何模型。它的徽章上写着“多模型 —— Gemini | Claude | GPT-4o | Qwen-VL”,其配置位于 code>config/artemis.jsonc/code>。它所带来的,是把模型的猜测变成经过验证的操作的那一部分:一个动态优先的定位器,能读取无障碍树时就读取,当 Compose 或 Flutter 界面什么都不给它时,则退回到视觉与坐标;一张安全网,在点击落下之前清除干扰性的系统弹窗;从 code>off/code> 到 code>strict/code> 四个级别的检查点验证;以及一个会话账本,它把旧截图压缩成视觉摘要,让上百步的上下文依然成本可控。

它还自带一个原生 MCP 服务器。 code>uv run artemis mcp --install all/code> 将 code>mobile_run_task/code>、code>mobile_manage_task/code>、code>mobile_get_device_state/code>、code>mobile_inspect_trace/code> 和 code>mobile_diagnose/code> 暴露给 Antigravity、Claude Code、Codex 以及任何其他支持 MCP 的东西——正是这一点让该项目传播得如此之快,也是对其用途最清晰的说明。ARTEMIS 是一个供智能体调用的工具。模型也是如此,这就是为什么把它们放在同一列里是一种范畴错误。

阅读 ARTEMIS 的 99.1% 时,有一件事需要特别注意:AndroidWorld 的排行榜明确不会独立核实提交内容。榜单上的每一个数字,包括 ARTEMIS 的在内,都是由产出该数字的团队自行报告的。同样的告诫用在发布帖中引用的差值上,只会更加适用。

两种方式解读“vs”

对于这组对阵,有两种诚实的解读,而它们指向相反的方向。

作为竞争对手真正的比较其实是:“我该用一个托管模型再加一套执行框架,还是用一个在移动端任务上足够好、好到我能自己写执行框架的模型?”按这个逻辑,ARTEMIS 默认胜出,因为模型不是执行框架——而 AndroidWorld 上那 +22.5 个百分点的差距,并不能告诉你:当一次百步运行走到第 74 步、系统弹窗吃掉了 Qwen3.8-Flash 的点击时,它还能不能撑住。基准测试表里没有任何东西能衡量安全网。

作为一个技术栈,这个比较才是有用的:ARTEMIS 是控制回路,Qwen3.8-Flash 是它一个说得通的引擎,于是问题就变成了长时长下的成本与可靠性。阿里巴巴为 Flash 这一档所做的全套主张——重要的数字是每完成一个任务的总成本,而不是每个 token 的价格——恰恰正是衡量一套 Android 自动化套件的指标,而且这个指标你可以在自己的测试集上用一天时间测出来。

挡在面前的尴尬细节是:Qwen3.8-Flash 并不在 ARTEMIS 已测试的后端列表上,该列表列出的是 Gemini、Claude、GPT-4o 和 Qwen-VL。Qwen-VL 是另一个模型。这个测试框架接收模型端点,因此这种配对在技术上说得通,但没有人发表过对它的评估,而且如果你运行它,你就是在做原创工作,而不是在遵循文档。

决定成败的算术

这里有一个值得在任意一篇发布文章说服你之前先做的计算。它是一个列出了明确假设的模型,而不是一次实测,你应该代入自己的数字——但它的形态才是关键所在。

进行一次 100 步的 Pro 运行。Pro 大约每步需要 15–40 秒,因此实际耗时在 25 分钟到一小时之间,而且每一步都会发送一张截图以及不断增长的提示词。假设每一步有 8,000 个提示词 token 和 300 个输出 token——这是一个保守的截图加指令预算,远低于原始全分辨率帧的开销。对于一次测试来说,这就是 800,000 个输入 token 和 30,000 个输出 token。

• 在 Qwen3.8-Flash 的 $0.15 / $0.47 定价下,那次运行的输入成本约为 $0.12,输出成本约为 $0.014——大约十三美分。

• 在每百万输入 token 低个位数美元、每百万输出 token 十几美元的前沿托管费率下,同一次运行的成本会落在数美元,而不是数美分。这里故意对这两个费率含糊处理,因为具体数字取决于你选哪个前沿模型,而比率才是关键:在每次测试、每次运行中,它都是一个数量级的差距。

• 而且由于 ARTEMIS 在每一步都会重新读取不断增长的上下文,对于缓存读取更便宜的模型而言,这一比例还会进一步改善。Qwen3.8-Flash 的缓存读取价格为每百万 $0.018,而全新输入为 $0.15——仅为前者的十二分之一,这也正是阿里巴巴在谈及智能体工作负载时反复强调缓存命中率的原因。

现在,乘以你的测试套件。一个每晚运行的500个测试的回归套件,一晚就是4亿个输入token,而每个测试13美分与3美元之间的差距,就是一套你能负担得起持续运行的测试框架与一套只能每周调度运行的测试框架之间的差距。

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

运行它,以及底层机制的关键所在

如果你想在自己的应用上验证这套算术,最靠谱的做法就是把 ARTEMIS 指向一个模型端点,然后实测。Qwen3.8-Flash 已在我们的目录中,公布价格为 $0.15 / $0.47,缓存读取为 $0.018,缓存写入为 $0.230,与其他 Qwen3.8 各尺寸以及我们路由的所有其他模型使用同一个密钥、同一份账单——当你所定价的工作流是一个每次测试要发起上百次调用的测试框架,而不是一个人只调用一次时,这一点才是关键。模型页面上还列出了你在把一整套测试交给它之前想知道的运行数据:1M token 上下文、131K 最大输出、首 token 时间 p50 为 7.12 秒、p95 为 10.00 秒,以及过去七天约有 23 亿 token 的流量经过它。最后一个数字是我们自己的数据,而不是供应商的,它能相当合理地反映其他人是否已经在这个端点上运行长时间智能体工作负载。

在这个规模下,不再只是理论问题的那个管道细节,发生在第 74 步。一次 Pro 运行会把上下文将近一个小时都保持在一个端点上;中途发生提供商故障不会让这次运行降级,而是会直接终结它,而你还要为那 73 个没有产出结果的步骤付费。把一段长时间的智能体会话经由一个能在同一模型的其他提供商之间故障转移的层来路由,就是不稳定测试套件与被中断的测试套件之间的区别。这是一个平淡无奇的工程属性,而正是它决定了你测得的每完成一个任务的成本,能否经受一周真实运行的考验。

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

每个到底是用来做什么的?

如果你有一个 Android 应用和一套测试套件,你会想要 ARTEMIS,而 Qwen3.8-Flash 是它的候选引擎,而不是它的替代品——它是一个没有文档的候选引擎,值得花一个下午做个实验,其定价让这场实验不会给你带来任何可衡量的成本。如果你正在为自己编写的移动智能体挑选模型,那 +22.5 个百分点的 AndroidWorld 差距是一个让你去看看 Qwen3.8-Flash 的理由,而不是一个让你相信它的理由,因为这是厂商报告的差距,既没有附带绝对分数,也没有独立复现。

这两个项目私下争论的其实是同一件事,而双方都没有把它说明白。谷歌声称,正是运行框架让移动智能体变得可靠,并将其开源,以便这一说法能够被检验。阿里巴巴则声称,每个已完成任务的成本才是唯一重要的数字,并据此定价。双方很可能都对,这正是为什么有意思的配置不是 ARTEMIS 或 Qwen3.8——而是在 Qwen3.8-Flash 上运行 ARTEMIS,在你自己的应用上测量,并让追踪保持开启。

而且,由于 ARTEMIS 会在每一步重新读取不断增长的上下文,这一比率对于缓存读取成本更低的任何模型来说都会进一步改善。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新