
ARTEMIS 對上 Qwen3.8:同一項基準測試,兩種不同的任務
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Google 的 ARTEMIS 與 Qwen3.8 都是在 AndroidWorld 上進行評測,而這個巧合是兩者發布報導中最具誤導性的一項事實。ARTEMIS 是一套 Android 自動化測試框架——Google 於 2026 年 8 月以 Apache 2.0 授權開源,它接收自然語言指令,透過 ADB 操作真實手機,並宣稱在 Google Research 的 116 項任務 AndroidWorld 基準測試上達到 99% 以上的完成率,截至 2026 年 9 月 11 日在公開排行榜上顯示為 99.1%。Qwen3.8-Flash 是阿里巴巴的多模態混合專家模型,於 2026 年 8 月 26 日發布並開源,其發布資料宣稱在 AndroidWorld 上以 22.5 分的差距擊敗 Claude Opus 4.6。這兩個數字中,一個是某個系統的得分,另一個則是模型對他人所撰寫系統的貢獻。若把它們當作競爭對手來解讀,你對兩者都會得出錯誤的結論;若把它們視為同一套堆疊的兩半,那個真正有趣的問題——一次長時間的 Android 執行究竟要付出多少成本——才終於有了答案。
依規模分別說明 Qwen3.8 是什麼
「Qwen3.8」是一個系列,而非一個檢查點,而這裡真正重要的成員並非旗艦型號。
• Qwen3.8-Max——旗艦級別,定位對標前沿的託管模型。
• Qwen3.8-27B — 開放的中型稠密同系列成員。
• Qwen3.8-Flash — 一款採用全新「Next」架構的多模態 MoE:125B Transformer 參數,但每個 token 僅啟用 6B;Qwen 稀疏注意力與 GDN 融合於混合注意力機制中,在快取命中時為長上下文帶來加速;閘控殘差將資訊通道分為四路;以及 51B 參數的 N-gram 嵌入。阿里巴巴將 Next 架構描述為下一代 Qwen4 的原型。
• 上下文 — 原生即相當大,多數規格列為 1M 詞元,部分來源則描述為 262K 原生並延伸至 1M。最大輸出約為 131K。
• 價格 — 官方公布的 API 費率為每百萬輸入 token ¥1、每百萬輸出 token ¥3,換算到我們的價目表中為 $0.15 / $0.47,而快取讀取為 $0.018、快取寫入為 $0.230。阿里自家的說法是,快取命中價格低至每百萬 ¥0.1,正是這點讓長輸入的代理工作流程得以可行,而數字也支持這個說法:一次快取讀取的成本大約僅為全新輸入 token 的十二分之一。
• 開放權重的問題——Flash 的權重在發布當天已於 Hugging Face 和 ModelScope 上公布。請注意這個系列是如何計算的:阿里巴巴表示,Qwen3.8 系列已開源三個規模——Max、27B 與 Flash——總計 2.4T 參數,這是整個系列的累計數字,而非任何單一模型的參數數量。
基準測試的宣稱範圍很廣,而且根據 Alibaba 自家的發布資料,全都是相對增量而非絕對值:SWE-bench Pro 較 Opus 4.6 高 +9.1,JobBench 約 +20,MathVision +25.1,ERQA +31.5,AndroidWorld +22.5。與競爭對手模型某個未具名配置相比的增量,並不屬於和排行榜成績同一類的證據,而且這些都沒有經過獨立重現。該公司主打的說法——將業界成本的「kill line」從每 token 價格重新定義為每完成一項任務的總成本——才是這項比較真正重要的主張,而且也是你自己可以實測的那一項。

ARTEMIS 的貢獻是什麼,以及為什麼這兩個數字無法相比
ARTEMIS 本身不含任何模型。它的徽章寫著「Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL」,而它的設定檔位於 code>config/artemis.jsonc/code>。它帶來的,是把模型的猜測轉化為經過驗證的行動的那個部分:一個動態優先的定位器,能在可行的時候讀取無障礙樹,而當 Compose 或 Flutter 介面什麼都不給它時,就退回視覺與座標;一張 Safety Net,會在點擊落下之前清除干擾的系統彈出視窗;四個層級的檢查點驗證,從 code>off/code> 到 code>strict/code>;以及一份工作階段帳本,會把舊的螢幕截圖壓縮成視覺摘要,讓上百步的上下文仍維持在可負擔的成本之內。
它也隨附一個原生 MCP 伺服器。code>uv run artemis mcp --install all/code> 會將 code>mobile_run_task/code>、code>mobile_manage_task/code>、code>mobile_get_device_state/code>、code>mobile_inspect_trace/code> 與 code>mobile_diagnose/code> 暴露給 Antigravity、Claude Code、Codex 以及任何其他會說 MCP 的東西——這正是讓這個專案竄紅得如此之快的原因,也是對它存在目的最簡潔的陳述。ARTEMIS 是一個供 agent 呼叫的工具。模型也是,所以把兩者放在同一欄是一種範疇謬誤。
在解讀 ARTEMIS 的 99.1% 時,有一件事要特別留意:AndroidWorld 的排行榜明確表示不會獨立驗證提交內容。榜上的每一個數字,包括 ARTEMIS 的,都是由產出該數字的團隊自行提報。同樣的告誡,套用到發布貼文中所引用的差異值時,只會更加適用。
「vs」的兩種解讀方式
這場對決有兩種誠實的解讀,而它們指向相反的方向。
作為競爭對手,比較其實是:「我該用託管模型加一套測試框架,還是該用一個在行動任務上夠強、強到我能自己寫測試框架的模型?」照這樣解讀,ARTEMIS 預設就贏了,因為模型不是測試框架——而 AndroidWorld 上 +22.5 分的差距,並不能告訴你當系統彈出視窗吃掉它的點擊時,Qwen3.8-Flash 能否撐過百步執行中的第 74 步。基準測試表上的任何數字都衡量不了安全網。
作為一套技術堆疊,這個比較才是有用的那個:ARTEMIS 是控制迴路,Qwen3.8-Flash 是對它而言合理的引擎,而問題就變成在長時間運行下的成本與可靠性。阿里巴巴對 Flash 這個層級的整套訴求——重要的數字是每完成一項任務的總成本,而不是每個 token 的價格——正是 Android 自動化套件被評分時所依據的指標,而且這是你在自己的測試集上一天之內就能測量的指標。
擋在前面的棘手細節是:Qwen3.8-Flash 並不在 ARTEMIS 已測試的後端清單上,那份清單列出的是 Gemini、Claude、GPT-4o 與 Qwen-VL。Qwen-VL 是另一個模型。這個測試框架接受模型端點,而這樣的配對在技術上說得通,但沒有人發表過相關評估;如果你實際跑它,你是在做原創工作,而不是遵循文件說明。
決定一切的算術
在任一篇發布貼文說服你任何事情之前,這裡有個值得先做的計算。它是一個附有明確假設的模型,而不是一次實測;你應該代換成你自己的數字——但它的形狀才是重點。
以一次 100 步的 Pro 執行為例。Pro 每一步大約執行 15 到 40 秒,所以實際耗時會落在 25 分鐘到一小時之間,而且每一步都會送出螢幕截圖加上一份不斷增長的提示。假設每一步是 8,000 個提示 token 與 300 個輸出 token——這是保守的截圖加指令預算,遠低於一張原始全解析度畫面所需的成本。也就是說,一次測試就要用掉 800,000 個輸入 token 和 30,000 個輸出 token。
• 以 Qwen3.8-Flash 的 $0.15 / $0.47 而言,該次執行的輸入費用約為 $0.12,輸出費用約為 $0.014——大約十三美分。
• 以前沿託管費率計算,每百萬輸入 token 為低個位數美元、每百萬輸出 token 為十幾美元,同一趟執行就會落在數美元,而不是數美分。這裡刻意對這兩個費率含糊帶過,因為確切數字取決於你選擇哪個前沿模型,而重要的是比率:在每一次測試、每一次執行中,它都相差一個數量級。
• 而且由於 ARTEMIS 在每個步驟都會重新讀取不斷增長的上下文,對於快取讀取成本較低的模型而言,這個比例會進一步改善。Qwen3.8-Flash 的快取讀取價格為每百萬 $0.018,相對於 $0.15 的全新輸入——僅為其十二分之一,這也是 Alibaba 在談論代理工作負載時不斷強調快取命中率的原因。
現在把它乘以你的測試套件。每晚執行 500 項測試的迴歸測試,一晚就是 4 億個輸入 token;而每項測試 13 美分和 3 美元之間的差距,就是你能負擔持續執行的測試框架,與只能每週排程執行的測試框架之間的差距。

執行它,以及底層架構的關鍵所在
如果你想在自己的應用程式上驗證這套算術,誠實的途徑是把 ARTEMIS 指向某個模型端點並實際測量。Qwen3.8-Flash 已在我們的目錄中,公開價格為 $0.15 / $0.47,快取讀取為 $0.018、快取寫入為 $0.230,使用同一把金鑰、同一份帳單,與其他 Qwen3.8 尺寸以及我們所路由的一切服務相同——當你要估算的工作流程是每次測試發出上百次呼叫的測試框架,而不是一個人只發一次呼叫時,這正是關鍵所在。模型頁面也載有你在一頭栽進整套測試之前會想知道的營運數字:1M token 的上下文、131K 的最大輸出、7.12 秒的 p50 首字時間與 10.00 秒的 p95,以及過去七天約有 23 億 token 的流量經過它。最後那個數字是我們自己的,而不是供應商的,而它是個合理的代理指標,可看出其他人是否已經在這個端點上執行長時間的代理工作負載。
在這個規模下,不再只是理論問題的底層管線細節,就是第 74 步會發生什麼事。一次 Pro 執行會把它的上下文放在單一端點上長達將近一小時;中途發生供應商事故不會讓這次執行降級,而是會直接結束它,而你還得為那 73 個沒有產生結果的步驟付費。把漫長的 agent 工作階段導向一個能在同一模型的其他供應商之間容錯移轉的層,差別就在於測試套件是時好時壞,還是會直接中斷。那是一項平凡無奇的工程特性,而正是它決定了你實測的每完成一項任務成本,能否經得起一週真實執行的考驗。

每個實際上是用來做什麼的
如果你有一個 Android 應用程式和一套測試套件,你會想要 ARTEMIS,而 Qwen3.8-Flash 是它的候選引擎,而不是它的替代方案——一個沒有文件記載的引擎,值得花一個下午做實驗,其定價讓這場實驗不會為你帶來任何可量測的成本。如果你正在為自己撰寫的行動代理挑選模型,+22.5 點的 AndroidWorld 差異是讓你考慮 Qwen3.8-Flash 的理由,而不是讓你相信它的理由,因為這是廠商自行回報的差異,既沒有附上絕對分數,也沒有獨立重現。
這兩個專案默默在爭論的,其實是同一件事,而雙方都沒有明說。Google 主張,是 harness 讓行動代理變得可靠,並將其開源,好讓這項主張能被檢驗。阿里巴巴則主張,每完成一項任務的成本是唯一重要的數字,並據此定價。兩邊可能都對,這也正是為什麼真正有意思的組合不是 ARTEMIS 或 Qwen3.8,而是跑在 Qwen3.8-Flash 上的 ARTEMIS,在你自家的應用上實測,並且把 trace 開著不關。
而且,因為 ARTEMIS 在每一步都會重新讀取不斷成長的上下文,對於快取讀取成本較低的任何模型。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
