Một thẻ tiêu đề được tạo cho 'ARTEMIS vs Qwen3.8' với phụ đề 'Cùng một benchmark, hai công việc khác nhau', đối chiếu kết quả AndroidWorld 99.1% do ARTEMIS tự báo cáo với mức tăng 22.5 điểm do nhà cung cấp báo cáo của Qwen3.8-Flash so với Opus 4.6 trên cùng một benchmark, có chú thích rằng AndroidWorld không xác minh độc lập các bài gửi.
Guides & Insights

ARTEMIS vs Qwen3.8: cùng một bài kiểm chuẩn, hai công việc khác nhau

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

ARTEMIS của GoogleQwen3.8 đều được đo trên AndroidWorld, và sự trùng hợp đó chính là chi tiết gây hiểu lầm nhiều nhất trong toàn bộ các bài đưa tin ra mắt của cả hai dự án. ARTEMIS là một bộ khung tự động hóa Android — được Google mở mã nguồn vào tháng 8 năm 2026 theo giấy phép Apache 2.0, nó nhận một chỉ thị bằng ngôn ngữ tự nhiên, điều khiển một chiếc điện thoại thật qua ADB, và tuyên bố tỷ lệ hoàn thành trên 99% trên bộ đánh giá AndroidWorld gồm 116 tác vụ của Google Research, với 99,1% trên bảng xếp hạng công khai tính đến ngày 11 tháng 9 năm 2026. Qwen3.8-Flash là mô hình đa phương thức mixture-of-experts của Alibaba, được phát hành và mở mã nguồn vào ngày 26 tháng 8 năm 2026, với tài liệu ra mắt tuyên bố nó vượt Claude Opus 4.6 tới 22,5 điểm trên AndroidWorld. Một trong hai con số đó là điểm của một hệ thống. Con số còn lại là đóng góp của một mô hình cho một hệ thống do người khác viết ra. Đọc chúng như những đối thủ và bạn sẽ kết luận sai về cả hai; đọc chúng như hai nửa của một ngăn xếp và câu hỏi thú vị — một lượt chạy Android dài thực sự tốn bao nhiêu — cuối cùng đã có câu trả lời.

Qwen3.8 là gì, theo từng kích thước

“Qwen3.8” là một dòng họ, không phải một checkpoint, và thành viên đáng chú ý ở đây không phải là mẫu chủ lực.

Qwen3.8-Max — phân khúc chủ lực, được định vị để cạnh tranh với các mô hình hosted tiên tiến nhất.

Qwen3.8-27B — người anh em dense cỡ trung, mã nguồn mở.

Qwen3.8-Flash — một MoE đa phương thức trên kiến trúc "Next" mới: 125B tham số transformer với chỉ 6B được kích hoạt mỗi token, Qwen Sparse Attention hợp nhất với GDN trong một sơ đồ attention lai giúp tăng tốc ngữ cảnh dài khi cache trúng, một Gated Residual chia kênh thông tin thành bốn nhánh, và 51B tham số embedding N-gram. Alibaba mô tả kiến trúc Next là nguyên mẫu cho Qwen4 thế hệ tiếp theo.

Ngữ cảnh — vốn đã lớn, với hầu hết các thông số niêm yết ở mức 1M token và một số nguồn mô tả 262K gốc được mở rộng lên 1M. Đầu ra tối đa khoảng 131K.

Giá — mức giá API công bố là ¥1 cho mỗi triệu token đầu vào và ¥3 cho mỗi triệu token đầu ra, tương ứng với $0.15 / $0.47 trong danh mục của chúng tôi, với lượt đọc bộ nhớ đệm ở mức $0.018 và ghi bộ nhớ đệm ở mức $0.230. Theo cách diễn đạt của chính Alibaba, mức giá trúng bộ nhớ đệm thấp tới ¥0.1 mỗi triệu chính là điều giúp các quy trình tác nhân có đầu vào dài trở nên khả thi, và các con số ủng hộ điều đó: một lượt đọc bộ nhớ đệm tốn khoảng một phần mười hai so với một token đầu vào mới.

Câu hỏi về trọng số mở — trọng số của Flash đã được công bố trên Hugging Face và ModelScope ngay trong ngày ra mắt. Hãy để ý cách đếm của cả dòng sản phẩm: Alibaba cho biết dòng Qwen3.8 đã mở nguồn ba kích cỡ — Max, 27B và Flash — với tổng cộng 2,4T tham số, đây là con số tích lũy của cả dòng sản phẩm chứ không phải số lượng tham số của bất kỳ một mô hình riêng lẻ nào.

Các tuyên bố benchmark rất rộng, và theo chính tài liệu ra mắt của Alibaba, đều là mức chênh lệch chứ không phải giá trị tuyệt đối: SWE-bench Pro +9.1 so với Opus 4.6, JobBench khoảng +20, MathVision +25.1, ERQA +31.5, AndroidWorld +22.5. Mức chênh lệch so với một cấu hình không được nêu tên của một mô hình đối thủ không cùng loại bằng chứng với một mục trên bảng xếp hạng, và không có tuyên bố nào trong số này được tái lập độc lập. Cách định khung trên tiêu đề của công ty — một sự định nghĩa lại “lằn ranh loại bỏ” về chi phí của ngành từ giá mỗi token sang tổng chi phí cho mỗi tác vụ hoàn thành — mới là tuyên bố thực sự quan trọng cho so sánh này, và đó cũng là tuyên bố bạn có thể tự mình kiểm chứng.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

ARTEMIS đóng góp những gì, và tại sao hai con số này không thể so sánh được

ARTEMIS không chứa mô hình nào. Huy hiệu của nó ghi "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" và cấu hình của nó nằm trong code>config/artemis.jsonc/code>. Điều nó mang lại là phần biến phỏng đoán của mô hình thành một hành động đã được xác minh: một trình định vị ưu tiên động, đọc cây trợ năng khi có thể và chuyển sang thị giác cùng tọa độ khi một bề mặt Compose hoặc Flutter không mang lại cho nó gì, một Safety Net dọn sạch các cửa sổ bật lên hệ thống gây nhiễu trước khi cú chạm diễn ra, xác minh checkpoint ở bốn mức từ code>off/code> đến code>strict/code>, và một sổ cái phiên nén các ảnh chụp màn hình cũ thành tóm tắt trực quan để ngữ cảnh trăm bước vẫn có chi phí hợp lý.

Nó cũng đi kèm một máy chủ MCP gốc. code>uv run artemis mcp --install all/code> cung cấp code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> và code>mobile_diagnose/code> cho Antigravity, Claude Code, Codex và bất kỳ thứ gì khác biết nói MCP — chính điều đó đã khiến dự án lan nhanh đến vậy, và cũng là phát biểu rõ ràng nhất về mục đích của nó. ARTEMIS là một công cụ mà một agent gọi đến. Mô hình cũng vậy, đó là lý do vì sao xếp chúng vào cùng một cột là một lỗi phạm trù.

Điều duy nhất cần lưu ý khi đọc con số 99,1% của ARTEMIS: bảng xếp hạng của AndroidWorld nói rõ rằng họ không xác minh độc lập các bài nộp. Mọi số liệu trên đó, kể cả của ARTEMIS, đều do chính nhóm đã tạo ra chúng tự báo cáo. Lưu ý tương tự còn áp dụng mạnh hơn đối với một mức chênh lệch được trích dẫn trong bài đăng ra mắt.

Đọc "vs" theo hai cách

Có hai cách diễn giải trung thực về cuộc đối đầu này, và chúng chỉ về hai hướng ngược nhau.

Xét như những đối thủ, phép so sánh thực ra là: "tôi nên dùng một mô hình hosted cộng với một harness, hay nên dùng một mô hình đủ giỏi ở các tác vụ di động để tôi có thể tự viết harness?" Theo cách hiểu đó, ARTEMIS thắng theo mặc định, bởi vì một mô hình không phải là một harness — và mức chênh lệch +22,5 điểm trên AndroidWorld không cho bạn biết liệu Qwen3.8-Flash có thể trụ nổi đến bước 74 trong một lượt chạy trăm bước khi một cửa sổ bật lên của hệ thống nuốt mất cú chạm của nó hay không. Không có gì trong một bảng benchmark đo được Safety Net.

Xét như một stack, phép so sánh này mới là phép so sánh hữu ích: ARTEMIS là vòng điều khiển, Qwen3.8-Flash là một engine khả dĩ cho nó, và câu hỏi trở thành chi phí và độ tin cậy khi xử lý độ dài lớn. Toàn bộ luận điểm của Alibaba cho hạng Flash — rằng con số quan trọng là tổng chi phí cho mỗi tác vụ hoàn thành chứ không phải giá trên mỗi token — chính xác là chỉ số mà một bộ tự động hóa Android được chấm điểm, và đó là chỉ số bạn có thể đo trên tập kiểm thử của riêng mình trong một ngày.

Chi tiết khó xử đang cản trở: Qwen3.8-Flash không nằm trong danh sách backend đã được ARTEMIS kiểm thử, vốn nêu tên Gemini, Claude, GPT-4o và Qwen-VL. Qwen-VL là một mô hình khác. Harness nhận một endpoint mô hình, và việc ghép cặp này về mặt kỹ thuật là khả thi, nhưng chưa ai công bố đánh giá về nó, và nếu bạn chạy nó, bạn đang làm công việc nguyên bản thay vì theo tài liệu.

Phép tính quyết định điều đó

Đây là phép tính đáng thực hiện trước khi một trong hai bài đăng ra mắt thuyết phục bạn bất cứ điều gì. Đó là một mô hình với những giả định được nêu rõ, chứ không phải một phép đo, và bạn nên thay bằng những con số của riêng mình — nhưng hình dạng của nó mới là điểm mấu chốt.

Thực hiện một lần chạy Pro 100 bước. Pro chạy với tốc độ khoảng 15–40 giây mỗi bước, vì vậy thời gian thực nằm trong khoảng từ 25 phút đến một giờ, và mỗi bước gửi một ảnh chụp màn hình cùng với một prompt ngày càng tăng. Giả sử 8.000 token prompt và 300 token đầu ra mỗi bước — một ngân sách ảnh chụp màn hình và hướng dẫn thận trọng, thấp hơn nhiều so với chi phí của một khung hình độ phân giải đầy đủ thô. Đó là 800.000 token đầu vào và 30.000 token đầu ra cho một bài kiểm tra.

Với mức $0.15 / $0.47 của Qwen3.8-Flash, lần chạy đó tốn khoảng $0.12 cho đầu vào và $0.014 cho đầu ra — khoảng mười ba xu.

• Với mức giá thuê mô hình tiên tiến được host, chỉ ở mức một chữ số thấp cho mỗi triệu token đầu vào và khoảng mười mấy cho mỗi triệu token đầu ra, cùng một lần chạy như vậy sẽ rơi vào hàng đô la, chứ không phải xu. Hai mức giá ở đây được nói đại khái một cách có chủ đích, vì con số chính xác phụ thuộc vào mô hình tiên tiến bạn chọn, và tỷ lệ mới là điều quan trọng: đó là một bậc độ lớn, trong mọi bài kiểm tra, mọi lần chạy.

• Và vì ARTEMIS đọc lại một ngữ cảnh ngày càng lớn ở mỗi bước, tỷ lệ này càng được cải thiện đối với bất kỳ mô hình nào có chi phí đọc cache rẻ hơn. Mức đọc cache của Qwen3.8-Flash là 0,018 USD mỗi triệu token, so với 0,15 USD cho đầu vào mới — bằng một phần mười hai mức giá, và là lý do Alibaba liên tục nhấn mạnh đến tỷ lệ cache hit khi nói về khối lượng công việc agent.

Giờ hãy nhân lên với bộ kiểm thử của bạn. Một lượt chạy hồi quy 500 bài kiểm thử mỗi đêm là 400 triệu token đầu vào mỗi đêm, và sự khác biệt giữa mười ba xu và ba đô la cho mỗi bài kiểm thử chính là sự khác biệt giữa một khung kiểm thử bạn có thể đủ khả năng chạy liên tục và một khung bạn phải lên lịch chạy hằng tuần.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Chạy nó, và nơi mà phần hạ tầng ngầm thực sự quan trọng

Nếu bạn muốn kiểm tra phép tính đó trên ứng dụng của riêng mình, con đường trung thực là hướng ARTEMIS vào một endpoint mô hình và đo lường. Qwen3.8-Flash nằm trong danh mục của chúng tôi với mức giá niêm yết $0,15 / $0,47 cùng với chi phí đọc bộ nhớ đệm là $0,018 và ghi bộ nhớ đệm là $0,230, trên cùng một khóa và cùng một hóa đơn như các kích cỡ Qwen3.8 khác và mọi thứ khác mà chúng tôi định tuyến — đây chính là phần quan trọng khi quy trình bạn đang định giá là một khung kiểm thử thực hiện hàng trăm cuộc gọi mỗi lần kiểm thử thay vì một người chỉ thực hiện một cuộc gọi. Trang mô hình cũng cung cấp những con số vận hành mà bạn muốn biết trước khi cam kết đưa một bộ kiểm thử vào chạy trên nó: ngữ cảnh 1M token với đầu ra tối đa 131K, thời gian đến token đầu tiên p50 là 7,12 giây và p95 là 10,00, cùng khoảng 2,3 tỷ token lưu lượng chạy qua nó trong bảy ngày qua. Con số cuối cùng đó là của chúng tôi chứ không phải của nhà cung cấp, và nó là một đại diện hợp lý cho việc liệu những người khác đã đang chạy các khối lượng công việc agent chạy dài trên endpoint này hay chưa.

Chi tiết hạ tầng ngầm không còn mang tính lý thuyết ở quy mô này là điều xảy ra ở bước 74. Một lượt chạy Pro giữ ngữ cảnh của nó trên một endpoint trong phần lớn một giờ; một sự cố từ nhà cung cấp xảy ra ở giữa quá trình đó không làm suy giảm lượt chạy mà kết thúc nó, và bạn vẫn phải trả tiền cho 73 bước không tạo ra kết quả. Định tuyến một phiên agent dài qua một lớp có cơ chế chuyển đổi dự phòng sang nhà cung cấp khác của cùng mô hình chính là khác biệt giữa một bộ kiểm thử chập chờn và một bộ bị gián đoạn. Đó là một thuộc tính kỹ thuật bình thường, và chính nó quyết định liệu chi phí đo được cho mỗi tác vụ hoàn thành có đứng vững khi tiếp xúc với một tuần chạy thực tế hay không.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

Mỗi cái thực sự được dùng để làm gì

Nếu bạn có một ứng dụng Android và một bộ kiểm thử, bạn muốn ARTEMIS, và Qwen3.8-Flash là một engine ứng viên cho nó chứ không phải một giải pháp thay thế cho nó — một engine chưa được ghi tài liệu, đáng để bỏ ra một buổi chiều thử nghiệm, với mức giá khiến cho thử nghiệm đó không tốn của bạn gì đáng kể. Nếu bạn đang chọn một mô hình cho một mobile agent mà bạn tự viết, mức chênh lệch +22,5 điểm trên AndroidWorld là một lý do để xem xét Qwen3.8-Flash chứ không phải là lý do để tin vào nó, bởi vì đó là mức chênh lệch do nhà cung cấp báo cáo, không kèm theo điểm tuyệt đối nào và không có tái lập độc lập.

Điều mà cả hai dự án đang âm thầm tranh luận thực ra là cùng một điều, và không bên nào nói thẳng ra. Google đang khẳng định rằng chính harness là thứ khiến một mobile agent trở nên đáng tin cậy, và mở mã nguồn nó để có thể kiểm chứng khẳng định đó. Alibaba đang khẳng định rằng chi phí trên mỗi tác vụ hoàn thành là con số duy nhất quan trọng, và định giá tương ứng. Cả hai có lẽ đều đúng, và đó là lý do cấu hình thú vị không phải là ARTEMIS hay Qwen3.8 — mà là ARTEMIS trên Qwen3.8-Flash, được đo trên ứng dụng của chính bạn, với trace được giữ ở trạng thái bật.

Và vì ARTEMIS đọc lại một ngữ cảnh ngày càng lớn ở mỗi bước, tỷ lệ này còn cải thiện hơn nữa đối với bất kỳ mô hình nào có chi phí đọc bộ nhớ đệm rẻ hơn.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày