
ARTEMIS của Google mở mã nguồn tự động hóa Android: tuyên bố 99% AndroidWorld thực sự bao gồm những gì
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Commit mới nhất trên google/artemis không phải là một tính năng. Đó là một dòng ghi công — "fix: complete README and relevant file headers per Apache 2.0 requirements," được đẩy lên ngày 12 tháng 9 năm 2026, ba ngày sau khi Minitap công bố một bài viết có tiêu đề Tôi đã kỳ vọng nhiều hơn ở Google. ARTEMIS của Google là tác nhân tự động hóa Android mới được hãng mở mã nguồn: nó biến một chỉ dẫn bằng tiếng Anh thông thường thành những thao tác chạm, vuốt, gõ và xác minh thực sự trên một thiết bị Android vật lý hoặc trình giả lập, ghi lại nhật ký và ảnh chụp màn hình trong suốt quá trình, và báo cáo tỷ lệ hoàn thành nhiệm vụ trên 99% trên bộ đánh giá AndroidWorld của Google Research. Nó được nhóm Pixel Test Engineering Fusion của Google công bố vào tháng Tám năm nay theo giấy phép Apache 2.0, và thực sự đáng để bạn dành trọn một buổi chiều. Tính đến giữa tháng Chín, nó cũng là tâm điểm của một cuộc tranh chấp ghi công trong cộng đồng mã nguồn mở — cuộc tranh chấp này nói lên nhiều điều về cách các tác nhân di động được xây dựng hơn là con số trên bộ đánh giá. Cả hai câu chuyện đều có thật. Chỉ một trong số đó mới là lý do vì sao commit cuối cùng của kho lưu trữ lại là một bản sửa lỗi giấy phép.
Những gì thực sự đã được phát hành
ARTEMIS không phải là một mô hình và cũng không phải là một lớp bọc chatbot. Nó là một khung điều khiển — một hệ thống Python 3.12+ nằm giữa một mô hình thị giác-ngôn ngữ và một thiết bị cầm tay thực. Bạn giao cho nó một nhiệm vụ bằng tiếng Anh; nó quan sát màn hình, quyết định hành động, thực thi hành động đó qua ADB, kiểm tra điều gì đã xảy ra và tiếp tục. Năm thứ có trong hộp:
• Một CLI và một SDK Python. code>./start.sh/code> khởi tạo ADB, scrcpy, FFmpeg và môi trường uv; code>uv run artemis run "…" --profile flash/code> chạy một tác vụ ở chế độ không giao diện; code>artemis-client/code> SDK bao bọc cùng lệnh gọi đó cho pytest và CI, trả về code>succeeded/code>, code>status/code>, code>device_serial/code> và một code>trace_id/code> mà bạn có thể theo dõi sau này.
• Một bảng điều khiển web. code>uv run artemis ui/code> cung cấp một bảng điều khiển kiểm thử trực quan trên code>localhost:8000/code> nơi bạn quan sát vòng lặp theo từng bước.
• Một MCP server gốc. Đây chính là phần đã khiến nó lan rộng. code>uv run artemis mcp --install all/code> hiển thị code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> và code>mobile_diagnose/code> cho bất kỳ trợ lý nào có khả năng MCP, với các đường cài đặt chính thức cho Antigravity, Claude Code và Codex, cùng khả năng tạo cấu hình cho Cursor, Windsurf, VS Code và Cline/Roo. Từ một trợ lý đã kết nối với server, "build APK, cài đặt nó, mở cài đặt, bật chế độ máy bay, chụp màn hình kết quả" không còn là một script nữa mà trở thành một câu.
• Một trình hỗ trợ trợ năng. Tác vụ đầu tiên cài đặt Artemis Accessibility Helper, công cụ này đọc bố cục màn hình mà không giữ kết nối UiAutomation — một cách có chủ đích, để các công cụ khác dựa trên UiAutomator trên cùng thiết bị không bị chặn. Nó chạy trên điện thoại và không gửi gì ra khỏi thiết bị, đồng thời chuyển sang UIAutomator2 khi không thể đính kèm, với phương án dự phòng được hiển thị trong dòng thời gian tác vụ.
• Thu thập log và trace. Ngăn xếp khi crash, ảnh chụp màn hình keyframe và báo cáo chẩn đoán được thu thập tự động thay vì được bên gọi gắn thêm — lý do nó có thể dùng như một bộ kiểm thử hồi quy chứ không chỉ là một bản demo.

Flash và Pro là hai sản phẩm khác nhau cùng chung một tên.
Điều quan trọng nhất cần hiểu trước khi bạn đánh giá ARTEMIS so với bất cứ thứ gì là code>--profile flash/code> và code>--profile pro/code> không phải là cài đặt tốc độ trên một tác nhân. Chúng là hai tác nhân.
• Flash — một vòng lặp quan sát-và-hành động mang tính phản ứng, khoảng 3–5 giây mỗi bước, không có kế hoạch, không có ghi chú, không có kiểm tra an toàn trước khi thực thi, không có xác minh điểm kiểm tra, không có báo cáo cuối cùng và không có ADB shell. Theo mặc định, vòng lặp này không bị giới hạn vì lịch sử được nén thay vì được tích lũy.
• Pro — một đồ thị đa tác tử mất khoảng 15–40 giây mỗi bước, được xây dựng từ một Planner duy trì một kế hoạch Markdown sống động với code>verify/code> và code>assert/code> là các mục rõ ràng, một Operator với bộ công cụ đầy đủ, và một Checker chỉ đọc để xác thực các checkpoint và chạy đánh giá khi thoát. code>--verification-level/code> nhận code>off/code>, code>final/code> (mặc định), code>checkpoints/code> hoặc code>strict/code>.
Đó là mức chênh lệch độ trễ gấp năm đến mười lần cho cùng một mô tả tác vụ, và đó là sự khác biệt giữa một smoke test và một lần chạy thăm dò hơn 100 bước. Cách định hình của chính Google là Pro dành cho công việc tầm xa và việc liên tục code>[Loop:continuous]/code> giám sát; Flash dành cho các việc UI thường ngày, mang tính xác định. Nếu bạn đọc một bài đánh giá trích dẫn thời gian từng bước mà không cho bạn biết cấu hình nào đã tạo ra chúng, thì nó chẳng nói cho bạn điều gì cả.

Chiến lược định vị mới là phần kỹ thuật thực sự.
Hầu hết các framework tự động hóa di động đều gục ngã vì selector. ARTEMIS được xây dựng theo hướng ưu tiên động: khi tồn tại chỉ mục phần tử trợ năng, nó dùng chỉ mục đó; khi không tồn tại — một Canvas, một bề mặt Compose, một view Flutter, một game — nó chuyển sang phương án dự phòng là tọa độ và thị giác máy tính. Không có lớp XPath nào cần bảo trì và không có ID nào bị lỗi thời, điều này rất quan trọng vì những ứng dụng bạn muốn kiểm thử nhất chính là những ứng dụng phát hành bản build mới hằng tuần.
Hồ sơ Pro bổ sung một Safety Net: mọi thao tác đều đi qua bước kiểm tra trước khi thực thi, ưu tiên XML với phương án dự phòng bằng pixel, để bắt được popup hệ thống đang chuẩn bị nuốt cú chạm của bạn. Khi thất bại, một “execution incident” sẽ được mở và vẫn nằm trong ngữ cảnh cho đến khi một lần thành công sau đó giải quyết nó, thay vì sinh ra một agent sửa chữa riêng. Các phiên dài được nén lại — ảnh chụp màn hình cũ trở thành tóm tắt trực quan, các bước đã hoàn thành được chia thành những giai đoạn có thể truy hồi mà code>search_history/code> và code>replay_steps/code> có thể kéo lại — điều này giúp ngữ cảnh 100 bước không trở nên quá đắt đỏ.
99,1% trên bảng xếp hạng, và lưu ý mà các bài đăng ra mắt bỏ qua
Tuyên bố đáng chú ý nhất của ARTEMIS là tỷ lệ hoàn thành trên 99% trên AndroidWorld, bộ đánh giá của Google Research gồm 116 tác vụ thực tế trải rộng trên hơn 20 ứng dụng, được tính điểm theo Pass@1. Tính đến ngày 11 tháng 9 năm 2026, bảng xếp hạng AndroidWorld ghi nhận ARTEMIS ở mức 99,1%, so với mobile-use của Minitap ở mức 91,4%, còn hiệu suất của con người là 80%. Nhìn trên bảng thì đó là mức tiên tiến nhất trong số các kết quả được công bố công khai.
Hai điều cần được đặt bên cạnh con số đó. Thứ nhất, bảng xếp hạng AndroidWorld nói rõ rằng họ không tự mình xác minh một cách độc lập các bài nộp — mọi con số trên đó, kể cả của ARTEMIS, đều do chính nhóm tạo ra nó tự báo cáo, và một phân tích độ bền vững đã cho thấy chỉ riêng các biến thể nhiệm vụ cũng có thể làm thay đổi đáng kể điểm số của một tác nhân. Hãy coi 99,1% là một tuyên bố mạnh mẽ từ nhà cung cấp trên một benchmark công khai, có thể kiểm tra, một điều có thật và hữu ích, chứ không phải là một phép đo đã được kiểm toán, vì nó không phải như vậy. Thứ hai, cấu trúc của phép so sánh rất quan trọng: benchmark là một tập nhiệm vụ cố định, và biểu đồ so sánh đã công bố của ARTEMIS được cho là đã bỏ sót mobile-use trong khi vẫn đưa vào các mục khác. Một benchmark mà kết quả mạnh nhất trước đó bị thiếu khỏi biểu đồ là một tuyên bố yếu hơn so với hàm ý của con số phần trăm thô.
Cuộc tranh chấp, vốn mới là tin tức thực sự trong tháng này
Trên blog của mình và trong một issue công khai trên repository, Minitap — một startup chuyên về kiểm thử di động với dự án mã nguồn mở mobile-use làm cùng công việc đó cho Android và iOS — cáo buộc rằng 228 trong số 229 tệp của ARTEMIS giống hệt với các tệp của chính mình. Những chi tiết cụ thể mà họ công bố mang tính cụ thể một cách bất thường: mã kết nối thiết bị Android khớp với cách triển khai của họ, việc tái sử dụng nguyên văn từng chữ các hướng dẫn thuộc về một agent tên là "Hopper", và một ví dụ WhatsApp gửi tin nhắn chúc mừng năm mới tới Alice, Bob và Charlie, được tái tạo với cùng các chú thích, cùng các bước dọn dẹp và cùng một lỗi. Họ còn cáo buộc thêm rằng một tệp mang tên của ba tác giả Minitap — Pierre-Louis Favreau, Jean-Pierre Lo và Nicolas Dehandschoewercker — đã bị thay thế bằng force-push vào tháng 8, với các tên bị xóa bỏ và một tác giả khác được thay vào.
Câu hỏi về giấy phép không hề mập mờ. mobile-use dùng Apache 2.0, và Apache 2.0 cho phép đúng kiểu tái sử dụng này — mang tính thương mại, phái sinh, đóng — miễn là bạn giữ lại các thông báo bản quyền và nêu rõ những gì bạn đã thay đổi. Điều mà nó không cho phép là phát hành mã nguồn với các thông báo đã bị gỡ bỏ. Kể từ khi những cáo buộc nổi lên, kho lưu trữ đã mang dòng "This project includes source code developed by Minitap, Inc." và liên kết tới minitap-ai/mobile-use, và bản commit ngày 12 tháng 9 hoàn tất việc ghi công đó, tại thời điểm viết bài, là thay đổi mới nhất trên code>main/code>. Minitap chưa công bố bằng chứng nào liên kết việc gỡ bỏ phần ghi công với các bài nộp bảng xếp hạng chưa được trả lời của chính mình, và Google cũng chưa đưa ra phản hồi công khai chi tiết. Cách hiểu trung thực: đoạn mã được chia sẻ là hợp pháp và vốn luôn được cho phép; còn khâu giấy tờ thì, trong một khoảng thời gian, là không, và nay đã được khắc phục.
Phần không ai tính vào chi phí: hóa đơn mô hình
ARTEMIS đi kèm một huy hiệu ghi dòng chữ "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL", và tệp cấu hình của nó tại code>config/artemis.jsonc/code> chính là nơi bạn trỏ nó tới bất kỳ mô hình thị giác nào mà bạn có thông tin xác thực. Không có gì trong tệp đó hướng đến người dùng cho tới khi bạn chạy Pro trên một quy trình thực tế và xem một tác nhân chạy dài thực sự tốn bao nhiêu.
Hãy làm phép tính trên các profile. Một lượt chạy Pro 100 bước với 15–40 giây mỗi bước rơi vào khoảng từ 25 phút đến hơn một tiếng đồng hồ thực, và mỗi bước trong số đó đều là ít nhất một lệnh gọi mô hình thị giác mang theo ảnh chụp màn hình. Flash rẻ hơn trên mỗi bước nhưng lặp dữ dội hơn, và vì ngữ cảnh của nó được nén chứ không bị cắt bớt, nó sẽ thoải mái chạy vượt qua giới hạn lượt mà bạn tưởng là mức trần. Dù bạn chọn profile nào, mô hình vẫn là khoản mục chi phí tăng theo quy mô bộ kiểm thử của bạn, chứ không phải giấy phép hay phần cứng.
Đây là điểm mà tại đó một lớp định tuyến không còn chỉ là một khái niệm trừu tượng nữa. Một mô hình thị giác điều khiển một phiên Android dài là một khối lượng công việc với hai đặc tính khó xử: nó tồn tại lâu dài, và nó không dung thứ cho bất kỳ trục trặc nào từ nhà cung cấp ngay giữa bước 74, bởi vì ngữ cảnh của lượt chạy nằm trên endpoint của nhà cung cấp đó. Việc trỏ ARTEMIS vào một base URL tương thích OpenAI duy nhất rồi để cơ chế chuyển đổi dự phòng của chúng tôi đưa lượt chạy sang một nhà cung cấp khác của cùng mô hình chính là sự khác biệt giữa một bài kiểm thử chập chờn và một buổi chiều bị mất trắng. Qwen3.8-Flash là ứng viên thú vị để thử trước tiên — một mô hình MoE đa phương thức với 6B tham số hoạt động và ngữ cảnh 1M token, được niêm yết trong danh mục của chúng tôi ở mức $0.15 mỗi triệu token đầu vào và $0.47 mỗi triệu token đầu ra, với giá đọc cache là $0.018 và ghi cache là $0.230. Giá đọc cache mới là con số đáng quan tâm ở đây, bởi vì một lượt chạy Pro sẽ đọc lại một ngữ cảnh ngày càng lớn ở mỗi bước.
Tuy nhiên, hãy chính xác về ý nghĩa của điều đó: Qwen3.8-Flash không nằm trong danh sách backend đã được kiểm thử của ARTEMIS, vốn nêu tên Gemini, Claude, GPT-4o và Qwen-VL. Đây là một mô hình có khả năng phù hợp với harness, và harness được xây dựng rõ ràng để chấp nhận một mô hình như vậy. Chưa ai công bố benchmark cho cặp kết hợp đó, và bạn nên coi bất kỳ ai tuyên bố có một benchmark như thế là đã bịa ra nó.
Lộ trình, và bao nhiêu phần trong đó là trụ cột
Bốn hạng mục nằm trên lộ trình đã công bố: tích hợp Android Studio với gỡ lỗi trong trình soạn thảo, ghi lại kiểm thử và điều khiển thiết bị; hỗ trợ iOS; các mô hình ngôn ngữ-thị giác nhẹ chạy trên thiết bị cho công việc có độ trễ thấp, ưu tiên quyền riêng tư; và tương tác thoại song công theo thời gian thực.
Mục đầu tiên là mục đáng tin, vì đây là sản phẩm kế tiếp tự nhiên của một nhóm kỹ thuật kiểm thử Pixel và không kèm theo rủi ro nghiên cứu nào — agent vốn đã điều khiển được thiết bị, chỉ cần thêm một bảng điều khiển trong IDE. iOS là một tuyên bố lớn hơn nhiều so với vẻ bề ngoài: toàn bộ chiến lược định vị dựa vào dịch vụ trợ năng của Android, và iOS không có bề mặt tương đương với cùng mô hình quyền, nên hãy kỳ vọng vào việc viết lại lớp nhận thức thay vì một bản chuyển nền tảng. Mục VLM trên thiết bị là mục đáng theo dõi sát sao, vì đây là mục duy nhất trong danh sách có thể loại bỏ chi phí API trên mỗi bước vốn hiện đang chiếm phần lớn trong một bộ kiểm thử lớn — và nó ngụ ý một mô hình nhỏ, nhanh, có khả năng thị giác, có thể duy trì một tác vụ UI từ đầu đến cuối, đây là một mục tiêu hẹp hơn nhiều so với "một mô hình nhỏ giỏi sử dụng công cụ".

Tuần này làm gì với nó
Sao chép nó, chạy code>./start.sh/code> trên một trình giả lập, và giao cho Flash một tác vụ mà bộ Espresso hiện có của bạn đã bao phủ. Điều đó sẽ cho bạn biết trong vòng một giờ liệu bộ định vị ưu tiên động có tồn tại được trên các bề mặt Compose của ứng dụng bạn hay không, và đây chính là câu hỏi quyết định liệu phần còn lại có quan trọng hay không. Sau đó chạy cùng tác vụ đó trên Pro và so sánh hai dấu vết — khoảng cách giữa 3–5 và 15–40 giây mỗi bước chính là nơi ngân sách của bạn nằm, và bạn không thể đánh giá chi phí của ARTEMIS nếu không có nó.
Trong khi bạn đang đọc mã, hãy đọc cả phần tiêu đề. Bản commit ngày 12 tháng 9 đã thêm ghi công Minitap là bản mới nhất trong kho mã, nghĩa là các tiêu đề tệp bạn đang đọc đã bốn ngày tuổi và dự án đang được sửa chữa công khai một cách tích cực. Đó không phải là lý do để tránh nó. Đó là lý do để kiểm tra xem bạn đang cầm phiên bản nào của câu chuyện trước khi bạn trích dẫn một tỷ lệ thành công trong slide.
Việc trỏ ARTEMIS vào một base URL tương thích OpenAI duy nhất và để cơ chế failover của chúng ta chuyển lượt chạy sang một nhà cung cấp khác của cùng mô hình chính là sự khác biệt giữa một bài test chập chờn và một buổi chiều bị mất.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
