بطاقة عنوان مُنشأة لـ ARTEMIS التابع لـ Google تحمل عبارة «Google جعلت ARTEMIS مفتوحة المصدر» فوق السطر «أتمتة Android باللغة الطبيعية، Apache 2.0، أغسطس 2026»، مع ثلاث بطاقات إحصائية تعرض 99.1% في AndroidWorld (وفق الإبلاغ الذاتي)، وFlash عند 3-5 ثوانٍ لكل خطوة وPro عند 15-40 ثانية لكل خطوة، وتذييل يذكر أن المعيار المرجعي مُبلَّغ عنه من المورّد وأن AndroidWorld لا تتحقق من المشاركات.
Engineering & Research

ARTEMIS من Google تجعل أتمتة Android مفتوحة المصدر: ما الذي يغطيه فعلاً ادعاء 99% في AndroidWorld

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أحدث إيداع على google/artemis ليس ميزة. إنه سطر اعتماد — "إصلاح: إكمال README وترويسات الملفات ذات الصلة وفقًا لمتطلبات Apache 2.0،" تم دفعه في 12 سبتمبر 2026، بعد ثلاثة أيام من نشر Minitap منشورًا بعنوان توقعت أفضل من Google. إن ARTEMIS من Google هو وكيل أتمتة Android مفتوح المصدر حديثًا للشركة: فهو يحول تعليمات باللغة الإنجليزية البسيطة إلى نقرات وتمريرات وكتابة وتحقق حقيقية على جهاز Android فعلي أو محاكي، ويلتقط السجلات ولقطات الشاشة أثناء ذلك، ويُبلغ عن معدل إنجاز مهام يبلغ 99% أو أكثر في معيار AndroidWorld التابع لـ Google Research. نُشر في أغسطس الماضي من قبل فريق Pixel Test Engineering Fusion التابع لـ Google بموجب Apache 2.0، وهو يستحق حقًا أن تقضي فيه بعد ظهرك. وهو أيضًا، اعتبارًا من منتصف سبتمبر، مركز نزاع إسناد في المصادر المفتوحة يقول أكثر عن كيفية بناء وكلاء الجوال مما يقوله رقم المعيار. كلتا القصتين حقيقية. واحدة فقط منهما هي سبب كون آخر إيداع في المستودع إصلاحًا لترخيص.

ما الذي تم شحنه فعليًا

ARTEMIS ليس نموذجًا وليس غلافًا لروبوت محادثة. إنه إطار تحكم — نظام Python 3.12+ يقع بين نموذج رؤية ولغة وهاتف حقيقي. تعطيه مهمة بالإنجليزية؛ فيراقب الشاشة، ويقرر إجراءً، وينفذه عبر ADB، ويتحقق مما حدث، ويواصل. خمسة أشياء جاءت في الصندوق:

واجهة سطر أوامر (CLI) وحزمة تطوير Python (SDK). code>./start.sh/code> يهيّئ ADB وscrcpy وFFmpeg وبيئة uv؛ code>uv run artemis run "…" --profile flash/code> يشغّل مهمة دون واجهة؛ code>artemis-client/code> SDK يغلّف الاستدعاء نفسه لـ pytest وCI، ويُعيد code>succeeded/code>، code>status/code>، code>device_serial/code> و code>trace_id/code> يمكنك تتبعه لاحقًا.

وحدة تحكم ويب. code>uv run artemis ui/code> يوفّر وحدة تحكم اختبار مرئية على code>localhost:8000/code> حيث تشاهد الحلقة خطوة بخطوة.

خادم MCP أصلي. هذا هو الجزء الذي جعله ينتشر. code>uv run artemis mcp --install all/code> يوفّر code>mobile_run_task/code>، code>mobile_manage_task/code>، code>mobile_get_device_state/code>، code>mobile_inspect_trace/code> و code>mobile_diagnose/code> إلى أي مساعد يدعم MCP، مع مسارات تثبيت من الدرجة الأولى لـ Antigravity وClaude Code وCodex، إضافة إلى توليد الإعدادات لـ Cursor وWindsurf وVS Code وCline/Roo. من مساعد متصل بالخادم، لم يعد "ابنِ ملف APK، ثبّته، افتح الإعدادات، بدّل وضع الطيران، التقط لقطة شاشة للنتيجة" سكربتًا، بل يتحول إلى جملة.

مساعد لإمكانية الوصول. تثبّت المهمة الأولى Artemis Accessibility Helper، الذي يقرأ تخطيط الشاشة دون الاحتفاظ باتصال UiAutomation — عن قصد، حتى لا تُعطَّل الأدوات الأخرى القائمة على UiAutomator على الجهاز نفسه. وهو يعمل على الهاتف ولا يرسل أي شيء منه، ويعود إلى UIAutomator2 عندما يتعذَّر الاتصال، مع ظهور هذا الاحتياط في الجدول الزمني للمهمة.

التقاط السجلات والتتبعات.يتم جمع مكدسات الأعطال، ولقطات الشاشة للإطارات المفتاحية، وتقرير تشخيصي تلقائيًا بدلًا من أن يضيفها المستدعي يدويًا — وهذا هو السبب في أنه يمكن استخدامها كمجموعة اختبارات انحدار وليست مجرد عرض توضيحي.

A screenshot of the google/artemis repository on GitHub showing the Apache-2.0 licence, 6.0k stars, 528 forks, 54 watchers, 119 commits and 6 contributors, with the most recent commit on main reading 'fix: complete README and relevant file headers per Apache 2.0 requirements', dated four days before capture.

Flash وPro منتجان مختلفان يشتركان في اسم واحد

إنّ أهمّ شيء على الإطلاق يجب فهمه قبل أن تُجري اختبارًا مرجعيًا لـ ARTEMIS مقابل أي شيء هو أنّ code>--profile flash/code> و code>--profile pro/code> ليسا إعداد سرعة في وكيل واحد. إنهما وكيلان.

• Flash — حلقة تفاعلية من الملاحظة والتنفيذ بزمن يقارب 3–5 ثوانٍ لكل خطوة، بلا خطة، وبلا ملاحظات، وبلا فحص سلامة قبل التنفيذ، وبلا تحقق عند نقاط التفتيش، وبلا تقرير نهائي وبلا ADB shell. الحلقة غير محدودة افتراضيًا لأن السجل يُضغط بدلًا من أن يتراكم.

• Pro — رسم بياني متعدد الوكلاء بمعدل 15–40 ثانية تقريبًا لكل خطوة، مبني من Planner يحافظ على خطة Markdown حية مع code>verify/code> و code>assert/code> عناصر صريحة، وOperator يمتلك مجموعة الأدوات الكاملة، وChecker للقراءة فقط يتحقق من نقاط التفتيش ويجري مراجعة خروج. code>--verification-level/code> يأخذ القيم code>off/code>، code>final/code> (الافتراضي)، code>checkpoints/code> أو code>strict/code>.

هذا فرق في زمن الاستجابة يتراوح بين خمسة إلى عشرة أضعاف لنفس وصف المهمة، وهو الفرق بين اختبار الدخان (smoke test) وتشغيل استكشافي يتجاوز 100 خطوة. الإطار الخاص بجوجل نفسه هو أن Pro مخصص للعمل طويل الأمد والمستمرة code>[Loop:continuous]/code> المراقبة؛ Flash مخصص للمهام الروتينية والحتمية لواجهة المستخدم. إذا قرأت مراجعة تقتبس أوقات الخطوات دون أن تخبرك أي ملف تعريف أنتجها، فهي لا تخبرك بأي شيء.

A generated scoreboard comparing ARTEMIS's two execution profiles: Flash at 3-5s per step with no planning, no Safety Net, no checkpoint checks and no ADB shell, against Pro at 15-40s per step with a Planner and living plan, a Safety Net on every action, four verification levels (off, final, checkpoints, strict) and ADB shell.

استراتيجية تحديد المواقع هي الهندسة الحقيقية

تنهار معظم أطر أتمتة الجوال عند المحدِّدات. بُني ARTEMIS على أساس الديناميكية أولًا: فعندما يوجد فهرس لعنصر إمكانية الوصول، يستخدمه؛ وعندما لا يوجد — سواء كان Canvas، أو سطح Compose، أو عرض Flutter، أو لعبة — يلجأ إلى الإحداثيات والرؤية الحاسوبية. لا توجد طبقة XPath يجب صيانتها ولا معرّف ID قد يتقادم، وهذا مهم لأن التطبيقات التي تريد اختبارها أكثر من غيرها هي تلك التي تصدر إصدارات جديدة أسبوعيًا.

يضيف ملف Pro شبكة أمان: يمر كل إجراء بفحص قبل التنفيذ، يعتمد على XML أولاً مع احتياطي بالبكسل، يلتقط النافذة المنبثقة للنظام التي تكاد تلتهم نقرةك. عند الفشل، يُفتح «حادث تنفيذ» يبقى في السياق إلى أن يحلّه نجاح لاحق، بدلاً من إنشاء وكيل إصلاح منفصل. تُضغط الجلسات الطويلة — تتحول لقطات الشاشة القديمة إلى ملخصات بصرية، وتُقسَّم الخطوات المكتملة إلى حقب قابلة للاستدعاء التي code>search_history/code> و code>replay_steps/code> يمكنهما استرجاعها — وهذا ما يمنع سياقاً من 100 خطوة من أن يصبح باهظ التكلفة.

‏99.1% على لوحة الصدارة، والتحذير الذي تتجاهله منشورات الإطلاق

الادعاء الرئيسي لـ ARTEMIS هو معدل إكمال يتجاوز 99% على AndroidWorld، المعيار الذي طورته Google Research والذي يضم 116 مهمة واقعية عبر نحو 20 تطبيقًا، ويُحتسب بدرجة Pass@1. حتى 11 سبتمبر 2026، كانت لوحة صدارة AndroidWorld تُدرج ARTEMIS عند 99.1% مقابل mobile-use من Minitap عند 91.4%، مع أداء بشري عند 80%. بناءً على الأرقام المعروضة، يُعد هذا الأفضل في فئته بين النتائج المعلنة علنًا.

هناك أمران يجب وضعهما بجانب ذلك الرقم. أولًا، لوحة صدارة AndroidWorld لا تتحقق صراحةً وبشكل مستقل من المشاركات — فكل رقم عليها، بما في ذلك رقم ARTEMIS، مُبلَّغ عنه ذاتيًا من الفريق الذي أنتجه، وقد أظهر تحليل متانة أن تنويعات المهام وحدها يمكن أن تحرّك درجة الوكيل بشكل كبير. تعامل مع 99.1% كادعاء قوي من مُورِّد على معيار عام قابل للتحقق، وهو أمر حقيقي ومفيد، وليس كقياس مُدقَّق، فهو ليس كذلك. ثانيًا، شكل المقارنة مهم: المعيار عبارة عن مجموعة مهام ثابتة، ويُقال إن مخطط المقارنة المنشور لـ ARTEMIS أغفل mobile-use بينما ضمّ إدخالات أخرى. إن معيارًا تغيب عنه أقوى نتيجة سابقة من المخطط هو ادعاء أضعف مما توحي به النسبة الخام.

الخلاف، الذي هو الخبر الفعلي هذا الشهر

على مدونتها وفي تذكرة عامة على المستودع، ادّعت Minitap — وهي شركة ناشئة لاختبار الجوال، ومشروعها مفتوح المصدر mobile-use الذي يؤدي المهمة نفسها على Android وiOS — أن 228 من أصل 229 ملفاً لدى ARTEMIS كانت مطابقة لملفاتها. والتفاصيل التي نشرتها محددة على نحو غير معتاد: كود اتصال أجهزة Android المطابق لتنفيذها، وإعادة الاستخدام الحرفي لتعليمات تخص وكيلاً يُدعى "Hopper"، ومثال WhatsApp يرسل رسائل رأس السنة إلى Alice وBob وCharlie، أُعيد إنتاجه بالتعليقات نفسها وخطوات التنظيف نفسها والخطأ نفسه. كما تدّعي أن ملفاً يحمل أسماء ثلاثة من مؤلفي Minitap — Pierre-Louis Favreau وJean-Pierre Lo وNicolas Dehandschoewercker — استُبدل عبر force-push في أغسطس، مع إزالة الأسماء واستبدالها بمؤلف مختلف.

مسألة الترخيص ليست غامضة. mobile-use مرخّص بموجب Apache 2.0، ويسمح Apache 2.0 تحديدًا بهذا النوع من إعادة الاستخدام — التجاري، والمشتق، والمغلق — بشرط أن تحافظ على إشعارات حقوق النشر وتوضّح ما غيّرته. وما لا يسمح به هو شحن الشيفرة بعد إزالة الإشعارات منها. منذ ظهور الادعاءات، أدرج المستودع السطر "يتضمن هذا المشروع شيفرة مصدرية مطوَّرة من Minitap, Inc." وروابط إلى minitap-ai/mobile-use، والإيداع المؤرخ 12 سبتمبر الذي أكمل هذا الإسناد هو، وقت كتابة هذا النص، أحدث تغيير على code>main/code>. لم تنشر Minitap أي دليل يربط إزالة الإسناد بمشاركاتها على لوحة المتصدرين التي لم يُرَدّ عليها، ولم تصدر Google ردًا عامًا مفصلًا. القراءة الصادقة: الشيفرة التي تُشارَك مشروعة وكان مسموحًا بها دائمًا؛ أما الجانب الورقي فلم يكن سليمًا لفترة، وقد صُحّح الآن.

الجانب الذي لا يحسب له أحد حسابًا: فاتورة النموذج

يأتي ARTEMIS مزوّدًا بشارة تحمل نص "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL"، وملف التكوين الخاص به في code>config/artemis.jsonc/code> هو المكان الذي توجّهه فيه نحو أي نموذج رؤية تملك بيانات اعتماده. لا شيء في ذلك الملف موجّه للمستخدم حتى تشغّل Pro على سير عمل حقيقي وتراقب التكلفة الفعلية لوكيل يعمل لفترة طويلة.

أجرِ الحسابات على الملفات التعريفية. تشغيل Pro من 100 خطوة بمعدل 15–40 ثانية لكل خطوة يقع بين 25 دقيقة وأكثر قليلًا من ساعة من الزمن الفعلي، وكل خطوة من تلك الخطوات هي على الأقل استدعاء واحد لنموذج رؤية يحمل لقطة شاشة. Flash أرخص لكل خطوة لكنه يكرر أكثر، ولأن سياقه يُضغط بدلًا من أن يُقتطع فسيستمر بسهولة إلى ما بعد حد الأدوار الذي افترضته سقفًا. أيّ ملف تعريف تختار، فإن النموذج هو البند الذي يتوسع مع مجموعة اختباراتك، وليس الترخيص أو العتاد.

هنا لم تعد طبقة التوجيه مجرد تجريد. نموذج رؤية يقود جلسة أندرويد طويلة هو عبء عمل ذو خاصيتين محرجتين: فهو طويل الأمد، ولا يتحمل عطلًا مؤقتًا من مزوّد في منتصف الخطوة 74، لأن سياق التشغيل موجود على نقطة نهاية ذلك المزوّد. توجيه ARTEMIS إلى عنوان URL أساسي واحد متوافق مع OpenAI والسماح لآلية تجاوز الفشل لدينا بنقل التشغيل إلى مزوّد آخر لنفس النموذج هو الفرق بين اختبار متقلب وضياع فترة بعد الظهر. Qwen3.8-Flash هو المرشح المثير للاهتمام للتجربة أولًا — نموذج MoE متعدد الوسائط بـ 6B نشط وسياق من 1M رمز، مُدرج في كتالوجنا بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون إخراج، مع قراءات ذاكرة مؤقتة بسعر 0.018 وكتابات ذاكرة مؤقتة بسعر 0.230. سعر قراءة الذاكرة المؤقتة هو السعر ذو الصلة هنا، لأن تشغيل Pro يعيد قراءة سياق متنامٍ في كل خطوة.

كن دقيقًا في ما يعنيه ذلك: Qwen3.8-Flash ليس ضمن قائمة الواجهات الخلفية المختبَرة لدى ARTEMIS، التي تذكر Gemini وClaude وGPT-4o وQwen-VL. إنه نموذج يُحتمل أن يتوافق مع إطار التقييم، وقد بُني إطار التقييم صراحةً ليقبل واحدًا. لم ينشر أحد اختبارًا معياريًا لهذا الاقتران، وعليك أن تعتبر أي شخص يزعم وجود واحد قد اختلقه.

خريطة الطريق، وكم منها يُعدّ حاملًا للعبء

أربعة عناصر على خارطة الطريق المنشورة: تكامل Android Studio مع التصحيح داخل المحرر، وتسجيل الاختبارات والتحكم في الأجهزة؛ ودعم iOS؛ ونماذج رؤية ولغة خفيفة تعمل على الجهاز لأداء منخفض زمن الاستجابة يعطي الأولوية للخصوصية؛ وتفاعل صوتي ثنائي الاتجاه في الوقت الفعلي.

الأول هو الجدير بالتصديق، لأنه الناتج التالي الطبيعي من فريق هندسة اختبار Pixel وليس له مخاطرة بحثية مرتبطة به — فالوكيل بالفعل يقود جهازًا، ويحتاج فقط إلى لوحة في IDE. إن iOS ادعاء أكبر بكثير مما يبدو من الخارج: فاستراتيجية التحديد بأكملها تعتمد على خدمة إمكانية الوصول في Android، ولا يوجد في iOS سطح مكافئ بنفس نموذج الأذونات، لذا توقّع إعادة كتابة طبقة الإدراك بدلًا من نقلها. أما بند VLM على الجهاز فهو الجدير بالمراقبة عن كثب، لأنه البند الوحيد في القائمة الذي من شأنه إزالة تكلفة API لكل خطوة التي تهيمن حاليًا على مجموعة اختبار كبيرة — وهو يلمّح إلى نموذج صغير وسريع وقادر على الرؤية يمكنه الحفاظ على تماسك مهمة واجهة مستخدم، وهو هدف أضيق بكثير من "نموذج صغير يجيد استخدام الأدوات".

A generated roadmap card listing ARTEMIS's four announced items - Android Studio plugin, iOS support, on-device lightweight VLMs and real-time duplex voice - above a wider card noting that the latest commit on main, dated 12 September 2026, was an Apache 2.0 attribution fix, with a footer reading 'Roadmap items are announced, not shipped'.

ماذا أفعل به هذا الأسبوع

انسخه، شغّل code>./start.sh/code> على محاكي واحد، وأعطِ Flash مهمة تغطيها مجموعة Espresso الحالية لديك. سيخبرك ذلك خلال ساعة ما إذا كان محدد الموقع الديناميكي أولاً ينجو من واجهات Compose في تطبيقك، وهذا هو السؤال الذي يحدد ما إذا كان أي من الباقي مهمًا. ثم شغّل المهمة نفسها على Pro وقارن التتبعين — الفجوة بين 3–5 و15–40 ثانية لكل خطوة هي حيث تكمن ميزانيتك، ولا يمكنك التفكير في تكلفة ARTEMIS من دونها.

بينما تقرأ الكود، اقرأ الترويسات. إنّ الالتزام بتاريخ 12 سبتمبر الذي أضاف إسناد Minitap هو الأحدث في المستودع، ما يعني أن ترويسات الملفات التي تقرأها عمرها أربعة أيام وأن المشروع يُصلَّح علنًا وبشكل نشط. هذا ليس سببًا لتجنّبه. بل هو سبب للتحقق من أي نسخة من القصة تحملها قبل أن تقتبس معدل نجاح في عرض تقديمي.

توجيه ARTEMIS إلى عنوان URL أساسي واحد متوافق مع OpenAI والسماح لآلية التحويل عند الفشل لدينا بنقل التشغيل إلى مزوّد آخر للنموذج نفسه هو الفرق بين اختبار غير مستقر وبعد ظهر ضائع.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا