
ARTEMIS של Google משחררת את אוטומציית Android כקוד פתוח: מה בעצם מכסה הטענה בדבר 99% ב-AndroidWorld
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
הקומיט החדש ביותר ב-google/artemis אינו תכונה. זהו שורת קרדיט — "תיקון: השלם את README ואת כותרות הקבצים הרלוונטיות בהתאם לדרישות Apache 2.0," שנדחף ב-12 בספטמבר 2026, שלושה ימים לאחר ש-Minitap פרסמה פוסט שכותרתו ציפיתי ליותר מגוגל. ARTEMIS של גוגל הוא סוכן האוטומציה לאנדרואיד שזה עתה נפתח בקוד פתוח של החברה: הוא הופך הוראה באנגלית פשוטה להקשות, החלקות, הקלדה ואימות אמיתיים על מכשיר אנדרואיד פיזי או אמולטור, לוכד את הלוגים וצילומי המסך לאורך הדרך, ומדווח על שיעור השלמת משימות של 99%+ במבחן AndroidWorld של Google Research. הוא פורסם באוגוסט הזה על ידי צוות Pixel Test Engineering Fusion של גוגל תחת Apache 2.0, ובאמת שווה את אחר הצהריים שלך. הוא גם, נכון לאמצע ספטמבר, במרכזו של מאבק ייחוס בקוד פתוח שאומר יותר על איך בונים סוכנים ניידים מאשר מספר הביצועים. שני הסיפורים אמיתיים. רק אחד מהם הוא הסיבה שהקומיט האחרון במאגר היה תיקון רישיון.
מה שנשלח בפועל
ARTEMIS אינו מודל ואינו עטיפה של צ'אטבוט. זוהי רתמת בקרה — מערכת Python 3.12+ שנמצאת בין מודל חזותי-לשוני לבין מכשיר טלפון אמיתי. אתה נותן לה משימה באנגלית; היא צופה במסך, מחליטה על פעולה, מבצעת אותה דרך ADB, בודקת מה קרה, וממשיכה הלאה. חמישה דברים הגיעו בקופסה:
• CLI ו-SDK של Python. code>./start.sh/code> מאתחל את ADB, scrcpy, FFmpeg ואת סביבת uv; code>uv run artemis run "…" --profile flash/code> מריץ משימה ללא ממשק; ה-SDK של code>artemis-client/code> עוטף את אותה קריאה עבור pytest ו-CI, ומחזיר code>succeeded/code>, code>status/code>, code>device_serial/code> ו-code>trace_id/code> שתוכל לעקוב אחריו מאוחר יותר.
• קונסול ווב. code>uv run artemis ui/code> מגיש קונסול בדיקות ויזואלי בכתובת code>localhost:8000/code> שבו תוכל לצפות בלולאה צעד אחר צעד.
• שרת MCP מקורי. זה החלק שגרם לו להתפשט. code>uv run artemis mcp --install all/code> חושף את code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> וcode>mobile_diagnose/code> בפני כל עוזר עם תמיכה ב-MCP, עם מסלולי התקנה מלאים ל-Antigravity, Claude Code ו-Codex, וגם יצירת קונפיגורציה ל-Cursor, Windsurf, VS Code ו-Cline/Roo. מעוזר שהשרת מחובר אליו, "בנה את ה-APK, התקן אותו, פתח את ההגדרות, הפעל מצב טיסה, צלם מסך של התוצאה" מפסיק להיות סקריפט והופך למשפט.
• עוזר נגישות. המשימה הראשונה מתקינה את Artemis Accessibility Helper, שקורא את פריסת המסך בלי להחזיק בחיבור ה-UiAutomation — במכוון, כדי שכלי עבודה אחרים מבוססי UiAutomator באותו מכשיר לא ידוכאו. הוא פועל על הטלפון ואינו שולח דבר ממנו החוצה, ונופל בחזרה אל UIAutomator2 כשהוא לא מצליח להתחבר, כאשר הנפילה לאחור מוצגת בציר הזמן של המשימה.
• לכידת לוג ועקיבה.מחסניות קריסה, צילומי מסך של פריימים מפתח ודוח אבחון נאספים אוטומטית במקום להיות מחוברים בדיעבד על ידי הקורא — הסיבה לכך שאפשר להשתמש בו כחבילת רגרסיה ולא רק כדמו.

Flash ו-Pro הם שני מוצרים שונים החולקים שם אחד.
הדבר היחיד והחשוב ביותר שצריך להבין לפני שאתה משווה את ARTEMIS למשהו הוא שcode>--profile flash/code> וcode>--profile pro/code> הם לא הגדרת מהירות בסוכן אחד. הם שני סוכנים.
• Flash — לולאת התבוננות-ופעולה ריאקטיבית בקצב של בערך 3–5 שניות לכל שלב, ללא תוכנית, ללא הערות, ללא בדיקת בטיחות לפני ביצוע, ללא אימות נקודת ביקורת, ללא דוח סופי וללא ADB shell. הלולאה אינה חסומה כברירת מחדל מכיוון שההיסטוריה נדחסת ולא נצברת.
• Pro — גרף מרובה-סוכנים בקצב של בערך 15–40 שניות לכל צעד, הבנוי ממתכנן שמתחזק תוכנית Markdown חיה עם פריטי code>verify/code> וcode>assert/code> מפורשים, מפעיל עם ערכת הכלים המלאה, ובודק לקריאה בלבד שמאמת נקודות ביקורת ומריץ סקירת יציאה. code>--verification-level/code> מקבל code>off/code>, code>final/code> (ברירת המחדל), code>checkpoints/code> או code>strict/code>.
זהו הבדל של פי חמישה עד עשרה בהשהיה עבור אותו תיאור משימה, וזה ההבדל בין בדיקת עשן לריצת חקר בת 100+ שלבים. המסגור של גוגל עצמה הוא ש-Pro מיועד לעבודה באופק ארוך ולניטור רציף code>[Loop:continuous]/code>; Flash מיועד למטלות UI שגרתיות ודטרמיניסטיות. אם אתם קוראים ביקורת שמצטטת זמני שלבים בלי לומר איזה פרופיל הפיק אותם, היא לא מספרת לכם דבר.

אסטרטגיית האיכון היא ההנדסה האמיתית
רוב מסגרות האוטומציה למובייל נשברות בגלל סלקטורים. ARTEMIS בנויה בגישה של דינמיות תחילה: כאשר קיים אינדקס של רכיבי נגישות, היא משתמשת בו; כאשר הוא לא קיים — Canvas, משטח Compose, תצוגת Flutter, משחק — היא עוברת לגיבוי של קואורדינטות וראייה. אין שכבת XPath לתחזק ואין ID שמתיישן, וזה חשוב כי היישומים שאתם הכי רוצים לבדוק הם אלה שמשחררים בילדים חדשים מדי שבוע.
פרופיל ה-Pro מוסיף רשת ביטחון: כל פעולה עוברת בדיקת קדם-ביצוע, XML תחילה עם גיבוי מבוסס פיקסלים, שתופסת את החלון הקופץ של המערכת שעומד לבלוע את ההקשה שלך. כשלים פותחים "תקרית ביצוע" שנשארת בהקשר עד שהצלחה מאוחרת יותר פותרת אותה, במקום ליצור סוכן תיקון נפרד. סשנים ארוכים נדחסים — צילומי מסך ישנים הופכים לסיכומים חזותיים, שלבים שהושלמו מקובצים לתקופות ניתנות לשליפה שאותן code>search_history/code> ו־code>replay_steps/code> יכולים לשלוף בחזרה — וזה מה שמונע מהקשר של 100 שלבים להפוך ליקר מדי.
99.1% בטבלת המובילים, וההסתייגות שהפוסטים של ההשקה מדלגים עליה
הטענה המרכזית של ARTEMIS היא שיעור השלמה של 99%+ ב-AndroidWorld, הבנצ'מרק של Google Research הכולל 116 משימות ריאליסטיות בכ-20 אפליקציות, הנמדד כ-Pass@1. נכון ל-11 בספטמבר 2026, לוח התוצאות של AndroidWorld הציג את ARTEMIS ב-99.1% לעומת mobile-use של Minitap ב-91.4%, כאשר ביצועי אדם עומדים על 80%. לפי הטבלה, מדובר במצב האמנות (state of the art) מבין התוצאות שדווחו בפומבי.
שני דברים צריכים לבוא לצד המספר הזה. ראשית, לוח הדירוג של AndroidWorld מציין במפורש שאינו מאמת את ההגשות באופן עצמאי — כל נתון בו, כולל זה של ARTEMIS, מדווח על ידי הצוות שהפיק אותו בעצמו, וניתוח עמידות הראה שווריאציות במשימות לבדן יכולות להזיז את הציון של סוכן באופן משמעותי. התייחסו ל-99.1% כאל טענה חזקה של הספק על בנצ'מרק ציבורי שניתן לבדוק, שזה דבר אמיתי ושימושי, ולא כאל מדידה מבוקרת, כי היא אינה כזו. שנית, לצורת ההשוואה יש חשיבות: הבנצ'מרק הוא סט משימות קבוע, ולפי הדיווחים תרשים ההשוואה שפורסם של ARTEMIS השמיט את mobile-use בעוד שכלל פריטים אחרים. בנצ'מרק שבו התוצאה הקודמת החזקה ביותר חסרה מהתרשים הוא טענה חלשה יותר ממה שהאחוז הגולמי מרמז.
המחלוקת, שהיא החדשות האמיתיות של החודש
בבלוג שלה וב-issue פומבי במאגר, Minitap — סטארטאפ לבדיקות מובייל שפרויקט הקוד הפתוח שלו mobile-use עושה את אותה עבודה עבור אנדרואיד ו-iOS — טענה ש-228 מתוך 229 הקבצים של ARTEMIS היו זהים לשלה. הפרטים שפרסמה קונקרטיים באופן יוצא דופן: קוד לחיבור מכשירי אנדרואיד שתואם את המימוש שלה, שימוש מילולי בהוראות השייכות לסוכן בשם "Hopper", ודוגמת WhatsApp ששולחת הודעות שנה חדשה לאליס, בוב וצ'ארלי, ומשוחזרת עם אותן הערות, אותם שלבי ניקוי ואותו באג. היא טוענת עוד שקובץ שנשא את שמותיהם של שלושה מחברים מ-Minitap — Pierre-Louis Favreau, Jean-Pierre Lo ו-Nicolas Dehandschoewercker — הוחלף ב-force-push באוגוסט, כשהשמות הוסרו והוחלף בהם מחבר אחר.
שאלת הרישיון אינה מעורפלת. mobile-use מופץ תחת Apache 2.0, ו-Apache 2.0 מתיר בדיוק סוג כזה של שימוש חוזר — מסחרי, נגזר, סגור — בתנאי שתשמרו את הודעות זכויות היוצרים ותציינו מה שיניתם. מה שהוא אינו מתיר הוא להפיץ את הקוד כשההודעות הוסרו ממנו. מאז שהתפרסמו ההאשמות, המאגר נושא את השורה "This project includes source code developed by Minitap, Inc." וקישורים אל minitap-ai/mobile-use, והקומיט מ-12 בספטמבר שהשלים את הייחוס הזה הוא, בזמן כתיבת הדברים, השינוי האחרון ב-code>main/code>. Minitap לא פרסמה שום ראיה המקשרת בין הסרת הייחוס לבין ההגשות שלה ללוח הדירוג שנותרו ללא מענה, וגוגל לא פרסמה תגובה ציבורית מפורטת. הקריאה הכנה: הקוד שמשותף הוא לגיטימי ותמיד היה מותר; התיעוד, למשך תקופה, לא היה כזה, וכעת הדבר תוקן.
החלק שאף אחד לא מתמחר: חשבון המודל
ARTEMIS מגיעה עם תג שעליו כתוב "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL", וקובץ התצורה שלה ב-code>config/artemis.jsonc/code> הוא המקום שבו אתה מפנה אותה לכל מודל ראייה שיש לך הרשאות עבורו. שום דבר בקובץ הזה אינו גלוי למשתמש עד שאתה מריץ Pro על זרימת עבודה אמיתית ורואה מה באמת עולה סוכן ארוך.
בצע את החשבון על הפרופילים. הרצת Pro בת 100 צעדים בקצב של 15–40 שניות לצעד היא משהו בין 25 דקות למעט יותר משעה של זמן שעון, וכל אחד מהצעדים האלה הוא לפחות קריאה אחת למודל ראייה שנושאת צילום מסך. Flash זול יותר לכל צעד אבל נכנס ללולאות חזק יותר, ומכיוון שההקשר שלו נדחס ולא נחתך, הוא ירוץ בשמחה מעבר למגבלת התורות שהנחת שהיא תקרה. איזה פרופיל שתבחר, המודל הוא סעיף ההוצאה שמתאים את עצמו לחבילת הבדיקות שלך, לא הרישיון ולא החומרה.
כאן שכבת ניתוב מפסיקה להיות הפשטה. מודל ראייה שמפעיל הפעלה ארוכה של אנדרואיד הוא עומס עבודה עם שתי תכונות לא נוחות: הוא ארוך-טווח, והוא לא סובל תקלה של ספק באמצע שלב 74, כי ההקשר של ההרצה נמצא בנקודת הקצה של אותו ספק. הפניית ARTEMIS לכתובת בסיס אחת תואמת OpenAI ומתן אפשרות ל-failover שלנו להעביר את ההרצה לספק אחר של אותו מודל היא ההבדל בין בדיקה לא יציבה לאחר צהריים אבוד. Qwen3.8-Flash הוא המועמד המעניין לנסות ראשון — MoE מולטימודלי עם 6B פעילים והקשר של 1M טוקנים, הרשום בקטלוג שלנו במחיר של $0.15 למיליון טוקני קלט ו-$0.47 למיליון פלט, עם קריאות מטמון ב-$0.018 וכתיבות מטמון ב-$0.230. מחיר קריאת המטמון הוא הרלוונטי כאן, כי הרצת Pro קוראת מחדש הקשר שהולך וגדל בכל שלב.
עם זאת, תהיה מדויק לגבי מה זה אומר: Qwen3.8-Flash אינו נמצא ברשימת הבקאנדים הנבדקים של ARTEMIS, שמפרטת את Gemini, Claude, GPT-4o ו-Qwen-VL. זהו מודל שסביר שהוא מתאים להרנס, וההרנס נבנה במפורש כדי לקבל אחד כזה. איש לא פרסם בנצ'מרק של הצירוף הזה, ועליך להתייחס לכל מי שטוען שכן כמי שהמציא אותו.
מפת הדרכים, וכמה ממנה נושא עומס
ארבעה פריטים נמצאים במפת הדרכים שפורסמה: אינטגרציה עם Android Studio הכוללת ניפוי שגיאות בתוך העורך, הקלטת בדיקות ושליטה במכשיר; תמיכה ב-iOS; מודלים קלים של ראייה-שפה על המכשיר לעבודה בזמן השהיה נמוכה ובעדיפות לפרטיות; ואינטראקציית קול דו-כיוונית בזמן אמת.
הראשון הוא זה שאפשר להאמין בו, כי הוא התוצר הטבעי הבא מצוות הנדסת בדיקות של Pixel ואין בו סיכון מחקרי — הסוכן כבר מפעיל מכשיר, הוא רק צריך פאנל ב-IDE. iOS הוא טענה גדולה בהרבה ממה שהוא נראה מבחוץ: כל אסטרטגיית האיתור נשענת על שירות הנגישות של Android, ול-iOS אין משטח מקביל עם אותו מודל הרשאות, אז צפו לשכתוב של שכבת התפיסה ולא להסבה. פריט ה-VLM על-המכשיר הוא זה ששווה לעקוב אחריו מקרוב, כי הוא הפריט היחיד ברשימה שיסיר את עלות ה-API לכל שלב, שכיום שולטת בחבילת בדיקות גדולה — והוא מרמז על מודל קטן, מהיר ובעל יכולת ראייה שיכול להחזיק משימת UI שלמה, וזה יעד צר בהרבה מ"מודל קטן שטוב בשימוש בכלים".

מה לעשות עם זה השבוע
שכפל אותו, הרץ code>./start.sh/code> מול אמולטור אחד, ותן ל-Flash משימה שחבילת ה-Espresso הקיימת שלך מכסה. זה יגיד לך בתוך שעה אם ה-locator שה-dynamic-first שורד את משטחי ה-Compose של האפליקציה שלך, וזו השאלה שמכריעה אם לכל השאר יש בכלל חשיבות. לאחר מכן הרץ את אותה משימה על Pro והשווה בין שני ה-traces — הפער בין 3–5 ל-15–40 שניות לכל צעד הוא המקום שבו התקציב שלך חי, ואי אפשר לנמק לגבי העלות של ARTEMIS בלעדיו.
בזמן שאתם קוראים את הקוד, קראו את הכותרות. הקומיט מ־12 בספטמבר שהוסיף את הייחוס של Minitap הוא הקומיט האחרון במאגר, מה שאומר שכותרות הקבצים שאתם קוראים בנות ארבעה ימים, ושהפרויקט נמצא כעת בתהליך תיקון פעיל לעיני הציבור. זו אינה סיבה להימנע ממנו. זו סיבה לבדוק איזו גרסה של הסיפור נמצאת בידיכם לפני שאתם מצטטים אחוז הצלחה בשקופית.
לכוון את ARTEMIS אל כתובת בסיס בודדת תואמת OpenAI ו-לאפשר למעבר הגיבוי שלנו להעביר את ההרצה לספק אחר של אותו מודל הוא ההבדל בין בדיקה לא יציבה לאחר צהריים אבוד.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
