כרטיס כותרת שנוצר עבור 'ARTEMIS נגד Qwen3.8', עם כותרת המשנה 'אותו בנצ׳מרק, שתי משימות שונות', תוך ניגוד בין תוצאת AndroidWorld של ARTEMIS שדווחה על ידה עצמה — 99.1% — לבין העלייה של 22.5 נקודות שדווחה על ידי הספק של Qwen3.8-Flash לעומת Opus 4.6 באותו בנצ׳מרק, עם הערת שוליים ש-AndroidWorld אינו מאמת באופן עצמאי הגשות.
Guides & Insights

ARTEMIS מול Qwen3.8: אותו בנצ'מרק, שתי משימות שונות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ARTEMIS של Google ו-Qwen3.8 נמדדים שניהם על AndroidWorld, והצירוף מקרים הזה הוא העובדה היחידה והמטעה ביותר בסיקור ההשקה של כל אחד מהפרויקטים. ARTEMIS הוא כלי אוטומציה לאנדרואיד — הוצא כקוד פתוח על ידי Google באוגוסט 2026 תחת Apache 2.0, הוא מקבל הוראה בשפה טבעית, מפעיל מכשיר אמיתי דרך ADB, וטוען לשיעור השלמה של 99%+ במבחן AndroidWorld של Google Research עם 116 משימות, ומציג 99.1% בלוח המובילים הציבורי נכון ל-11 בספטמבר 2026. Qwen3.8-Flash הוא המודל המולטימודלי מסוג תערובת מומחים של Alibaba, שוחרר והוצא כקוד פתוח ב-26 באוגוסט 2026, וחומרי ההשקה שלו טוענים שהוא מנצח את Claude Opus 4.6 ב-22.5 נקודות ב-AndroidWorld. אחד מהמספרים האלה הוא הניקוד של מערכת. האחר הוא התרומה של מודל למערכת שמישהו אחר כתב. אם תקרא אותם כיריבים, תסיק את הדבר הלא נכון לגבי שניהם; אם תקרא אותם כשני חצאים של סטאק אחד, לשאלה המעניינת — מה העלות האמיתית של ריצה ארוכה באנדרואיד — סוף סוף יש תשובה.

מהו Qwen3.8, לפי גודל

"Qwen3.8" הוא משפחה, לא צ'קפוינט, והחבר שמשנה כאן אינו דגם הדגל.

Qwen3.8-Max — דרגת הדגל, ממוצבת מול מודלי חזית מתארחים.

Qwen3.8-27B — האח הפתוח בגודל בינוני, מסוג dense.

Qwen3.8-Flash — מודל MoE מולטימודלי בארכיטקטורת "Next" חדשה: 125B פרמטרים של טרנספורמר, כשרק 6B מופעלים לכל טוקן, Qwen Sparse Attention משולב עם GDN בסכמת קשב היברידית להאצת הקשר ארוך כאשר יש פגיעת מטמון, Gated Residual שמפצל את ערוץ המידע לארבעה נתיבים, ו-51B פרמטרים של הטמעות N-gram. Alibaba מתארת את ארכיטקטורת Next כאב הטיפוס של Qwen4 מהדור הבא.

הקשר — גדול באופן מובנה, כאשר רוב הרשומות מציינות 1M טוקנים ומקורות מסוימים מתארים 262K מובנה המורחב ל-1M. הפלט המרבי הוא בסביבות 131K.

מחיר — התעריף המפורסם של ה-API הוא ¥1 למיליון טוקני קלט ו-¥3 למיליון טוקני פלט, מה שמסתכם ב-$0.15 / $0.47 בקטלוג שלנו, עם קריאות מטמון ב-$0.018 וכתיבות מטמון ב-$0.230. הניסוח של אליבאבא עצמה הוא שתמחור פגיעות מטמון נמוך עד ¥0.1 למיליון הוא מה שהופך תהליכי עבודה של סוכנים עם קלט ארוך לישימים, והמספרים תומכים בכך: קריאת מטמון עולה בערך כחלק אחד מתוך שנים עשר של טוקן קלט טרי.

שאלת המשקולות הפתוחות — משקולות Flash פורסמו ב-Hugging Face וב-ModelScope ביום ההשחרור. שימו לב כיצד נספרת המשפחה: עליבאבא מוסרת שסדרת Qwen3.8 שחררה בקוד פתוח שלושה גדלים — Max, 27B ו-Flash — עבור 2.4T פרמטרים בסך הכול, שהוא נתון מצטבר על פני הסדרה כולה ולא מספר הפרמטרים של מודל单个 כלשהו.

טענות הבנצ'מרק רחבות, ולפי חומר ההשקה של Alibaba עצמה, כולן הפרשים ולא ערכים מוחלטים: SWE-bench Pro +9.1 לעומת Opus 4.6, JobBench בסביבות +20, MathVision +25.1, ERQA +31.5, AndroidWorld +22.5. הפרשים מול תצורה חסרת שם של מודל מתחרה אינם אותה קטגוריית ראיות כמו רשומה בלוח תוצאות, ואף אחד מאלה לא שוחזר באופן עצמאי. המסגור הכותרתי של החברה — הגדרה מחדש של "קו החיסול" של עלויות התעשייה ממחיר לכל טוקן לעלות כוללת לכל משימה שהושלמה — הוא הטענה שבאמת חשובה להשוואה הזאת, והיא גם זו שאתה יכול לבדוק בעצמך.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

מה ARTEMIS תורם, ומדוע שני המספרים אינם ברי השוואה

ARTEMIS אינו מכיל מודל. התג שלו מציין "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" והתצורה שלו נמצאת ב-code>config/artemis.jsonc/code>. מה שהוא מביא הוא החלק שהופך ניחוש של מודל לפעולה מאומתת: מאתר דינמי-תחילה שקורא את עץ הנגישות כשהוא יכול ונופל חזרה לראייה ולקואורדינטות כשמשטח Compose או Flutter לא נותן לו דבר, רשת ביטחון שמפנה חלונות קופצים מערכתיים מפריעים לפני שההקשה נוחתת, אימות נקודות ביקורת בארבע רמות מ-code>off/code> ועד code>strict/code>, ויומן סשן שדוחס צילומי מסך ישנים לסיכומים חזותיים כך שההקשר של מאה צעדים נשאר בר-השגה.

הוא גם מגיע עם שרת MCP נייטיבי. code>uv run artemis mcp --install all/code> חושף את code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> ו־code>mobile_diagnose/code> ל-Antigravity, Claude Code, Codex וכל דבר אחר שמדבר MCP — וזה מה שגרם לפרויקט להתקדם במהירות כזו, וזו ההצהרה הצלולה ביותר למה שהוא נועד. ARTEMIS הוא כלי שסוכן קורא לו. כך גם מודל, ולכן הצבתם באותה עמודה היא שגיאת קטגוריה.

הדבר היחיד שצריך להיזהר ממנו בקריאת ה-99.1% של ARTEMIS: לוח התוצאות של AndroidWorld במפורש אינו מאמת באופן עצמאי את ההגשות. כל נתון בו, כולל זה של ARTEMIS, מדווח על ידי הצוות שהפיק אותו. אותה הסתייגות חלה ביתר שאת על דלתא המצוטטת בפוסט השקה.

קריאה של "vs" בשתי דרכים

ישנן שתי קריאות כנות של ההתמודדות הזו, והן מצביעות לכיוונים מנוגדים.

כיריבים, ההשוואה היא בעצם: "האם להשתמש במודל מתארח בתוספת harness, או שעליי להשתמש במודל שטוב מספיק במשימות מובייל כדי שאוכל לכתוב את ה-harness בעצמי?" לפי קריאה זו, ARTEMIS מנצחת כברירת מחדל, כי מודל אינו harness — והדלתא של +22.5 נקודות ב-AndroidWorld לא אומרת לך האם Qwen3.8-Flash יכול לשרוד את שלב 74 מתוך ריצה בת מאה שלבים כאשר חלון קופץ של המערכת בולע את ההקשה שלו. שום דבר בטבלת בנצ'מרק לא מודד את ה-Safety Net.

בתור סטאק, ההשוואה היא המועילה: ARTEMIS הוא לולאת הבקרה, Qwen3.8-Flash הוא מנוע סביר עבורו, והשאלה הופכת לשאלה של עלות ואמינות לאורך זמן. כל הטיעון השיווקי של אליבאבא עבור דרגת ה-Flash — שהמספר החשוב הוא העלות הכוללת למשימה שהושלמה ולא המחיר לטוקן — הוא בדיוק המדד שלפיו נמדדת חבילת אוטומציה לאנדרואיד, וזה מדד שאפשר למדוד על מערך הבדיקות שלך בתוך יום.

הפרט המביך שעומד בדרך: Qwen3.8-Flash אינו ברשימת ה-backends הנבדקים של ARTEMIS, שבה מנויים Gemini, Claude, GPT-4o ו-Qwen-VL. Qwen-VL הוא מודל אחר. ה-harness מקבל endpoint של מודל, והשילוב סביר מבחינה טכנית, אבל איש לא פרסם הערכה שלו, ואם תריץ אותו תעשה עבודה מקורית במקום לפעול לפי תיעוד.

החשבון שמכריע את זה

הנה החישוב ששווה לעשות לפני שמי משני פוסטי ההשקה ישכנע אותך במשהו. זהו מודל עם הנחות מוצהרות, לא מדידה, וכדאי שתציב את המספרים שלך — אבל הצורה שלו היא העיקר.

קח ריצת Pro בת 100 שלבים. Pro פועל בקצב של בערך 15–40 שניות לכל שלב, כך שזמן הקיר הוא איפשהו בין 25 דקות לשעה, וכל שלב שולח צילום מסך בתוספת פרומפט שהולך וגדל. נניח 8,000 טוקנים של פרומפט ו-300 טוקנים של פלט לכל שלב — תקציב שמרני לצילום מסך והוראות, הרבה מתחת למה שעולה פריים גולמי ברזולוציה מלאה. כלומר 800,000 טוקנים של קלט ו-30,000 טוקנים של פלט לבדיקה אחת.

• בתעריף $0.15 / $0.47 של Qwen3.8-Flash, ההרצה הזו עולה כ-$0.12 בקלט וכ-$0.014 בפלט — בערך שלושה עשר סנט.

• בתעריף אירוח של מודל חזיתי, בספרות בודדות נמוכות למיליון טוקני קלט ובאמצע העשרה למיליון טוקני פלט, אותה הרצה מסתכמת בדולרים, לא בסנטים. שני התעריפים מוצגים כאן באופן מעורפל במכוון, משום שהנתון המדויק תלוי באיזה מודל חזיתי תבחרו, והיחס הוא מה שחשוב: מדובר בסדר גודל, בכל בדיקה, בכל הרצה.

• ומכיוון ש-ARTEMIS קוראת מחדש הקשר שהולך וגדל בכל צעד, היחס משתפר עוד יותר עבור המודל שבו קריאת המטמון זולה יותר. קריאת המטמון של Qwen3.8-Flash היא $0.018 למיליון לעומת $0.15 לקלט טרי — חלק שנים עשר מהמחיר, והסיבה שאליבאבא ממשיכה להצביע על שיעורי פגיעת מטמון כשהיא מדברת על עומסי סוכנים.

עכשיו הכפל בסוויטה שלך. הרצת רגרסיה של 500 בדיקות מדי לילה היא 400 מיליון טוקני קלט בלילה, וההבדל בין שלושה עשר סנט לשלושה דולרים לבדיקה הוא ההבדל בין הרנס שאתה יכול להרשות לעצמך להריץ ברציפות לבין כזה שאתה מתזמן אחת לשבוע.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

להריץ את זה, ואיפה שהצנרת משנה

אם ברצונך לבדוק את החשבון הזה באפליקציה שלך, הדרך הכנה היא לכוון את ARTEMIS לנקודת קצה של מודל ולמדוד. Qwen3.8-Flash נמצא בקטלוג שלנו במחיר המפורסם של $0.15 / $0.47עם קריאות מטמון ב-$0.018 וכתיבות מטמון ב-$0.230, על אותו מפתח ובאותה חשבונית כמו שאר הגדלים של Qwen3.8 וכל דבר אחר שאנחנו מנתבים — וזה החלק שקובע כשתהליך העבודה שאתה מתמחר הוא הרנס שמבצע מאה קריאות בכל בדיקה ולא אדם שמבצע קריאה אחת. דף המודל מציג גם את המספרים התפעוליים שתרצה לראות לפני שאתה מחייב אליו חבילת בדיקות: הקשר של 1M טוקנים עם פלט מרבי של 131K, זמן p50 עד לטוקן הראשון של 7.12 שניות ו-p95 של 10.00, וכ-2.3 מיליארד טוקנים של תעבורה דרכו בשבעת הימים האחרונים. הנתון האחרון הוא שלנו ולא של ספק, והוא מהווה פרוקסי סביר לשאלה אם אנשים אחרים כבר מריצים עומסי סוכנים ארוכים בנקודת הקצה הזו.

פרט התשתית שמפסיק להיות תיאורטי בקנה המידה הזה הוא מה שקורה בשלב 74. הרצת Pro מחזיקה את ההקשר שלה על נקודת קצה אחת במשך רוב השעה; תקלה של ספק באמצע לא מדרדרת את ההרצה, היא מסיימת אותה, ואתה משלם על 73 השלבים שלא הניבו תוצאה. ניתוב סשן סוכן ארוך דרך שכבה שעוברת לספק אחר של אותו מודל הוא ההבדל בין חבילת בדיקות לא יציבה לחבילה שנקטעת. זו תכונה הנדסית שגרתית, והיא זו שקובעת אם העלות הנמדדת שלך למשימה שהושלמה שורדת מפגש עם שבוע של הרצות אמיתיות.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

למה כל אחד מהם בעצם מיועד

אם יש לך אפליקציית אנדרואיד ומערך בדיקות, אתה רוצה את ARTEMIS, ו-Qwen3.8-Flash הוא מנוע מועמד עבורה ולא חלופה לה — אחד שאינו מתועד, ששווה ניסוי של אחר צהריים, במחיר כזה שהניסוי לא עולה לך דבר מדיד. אם אתה בוחר מודל עבור סוכן נייד שאתה כותב בעצמך, הפער של +22.5 נקודות ב-AndroidWorld הוא סיבה להסתכל על Qwen3.8-Flash ולא סיבה להאמין לו, מכיוון שמדובר בפער שמדווח על ידי ספק, בלי ציון מוחלט מצורף ובלי שחזור בלתי תלוי.

הדבר ששני הפרויקטים מתווכחים עליו בשקט הוא אותו דבר, ואף אחד מהם לא אומר אותו בפשטות. גוגל טוענת שההרנס הוא מה שהופך סוכן נייד לאמין, ומשחררת אותו בקוד פתוח כדי שניתן יהיה לבדוק את הטענה. עליבאבא טוענת שעלות לכל משימה שהושלמה היא המספר היחיד שחשוב, ומתמחרת בהתאם. שתיהן כנראה צודקות, ולכן התצורה המעניינת היא לא ARTEMIS או Qwen3.8 — אלא ARTEMIS על Qwen3.8-Flash, נמדדת באפליקציה שלך, כשהעקיבה נשארת מופעלת.

ומכיוון ש-ARTEMIS קוראת מחדש בכל שלב הקשר שהולך וגדל, היחס משתפר עוד יותר עבור כל מודל שיש לו קריאת המטמון הזולה יותר.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית