
ARTEMIS מול Qwen3.8: אותו בנצ'מרק, שתי משימות שונות
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ARTEMIS של Google ו-Qwen3.8 נמדדים שניהם על AndroidWorld, והצירוף מקרים הזה הוא העובדה היחידה והמטעה ביותר בסיקור ההשקה של כל אחד מהפרויקטים. ARTEMIS הוא כלי אוטומציה לאנדרואיד — הוצא כקוד פתוח על ידי Google באוגוסט 2026 תחת Apache 2.0, הוא מקבל הוראה בשפה טבעית, מפעיל מכשיר אמיתי דרך ADB, וטוען לשיעור השלמה של 99%+ במבחן AndroidWorld של Google Research עם 116 משימות, ומציג 99.1% בלוח המובילים הציבורי נכון ל-11 בספטמבר 2026. Qwen3.8-Flash הוא המודל המולטימודלי מסוג תערובת מומחים של Alibaba, שוחרר והוצא כקוד פתוח ב-26 באוגוסט 2026, וחומרי ההשקה שלו טוענים שהוא מנצח את Claude Opus 4.6 ב-22.5 נקודות ב-AndroidWorld. אחד מהמספרים האלה הוא הניקוד של מערכת. האחר הוא התרומה של מודל למערכת שמישהו אחר כתב. אם תקרא אותם כיריבים, תסיק את הדבר הלא נכון לגבי שניהם; אם תקרא אותם כשני חצאים של סטאק אחד, לשאלה המעניינת — מה העלות האמיתית של ריצה ארוכה באנדרואיד — סוף סוף יש תשובה.
מהו Qwen3.8, לפי גודל
"Qwen3.8" הוא משפחה, לא צ'קפוינט, והחבר שמשנה כאן אינו דגם הדגל.
• Qwen3.8-Max — דרגת הדגל, ממוצבת מול מודלי חזית מתארחים.
• Qwen3.8-27B — האח הפתוח בגודל בינוני, מסוג dense.
• Qwen3.8-Flash — מודל MoE מולטימודלי בארכיטקטורת "Next" חדשה: 125B פרמטרים של טרנספורמר, כשרק 6B מופעלים לכל טוקן, Qwen Sparse Attention משולב עם GDN בסכמת קשב היברידית להאצת הקשר ארוך כאשר יש פגיעת מטמון, Gated Residual שמפצל את ערוץ המידע לארבעה נתיבים, ו-51B פרמטרים של הטמעות N-gram. Alibaba מתארת את ארכיטקטורת Next כאב הטיפוס של Qwen4 מהדור הבא.
• הקשר — גדול באופן מובנה, כאשר רוב הרשומות מציינות 1M טוקנים ומקורות מסוימים מתארים 262K מובנה המורחב ל-1M. הפלט המרבי הוא בסביבות 131K.
• מחיר — התעריף המפורסם של ה-API הוא ¥1 למיליון טוקני קלט ו-¥3 למיליון טוקני פלט, מה שמסתכם ב-$0.15 / $0.47 בקטלוג שלנו, עם קריאות מטמון ב-$0.018 וכתיבות מטמון ב-$0.230. הניסוח של אליבאבא עצמה הוא שתמחור פגיעות מטמון נמוך עד ¥0.1 למיליון הוא מה שהופך תהליכי עבודה של סוכנים עם קלט ארוך לישימים, והמספרים תומכים בכך: קריאת מטמון עולה בערך כחלק אחד מתוך שנים עשר של טוקן קלט טרי.
• שאלת המשקולות הפתוחות — משקולות Flash פורסמו ב-Hugging Face וב-ModelScope ביום ההשחרור. שימו לב כיצד נספרת המשפחה: עליבאבא מוסרת שסדרת Qwen3.8 שחררה בקוד פתוח שלושה גדלים — Max, 27B ו-Flash — עבור 2.4T פרמטרים בסך הכול, שהוא נתון מצטבר על פני הסדרה כולה ולא מספר הפרמטרים של מודל单个 כלשהו.
טענות הבנצ'מרק רחבות, ולפי חומר ההשקה של Alibaba עצמה, כולן הפרשים ולא ערכים מוחלטים: SWE-bench Pro +9.1 לעומת Opus 4.6, JobBench בסביבות +20, MathVision +25.1, ERQA +31.5, AndroidWorld +22.5. הפרשים מול תצורה חסרת שם של מודל מתחרה אינם אותה קטגוריית ראיות כמו רשומה בלוח תוצאות, ואף אחד מאלה לא שוחזר באופן עצמאי. המסגור הכותרתי של החברה — הגדרה מחדש של "קו החיסול" של עלויות התעשייה ממחיר לכל טוקן לעלות כוללת לכל משימה שהושלמה — הוא הטענה שבאמת חשובה להשוואה הזאת, והיא גם זו שאתה יכול לבדוק בעצמך.

מה ARTEMIS תורם, ומדוע שני המספרים אינם ברי השוואה
ARTEMIS אינו מכיל מודל. התג שלו מציין "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" והתצורה שלו נמצאת ב-code>config/artemis.jsonc/code>. מה שהוא מביא הוא החלק שהופך ניחוש של מודל לפעולה מאומתת: מאתר דינמי-תחילה שקורא את עץ הנגישות כשהוא יכול ונופל חזרה לראייה ולקואורדינטות כשמשטח Compose או Flutter לא נותן לו דבר, רשת ביטחון שמפנה חלונות קופצים מערכתיים מפריעים לפני שההקשה נוחתת, אימות נקודות ביקורת בארבע רמות מ-code>off/code> ועד code>strict/code>, ויומן סשן שדוחס צילומי מסך ישנים לסיכומים חזותיים כך שההקשר של מאה צעדים נשאר בר-השגה.
הוא גם מגיע עם שרת MCP נייטיבי. code>uv run artemis mcp --install all/code> חושף את code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> ו־code>mobile_diagnose/code> ל-Antigravity, Claude Code, Codex וכל דבר אחר שמדבר MCP — וזה מה שגרם לפרויקט להתקדם במהירות כזו, וזו ההצהרה הצלולה ביותר למה שהוא נועד. ARTEMIS הוא כלי שסוכן קורא לו. כך גם מודל, ולכן הצבתם באותה עמודה היא שגיאת קטגוריה.
הדבר היחיד שצריך להיזהר ממנו בקריאת ה-99.1% של ARTEMIS: לוח התוצאות של AndroidWorld במפורש אינו מאמת באופן עצמאי את ההגשות. כל נתון בו, כולל זה של ARTEMIS, מדווח על ידי הצוות שהפיק אותו. אותה הסתייגות חלה ביתר שאת על דלתא המצוטטת בפוסט השקה.
קריאה של "vs" בשתי דרכים
ישנן שתי קריאות כנות של ההתמודדות הזו, והן מצביעות לכיוונים מנוגדים.
כיריבים, ההשוואה היא בעצם: "האם להשתמש במודל מתארח בתוספת harness, או שעליי להשתמש במודל שטוב מספיק במשימות מובייל כדי שאוכל לכתוב את ה-harness בעצמי?" לפי קריאה זו, ARTEMIS מנצחת כברירת מחדל, כי מודל אינו harness — והדלתא של +22.5 נקודות ב-AndroidWorld לא אומרת לך האם Qwen3.8-Flash יכול לשרוד את שלב 74 מתוך ריצה בת מאה שלבים כאשר חלון קופץ של המערכת בולע את ההקשה שלו. שום דבר בטבלת בנצ'מרק לא מודד את ה-Safety Net.
בתור סטאק, ההשוואה היא המועילה: ARTEMIS הוא לולאת הבקרה, Qwen3.8-Flash הוא מנוע סביר עבורו, והשאלה הופכת לשאלה של עלות ואמינות לאורך זמן. כל הטיעון השיווקי של אליבאבא עבור דרגת ה-Flash — שהמספר החשוב הוא העלות הכוללת למשימה שהושלמה ולא המחיר לטוקן — הוא בדיוק המדד שלפיו נמדדת חבילת אוטומציה לאנדרואיד, וזה מדד שאפשר למדוד על מערך הבדיקות שלך בתוך יום.
הפרט המביך שעומד בדרך: Qwen3.8-Flash אינו ברשימת ה-backends הנבדקים של ARTEMIS, שבה מנויים Gemini, Claude, GPT-4o ו-Qwen-VL. Qwen-VL הוא מודל אחר. ה-harness מקבל endpoint של מודל, והשילוב סביר מבחינה טכנית, אבל איש לא פרסם הערכה שלו, ואם תריץ אותו תעשה עבודה מקורית במקום לפעול לפי תיעוד.
החשבון שמכריע את זה
הנה החישוב ששווה לעשות לפני שמי משני פוסטי ההשקה ישכנע אותך במשהו. זהו מודל עם הנחות מוצהרות, לא מדידה, וכדאי שתציב את המספרים שלך — אבל הצורה שלו היא העיקר.
קח ריצת Pro בת 100 שלבים. Pro פועל בקצב של בערך 15–40 שניות לכל שלב, כך שזמן הקיר הוא איפשהו בין 25 דקות לשעה, וכל שלב שולח צילום מסך בתוספת פרומפט שהולך וגדל. נניח 8,000 טוקנים של פרומפט ו-300 טוקנים של פלט לכל שלב — תקציב שמרני לצילום מסך והוראות, הרבה מתחת למה שעולה פריים גולמי ברזולוציה מלאה. כלומר 800,000 טוקנים של קלט ו-30,000 טוקנים של פלט לבדיקה אחת.
• בתעריף $0.15 / $0.47 של Qwen3.8-Flash, ההרצה הזו עולה כ-$0.12 בקלט וכ-$0.014 בפלט — בערך שלושה עשר סנט.
• בתעריף אירוח של מודל חזיתי, בספרות בודדות נמוכות למיליון טוקני קלט ובאמצע העשרה למיליון טוקני פלט, אותה הרצה מסתכמת בדולרים, לא בסנטים. שני התעריפים מוצגים כאן באופן מעורפל במכוון, משום שהנתון המדויק תלוי באיזה מודל חזיתי תבחרו, והיחס הוא מה שחשוב: מדובר בסדר גודל, בכל בדיקה, בכל הרצה.
• ומכיוון ש-ARTEMIS קוראת מחדש הקשר שהולך וגדל בכל צעד, היחס משתפר עוד יותר עבור המודל שבו קריאת המטמון זולה יותר. קריאת המטמון של Qwen3.8-Flash היא $0.018 למיליון לעומת $0.15 לקלט טרי — חלק שנים עשר מהמחיר, והסיבה שאליבאבא ממשיכה להצביע על שיעורי פגיעת מטמון כשהיא מדברת על עומסי סוכנים.
עכשיו הכפל בסוויטה שלך. הרצת רגרסיה של 500 בדיקות מדי לילה היא 400 מיליון טוקני קלט בלילה, וההבדל בין שלושה עשר סנט לשלושה דולרים לבדיקה הוא ההבדל בין הרנס שאתה יכול להרשות לעצמך להריץ ברציפות לבין כזה שאתה מתזמן אחת לשבוע.

להריץ את זה, ואיפה שהצנרת משנה
אם ברצונך לבדוק את החשבון הזה באפליקציה שלך, הדרך הכנה היא לכוון את ARTEMIS לנקודת קצה של מודל ולמדוד. Qwen3.8-Flash נמצא בקטלוג שלנו במחיר המפורסם של $0.15 / $0.47עם קריאות מטמון ב-$0.018 וכתיבות מטמון ב-$0.230, על אותו מפתח ובאותה חשבונית כמו שאר הגדלים של Qwen3.8 וכל דבר אחר שאנחנו מנתבים — וזה החלק שקובע כשתהליך העבודה שאתה מתמחר הוא הרנס שמבצע מאה קריאות בכל בדיקה ולא אדם שמבצע קריאה אחת. דף המודל מציג גם את המספרים התפעוליים שתרצה לראות לפני שאתה מחייב אליו חבילת בדיקות: הקשר של 1M טוקנים עם פלט מרבי של 131K, זמן p50 עד לטוקן הראשון של 7.12 שניות ו-p95 של 10.00, וכ-2.3 מיליארד טוקנים של תעבורה דרכו בשבעת הימים האחרונים. הנתון האחרון הוא שלנו ולא של ספק, והוא מהווה פרוקסי סביר לשאלה אם אנשים אחרים כבר מריצים עומסי סוכנים ארוכים בנקודת הקצה הזו.
פרט התשתית שמפסיק להיות תיאורטי בקנה המידה הזה הוא מה שקורה בשלב 74. הרצת Pro מחזיקה את ההקשר שלה על נקודת קצה אחת במשך רוב השעה; תקלה של ספק באמצע לא מדרדרת את ההרצה, היא מסיימת אותה, ואתה משלם על 73 השלבים שלא הניבו תוצאה. ניתוב סשן סוכן ארוך דרך שכבה שעוברת לספק אחר של אותו מודל הוא ההבדל בין חבילת בדיקות לא יציבה לחבילה שנקטעת. זו תכונה הנדסית שגרתית, והיא זו שקובעת אם העלות הנמדדת שלך למשימה שהושלמה שורדת מפגש עם שבוע של הרצות אמיתיות.

למה כל אחד מהם בעצם מיועד
אם יש לך אפליקציית אנדרואיד ומערך בדיקות, אתה רוצה את ARTEMIS, ו-Qwen3.8-Flash הוא מנוע מועמד עבורה ולא חלופה לה — אחד שאינו מתועד, ששווה ניסוי של אחר צהריים, במחיר כזה שהניסוי לא עולה לך דבר מדיד. אם אתה בוחר מודל עבור סוכן נייד שאתה כותב בעצמך, הפער של +22.5 נקודות ב-AndroidWorld הוא סיבה להסתכל על Qwen3.8-Flash ולא סיבה להאמין לו, מכיוון שמדובר בפער שמדווח על ידי ספק, בלי ציון מוחלט מצורף ובלי שחזור בלתי תלוי.
הדבר ששני הפרויקטים מתווכחים עליו בשקט הוא אותו דבר, ואף אחד מהם לא אומר אותו בפשטות. גוגל טוענת שההרנס הוא מה שהופך סוכן נייד לאמין, ומשחררת אותו בקוד פתוח כדי שניתן יהיה לבדוק את הטענה. עליבאבא טוענת שעלות לכל משימה שהושלמה היא המספר היחיד שחשוב, ומתמחרת בהתאם. שתיהן כנראה צודקות, ולכן התצורה המעניינת היא לא ARTEMIS או Qwen3.8 — אלא ARTEMIS על Qwen3.8-Flash, נמדדת באפליקציה שלך, כשהעקיבה נשארת מופעלת.
ומכיוון ש-ARTEMIS קוראת מחדש בכל שלב הקשר שהולך וגדל, היחס משתפר עוד יותר עבור כל מודל שיש לו קריאת המטמון הזולה יותר.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
