
ARTEMIS לעומת Gemma 4 12B: רתמה ומוח הם לא אותה רכישה
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ARTEMIS של Google ו-Gemma 4 12B לא מתחרים, והדרך המהירה ביותר לבזבז שבוע היא לשים אותם בטבלת השוואה ולבחור מנצח. ARTEMIS, שהופצה בקוד פתוח על ידי Google באוגוסט 2026 תחת Apache 2.0, היא רתמת אוטומציה ל-Android: היא מקבלת משפט, מפעילה טלפון אמיתי דרך ADB, ומדווחת מה קרה. Gemma 4 12B, ששוחררה על ידי Google DeepMind ב-3 ביוני 2026, היא מודל מולטימודלי צפוף עם משקולות פתוחות וב-12 מיליארד פרמטרים — מוח שאפשר להריץ על מחשב נייד, לא מערכת שיכולה להקיש על מסך. אחד מהם לא יכול לראות, להחליט או לפעול בלי שדבר מהסוג האחר מחובר אליו; האחר לא יכול להחזיק מכשיר בכלל. אבל כדאי לערוך את ההשוואה, כי השאלה שמתחתיה היא זו שכל צוות מובייל שואל כעת: האם מודל פתוח קטן שנמצא בבעלותכם המלאה יכול לבצע אוטומציה של Android, או שאתם זקוקים למודל חזית מתארח מאחורי רתמה כמו ARTEMIS? לשאלה הזו יש תשובה אמיתית, והיא לא זו שמשתמעת מפוסט ההשקה של אף אחד מהספקים.
ראשית, הטעות הקטגורית, בניסוח פשוט
ARTEMIS אינו מכיל מודל. התג שלו עצמו מציין "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL", והקובץ שקובע באיזה מהם תשתמש הוא code>config/artemis.jsonc/code>. זהו לולאת בקרה: מאתר שמתעדף נגישות, בדיקת בטיחות שמפנה חלונות קופצים לפני שההקשה שלך נקלטת, יומן הפעלות שדוחס צילומי מסך ישנים לסיכומים חזותיים, ושתי פרופילי הרצה — Flash בכ-3–5 שניות לשלב, Pro בכ-15–40 שניות לשלב עם Planner, Operator ו-Checker לקריאה בלבד. כל מה שהוא יודע על העולם מגיע דרך מודל חזותי-לשוני שהוא לא כתב.
Gemma 4 12B הוא אובייקט מסוג הפוך. הוא צ׳קפוינט. אין לו חיבור למכשיר, אין ADB, אין שירות נגישות, ואין לו מושג שהקשה היא דבר שאפשר לבצע. תנו לו צילום מסך ושאלו מה לעשות הלאה, והוא יענה לכם — אולי אפילו היטב — אבל המענה הוא כל היקף היכולת שלו לפעול. כל מה שבין "המודל אמר להקיש ב-(540, 1180)" לבין "הטלפון הקיש ב-(540, 1180)" הוא העבודה של ARTEMIS, וזה עיקר העבודה.
אז הדרך הכנה להציג את העימות הזה היא לא ARTEMIS מול Gemma. היא: מה מודל פתוח של 12B מקנה לך בתור שכבת החשיבה של סוכן אנדרואיד, ומתי אתה צריך לשלם עבור משהו גדול יותר?
מה Gemma 4 12B באמת מביא
עבור מודל בגודל בינוני הוא מפורט היטב באופן יוצא דופן, ושלוש מהתכונות שלו חשובות לכל דבר נייד.
• הוא באמת מולטימודאלי בשכבת הקלט. טקסט, תמונה, אודיו ווידאו נכנסים; טקסט יוצא. זהו ה-Gemma הראשון בגודל בינוני ללא מקודדים מולטימודאליים נפרדים, והראשון במשפחה שקולט אודיו באופן נייטיבי — מה שאינו תכונת אוטומציה של ממשק משתמש, אבל הוא תכונה אמיתית אם תרחישי הבדיקה שלך כוללים הודעות קוליות, התראות שמדברות, או מסלולי נגישות המבוססים על רמזי אודיו.
• זהו מודל 12B שאפשר להחזיק. Artificial Analysis מפרטת אותו כ־12B פרמטרים בסך הכול תחת Apache 2.0 — בלי סף הכנסות, בלי סעיף מחקר, רישיון שאפשר לבנות עליו מוצר בלי לבקש רשות מאף אחד — עם חלון הקשר של 256K, חשיבה מופעלת, ומהירות פלט נמדדת של 109.2 טוקנים לשנייה. דיווחים מהקהילה מציבים את המשקלים בסביבות 13.4 GB ב־SFP8 וכ־6.7 GB ב־Q4_0, שזה מחשב נייד עם 16 GB זיכרון.
• הוא זול, אבל לא הדבר הזול ביותר בקטגוריה שלו.Artificial Analysis מציין אותו ב-$0.10 למיליון טוקני קלט ו-$0.30 למיליון טוקני פלט — ומציין באותו פאנל שזה בצד היקר עבור מודל במשקלים פתוחים בגודל דומה, שבו החציון עומד על $0.05 בקלט ו-$0.15 בפלט. קריאות מטמון עומדות על כ-$0.03.
תמונת הבenchmark היא הבלבול הרגיל בגודל בינוני וראויה לציון בזהירות, כי המספרים באתרי המעקב אינם תואמים זה לזה. Artificial Analysis מדרגת את תצורת החשיבה באינדקס אינטליגנציה של 14, ומדרגת אותה במקום ה-21 מתוך 142 מודלים עם משקלים פתוחים בקטגוריה שלה — שזה מיקום מכובד באמצע הטבלה והרחק מהחזית. המיצוב של גוגל עצמה הוא שה-12B כמעט משתווה ל-Gemma 4 26B-A4B הגדול יותר ומנצח את Gemma 3 27B מהדור הקודם במשימות חשיבה, מדע ומסמכים. מצרפי צד שלישי מציבים אותו בסביבות 72% ב-LiveCodeBench v6 ו-77.2% ב-MMLU-Pro, כאשר GPQA Diamond נע בין 66% ל-79% בהתאם לאיזה אתר מעקב ואיזו תצורה אתה קורא. אלה מספרים מכובדים עבור 12B. הם גם מצרפים מדווחים עצמית שלא עברו ביקורת, וכאשר ארבעה אתרים חלוקים ב-13 נקודות, עליך להחזיק בטווח ולא בנקודה.

מה ARTEMIS מביא, בפסקה אחת, כי זה לא הנושא כאן.
ARTEMIS מביא את כל מה שהמודל לא מסוגל: לוקייטור דינמי-מלכתחילה שמשתמש באינדקסים של רכיבי נגישות כשהם קיימים, ונופל חזרה לראייה ולקואורדינטות כשאינם — מה שאומר שאין XPath לתחזק ואין מזהים שמתיישנים על משטח Compose או Flutter. הוא מביא רשת ביטחון שלוכדת את חלון המערכת שההקשה שלך עמדה לנחות עליו, אימות נקודות ביקורת בארבע רמות מ-code>off/code> עד code>strict/code>, ערימות קריסה אוטומטיות, צילומי מסך של פריימים מרכזיים ודוחות אבחון, קונסולת ווב, SDK בפייתון ל-pytest ול-CI, ו—הסיבה שהוא התפשט במהירות כזו—שרת MCP מקורי שחושף את כל זה ל-Antigravity, ל-Claude Code, ל-Codex ולכל עוזר אחר עם תמיכת MCP כחמישה כלים. שיעור ההשלמה המוצהר שלו של 99%+ במדד AndroidWorld של Google Research מציב אותו על 99.1% בלוח המובילים הציבורי נכון ל-11 בספטמבר 2026, לעומת 80% עבור ביצועי אדם. הנתון הזה מדווח על ידיו עצמו והלוח אינו מאמת הגשות, ולכן יש להתייחס אליו כאל הצהרה חזקה של הספק ולא כאודיט.
המקום היחיד שבו השניים באמת חופפים
קיימת ארכיטקטורה אמיתית שבה Gemma קטן עושה את כל העבודה, וכדאי לבחון אותה כי היא מראה עבור מה מודל הענן באמת משלם. מסגרת סוכנים בקוד פתוח לאנדרואיד בשם Orion פועלת כולה על המכשיר: MediaProjection לוכד את המסך, ומודל מקוונטז Gemma-4-E4B-it שרץ על ה-NPU Qualcomm Hexagon באמצעות LiteRT-LM בוחר את הפעולה הבאה, ושירות הנגישות של אנדרואיד שולח את ההקשות. בלי API בענן, בלי חשבון לפי טוקנים, והמסך לעולם אינו עוזב את המכשיר. הוא מאומת על Galaxy S25 Ultra, ולפי תיאורו שלו, הוא בעל משמעות רק על חומרה עם NPU Hexagon — המודל דורש כ-3 GB אחסון, והמסגרת מכוונת ל-QNN HTP v79 על arm64.
זו הצורה של סוכן אנדרואיד מבוסס מודל קטן שפועל כיום, ושימו לב למחיר של ההגעה לשם. המודל מכומת וממופה ל-NPU. מרחב הפעולה הוא פיקסלים, כי מודל שמתבסס רק על צילום מסך לא יכול לפרש "אינדקס אלמנט 12". כל העיצוב הוא מחסנית אנכית — מודל, סביבת ריצה, סיליקון, פריימוורק — ולכן זהו פריימוורק ולא משהו שמתחבר ישירות לחבילת הבדיקות שלכם. Gemma 4 12B הוא בערך פי שלושה ממספר הפרמטרים של ה-E4B במחסנית הזו, ואינו מסופק בפורמט שניתן להריץ בטלפון; 12B בכימות של ארבעה סיביות הוא תחנת עבודה או נקודת קצה בשרת, לא תושב NPU.

איפה כל אחד באמת מנצח
• עלות בקנה מידה — ל-Gemma 4 12B בהתארחות עצמית אין כלל מחיר לכל טוקן, לעומת קריאת ראייה לכל שלב בהרצת ARTEMIS. בהרצת חבילת רגרסיה של 500 בדיקות מדי לילה, הפער הזה מצטבר מהר יותר מכל פער בנצ'מרק.
• פרטיות — Gemma 4 12B על החומרה שלך לעולם לא שולח צילום מסך לשום מקום; עוזר הנגישות של ARTEMIS פועל במפורש על המכשיר ואינו שולח דבר, אך קריאת המודל שהוא מבצע עם כל צילום מסך נשלחת לספק שהגדרת.
• אמינות משימות באפליקציה אמיתית — ARTEMIS, בפער עצום, מכיוון שזו מערכת הרצה עם רשת ביטחון, אימות נקודות ביקורת ושחזור. שום דבר במודל טוב יותר לא מחליף את זה.
• אודיו ומסמכים ארוכים — Gemma 4 12B, עם קלט אודיו מובנה בגיליון המפרט הטכני וחלון הקשר של 256K טוקנים. ל-ARTEMIS אין דעה על אף אחד מהשניים.
• זמן עד לבדיקה הראשונה שעוברת — ARTEMIS, בפער עצום. שכפלו, code>./start.sh/code>, חברו מכשיר עם ניפוי באגים ב-USB, המתינו שהמשימה הראשונה תתקין את עוזר הנגישות. בניית המקבילה עם נקודת ביקורת חשופה היא פרויקט רב-חודשי, והדוגמה של Orion שלמעלה היא איך שהפרויקט הזה נראה כשהוא גמור.
• חופש לשנות את שכבת ההיסק — Gemma 4 12B, שהם משקולות Apache 2.0 שתוכלו לבצע עליהן כיוונון עדין על אוצר המילים של ממשק המשתמש שלכם. ARTEMIS הוא קוד Apache 2.0, אבל ההיסק נמצא בכל מקום שבו שוכן המודל שלכם.
הגרסאות של הזיווג הזה שזמינות בפועל היום
היה ברור לגבי מה שאתה יכול לפרוס השבוע. רשימת ה-backend הנבדקת של ARTEMIS היא Gemini, Claude, GPT-4o ו-Qwen-VL — Gemma 4 12B לא מופיע בה, ואין הערכה מפורסמת של Gemma 4 12B שמפעיל סשן של ARTEMIS. קובץ התצורה מקבל נקודת קצה של מודל, כך שהשידוך סביר ולא מוכח, ואם תנסה זאת אתה עושה עבודה מקורית במקום לעקוב אחר תיעוד. כדאי לומר בפשטות: במפת הדרכים של ARTEMIS יש סעיף "מודלי VLM קלים על המכשיר", והמודל שימלא אותו לא יהיה 12B.
Gemma 4 12B גם לא נמצא בקטלוג שלנו — אנחנו מנתבים את שאר הגדלים של Gemma 4, Gemma 4 26B-A4B ו-Gemma 4 31B, ולא את ה-12B, כך שאם זה הצ'קפוינט שאתם רוצים, אתם משיגים אותו מההפצה של הספק עצמו ומהמארחים הרגילים של צד שלישי. מה שקטלוג מנותב נועד לעשות הוא החצי השני של הבעיה הזו: אם התוכנית שלכם היא ARTEMIS על מודל חזותי מתארח, המודל הזה הוא סעיף חיוב שמשתנה בהתאם לכל צעד בכל הרצה, והידית השימושית היא לא המחיר הנקוב אלא מחיר המטמון. הרצת Pro קוראת מחדש הקשר שהולך וגדל בכל צעד, כך שמודל עם קריאת מטמון זולה משנה את החשבון הרבה יותר ממודל עם קלט חדש זול. זו גם הסיבה שמעבר בין ספקים שייך לקונפיגורציה ולא ליומן התקריות שלכם — הפעלה ארוכה של Android מחזיקה את ההקשר שלה בנקודת קצה אחת, ותקלה של ספק בצעד 74 עולה לכם בהרצה.

איזה מהם הוא המהלך הבא שלך?
אם יש לך אפליקציית מובייל וחבילת בדיקות רגרסיה, אתה רוצה את ARTEMIS, ו-Gemma 4 12B אינו תחליף לשום חלק ממנה — הוא לכל היותר המנוע שאולי תחליף בהמשך, ללא תיעוד, על חשבון הזמן שלך. אם אתה בונה מוצר שחייב לפעול על מכשיר נייד בלי רשת ובלי עלות לכל קריאה, אתה רוצה מודל קטן, ו-Gemma 4 12B כנראה גדול מדי לגודל הפורמט שבאמת יש לך; תסתכל מה Orion עשה עם Gemma בדרגת 4B על NPU לפני שאתה מניח ש-12B יתאים.
שתי ההחלטות מתנגשות רק במקום אחד, וזו שאלה של עלות ולא של יכולת: כמה קריאות ראייה ביום אתה מוכן לשלם עליהן? ענה על זה בכנות — ספור את הבדיקות שלך, ספור את הצעדים שלך, ספור את ההרצות הליליות שלך — והבחירה בין רתמה על מודל מתארח לבין מחסנית באירוח עצמי תעשה את עצמה.
מה שקטלוג מנותב נועד לו הוא החצי השני של הבעיה הזו: אם התוכנית שלך היא ARTEMIS על מודל ראייה מתארח, המודל הזה הוא סעיף עלות שגדל עם כל שלב בכל ריצה
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
