بطاقة عنوان مُولَّدة لـ«ARTEMIS مقابل Gemma 4 12B» بعنوان فرعي «أداة التشغيل والدماغ ليسا الشيء نفسه عند الشراء»، مع بطاقتين تقارنان ARTEMIS بوصفها أداة تشغيل لأتمتة أندرويد لا تملك نموذجًا خاصًا بها، في مقابل Gemma 4 12B بوصفه نقطة تحقق كثيفة متعددة الوسائط بحجم 12B لا يملك أي وسيلة للتصرف.
Guides & Insights

ARTEMIS مقابل Gemma 4 12B: الطقم والدماغ ليسا الشراء نفسه

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ARTEMIS من Google وGemma 4 12B لا يتنافسان، وأسرع طريقة لإهدار أسبوع هي وضعهما في جدول مقارنة واختيار فائز. ARTEMIS، الذي أتاحته Google كمصدر مفتوح في أغسطس 2026 بموجب Apache 2.0، هو إطار أتمتة Android: يتلقى جملة، ويقود هاتفًا حقيقيًا عبر ADB، ويقدّم تقريرًا عمّا حدث. Gemma 4 12B، الذي أطلقته Google DeepMind في 3 يونيو 2026، هو نموذج متعدد الوسائط مفتوح الأوزان، كثيف بـ12 مليار معلمة — دماغ يمكنك تشغيله على حاسوب محمول، وليس نظامًا يمكنه النقر على شاشة. أحدهما لا يستطيع الرؤية أو اتخاذ القرار أو التصرف دون أن يُلحَق به النوع الآخر من الأشياء؛ أما الآخر فلا يستطيع الإمساك بجهاز على الإطلاق. لكن المقارنة تستحق العناء، لأن السؤال الكامن تحتها هو السؤال الذي يطرحه كل فريق يعمل في مجال الجوال حاليًا: هل يمكن لنموذج مفتوح صغير تملكه بالكامل أن يقوم بأتمتة Android، أم أنك تحتاج إلى نموذج حدودي مستضاف خلف إطار مثل ARTEMIS؟ لهذا السؤال إجابة حقيقية، وهي ليست الإجابة التي يوحي بها منشور إطلاق أي من المورّدين.

أولًا، الخطأ الفئوي، بصياغة مباشرة.

لا يحتوي ARTEMIS على أي نموذج. تقول شارته الخاصة "متعدد النماذج — Gemini | Claude | GPT-4o | Qwen-VL"، والملف الذي يحدد أيّها تستخدم هو code>config/artemis.jsonc/code>. إنه حلقة تحكم: محدِّد موقع يعطي الأولوية لإمكانية الوصول، وفحص سلامة يزيل النوافذ المنبثقة قبل أن تستقر نقرتك، وسجل جلسات يضغط لقطات الشاشة القديمة إلى ملخصات بصرية، ووضعا تنفيذ — Flash بنحو 3–5 ثوانٍ لكل خطوة، وPro بنحو 15–40 ثانية لكل خطوة مع مخطِّط ومشغِّل ومدقِّق للقراءة فقط. كل ما يعرفه عن العالم يصل عبر نموذج رؤية-لغة لم يكتبه هو.

Gemma 4 12B هو الكائن ذو الشكل المعاكس. إنه نقطة تحقق. لا يملك أي اتصال بجهاز، ولا ADB، ولا خدمة إمكانية وصول، ولا أي تصور بأن النقر شيء يمكن تنفيذه. أعطِه لقطة شاشة واسأله عما ينبغي فعله تاليًا وسيجيبك — وربما بشكل جيد — لكن الإجابة هي المدى الكامل لفاعليته. كل ما يقع بين "قال النموذج انقر عند (540, 1180)" و"نقر الهاتف عند (540, 1180)" هو مهمة ARTEMIS، وهو معظم العمل.

إذن، الطرح الصادق لهذه المواجهة ليس ARTEMIS مقابل Gemma. بل هو: ما الذي يمنحك إياه نموذج مفتوح بحجم 12B كطبقة استدلال لوكيل Android، ومتى تحتاج إلى الدفع مقابل شيء أكبر؟

ما الذي يقدمه Gemma 4 12B فعلياً

بالنسبة لطراز متوسط الحجم، فإن مواصفاته جيدة على نحو غير معتاد، وثلاث من خصائصه مهمة لأي شيء محمول.

إنه متعدد الوسائط حقًا على مستوى الإدخال. يدخل النص والصورة والصوت والفيديو؛ ويخرج النص. وهو أول نموذج Gemma متوسط الحجم من دون مُرمِّزات منفصلة متعددة الوسائط، وأول فرد في العائلة يستوعب الصوت أصلاً — وهذه ليست ميزة لأتمتة واجهة المستخدم، لكنها ميزة حقيقية إذا كانت سيناريوهات اختبارك تتضمن ملاحظات صوتية، أو إشعارات ناطقة، أو مسارات وصول مبنية على إشارات صوتية.

إنه نموذج بحجم 12B يمكنك حمله.تُدرجه Artificial Analysis عند 12B إجمالي المعاملات بموجب Apache 2.0 — لا بوابة إيرادات، ولا بند أبحاث، بل ترخيص يمكنك بناء منتج عليه دون سؤال أي أحد — مع نافذة سياق 256K، والاستدلال مُفعَّل، وسرعة إخراج مُقاسة تبلغ 109.2 رمز في الثانية. تشير تقارير المجتمع إلى أن الأوزان تبلغ نحو 13.4 جيجابايت عند SFP8 وحوالي 6.7 جيجابايت عند Q4_0، وهو ما يعادل حاسوبًا محمولًا بذاكرة سعة 16 جيجابايت.

إنه رخيص، لكنه ليس أرخص شيء في فئته.يُدرجه Artificial Analysis بسعر 0.10 دولار لكل مليون رمز إدخال و0.30 دولار لكل مليون رمز إخراج — ويشير في اللوحة نفسها إلى أن هذا يُعد مرتفعًا نسبيًا بالنسبة لنموذج مفتوح الأوزان مماثل الحجم، حيث يقع الوسيط عند 0.05 دولار إدخالًا و0.15 دولار إخراجًا. وتقارب قراءات ذاكرة التخزين المؤقت 0.03 دولار.

الصورة المعيارية هي الفوضى المعتادة متوسطة الحجم وتستحق أن تُذكر بعناية، لأن الأرقام على مواقع التتبع تختلف فيما بينها. يمنح Artificial Analysis إعداد الاستدلال مؤشر ذكاء Intelligence Index قدره 14، ليحل في المرتبة 21 من أصل 142 نموذجًا مفتوح الأوزان في فئته — وهو مركز محترم في منتصف الجدول وبعيد جدًا عن الطليعة. وترى Google نفسها أن 12B يكاد يضاهي Gemma 4 26B-A4B الأكبر ويتغلب على Gemma 3 27B من الجيل السابق في مهام الاستدلال والعلوم والمستندات. وتضعه جهات التجميع الخارجية عند نحو 72% على LiveCodeBench v6 و77.2% على MMLU-Pro، مع تراوح GPQA Diamond بين 66% و79% بحسب المتتبع الذي تقرأ منه والإعداد الذي تنظر إليه. هذه أرقام محترمة لنموذج بحجم 12B. وهي أيضًا مجاميع غير مدققة ومُبلَّغ عنها ذاتيًا، وحين تختلف أربعة مواقع بثلاث عشرة نقطة، ينبغي أن تتمسك بالنطاق بدلًا من النقطة.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a measured speed of 109.2 output tokens per second, $0.10 per million input tokens and $0.30 per million output, a 256k-token context window, 12B total parameters, an Apache 2.0 licence and reasoning enabled.

ما الذي يجلبه ARTEMIS، في فقرة واحدة، لأنه ليس الموضوع هنا

يقدّم ARTEMIS كل ما لا يستطيع النموذج تقديمه: محدِّد موقع يعطي الأولوية للديناميكية ويستخدم فهارس عناصر إمكانية الوصول عندما تكون موجودة، ويلجأ إلى الرؤية والإحداثيات عندما لا تكون كذلك، ما يعني أنه لا توجد XPath يجب صيانتها ولا معرّفات تتقادم على واجهة Compose أو Flutter. ويقدّم Safety Net التي تعترض النافذة المنبثقة النظامية التي كانت نقرةك على وشك أن تهبط عليها، وتحققًا من نقاط التفتيش بأربعة مستويات بدءًا من code>off/code> إلى code>strict/code>، ومكدسات الأعطال التلقائية، ولقطات شاشة للإطارات المفتاحية وتقارير تشخيصية، ووحدة تحكم ويب، وPython SDK لـ pytest وCI، و— وهو السبب في انتشاره بهذه السرعة — خادم MCP أصلي يتيح المنظومة كلها لـ Antigravity وClaude Code وCodex وأي مساعد آخر يدعم MCP في صورة خمس أدوات. معدل الإكمال المزعوم البالغ أكثر من 99% على معيار AndroidWorld من Google Research يضعه عند 99.1% على لوحة الصدارة العامة اعتبارًا من 11 سبتمبر 2026، مقابل 80% للأداء البشري. هذا الرقم مُبلَّغ عنه ذاتيًا ولا تتحقق لوحة الصدارة من المشاركات، لذا تعامل معه بوصفه ادعاءً قويًا من المورّد وليس تدقيقًا.

المكان الوحيد الذي يتداخل فيه الاثنان حقًا

هناك معمارية حقيقية يؤدي فيها نموذج Gemma صغير المهمة بأكملها، وهي جديرة بالنظر لأنها تُظهر ما يدفع النموذج السحابي مقابله فعلاً. إطار عمل مفتوح المصدر لوكلاء Android يُسمى Orion يعمل بالكامل على الجهاز: يقوم MediaProjection بالتقاط الشاشة، ونسخة مكمَّمة من Gemma-4-E4B-it تعمل على Qualcomm Hexagon NPU عبر LiteRT-LM وتختار الإجراء التالي، وتتولى Android Accessibility Service إرسال نقرات اللمس. لا واجهة برمجة تطبيقات سحابية، ولا فاتورة لكل رمز، ولا تغادر الشاشة الهاتف أبداً. تم التحقق من صحته على Galaxy S25 Ultra، وهو بحسب وصفه الخاص لا يكون ذا معنى إلا على عتاد مزوَّد بـ Hexagon NPU — يحتاج النموذج إلى نحو 3 GB من مساحة التخزين، ويستهدف الإطار QNN HTP v79 على arm64.

هذا هو شكل وكيل Android بنموذج صغير يعمل اليوم، ولاحظ ما يتطلبه الوصول إلى ذلك. النموذج مُكمَّم ومُعيَّن على NPU. فضاء الإجراءات هو البكسلات، لأن نموذجًا يعتمد على لقطة الشاشة فقط لا يستطيع تفسير «فهرس العنصر 12». التصميم بأكمله مكدّس عمودي — نموذج، وبيئة تشغيل، وسيليكون، وإطار عمل — ولهذا هو إطار عمل وليس بديلًا جاهزًا لمجموعة اختباراتك. يبلغ Gemma 4 12B نحو ثلاثة أضعاف عدد معاملات E4B في ذلك المكدس، ولا يُشحن بصيغة قابلة للتشغيل على الهاتف؛ فنموذج 12B بتكميم رباعي البتات هو محطة عمل أو نقطة نهاية مُخدَّمة، وليس مقيمًا على NPU.

A generated diagram of a four-layer Android agent stack - assistant (Antigravity, Claude Code, Codex) on top, then the ARTEMIS harness with locator, Safety Net, checkpoints and traces, then the vision-language reasoning layer, then the Android device via ADB - with a callout beside the reasoning layer noting that Gemma 4 12B could sit there but is untested with ARTEMIS.

حيث يتفوق كل منهما فعليًا

التكلفة عند التوسع — لا توجد لـ Gemma 4 12B المستضاف ذاتيًا أي تكلفة لكل رمز على الإطلاق، مقابل استدعاء رؤية لكل خطوة من خطوات تشغيل ARTEMIS. عند تشغيل حزمة اختبارات انحدار مكوَّنة من 500 اختبار ليلاً، يتراكم هذا الفرق أسرع من أي فجوة في المعايير.

الخصوصية — Gemma 4 12B على عتادك الخاص لا يرسل أي لقطة شاشة إلى أي مكان؛ مساعد إمكانية الوصول الخاص بـ ARTEMIS يعمل على الجهاز بشكل صريح ولا يرسل شيئًا، لكن استدعاء النموذج الذي يجريه مع كل لقطة شاشة يذهب إلى المزوّد الذي قمت بإعداده.

موثوقية المهام على تطبيق حقيقي — ARTEMIS، بفارق كبير، لأنه إطار عمل مزوّد بشبكة أمان، مع التحقق من نقاط التفتيش والاستعادة. لا شيء في نموذج أفضل يعوّض عن ذلك.

الصوت والمستندات الطويلة — Gemma 4 12B، مع إدخال صوتي أصلي في ورقة المواصفات التقنية ونافذة سياق بسعة 256K رمزًا. وليس لـ ARTEMIS رأي في أيٍّ منهما.

الوقت حتى أول اختبار ناجح — ARTEMIS، بفارق هائل. استنسخ، code>./start.sh/code>، وصّل جهازًا مع تصحيح USB، وانتظر حتى تُثبّت المهمة الأولى مساعد إمكانية الوصول. بناء المكافئ باستخدام نقطة تحقق مجردة هو مشروع يستغرق شهورًا، ومثال Orion أعلاه هو ما يبدو عليه ذلك المشروع عند اكتماله.

حرية تعديل طبقة الاستدلال — Gemma 4 12B، وهي أوزان Apache 2.0 يمكنك ضبطها بدقة على مفردات واجهة المستخدم الخاصة بك. ARTEMIS شيفرة Apache 2.0، لكن الاستدلال يكون أينما يقيم نموذجك.

الإصدارات المتاحة فعليًا اليوم من هذا الاقتران

كن واضحًا بشأن ما يمكنك نشره هذا الأسبوع. قائمة الواجهات الخلفية المُختبرة لدى ARTEMIS هي Gemini وClaude وGPT-4o وQwen-VL — لا يظهر Gemma 4 12B عليها، ولا يوجد تقييم منشور لـ Gemma 4 12B يقود جلسة ARTEMIS. يقبل ملف الإعداد نقطة نهاية نموذج، لذا فإن الاقتران معقول وليس مُثبتًا، وإذا جرّبته فأنت تقوم بعمل أصلي بدلًا من اتباع التوثيق. يجدر القول بصراحة: خارطة طريق ARTEMIS تتضمن بندًا بعنوان «نماذج VLMs خفيفة تعمل على الجهاز»، والنموذج الذي سيملؤه لن يكون بحجم 12B.

Gemma 4 12B ليس في كتالوجنا أيضًا — نحن نوجّه أحجام Gemma 4 الأخرى، Gemma 4 26B-A4B وGemma 4 31B، وليس 12B، لذا إذا كانت تلك هي نقطة التحقق التي تريدها فأنت تحصل عليها من توزيع المورّد نفسه ومن المضيفين المعتادين من طرف ثالث. ما الغرض من الكتالوج الموجَّه هو النصف الآخر من هذه المشكلة: إذا كانت خطتك هي ARTEMIS على نموذج رؤية مستضاف، فإن ذلك النموذج بند يتوسّع مع كل خطوة في كل تشغيل، والرافعة المفيدة ليست سعر الملصق بل سعر الذاكرة المؤقتة. يعيد تشغيل Pro قراءة سياق متنامٍ في كل خطوة، لذا فإن نموذجًا بقراءة ذاكرة مؤقتة رخيصة يغيّر الحساب أكثر بكثير من نموذج بمدخل جديد رخيص. ولهذا أيضًا ينتمي التحويل الاحتياطي للمزوّد إلى الإعدادات بدلًا من سجل الحوادث لديك — فجلسة Android الطويلة تحتفظ بسياقها على نقطة نهاية واحدة، وأي تعثّر للمزوّد عند الخطوة 74 يكلّفك التشغيل.

A generated scoreboard comparing ARTEMIS and Gemma 4 12B across six dimensions: category (harness vs open-weights VLM checkpoint), ability to drive a phone (yes via ADB vs no), parameter count (not a model vs 12B dense, about 6.7GB at Q4), price (per-step model call vs $0.10 in / $0.30 out per 1M), AndroidWorld (99.1% self-reported vs not published) and licence (Apache 2.0 for both).

أي واحدة هي خطوتك التالية؟

إذا كان لديك تطبيق جوال ومجموعة اختبارات انحدار، فإنك تريد ARTEMIS، ولا يُعد Gemma 4 12B بديلاً عن أي جزء من ARTEMIS — فهو في أفضل الأحوال المحرك الذي قد تستبدله لاحقًا، بلا توثيق، في وقتك الخاص. وإذا كنت تبني منتجًا يجب أن يعمل على هاتف محمول بلا شبكة وبلا تكلفة لكل استدعاء، فإنك تريد نموذجًا صغيرًا، ومن المرجح أن يكون Gemma 4 12B كبيرًا جدًا بالنسبة لعامل الشكل الذي لديك فعلاً؛ انظر إلى ما فعله Orion بنموذج Gemma من فئة 4B على NPU قبل أن تفترض أن 12B سيناسب.

لا يتصادم القراران إلا في موضع واحد، وهو مسألة كلفة لا مسألة قدرة: كم عدد نداءات الرؤية يوميًا الذي أنت مستعد لدفع ثمنه؟ أجب عن ذلك بصدق — أحصِ اختباراتك، وأحصِ خطواتك، وأحصِ تشغيلاتك الليلية — وسيحسم الاختيار بين منظومة تشغيل على نموذج مستضاف وحزمة مستضافة ذاتيًا أمره بنفسه.

الغرض منكتالوج موجّه هو النصف الآخر من هذه المشكلة: إذا كانت خطتك هي ARTEMIS على نموذج رؤية مستضاف، فإن ذلك النموذج بند تكلفة يزداد مع كل خطوة من كل تشغيل

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا