
ARTEMIS مقابل Qwen3.8: المعيار نفسه، لكن مهمتان مختلفتان
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
إن ARTEMIS من Google وQwen3.8 كلاهما يُقاسان على AndroidWorld، وهذا التطابق هو الحقيقة الأكثر تضليلًا على الإطلاق في تغطية إطلاق أي من المشروعين. ARTEMIS هو إطار أتمتة لأندرويد — أطلقته Google كمصدر مفتوح في أغسطس 2026 تحت رخصة Apache 2.0 — يتلقى تعليمات باللغة الطبيعية، ويشغّل هاتفًا حقيقيًا عبر ADB، ويزعم معدل إنجاز يتجاوز 99% على معيار AndroidWorld المكوّن من 116 مهمة والتابع لـ Google Research، مع تسجيل 99.1% على لوحة الصدارة العامة حتى 11 سبتمبر 2026. أما Qwen3.8-Flash فهو نموذج Alibaba متعدد الوسائط قائم على مزيج الخبراء، صدر وأُتيح كمصدر مفتوح في 26 أغسطس 2026، وتزعم مواد إطلاقه أنه يتفوق على Claude Opus 4.6 بـ 22.5 نقطة على AndroidWorld. أحد هذين الرقمين هو نتيجة نظام. والآخر هو مساهمة نموذج في نظام كتبه شخص آخر. اقرأهما كمنافسين وستستنتج الشيء الخطأ بشأن كليهما؛ واقرأهما كنصفين لمنظومة واحدة، فيصبح للسؤال المثير — ما التكلفة الفعلية لتشغيل Android طويل — جواب أخيرًا.
ما هو Qwen3.8، حسب الحجم
Qwen3.8 هي عائلة، وليست نقطة حفظ، والعضو الذي يهم هنا ليس الطراز الرائد.
• Qwen3.8-Max — الفئة الرائدة، الموضوعة في مواجهة النماذج المستضافة المتطورة.
• Qwen3.8-27B — النموذج الشقيق المفتوح متوسط الحجم الكثيف.
• Qwen3.8-Flash — نموذج MoE متعدد الوسائط على بنية "Next" الجديدة: 125 مليار معامل محوّل مع تفعيل 6 مليارات فقط لكل رمز، وQwen Sparse Attention مدمج مع GDN في مخطط انتباه هجين لتسريع السياق الطويل عندما تتحقق إصابة الذاكرة المؤقتة، وGated Residual يقسم قناة المعلومات إلى أربعة مسارات، و51 مليار معامل من تضمينات N-gram. تصف Alibaba بنية Next بأنها النموذج الأولي لـ Qwen4 من الجيل التالي.
• السياق — كبير بطبيعته، مع وجود معظم القوائم عند 1M توكن، وتصف بعض المصادر 262K بأنها أصلية موسّعة إلى 1M. الحد الأقصى للإخراج حوالي 131K.
• السعر — سعر API المعلن هو ¥1 لكل مليون رمز إدخال و¥3 لكل مليون رمز إخراج، وهو ما يعادل $0.15 / $0.47 في كتالوجنا، مع قراءات الذاكرة المؤقتة بسعر $0.018 وكتابات الذاكرة المؤقتة بسعر $0.230. وترى Alibaba نفسها أن تسعير إصابة الذاكرة المؤقتة الذي يصل إلى ¥0.1 لكل مليون هو ما يجعل سير عمل الوكلاء ذي المدخلات الطويلة قابلاً للتطبيق، والأرقام تؤيد ذلك: تكلفة قراءة من الذاكرة المؤقتة تبلغ نحو 1/12 من تكلفة رمز إدخال جديد.
• مسألة الأوزان المفتوحة — نُشرت أوزان Flash على Hugging Face وModelScope في يوم الإصدار. لاحظ كيف تُحتسب العائلة: تقول Alibaba إن سلسلة Qwen3.8 أتاحت مفتوحة المصدر ثلاثة أحجام — Max و27B وFlash — بما مجموعه 2.4 تريليون معلمة، وهو رقم تراكمي عبر السلسلة لا عدد معلمات أي نموذج واحد بمفرده.
إن مزاعم المعايير واسعة، ووفقًا لمواد الإطلاق الخاصة بـ Alibaba نفسها، فهي كلها فروق وليست قيمًا مطلقة: SWE-bench Pro +9.1 مقابل Opus 4.6، وJobBench نحو +20، وMathVision +25.1، وERQA +31.5، وAndroidWorld +22.5. والفروق مقابل إعداد غير مسمى لنموذج منافس ليست من الفئة نفسها من الأدلة كمدخل في لوحة المتصدرين، ولم يُعِد أحد إنتاج أي منها بشكل مستقل. أما الصياغة الرئيسية للشركة — إعادة تعريف «خط القتل» في تكلفة الصناعة من السعر لكل رمز إلى التكلفة الإجمالية لكل مهمة مكتملة — فهي الادعاء الذي يهم فعلاً في هذه المقارنة، وهو أيضًا الادعاء الذي يمكنك اختباره بنفسك.

ما الذي يقدمه ARTEMIS، ولماذا لا يمكن مقارنة الرقمين
لا يحتوي ARTEMIS على أي نموذج. تشير شارتُه إلى "متعدد النماذج — Gemini | Claude | GPT-4o | Qwen-VL" وتهيئته موجودة في code>config/artemis.jsonc/code>. ما يقدمه هو الجزء الذي يحوّل تخمين النموذج إلى إجراء مُتحقَّق منه: محدِّد موقع يعطي الأولوية للديناميكي، يقرأ شجرة إمكانية الوصول عندما يستطيع، ويعود إلى الرؤية والإحداثيات عندما لا يمنحه سطح Compose أو Flutter شيئًا، وشبكة أمان تزيل النوافذ المنبثقة للنظام المعترضة قبل أن يقع النقر، وتحقق من نقاط التفتيش عند أربعة مستويات من code>off/code> إلى code>strict/code>، وسجل جلسات يضغط لقطات الشاشة القديمة إلى ملخصات بصرية حتى يبقى سياق من مئة خطوة ميسور التكلفة.
كما أنه يأتي مزودًا بخادم MCP أصلي. code>uv run artemis mcp --install all/code> يوفّر code>mobile_run_task/code>، code>mobile_manage_task/code>، code>mobile_get_device_state/code>، code>mobile_inspect_trace/code> و code>mobile_diagnose/code> إلى Antigravity، وClaude Code، وCodex، وأي شيء آخر يتحدث MCP — وهو ما جعل المشروع ينتشر بهذه السرعة، وهو أنظف تعبير عن الغرض منه. ARTEMIS أداة يستدعيها وكيل. وكذلك النموذج، ولهذا فإن وضعهما في نفس العمود خطأ فئوي.
الشيء الوحيد الذي يجب الحذر منه عند قراءة نسبة 99.1% الخاصة بـ ARTEMIS: لوحة صدارة AndroidWorld لا تتحقق بشكل مستقل وصريح من المشاركات. كل رقم عليها، بما في ذلك رقم ARTEMIS، مُبلَّغ عنه ذاتيًا من الفريق الذي أنتجه. ينطبق التحفظ نفسه بقوة أكبر على الفارق المذكور في منشور إطلاق.
قراءة "vs" بطريقتين
هناك قراءتان صادقتان لهذه المواجهة وهما تشيران في اتجاهين متعاكسين.
باعتبارهما متنافسين، فإن المقارنة في الحقيقة هي: "هل ينبغي أن أستخدم نموذجًا مستضافًا بالإضافة إلى أداة تشغيل، أم ينبغي أن أستخدم نموذجًا جيدًا بما يكفي في مهام الجوال حتى أستطيع كتابة أداة التشغيل بنفسي؟" وبناءً على هذه القراءة، يفوز ARTEMIS تلقائيًا، لأن النموذج ليس أداة تشغيل — كما أن فرق AndroidWorld البالغ +22.5 نقطة لا يخبرك ما إذا كان Qwen3.8-Flash قادرًا على النجاة من الخطوة 74 في مسار من مئة خطوة عندما تلتهم نافذة نظام منبثقة النقرة الخاصة به. لا شيء في جدول معايير الأداء يقيس Safety Net.
كحزمة تقنية، تكون المقارنة هي المفيدة: فـARTEMIS هي حلقة التحكم، وQwen3.8-Flash محرك معقول لها، ويصبح السؤال سؤالًا عن التكلفة والموثوقية على المدى الطويل. إن عرض علي بابا بأكمله لطبقة Flash — أن الرقم المهم هو التكلفة الإجمالية لكل مهمة مكتملة وليس السعر لكل رمز — هو بالضبط المقياس الذي تُقيَّم عليه مجموعة أتمتة أندرويد، وهو مقياس يمكنك قياسه على مجموعة الاختبار الخاصة بك في يوم واحد.
التفصيل المُحرِج الذي يقف في الطريق: Qwen3.8-Flash ليس ضمن قائمة الواجهات الخلفية المُختبرة لدى ARTEMIS، التي تُسمّي Gemini وClaude وGPT-4o وQwen-VL. وQwen-VL نموذج مختلف. تأخذ منصة الاختبار نقطة نهاية نموذج، والاقتران معقول تقنيًا، لكن لم ينشر أحد تقييمًا له، وإذا شغّلته فأنت تقوم بعمل أصلي بدلًا من اتباع الوثائق.
الحساب الذي يحسم الأمر
إليك الحساب الذي يستحق العناء قبل أن يقنعك أيٌّ من منشورَي الإطلاق بأي شيء. إنه نموذج بافتراضات معلنة، لا قياس، وينبغي أن تستبدل به أرقامك الخاصة — لكن شكل النموذج هو المقصد.
خذ تشغيل Pro المكوّن من 100 خطوة. يعمل Pro بمعدل نحو 15–40 ثانية لكل خطوة، لذا يقع الوقت الفعلي في مكان ما بين 25 دقيقة وساعة، وترسل كل خطوة لقطة شاشة بالإضافة إلى مطالبة متزايدة. افترض 8,000 توكن للمطالبة و300 توكن للإخراج لكل خطوة — ميزانية متحفظة للقطة الشاشة والتعليمات، وهي أقل بكثير مما تكلفه إطار خام كامل الدقة. هذا يعني 800,000 توكن إدخال و30,000 توكن إخراج لاختبار واحد.
• عند سعر Qwen3.8-Flash البالغ $0.15 / $0.47، تكلّف تلك التشغيلة نحو $0.12 للإدخال و$0.014 للإخراج — أي نحو ثلاثة عشر سنتًا.
• عند سعر استضافة نموذج حدودي يبلغ أرقامًا أحادية منخفضة لكل مليون إدخال، ومنتصف العشرات لكل مليون إخراج، فإن التشغيل نفسه يقع في نطاق الدولارات، لا السنتات. المعدّلان مذكوران هنا على سبيل التقريب عمدًا، لأن الرقم الدقيق يعتمد على النموذج الحدودي الذي تختاره، والنسبة هي ما يهم: إنه فرق بمقدار مرتبة قدرية، في كل اختبار، وكل تشغيل.
• ولأن ARTEMIS يعيد قراءة سياق متنامٍ في كل خطوة، تتحسّن النسبة أكثر لأي نموذج تكون قراءة ذاكرته المؤقتة أرخص. فقراءة الذاكرة المؤقتة لدى Qwen3.8-Flash هي $0.018 لكل مليون مقابل $0.15 للإدخال الجديد — أي ما يعادل واحدًا من كل اثني عشر من السعر، وهو السبب وراء استمرار Alibaba في الإشارة إلى معدلات إصابة الذاكرة المؤقتة عند حديثها عن أحمال عمل الوكلاء.
الآن اضرب ذلك في حزمة اختباراتك. تشغيل انحدار من 500 اختبار كل ليلة يعني 400 مليون توكن إدخال في الليلة، والفرق بين ثلاثة عشر سنتًا وثلاثة دولارات لكل اختبار هو الفرق بين إطار اختبار يمكنك تحمّل تشغيله باستمرار وآخر تجدول تشغيله أسبوعيًا.

تشغيله، وحيث تهمّ البنية التحتية
إذا كنت تريد اختبار تلك الحسابات على تطبيقك الخاص، فالطريق الأمين هو توجيه ARTEMIS إلى نقطة نهاية نموذج والقياس.Qwen3.8-Flash موجود في كتالوجنا بالسعر المنشور $0.15 / $0.47 مع قراءات ذاكرة تخزين مؤقت بسعر $0.018 وكتابات ذاكرة تخزين مؤقت بسعر $0.230، على نفس المفتاح ونفس الفاتورة مثل أحجام Qwen3.8 الأخرى وكل ما نوجّهه — وهو الجزء الذي يهم عندما يكون سير العمل الذي تسعّره أداة اختبار تُجري مئة استدعاء لكل اختبار بدلاً من شخص يُجري استدعاءً واحدًا. تعرض صفحة النموذج أيضًا الأرقام التشغيلية التي تريدها قبل أن تلتزم بمجموعة اختبارات عليه: سياق بحجم 1M رمز مع حد أقصى للإخراج 131K، وزمن p50 للرمز الأول 7.12 ثانية وp95 البالغ 10.00، ونحو 2.3 مليار رمز من حركة المرور عبره في الأيام السبعة الماضية. هذا الرقم الأخير رقمنا وليس رقم مورّد، وهو مؤشر معقول على ما إذا كان آخرون يشغّلون بالفعل أحمال عمل وكلاء طويلة على نقطة النهاية هذه.
التفصيل التقني الداخلي الذي يتوقف عن كونه نظريًا عند هذا النطاق هو ما يحدث في الخطوة 74. يحافظ تشغيل Pro على سياقه على نقطة نهاية واحدة لمعظم ساعة تقريبًا؛ وحادثة لدى المزوّد في منتصف ذلك لا تُضعف التشغيل، بل تُنهيه، وتدفع ثمن الخطوات الـ73 التي لم تنتج نتيجة. إن توجيه جلسة وكيل طويلة عبر طبقة تتحوّل عند الفشل إلى مزوّد آخر للنموذج نفسه هو الفرق بين مجموعة تشغيلات متقلبة وأخرى منقطعة. هذه خاصية هندسية عادية، وهي التي تحدد ما إذا كانت تكلفتك المقاسة لكل مهمة مكتملة تصمد عند الاحتكاك بأسبوع من التشغيلات الحقيقية.

ما هو الغرض الفعلي من كل واحد منها
إذا كان لديك تطبيق Android ومجموعة اختبارات، فأنت تريد ARTEMIS، وQwen3.8-Flash هو محرك مرشّح له بدلًا من أن يكون بديلًا عنه — محرك غير موثّق، يستحق تجربة عصر واحد، ومسعّر بحيث لا تكلفك التجربة شيئًا قابلًا للقياس. وإذا كنت تختار نموذجًا لوكيل جوّال تكتبه بنفسك، فإن فارق +22.5 نقطة على AndroidWorld سبب للنظر في Qwen3.8-Flash وليس سببًا للاعتقاد به، لأنه فارق مُبلَّغ عنه من المورّد دون نتيجة مطلقة مرفقة ودون إعادة إنتاج مستقلة.
الشيء الذي يتناقش فيه المشروعان بهدوء هو الشيء نفسه، ولا يقول أيٌّ منهما ذلك بصراحة. تدّعي Google أن إطار التشغيل هو ما يجعل وكيل الهاتف المحمول موثوقًا، وتفتح مصدره حتى يمكن التحقق من الادعاء. وتدّعي Alibaba أن التكلفة لكل مهمة مكتملة هي الرقم الوحيد المهم، وتُسعّر وفقًا لذلك. الأرجح أن كليهما على حق، ولهذا فإن التهيئة المثيرة للاهتمام ليست ARTEMIS أو Qwen3.8 — بل ARTEMIS على Qwen3.8-Flash، مقيسًا على تطبيقك أنت، مع إبقاء التتبّع مفعّلًا.
ولأن ARTEMIS تعيد قراءة سياق متزايد في كل خطوة، فإن النسبة تتحسن أكثر بالنسبة إلىأي نموذج تكون قراءة ذاكرته المؤقتة أرخص.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
