بطاقة عنوان مُنشأة لـ 'ARTEMIS vs Qwen3.8' بعنوان فرعي 'المقياس نفسه، مهمّتان مختلفتان'، تُقابل نتيجة ARTEMIS المُعلنة ذاتيًا بنسبة 99.1% في AndroidWorld مع تحسّن Qwen3.8-Flash المُبلَّغ عنه من المورّد بمقدار 22.5 نقطة على Opus 4.6 في المقياس نفسه، مع حاشية سفلية تفيد بأن AndroidWorld لا تتحقق من المشاركات بشكل مستقل.
Guides & Insights

ARTEMIS مقابل Qwen3.8: المعيار نفسه، لكن مهمتان مختلفتان

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إن ARTEMIS من Google وQwen3.8 كلاهما يُقاسان على AndroidWorld، وهذا التطابق هو الحقيقة الأكثر تضليلًا على الإطلاق في تغطية إطلاق أي من المشروعين. ARTEMIS هو إطار أتمتة لأندرويد — أطلقته Google كمصدر مفتوح في أغسطس 2026 تحت رخصة Apache 2.0 — يتلقى تعليمات باللغة الطبيعية، ويشغّل هاتفًا حقيقيًا عبر ADB، ويزعم معدل إنجاز يتجاوز 99% على معيار AndroidWorld المكوّن من 116 مهمة والتابع لـ Google Research، مع تسجيل 99.1% على لوحة الصدارة العامة حتى 11 سبتمبر 2026. أما Qwen3.8-Flash فهو نموذج Alibaba متعدد الوسائط قائم على مزيج الخبراء، صدر وأُتيح كمصدر مفتوح في 26 أغسطس 2026، وتزعم مواد إطلاقه أنه يتفوق على Claude Opus 4.6 بـ 22.5 نقطة على AndroidWorld. أحد هذين الرقمين هو نتيجة نظام. والآخر هو مساهمة نموذج في نظام كتبه شخص آخر. اقرأهما كمنافسين وستستنتج الشيء الخطأ بشأن كليهما؛ واقرأهما كنصفين لمنظومة واحدة، فيصبح للسؤال المثير — ما التكلفة الفعلية لتشغيل Android طويل — جواب أخيرًا.

ما هو Qwen3.8، حسب الحجم

Qwen3.8 هي عائلة، وليست نقطة حفظ، والعضو الذي يهم هنا ليس الطراز الرائد.

Qwen3.8-Max — الفئة الرائدة، الموضوعة في مواجهة النماذج المستضافة المتطورة.

Qwen3.8-27B — النموذج الشقيق المفتوح متوسط الحجم الكثيف.

Qwen3.8-Flash — نموذج MoE متعدد الوسائط على بنية "Next" الجديدة: 125 مليار معامل محوّل مع تفعيل 6 مليارات فقط لكل رمز، وQwen Sparse Attention مدمج مع GDN في مخطط انتباه هجين لتسريع السياق الطويل عندما تتحقق إصابة الذاكرة المؤقتة، وGated Residual يقسم قناة المعلومات إلى أربعة مسارات، و51 مليار معامل من تضمينات N-gram. تصف Alibaba بنية Next بأنها النموذج الأولي لـ Qwen4 من الجيل التالي.

السياق — كبير بطبيعته، مع وجود معظم القوائم عند 1M توكن، وتصف بعض المصادر 262K بأنها أصلية موسّعة إلى 1M. الحد الأقصى للإخراج حوالي 131K.

السعر — سعر API المعلن هو ¥1 لكل مليون رمز إدخال و¥3 لكل مليون رمز إخراج، وهو ما يعادل $0.15 / $0.47 في كتالوجنا، مع قراءات الذاكرة المؤقتة بسعر $0.018 وكتابات الذاكرة المؤقتة بسعر $0.230. وترى Alibaba نفسها أن تسعير إصابة الذاكرة المؤقتة الذي يصل إلى ¥0.1 لكل مليون هو ما يجعل سير عمل الوكلاء ذي المدخلات الطويلة قابلاً للتطبيق، والأرقام تؤيد ذلك: تكلفة قراءة من الذاكرة المؤقتة تبلغ نحو 1/12 من تكلفة رمز إدخال جديد.

مسألة الأوزان المفتوحة — نُشرت أوزان Flash على Hugging Face وModelScope في يوم الإصدار. لاحظ كيف تُحتسب العائلة: تقول Alibaba إن سلسلة Qwen3.8 أتاحت مفتوحة المصدر ثلاثة أحجام — Max و27B وFlash — بما مجموعه 2.4 تريليون معلمة، وهو رقم تراكمي عبر السلسلة لا عدد معلمات أي نموذج واحد بمفرده.

إن مزاعم المعايير واسعة، ووفقًا لمواد الإطلاق الخاصة بـ Alibaba نفسها، فهي كلها فروق وليست قيمًا مطلقة: SWE-bench Pro +9.1 مقابل Opus 4.6، وJobBench نحو +20، وMathVision +25.1، وERQA +31.5، وAndroidWorld +22.5. والفروق مقابل إعداد غير مسمى لنموذج منافس ليست من الفئة نفسها من الأدلة كمدخل في لوحة المتصدرين، ولم يُعِد أحد إنتاج أي منها بشكل مستقل. أما الصياغة الرئيسية للشركة — إعادة تعريف «خط القتل» في تكلفة الصناعة من السعر لكل رمز إلى التكلفة الإجمالية لكل مهمة مكتملة — فهي الادعاء الذي يهم فعلاً في هذه المقارنة، وهو أيضًا الادعاء الذي يمكنك اختباره بنفسك.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

ما الذي يقدمه ARTEMIS، ولماذا لا يمكن مقارنة الرقمين

لا يحتوي ARTEMIS على أي نموذج. تشير شارتُه إلى "متعدد النماذج — Gemini | Claude | GPT-4o | Qwen-VL" وتهيئته موجودة في code>config/artemis.jsonc/code>. ما يقدمه هو الجزء الذي يحوّل تخمين النموذج إلى إجراء مُتحقَّق منه: محدِّد موقع يعطي الأولوية للديناميكي، يقرأ شجرة إمكانية الوصول عندما يستطيع، ويعود إلى الرؤية والإحداثيات عندما لا يمنحه سطح Compose أو Flutter شيئًا، وشبكة أمان تزيل النوافذ المنبثقة للنظام المعترضة قبل أن يقع النقر، وتحقق من نقاط التفتيش عند أربعة مستويات من code>off/code> إلى code>strict/code>، وسجل جلسات يضغط لقطات الشاشة القديمة إلى ملخصات بصرية حتى يبقى سياق من مئة خطوة ميسور التكلفة.

كما أنه يأتي مزودًا بخادم MCP أصلي. code>uv run artemis mcp --install all/code> يوفّر code>mobile_run_task/code>، code>mobile_manage_task/code>، code>mobile_get_device_state/code>، code>mobile_inspect_trace/code> و code>mobile_diagnose/code> إلى Antigravity، وClaude Code، وCodex، وأي شيء آخر يتحدث MCP — وهو ما جعل المشروع ينتشر بهذه السرعة، وهو أنظف تعبير عن الغرض منه. ARTEMIS أداة يستدعيها وكيل. وكذلك النموذج، ولهذا فإن وضعهما في نفس العمود خطأ فئوي.

الشيء الوحيد الذي يجب الحذر منه عند قراءة نسبة 99.1% الخاصة بـ ARTEMIS: لوحة صدارة AndroidWorld لا تتحقق بشكل مستقل وصريح من المشاركات. كل رقم عليها، بما في ذلك رقم ARTEMIS، مُبلَّغ عنه ذاتيًا من الفريق الذي أنتجه. ينطبق التحفظ نفسه بقوة أكبر على الفارق المذكور في منشور إطلاق.

قراءة "vs" بطريقتين

هناك قراءتان صادقتان لهذه المواجهة وهما تشيران في اتجاهين متعاكسين.

باعتبارهما متنافسين، فإن المقارنة في الحقيقة هي: "هل ينبغي أن أستخدم نموذجًا مستضافًا بالإضافة إلى أداة تشغيل، أم ينبغي أن أستخدم نموذجًا جيدًا بما يكفي في مهام الجوال حتى أستطيع كتابة أداة التشغيل بنفسي؟" وبناءً على هذه القراءة، يفوز ARTEMIS تلقائيًا، لأن النموذج ليس أداة تشغيل — كما أن فرق AndroidWorld البالغ +22.5 نقطة لا يخبرك ما إذا كان Qwen3.8-Flash قادرًا على النجاة من الخطوة 74 في مسار من مئة خطوة عندما تلتهم نافذة نظام منبثقة النقرة الخاصة به. لا شيء في جدول معايير الأداء يقيس Safety Net.

كحزمة تقنية، تكون المقارنة هي المفيدة: فـARTEMIS هي حلقة التحكم، وQwen3.8-Flash محرك معقول لها، ويصبح السؤال سؤالًا عن التكلفة والموثوقية على المدى الطويل. إن عرض علي بابا بأكمله لطبقة Flash — أن الرقم المهم هو التكلفة الإجمالية لكل مهمة مكتملة وليس السعر لكل رمز — هو بالضبط المقياس الذي تُقيَّم عليه مجموعة أتمتة أندرويد، وهو مقياس يمكنك قياسه على مجموعة الاختبار الخاصة بك في يوم واحد.

التفصيل المُحرِج الذي يقف في الطريق: Qwen3.8-Flash ليس ضمن قائمة الواجهات الخلفية المُختبرة لدى ARTEMIS، التي تُسمّي Gemini وClaude وGPT-4o وQwen-VL. وQwen-VL نموذج مختلف. تأخذ منصة الاختبار نقطة نهاية نموذج، والاقتران معقول تقنيًا، لكن لم ينشر أحد تقييمًا له، وإذا شغّلته فأنت تقوم بعمل أصلي بدلًا من اتباع الوثائق.

الحساب الذي يحسم الأمر

إليك الحساب الذي يستحق العناء قبل أن يقنعك أيٌّ من منشورَي الإطلاق بأي شيء. إنه نموذج بافتراضات معلنة، لا قياس، وينبغي أن تستبدل به أرقامك الخاصة — لكن شكل النموذج هو المقصد.

خذ تشغيل Pro المكوّن من 100 خطوة. يعمل Pro بمعدل نحو 15–40 ثانية لكل خطوة، لذا يقع الوقت الفعلي في مكان ما بين 25 دقيقة وساعة، وترسل كل خطوة لقطة شاشة بالإضافة إلى مطالبة متزايدة. افترض 8,000 توكن للمطالبة و300 توكن للإخراج لكل خطوة — ميزانية متحفظة للقطة الشاشة والتعليمات، وهي أقل بكثير مما تكلفه إطار خام كامل الدقة. هذا يعني 800,000 توكن إدخال و30,000 توكن إخراج لاختبار واحد.

• عند سعر Qwen3.8-Flash البالغ $0.15 / $0.47، تكلّف تلك التشغيلة نحو $0.12 للإدخال و$0.014 للإخراج — أي نحو ثلاثة عشر سنتًا.

• عند سعر استضافة نموذج حدودي يبلغ أرقامًا أحادية منخفضة لكل مليون إدخال، ومنتصف العشرات لكل مليون إخراج، فإن التشغيل نفسه يقع في نطاق الدولارات، لا السنتات. المعدّلان مذكوران هنا على سبيل التقريب عمدًا، لأن الرقم الدقيق يعتمد على النموذج الحدودي الذي تختاره، والنسبة هي ما يهم: إنه فرق بمقدار مرتبة قدرية، في كل اختبار، وكل تشغيل.

• ولأن ARTEMIS يعيد قراءة سياق متنامٍ في كل خطوة، تتحسّن النسبة أكثر لأي نموذج تكون قراءة ذاكرته المؤقتة أرخص. فقراءة الذاكرة المؤقتة لدى Qwen3.8-Flash هي $0.018 لكل مليون مقابل $0.15 للإدخال الجديد — أي ما يعادل واحدًا من كل اثني عشر من السعر، وهو السبب وراء استمرار Alibaba في الإشارة إلى معدلات إصابة الذاكرة المؤقتة عند حديثها عن أحمال عمل الوكلاء.

الآن اضرب ذلك في حزمة اختباراتك. تشغيل انحدار من 500 اختبار كل ليلة يعني 400 مليون توكن إدخال في الليلة، والفرق بين ثلاثة عشر سنتًا وثلاثة دولارات لكل اختبار هو الفرق بين إطار اختبار يمكنك تحمّل تشغيله باستمرار وآخر تجدول تشغيله أسبوعيًا.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

تشغيله، وحيث تهمّ البنية التحتية

إذا كنت تريد اختبار تلك الحسابات على تطبيقك الخاص، فالطريق الأمين هو توجيه ARTEMIS إلى نقطة نهاية نموذج والقياس.Qwen3.8-Flash موجود في كتالوجنا بالسعر المنشور $0.15 / $0.47 مع قراءات ذاكرة تخزين مؤقت بسعر $0.018 وكتابات ذاكرة تخزين مؤقت بسعر $0.230، على نفس المفتاح ونفس الفاتورة مثل أحجام Qwen3.8 الأخرى وكل ما نوجّهه — وهو الجزء الذي يهم عندما يكون سير العمل الذي تسعّره أداة اختبار تُجري مئة استدعاء لكل اختبار بدلاً من شخص يُجري استدعاءً واحدًا. تعرض صفحة النموذج أيضًا الأرقام التشغيلية التي تريدها قبل أن تلتزم بمجموعة اختبارات عليه: سياق بحجم 1M رمز مع حد أقصى للإخراج 131K، وزمن p50 للرمز الأول 7.12 ثانية وp95 البالغ 10.00، ونحو 2.3 مليار رمز من حركة المرور عبره في الأيام السبعة الماضية. هذا الرقم الأخير رقمنا وليس رقم مورّد، وهو مؤشر معقول على ما إذا كان آخرون يشغّلون بالفعل أحمال عمل وكلاء طويلة على نقطة النهاية هذه.

التفصيل التقني الداخلي الذي يتوقف عن كونه نظريًا عند هذا النطاق هو ما يحدث في الخطوة 74. يحافظ تشغيل Pro على سياقه على نقطة نهاية واحدة لمعظم ساعة تقريبًا؛ وحادثة لدى المزوّد في منتصف ذلك لا تُضعف التشغيل، بل تُنهيه، وتدفع ثمن الخطوات الـ73 التي لم تنتج نتيجة. إن توجيه جلسة وكيل طويلة عبر طبقة تتحوّل عند الفشل إلى مزوّد آخر للنموذج نفسه هو الفرق بين مجموعة تشغيلات متقلبة وأخرى منقطعة. هذه خاصية هندسية عادية، وهي التي تحدد ما إذا كانت تكلفتك المقاسة لكل مهمة مكتملة تصمد عند الاحتكاك بأسبوع من التشغيلات الحقيقية.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

ما هو الغرض الفعلي من كل واحد منها

إذا كان لديك تطبيق Android ومجموعة اختبارات، فأنت تريد ARTEMIS، وQwen3.8-Flash هو محرك مرشّح له بدلًا من أن يكون بديلًا عنه — محرك غير موثّق، يستحق تجربة عصر واحد، ومسعّر بحيث لا تكلفك التجربة شيئًا قابلًا للقياس. وإذا كنت تختار نموذجًا لوكيل جوّال تكتبه بنفسك، فإن فارق +22.5 نقطة على AndroidWorld سبب للنظر في Qwen3.8-Flash وليس سببًا للاعتقاد به، لأنه فارق مُبلَّغ عنه من المورّد دون نتيجة مطلقة مرفقة ودون إعادة إنتاج مستقلة.

الشيء الذي يتناقش فيه المشروعان بهدوء هو الشيء نفسه، ولا يقول أيٌّ منهما ذلك بصراحة. تدّعي Google أن إطار التشغيل هو ما يجعل وكيل الهاتف المحمول موثوقًا، وتفتح مصدره حتى يمكن التحقق من الادعاء. وتدّعي Alibaba أن التكلفة لكل مهمة مكتملة هي الرقم الوحيد المهم، وتُسعّر وفقًا لذلك. الأرجح أن كليهما على حق، ولهذا فإن التهيئة المثيرة للاهتمام ليست ARTEMIS أو Qwen3.8 — بل ARTEMIS على Qwen3.8-Flash، مقيسًا على تطبيقك أنت، مع إبقاء التتبّع مفعّلًا.

ولأن ARTEMIS تعيد قراءة سياق متزايد في كل خطوة، فإن النسبة تتحسن أكثر بالنسبة إلىأي نموذج تكون قراءة ذاكرته المؤقتة أرخص.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا