بطاقة عنوان مُولَّدة لـ «ARTEMIS vs LFM2.5-2.6B-Base» بعنوان فرعي «إطار أتمتة مكتمل، ونقطة حفظ غير مكتملة»، تُقابل ARTEMIS بوصفها إطار أتمتة Android بترخيص Apache 2.0 مع LFM2.5-2.6B-Base بوصفه أوزانًا مُدرَّبة مسبقًا بحجم 2.69B دون ضبط بالتعليمات ودون مقاييس أداء، مع حاشية تفيد بأن النموذج الأساسي يُتاح بموجب رخصة LFM Open License بدلًا من Apache 2.0.
Guides & Insights

ARTEMIS مقابل LFM2.5-2.6B-Base: نقطة التحقق التي لا يمكنها أداء المهمة، وأداة الاختبار التي تحتاج إليها لكي

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

توجد أربعة عناصر على خارطة طريق ARTEMIS من Google، وواحد منها بالضبط يتطلب نموذجًا لا وجود له بشكل واضح بعد: نماذج رؤية-لغة خفيفة على الجهاز، من أجل أتمتة منخفضة الكمون وتركز على الخصوصية أولًا. المرشح الواضح لمهمة كهذه هو شيء من فئة الحجم LFM2.5-2.6B-Base — نقطة التحقق المُدربة مسبقًا من Liquid AI ذات 2.69 مليار معامل، منشورة كأوزان مفتوحة بسياق 131,072 رمزًا وبصمة صغيرة بما يكفي لهاتف. وهي أيضًا، كما هي مُشحونة، غير قادرة على ملء تلك الفتحة، والأسباب تستحق الفهم قبل أن يضع أي شخص الاثنين في جدول مقارنة. ARTEMIS من Google هي أداة أتمتة أندرويد باللغة الطبيعية، مفتوحة المصدر بموجب Apache 2.0 في أغسطس 2026، تقود هاتفًا حقيقيًا عبر ADB وتدّعي معدل إنجاز يتجاوز 99% في معيار AndroidWorld من Google Research. LFM2.5-2.6B-Base هي مادة خام مُدربة مسبقًا بدون ضبط بالتعليمات، ولا قالب محادثة، و— عن قصد — بدون معايير منشورة، مخصصة للفرق التي ستقوم بتدريبها لاحقًا بنفسها. أحدهما برمجية منتهية مع مشكلة نموذج غير منتهية. والآخر أوزان غير منتهية مع مشكلة ترخيص منتهية. لا يُعد أي منهما بديلًا عن الآخر، والمكان الذي يلتقيان فيه حقًا ليس المكان الذي قد تتوقعه.

ما هو LFM2.5-2.6B-Base في الواقع؟

إذا جرّدتها من العلامة التجارية، فهي أساس مبني بعناية للعمل على الجهاز، بمواصفات تبدو وكأن أحدهم حسّنها لعرض النطاق الترددي للذاكرة بدلًا من موقع الصدارة في لوحات الترتيب.

الحجم — 2.69 مليار معامل بصيغة bfloat16 في جزء واحد بحجم ~5.39 غيغابايت، ويُسوَّق له على أنه "2.6B".

البنية — 30 طبقة في تقسيم هجين: 22 كتلة التفاف قصيرة مزدوجة البوابات فوق 8 طبقات انتباه ذات استعلامات مجمّعة، عرض مخفي 2048، 32 رأس انتباه مقابل 8 رؤوس KV، تضمينات مربوطة. نفس code>Lfm2ForCausalLM/code> الصنف كما في الجيل السابق، لذا لا حاجة إلى كود نمذجة مخصص.

التدريب — ما يقرب من 34 تريليون رمز، مع مرحلة تدريب وسطية مخصصة لتوسيع السياق.

المفردات — 128,000 رمزًا، وقد تضاعفت في هذا الجيل للتعامل مع النصوص غير اللاتينية على نحو أفضل. حوالي 262 مليون معامل، أي ما يقارب عُشر النموذج، تقع في التضمين المربوط.

السياق — تتعارض بطاقة النموذج والإعدادات هنا، ومن الجدير معرفته: تُعلن الوثائق عن 131,072 رمزًا بينما code>config.json/code> يضبط code>max_position_embeddings/code> على 128,000. خصص ميزانية لـ 128K وتعامل مع أي شيء يتجاوز ذلك على أنه غير مُتحقّق منه.

اللغات — ستة عشر: الإنجليزية، والعربية، والصينية، والفرنسية، والألمانية، والهندية، والإندونيسية، والإيطالية، واليابانية، والكورية، والبولندية، والبرتغالية، والروسية، والإسبانية، والتايلاندية، والفيتنامية.

الاختبارات المعيارية — لا شيء. لا تنشر Liquid أي تقييم لنقطة التحقق الأساسية، وتُصوّر بطاقة النموذج هذا الإغفال على أنه مقصود: هذا المُخرَج موجود ليُجرى عليه تدريب لاحق، لا ليُقاس في حالته الخام.

هذا السطر الأخير هو بيت القصيد من الإصدار، وهو أيضاً السبب في أن مقارنة "X مقابل LFM2.5-2.6B-Base" يجب التعامل معها بحذر. نقطة تحقق أساسية لا تملك رأياً في أي شيء. اطلب منها تخطيط سير عمل أندرويد وستكمل نصك احتمالياً، لأنها لم تُعلَّم قط أن تجيب. لا توصي بها البطاقة إلا للحالات التي تتطلب ضبطاً دقيقاً مكثفاً: مساعد خاص بلغة معينة، أو مساعد خاص بمجال في قطاع خاضع للتنظيم، أو التدريب على بيانات مملوكة، أو كطالب تقطير. لأي شيء جاهز للاستخدام مباشرة، بما في ذلك استدعاء الأدوات، توجّهك Liquid إلى LFM2.5-2.6B المدرَّب بعدياً بدلاً من ذلك.

A screenshot of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the lfm1.0 licence, 16 languages, the lfm2.5, liquid and edge tags, BF16 tensor type, 27,908 downloads in the last month, 13 finetunes and 10 quantizations, and a model table listing the base as a pre-trained base model for fine-tuning alongside its post-trained sibling for agentic workloads.

ما تحتاجه ARTEMIS من نموذج، وهو ما لا توفره نقطة تحقق أساسية

ARTEMIS هي حلقة تحكم ذات وضعين. Flash هو دورة تفاعلية للمراقبة والتنفيذ تستغرق نحو 3–5 ثوانٍ لكل خطوة. Pro هو رسم بياني متعدد الوكلاء يستغرق نحو 15–40 ثانية لكل خطوة، مع Planner يحتفظ بخطة Markdown حية، وOperator يمتلك مجموعة الأدوات الكاملة، وChecker للقراءة فقط يتحقق من نقاط التفتيش عند أربعة مستويات من code>off/code> إلى code>strict/code>. يطلب كلا الوضعين الشيء نفسه من النموذج الكامن: انظر إلى لقطة شاشة، واختر إجراءً واحدًا من مجموعة أدوات ثابتة، وأعد تنفيذه خلال ثانية أو ثانيتين، مئة مرة، دون فقدان الخيط.

هذا طلب شاق — اتباع التعليمات ضمن مخطط صارم، وفهم بصري مُسنَد، وتماسك على المدى الطويل — وهو بالضبط مجموعة المهارات التي لم تُمنح لنقطة تحقق أساسية. الواجهات الخلفية المُختبرة الخاصة بـ ARTEMIS هي نماذج مستضافة: Gemini وClaude وGPT-4o وQwen-VL. وكل واحد منها مضبوط بالتعليمات لاستخدام الأدوات، وكل واحد منها كبير.

إذن، الفجوة ليست مسألة حجم. يمكن لنموذج بحجم 2.6B مُدرَّب لاحقًا أن يشغّل حلقة استدعاء أدوات — فالشقيق المدرَّب لاحقًا من Liquid نفسه يزعم أنه يتفوق على Gemma 4 E2B-it وE4B-it في جميع تقييمات اتباع التعليمات الخاصة به وتقريبًا كل تقييمات استخدام الأدوات الخاصة به، رغم أن هذه أرقام معلنة من المورّد دون تحقق مستقل. الفجوة هي أن base نقطة تحقق لم يُطبَّق عليها أي من ذلك التدريب، لذا لا يمكن إدراجها في إطار تشغيل على الإطلاق.

الترخيص هو الفارق الأكثر حدة.

هنا تُحسم المواجهة فعليًا، وهو الجزء الذي تتجاهله معظم المقارنات.

ARTEMIS — Apache 2.0. استخدمه تجاريًا، واشتقّ منه، ووزّعه داخل منتج، دون شرط يتعلق بالإيرادات. الالتزام الوحيد هو الحفاظ على الإشعارات وبيان تغييراتك، وهو التزام اضطر المشروع نفسه إلى إصلاحه علنًا في سبتمبر 2026 بعد أن ادّعت Minitap أن 228 من ملفات ARTEMIS من أصل 229 تطابق مشروعها الخاص المرخّص بموجب Apache-2.0 code>mobile-use/code>، وهو المشروع نفسه، وأن أسماء المؤلفين قد حُذفت عبر force-push. يحمل المستودع الآن سطر إسناد إلى Minitap.

LFM2.5-2.6B-Base — رخصة LFM Open License، رخصة مخصصة بدلًا من Apache أو MIT. إذا كانت الإيرادات السنوية أقل من 10 ملايين دولار، فإن المنح واسع ودائم وخالٍ من الإتاوات. وعند هذا الحد أو أعلى منه، لا تمتد الرخصة إلى الاستخدام التجاري إطلاقًا، ويتعين عليك التواصل مع Liquid. التفصيل المهم لأي شخص يبني عليه: الأعمال المشتقة ترث الشروط نفسها. نقطة التحقق التي تدرّبها لاحقًا ليست شيئًا جديدًا تملكه بالكامل — بل تنقل الرخصة المشروطة بالإيرادات إلى الأمام، مع استثناء للمنظمات غير الربحية المؤهلة.

ضع هاتين الحقيقتين جنبًا إلى جنب، ينقلب القرار تبعًا لمن تكون. الشركة الممولة التي تريد إطلاق وكيل على جانب الهاتف لديها إطار عمل Apache-2.0 يمكنها استخدامه بحرية، ونقطة تفتيش قد لا تتمكن من استخدامها تجاريًا على الإطلاق. أما المطور الفرد أو الشركة الناشئة تحت العتبة فيمتلكان كليهما، والترخيص مجرد حاشية. لا يتصرف أي من المورّدين بشكل غير معقول — فـ Liquid شركة تحمي طبقتها التجارية، وGoogle تجعل أدوات الاختبار مفتوحة المصدر — لكن "الأوزان المفتوحة" و"الأوزان المفتوحة" ليستا الإذن نفسه، والمقارنة التي تتوقف عند أعداد المعاملات لن تخبرك أيّهما لديك.

A generated licence comparison: ARTEMIS under Apache 2.0 with commercial use, no revenue gate, freedom to fork and ship, and a keep-notices obligation, against LFM2.5-2.6B-Base under the LFM Open License, where commercial use applies below $10M revenue, derivatives inherit the same terms, and organisations above the threshold must contact Liquid.

العائلة، لأن نقطة التحقق الأساسية هي الباب الخاطئ للدخول إليها.

إذا كان الهدف وكيل Android على الجهاز، فإنّ ثلاثة أشقاء يهمّون أكثر من الأساس، والشقيق الذي تحتاجه خارطة طريق ARTEMIS فعلاً ليس الشقيق الواضح.

LFM2.5-2.6B — النموذج الشقيق الوكيلي المدرَّب تدريبًا لاحقًا. تبلغ الإنتاجية المُبلَّغ عنها من المورّد نحو 30 رمزًا في الثانية على أجهزة من فئة الهواتف، و113 على Ryzen AI Max+ 395 و220 على Apple M5 Max، ويعمل في أقل من 2.5 غيغابايت.

LFM2.5-VL-3B — نموذج الرؤية واللغة الطرفي، مبني على نفس الأساس مع مُشفِّر SigLIP2 400M NaFlex، مع دقة تأسيس precision@1 المُبلَّغ عنها من البائع والتي ارتفعت من 57.1 إلى 87.9 على RefCOCO، ووفقًا لـ Liquid، الأداء على عناصر واجهة المستخدم على الشاشة الذي يتفوق على نماذج Gemma الأكبر بكثير ويقترب بنسبة 0.7% من Qwen 3.5 بحجم 4.7B. غير مُتحقق منه، لكنه العضو الوحيد في هذه العائلة الذي يمكنه رؤية الشاشة.

LFM2.5-230M — طبقة الاستخراج والتصنيف، غير موصى بها صراحةً للمهام التي تتطلب استدلالًا مكثفًا.

ما هو الاستنتاج غير المريح بشأن نقطة التحقق الأساسية في هذه المواجهة: بند خارطة طريق ARTEMIS هو متطلب رؤية، والنموذج الأساسي نصي فقط، وعضو العائلة الذي يملأ الخانة هو المتغير VL الذي طُبّق عليه بالفعل كل من مُرمِّز الرؤية والتدريب اللاحق. ودور نقطة التحقق الأساسية في منظومة أتمتة أندرويد ليس تشغيل الهاتف. بل أن تكون المادة الخام التي تقع تحت أي نموذج صغير يقوم بذلك في النهاية.

حيث يلتقيان فعلًا: دولاب الموازنة الذي لم يبنه أحد بعد

هذه هي الصلة الوحيدة الحقيقية لا الخطابية، وهي تسير عكس الاتجاه المعتاد. ليست الميزة الأكثر إغفالًا في ARTEMIS هي الوكيل — بل العوادم. فكل تشغيل يلتقط مكدسات الأعطال، ولقطات شاشة للإطارات المفتاحية، وسجل جلسة للخطوات المضغوطة، وتقريرًا تشخيصيًا، ويفتح Pro «حادثة تنفيذ» كلما فشل إجراء ويبقيها في السياق حتى يحلّها نجاح لاحق. وهذه مجموعة بيانات موسومة للّحظات التي كان فيها إدراك وكيل واجهة المستخدم خاطئًا بالضبط.

اقرن ذلك بنقطة تحقق غرضها بالكامل هو التدريب اللاحق، وستحصل على حلقة واضحة: شغّل منظومة الاختبار على نموذج مستضاف، واجمع التتبعات التي تعثّر فيها عند تطبيقك، ثم اضبط نموذجًا بحجم 2.6B بدقة على تلك الإطارات تحديدًا. إنها نوع مجموعة البيانات المملوكة التي تستشهد بها بطاقة Liquid الخاصة كمبرر لإصدار نقطة تحقق أساسية من الأساس — "التدريب على بياناتك الخاصة" — كما أن الترخيص المقيّد بعتبة الإيرادات يعني أنه مسار منطقي للفرق دون العتبة ويتطلب محادثة للفرق فوقها.

لكي أكون صريحًا بشأن وضع تلك الفكرة: لم ينشر أحد هذه الحلقة، ولا يقترحها أيٌّ من المورّدين، ولا يوجد دليل على أن أيًّا من الطرفين قد اختبرها. إنها اقتراح، وليست نتيجة، وينبغي قراءتها على هذا الأساس. لكنها الإطار الوحيد الذي يكون فيه هذان الأثران متعاونَين لا خطأً في التصنيف.

إذا وصلت إلى مرحلة الضبط الدقيق، فإن مجموعة المقارنة هي النصف الآخر من المشكلة. لا يظهر LFM2.5-2.6B-Base في كتالوجنا — ولا أي إصدار من LFM2.5 — لذا تأتي نقطة التحقق هذه من توزيع Liquid نفسه ومن المضيفين الخارجيين المعتادين. وحيث يثبت الكتالوج الموجَّه قيمته هو في تقييم الضبط الدقيق لديك مقابل النماذج التي يتعين عليه التغلب عليها في استخدام الأدوات، بمفتاح واحد وفاتورة واحدة، مع تجاوز الفشل حتى لا تتحول فترة سوء لدى مزوّد إلى فترة سوء في تقييمك. وهذا شيء مفيد حقًا عندما يكون هدف التمرين كله مواجهة مباشرة تنوي التصرف بناءً عليها.

A generated scoreboard comparing ARTEMIS and LFM2.5-2.6B-Base across six dimensions: type (Android automation harness vs pre-trained text checkpoint), whether it runs a phone (yes through ADB vs no), instruction tuning (not applicable vs none), vision (from the configured model vs none, text only), context (compressed session history vs 128,000 tokens) and licence (Apache 2.0 vs LFM Open License with a revenue threshold).

إذن، أي واحد هو مشكلتك؟

إذا كان لديك تطبيق أندرويد وتريد اختباره تلقائيًا هذا الربع، فأنت تريد ARTEMIS، وLFM2.5-2.6B-Base ليس جزءًا من الإجابة — ستشغّل ARTEMIS مقابل نموذج رؤية مستضاف، وتدفع مقابل كل خطوة، وسيصل بند خارطة الطريق المتعلق بنماذج اللغات البصرية على الجهاز (VLMs) في النهاية ويحل مشكلة تكلفة لم تقِسها بعد.

إذا كنت تبني منتجًا يجب أن يعمل على جهاز محمول بدون شبكة، فأنت تريد مسار النموذج الصغير، وLFM2.5-2.6B-Base هو بداية ذلك المشروع وليس أي جزء من حله: ستقوم بتدريبه لاحقًا، وستقرأ رخصة LFM Open License مقابل توقعات إيراداتك قبل أن تكتب أول نص برمجي تدريبي، وإذا كان وكيلك بحاجة إلى رؤية شاشة فستنتهي إلى البديل VL بدلاً من ذلك.

الشيء الوحيد الذي ينبغي ألا تفعله هو أن تضع هذين الاثنين جنبًا إلى جنب، وتعلن أن الهارنس أكثر قدرة، ثم تمضي قدمًا. المقارنة المفيدة هي بين المنظومتين الكاملتين — نموذج مستضاف مع هارنس، مقابل نموذج صغير خضع لضبط دقيق مع إطار من بنائك — وواحد فقط منهما لديه معدل نجاح منشور على معيار مرجعي عام، وهذا يساوي تمامًا كون الآخر لا توجد عليه أي فاتورة سحابية على الإطلاق.

إن ما يمنح الكتالوج الموجَّه مكانته هو قياس أداء نموذجك المضبوط بدقة مقابل النماذج التي عليه التغلّب عليها في استخدام الأدوات، على مفتاح واحد وفاتورة واحدة، مع تجاوز الفشل بحيث لا تتحوّل فترة بعد ظهر سيئة لدى مزوّد إلى فترة بعد ظهر سيئة لتقييمك.

LFM2.5-2.6B-Base ليس في الكتالوج الخاص بنا — لا يوجد أي إصدار من LFM2.5 — لذا فإن نقطة التحقق تلك تأتي من توزيع Liquid الخاص ومن المضيفين المعتادين من الأطراف الثالثة.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا