بطاقة رئيسية مع عبارة تمهيدية 'وظيفتان مختلفتان' والعنوان الرئيسي 'DSpark مقابل UI-Venus 2.9B'، وعنوان فرعي 'مضاعِف سرعة 279.5M مقابل وكيل واجهة رسومية 9B - لا تكون المقارنة منطقية إلا عندما تتوقف عن التعامل معهما كبديلين.' ثلاث بطاقات تقول 'مُسوِّد 279.5M - يجعل LFM2.5-VL-3B أسرع؛ ولا ينتج شيئًا بمفرده'، 'وكيل واجهة رسومية 9B - inclusionAI التابع لـ Ant Group؛ ينقر، يكتب، يتنقل' و'ليسا بديلين - أحدهما تحسين وقت التشغيل، والآخر السياسة'. تذييل يقول 'أرقام السرعة قيست من المورّد Liquid AI؛ ودرجات الوكيل مُبلّغ عنها من المورّد Ant Group. لم يُعِد أحد إنتاج أيٍّ منهما بشكل مستقل.' شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Engineering & Research

LFM2.5-VL-3B-DSpark مقابل UI-Venus 2.9B: مضاعِف سرعة في مواجهة وكيل واجهة مستخدم رسومية

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يُدرَج LFM2.5-VL-3B-DSpark وUI-Venus 2.9B تحت العنوان الغامض نفسه — نماذج رؤية صغيرة — ثم يُقارَن أحدهما بالآخر، وهو خطأ تصنيفي يستحق الإصلاح قبل أن يكلّف أحدهم أسبوعًا من التكامل. LFM2.5-VL-3B-DSpark هو نموذج مسوّدة بمعاملات 279.5M يسرّع LFM2.5-VL-3B من Liquid AI. أما UI-Venus 2.9B، من مختبر inclusionAI التابع لمجموعة Ant، فهو وكيل واجهة رسومية بحجم 9B يقرأ لقطات الشاشة، ويقرّر إجراءً، وينفّذه عبر بيئات الجوال والويب وسطح المكتب. أحدهما يجعل نموذجًا موجودًا أسرع. والآخر هو الشيء الذي يقوم بالعمل. إذا كنت تحتاج إلى وكيل واجهة رسومية، فليست المسوّدة خيارًا أرخص — بل ليست خيارًا على الإطلاق.

المقارنة المفيدة ليست أيّهما أفضل، بل أيّ مشكلة يحلّها كلّ منهما، وما يكلّفك إيّاه كلّ منهما في هذه العملية. كما أنّ كليهما وافدان حديثان لم يلحق بهما النظام البيئي الأوسع بعد، والفجوة بين ما تدّعيه مستودعاتهما وما تحقّق منه أيّ طرف آخر أكبر لدى أحدهما من الآخر.

ما هو كل واحد منها، على وجه الدقة

ابدأ بالأشكال، لأنها تشرح معظم الباقي.

• ما هو — LFM2.5-VL-3B-DSpark هو مُعِدّ مسودات لفك التشفير التخميني؛ UI-Venus 2.9B هي سياسة وكيل لواجهات المستخدم الرسومية عامة الأغراض

• المعلمات — 279.5M BF16 لمُعِدّ المسودة، مقابل 9B لـ UI-Venus 2.9B المهيَّأة من Qwen3.5-9B

• قدرة مستقلة — لا يولّد مُعِدّ المسودة شيئًا صالحًا للاستخدام بمفرده، ولا يمكن قياس أدائه بمعزل عن غيره؛ يعمل UI-Venus 2.9B وكيلًا كاملًا

• المدخلات — لا يرى المُسوِّد الصورة نفسها أبدًا، بل يرى فقط الحالات المخفية للنموذج الهدف؛ بينما يستهلك UI-Venus 2.9B لقطات الشاشة مباشرةً، وقد بُني بالكامل حولها

• المخرجات — يقترح المُصاغ رموزًا للتحقق؛ ويصدر UI-Venus 2.9B إجراءات مُسنَدة مع صناديق إحاطة مقابل واجهة حية

• الأساس — نموذج المسودة مرتبط بـ LiquidAI/LFM2.5-VL-3B في بياناته الوصفية الخاصة به؛ أما UI-Venus 2.9B فهو مبني على Qwen3.5-9B

• السياق — يرث نموذج المسودة كل ما يوفره النموذج الهدف؛ ويتم تقديم UI-Venus 2.9B بحد أقصى قدره 262,144 رمزًا في وصفة vLLM الخاصة بالمورّد نفسه

• الترخيص — كلاهما غير محسوم، ولكن بطرق مختلفة؛ إذ تُتاح Liquid بموجب ترخيص LFM1.0، بينما تذكر بطاقة UI-Venus 2.9B صراحةً أن ترخيص أوزانها لا يزال معلّقًا بانتظار تأكيد نهائي

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

تلك النقطة الأخيرة هي التي ينبغي التمهّل عندها. وصفت تغطيتنا الخاصة لـ UI-Venus-2-9B في أواخر أغسطس الإصدارَ بأنه Apache-2.0، لأن هذا ما كانت تحمله مواد المشروع في ذلك الوقت. أما بطاقة النموذج اليوم فتقول شيئًا مختلفًا وأقوى: إن ترخيص أوزان النموذج معلّق بانتظار تأكيد نهائي وسيُضاف قبل الإصدار العام، وإن إعلان Apache-2.0 لم يُنقل عن قصد لأن المواد الحالية في المنبع تحتوي على بيانات ترخيص متعارضة. إذا كنت تخطط لنشر تجاري لـ UI-Venus 2.9B، فإن مسألة الترخيص مفتوحة وفقًا لإقرار المورّد نفسه، وهذا خطر جوهري وليس مجرد حاشية.

الأرقام التي نشرها كل طرفٍ فعليًا

يقيس المستودعان أمرين مختلفين، وهذا هو المقصود. ينشر Liquid معدل الإنتاجية؛ وتنشر Ant Group نجاح المهام.

بالنسبة إلى نموذج المسودة (drafter)، وفقًا لإطار الاختبار الخاص بـ Liquid نفسه: تسريع فك الترميز يصل إلى 2.66× في أفضل الأحوال على بطاقة H100 80GB واحدة بدقة BF16 عبر SGLang، و3.13× في أفضل الأحوال مع MLX-VLM على Apple M5 Max، و2.14× في أفضل الأحوال مع llama.cpp على M3 Ultra. ومن البداية إلى النهاية، تتراوح تلك التشغيلات نفسها بين 1.30× و2.62× حسب الحزمة والمهمة. ويبلغ معدل قبول المسودة نحو 3.2 إلى 4.5 رمزًا لكل تمريرة تحقق. وكل واحد من هذه القياسات مُقاس من قِبَل المورّد دون أي إعادة إنتاج خارجية.

بالنسبة إلى UI-Venus 2.9B، تُبلغ جداول البطاقة الخاصة به عن 80.2 على AndroidWorld، و65.8 على MobileWorld ضمن ميزانية 50 خطوة، و70.8 على OSWorld-Verified، و48.0 على DeskCraft، و90.8 على WebVoyager عبر تقسيم الـ595 مهمة المُحدَّث، و74.0 على Online-Mind2Web، و73.0 على ScreenSpot-Pro و77.1 على VenusBench-GD. وفيما يتعلق بـ CAPTCHA، يُبلغ عن 78.1 على VenusBench-CAPTCHA و75.7 على MCA-Bench. وعلى صعيد السلامة، يُبلغ عن معدل نجاح هجمات قدره 11.3% على OSHarm مقابل 25.3% لقاعدته Qwen3.5-9B. كل هذه النتائج مُبلَّغ عنها من المورّد، وبعض خطوط الأساس تحمل علامة نجمة تعني أن مؤلفي UI-Venus قيّموها وفق البروتوكول المذكور، كما تحذّر البطاقة نفسها من أن مقارنات OSWorld-Verified تستخدم سقالات إجراءات خاصة بكل نموذج وينبغي قراءتها كمراجع على مستوى المعيار لا كتجارب استئصال مضبوطة.

لاحِظ ما هو غائب عن كلتا القائمتين: أي شيء يقيسه طرف ثالث. بالنسبة إلى drafter، فذلك لأن نقطة التحقق عمرها بضعة أيام. وبالنسبة إلى UI-Venus 2.9B، فذلك لأن معايير وكيل واجهة المستخدم الرسومية باهظة التكلفة لإعادة إنتاجها، كما أن نتائج البيئة الحية تتغير بتغير حالة البيئة في تاريخ التقييم — وهو تحفّظ تذكره البطاقة من تلقاء نفسها.

حيث يلتقي الاثنان فعليًا

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

هناك تداخل حقيقي، وهو أضيق مما يوحيه اسم الفئة. كلاهما ذو صلة إذا كنت تبني وكيلًا بصريًا يعمل على الجهاز أو على الحافة، وكلاهما يهتم بتكلفة تمرير البكسلات عبر نموذج. وهما يتناولان المشكلة من طرفين متعاكسين.

تتصدّى لها UI-Venus 2.9B بالتدريب: خطّ أنابيب من ثلاث مراحل يشمل تدريبًا متوسطًا متعدد الوسائط على بيئات محاكاة للهواتف المحمولة والويب وأنظمة التشغيل، ثم تعلّمًا معزّزًا دون اتصال لكل نطاق، ثم تقطيرًا متعدد المعلّمين وفق السياسة إلى سياسة واحدة. والقدرة المنشورة هي النتيجة. النموذج بحجم 9B، وهو صغير بالنسبة لوكيل GUI وكبير بالنسبة لجهاز طرفي، وتكوين تقديم الخدمة المقصود في البطاقة هو نشر vLLM — وتشير الوثائق نفسها إلى أن ذلك التكوين لم يُتحقّق منه عبر الكناري المباشر كجزء من تحديث البطاقة، وتوصيك بتثبيت إصدار vLLM الخاص بك لـ Qwen3.5 والتحقق منه قبل النشر.

تهاجم LFM2.5-VL-3B-DSpark المشكلة عبر وقت التشغيل: فهي تترك أوزان النموذج الهدف دون مساس، وتشتري السرعة عبر صياغة الرموز والتحقق منها. على جهاز من فئة الهواتف، تكون المقايضة أحادية الجانب لصالح نموذج المسودة، لأن المخرجات يمكن إثبات أنها مخرجات النموذج الهدف، والذاكرة الإضافية تقل عن عُشر نموذج.

النتيجة المترتبة على أي شخص يختار: حلقة الوكيل تُجري استدعاءات عديدة للنموذج في المهمة الواحدة، وكل استدعاء يدفع تكلفة التعبئة المسبقة مقابل لقطة شاشة جديدة. وترميز الرؤية والتعبئة المسبقة هما بالضبط المرحلتان اللتان لا يسرّعهما فك التشفير التخميني — فإعلان Liquid نفسه يطرح هذه الحجة ضد قراءة غير محدودة لأرقامه الرئيسية. لذا تتقلص ميزة النموذج المسوّد بالضبط في عبء العمل الذي يعيش فيه UI-Venus 2.9B. وبالمقابل، فإن ميزة UI-Venus 2.9B — إنجاز المهمة فعليًا — ليست شيئًا يوفره النموذج المسوّد بأي سرعة.

تشغيل الاثنين

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

ليس أيٌّ منهما نقطة نهاية مستضافة على OrcaRouter. يتطلب كلٌّ من LFM2.5-VL-3B-DSpark وUI-Venus 2.9B منك سحب الأوزان وتشغيلها بنفسك، وتتشكّل متطلبات تشغيلهما بحسب أدوارهما المختلفة جدًا. يحتاج المُسوِّد إلى SGLang v0.5.19 أو أحدث مع علم خوارزمية DSPARK التخمينية وحجم كتلة 9، أو MLX-VLM v0.7.2 أو أحدث مع تمرير المُسوِّد كنموذج مسودة وفرض درجة الحرارة على صفر، أو llama.cpp مع ملف GGUF بصيغة F16 بحجم 567 MB مقترن بنموذج هدف مُكمَّم. يحتاج UI-Venus 2.9B إلى خادم vLLM كبير بما يكفي لنموذج بحجم 9B عند طول أقصى يبلغ 262,144 رمزًا، بالإضافة إلى المطالبات المرجعية ومحلّلات الإجراءات من مستودع شيفرة المشروع — فبطاقة النموذج تنص صراحةً على أن تشغيل الخادم وحده لا يمنحك وكيل GUI عاملًا بحلقة مغلقة.

يترك كلاهما أيضًا الفجوة نفسها عند أطراف ما يستطيعان فعله. لا يزال نموذج رؤية-لغة صغير مقترن بنموذج صياغة يواجه شاشات ومهامًا لا يستطيع التعامل معها، ولا يزال وكيل واجهة المستخدم الرسومية يفشل في بيئات خارج توزيع تدريبه. والاستعلامات التي تسقط عبر الفجوة تستقر في مكان ما، وفي معظم تصاميم الإنتاج يكون ذلك نموذجًا عام الأغراض أكبر. وتوجيهها عبر نقطة نهاية واحدة تغطي أكثر من 200 نموذج بسعر قائمة كل مزوّد، مع تحويل احتياطي تلقائي عند تدهور أحد المزوّدين، يُبقي مسار الاحتياط خارج قائمة التكاملات الحرجة بدلًا من تحويله إلى مشروع نشر ثانٍ له مفاتيحه وعقوده الخاصة.

كيف تقرر في دقيقة واحدة

إذا كنت بحاجة إلى برمجية تشغّل واجهة مستخدم — بالنقر والكتابة والتنقل في تطبيق لم تره من قبل — فأنت تشتري سياسة، وتلك هي UI-Venus 2.9B. خصّص ميزانية لنشر vLLM بحجم 9B، واقرأ مسألة الترخيص المعلّقة قبل أن تلتزم تجاريًا، وتعامل مع جدول المعايير الخاص بالبائع كفرضية انطلاق قوية لا كنتيجة محسومة، خصوصًا مقارنات OSWorld-Verified التي تشير البطاقة نفسها إلى أنها تعتمد على بنية الدعم.

إذا كنت تشغّل بالفعل LFM2.5-VL-3B وتريد تسريعه على عتاد تملكه، فأنت تشتري تحسيناً لزمن التشغيل، وهذا هو LFM2.5-VL-3B-DSpark. تحقق من ثلاثة أمور أولاً: أن أحمال العمل لديك كثيفة فك الترميز لا كثيفة التعبئة المسبقة، وأنك تقدّم الخدمة بدقة 16-بت لا بتصدير 4-بت، وأن بيئة التشغيل لديك تستوفي الحد الأدنى للإصدارات. إذا تحققت الثلاثة جميعاً، فإن تكلفة الذاكرة هي 8.9% والمخرجات غير متغيرة بحكم البنية.

الشيء الوحيد الذي لا يصمد عند الاحتكاك بأي من المستودعين هو اعتبارهما بديلين. إنهما مضاعِف للسرعة ووكيل، والسيناريو الوحيد الذي يتنافسان فيه هو السيناريو الذي تكون قد قررت فيه بالفعل ما الذي تبنيه وتبحث فيه عن سبب لبناء شيء أرخص بدلاً منه.

تصل OrcaRouter إلى أكثر من 200 نموذج عبر مفتاح واحد بسعر المزوّد ودون أي هامش ربح، مع سياسة توجيه وتحويل تلقائي عند الفشل للاستعلامات التي لا ينبغي أن يتولاها نموذج طرفي أو وكيل. واجهة برمجية واحدة للتحويل عند الفشللا يُستضاف أي من النموذجين في هذه الصفحة - فكلاهما يعمل من أوزانك الخاصة - لكن التحويل عند الفشل هو ما لا يتعين عليك بناؤه.