بطاقة عنوان رئيسية مُولّدة لـ 'MiniCPM-V 4.7 vs UI-Venus 2.9B' مع العنوان الفرعي 'نموذج رؤية عام ضد وكيل GUI مُصمم لغرض محدد'، بطاقة على اليسار مكتوب عليها 'UI-Venus 2.9B: grounding، CAPTCHA، الجوال، الويب، استخدام الكمبيوتر'، وبطاقة على اليمين مكتوب عليها 'MiniCPM-V 4.7: 35.2B sparse، بدون بطاقة، بدون معايير'، وكبسولة مكتوب عليها 'متخصص ضد عام غير مُقاس'، مع شعار OrcaRouter في الزاوية اليمنى السفلى.
Guides & Insights

MiniCPM-V 4.7 مقابل UI-Venus 2.9B: نموذج رؤية عام في مواجهة وكيل واجهة مستخدم رسومية مُصمَّم لغرض محدد

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

MiniCPM-V 4.7 وUI-Venus 2.9B كلاهما نموذجان لغويان بصريان ينظران إلى لقطة شاشة وينتجان نصًا، وهنا ينتهي الشبه — لأن أحدهما بُني لهذه المهمة تحديدًا. UI-Venus 2.9B وكيل واجهات رسومية عام الأغراض من inclusionAI، صدر في 26 أغسطس 2026، ويتمحور تصميمه بأكمله حول ملاحظة واجهة، والاستدلال بشأن حالة المهمة، وإصدار إجراء، ودمج التغذية الراجعة الناتجة؛ ويأتي مصحوبًا بتقرير تقني، وجداول معايير أداء عبر مهام تأصير واجهات المستخدم الرسومية، والجوال، والويب، واستخدام الحاسوب، وCAPTCHA، وتقييم صريح لمدى سهولة إقناعه بتنفيذ إجراء خطير. أما MiniCPM-V 4.7 فهو نقطة تفتيش بنحو 35.2 مليار معامل بتقنية مزيج الخبراء المتناثر، رفعتها OpenBMB في 6 أكتوبر 2026 بلا بطاقة، ولا ترخيص، ولا معايير أداء. إن مقارنة متخصص بنموذج عام غير مقيس ممارسة غير مألوفة إلى حد ما، وهذه الصفحة توضح صراحة أين تصح المقارنة وأين لا تصح.

نوعان مختلفان جدًا من الإصدارات

UI-Venus 2.9B هو inclusionAI/UI-Venus-2-9B، نموذج بـ9 مليارات معامل تم تهيئته من Qwen3.5-9B وتدريبه لاحقًا خصيصًا ليكون وكيل GUI. تصف البطاقة حلقة مغلقة — مراقبة الواجهة، والتفكير في حالة المهمة، وتنفيذ إجراء، ودمج التغذية الراجعة في القرار التالي — مدربة عبر ثلاث مراحل: التدريب المتوسط متعدد الوسائط على مسارات محاكاة واسعة النطاق للجوال والويب وسطح المكتب؛ والتعلم المعزز دون الاتصال مقسمًا عبر خمس عائلات مهام؛ وتقطير متعدد المعلمين على السياسة الذي يدمج المعلمين المتخصصين في المجال في سياسة واحدة. يتم تقييمه على معايير تأريض GUI، والجوال، والويب، واستخدام الكمبيوتر، وCAPTCHA، وبشكل منفصل على سلامة الإجراءات ذات العواقب: تفيد البطاقة بمعدل نجاح هجوم يبلغ 11.3% على OSHarm و48.8% على OSBlind مقابل 25.3% و79.4% لقاعدته Qwen3.5-9B. نظر نظير OpenBMB الخاص، بالمناسبة، إلى مجال مشابه: لدى منظمة MiniCPM مشروع AgentCPM-GUI من يناير 2026، لذا هذا مسار دخلته كلا المختبرين.

MiniCPM-V 4.7 هو openbmb/MiniCPM-V-4.7-35B-A3B، 35,212,875,824 معلمة BF16 موزعة على 70.4 غيغابايت وستة عشر جزءًا، تم رفعها في 6 أكتوبر 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

العمود الفقري النصي Sparse MoE المُوسّم qwen3_5_moe_text — 256 خبيرًا، 8 لكل رمز — عبر أكثر من 40 طبقة بنمط انتباه من ثلاث خطيات إلى انتباه كامل واحد، وبرج رؤية داخلي من 27 طبقة مع تقليل العينات بمقدار 16× وما يصل إلى تسع شرائح صور، ونافذة سياق بحجم 256K. لا يوجد README، وبالتالي لا ترخيص ولا معايير أداء. ثلاثة إعجابات، صفر تنزيلات، مناقشات فارغة.

المقارنة، مع ترك الفجوات مفتوحة

• الغرض — UI-Venus 2.9B: وكيل واجهة مستخدم رسومية، مُدرَّب من البداية إلى النهاية للتفاعل مع الواجهات. MiniCPM-V 4.7: نموذج رؤية ولغة عام؛ ولم يُذكر ما تم تحسينه من أجله.

• المعاملات — UI-Venus 2.9B: 9.41B، كثيف. MiniCPM-V 4.7: 35.2B إجمالًا، متناثر، 8 من 256 خبيرًا لكل رمز.

• النموذج الأساسي — UI-Venus 2.9B: تمت تهيئته من Qwen3.5-9B، وهو مكدّس نصي Qwen كثيف. MiniCPM-V 4.7: مكدّس نصي MoE مشتق من Qwen3.5، الفئة qwen3_5_moe_text. فرعان مختلفان من شجرة العائلة نفسها.

• الإرساء في الواجهة — UI-Venus 2.9B: الكفاءة الأساسية، مع عائلات مهام مخصصة للإرساء وCAPTCHA في التدريب ونظام تحقق قائم على النقاط المفتاحية يستخدم التصويت متعدد النماذج. MiniCPM-V 4.7: لا ادعاء خاص بالإرساء، ولا تنسيق موثّق لإخراج الإحداثيات.

• تقييم السلامة — UI-Venus 2.9B: يُبلّغ عن ASR بنسبة 11.3% على OSHarm و48.8% على OSBlind. MiniCPM-V 4.7: لا يوجد.

• الأدلة — UI-Venus 2.9B: تقرير تقني على arXiv، وصفحة مشروع، ومستودع GitHub، وجداول معايير. MiniCPM-V 4.7: ملف تكوين.

• الأدوات — UI-Venus 2.9B: البدء السريع لـ vLLM مع علامة محلّل الاستدلال، بالإضافة إلى تحويلات GGUF من المجتمع. MiniCPM-V 4.7: لا شيء بعد.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

لماذا لا يُعد وكيل واجهة المستخدم الرسومية مجرد "نموذج لغوي بصري ينظر إلى الشاشات"؟

الفجوة بين هذين النموذجين لا تتعلق بشكل رئيسي بعدد المعاملات، ويجدر بنا توضيح ذلك لأنها هي ما يجعل المواجهة مثيرة للاهتمام بدل أن تكون مجرد مواجهة غير متكافئة.

تتسم مهمة لقطة الشاشة بخاصية لا تملكها معظم معايير تقييم الرؤية: يجب أن يكون الناتج قابلاً للتنفيذ. فعندما يُطلب من UI-Venus 2.9B النقر على زر، يجب أن يُصدر إحداثيًا أو إجراءً مُنظمًا تستطيع البيئة تطبيقه فعلاً، وخطأ صغير في الإرساء ليس إجابة خاطئة على لوحة المتصدرين، بل مهمة فاشلة وحالة تالفة. لهذا السبب تُخصص بطاقة UI-Venus 2 كل هذا القدر من طولها للتحقق: يُحكم على إنجاز المهمة بناءً على نقاط أساسية بصرية وثيقة الصلة بالمهمة بدلاً من نظرة كلية إلى الشاشة النهائية، ويصوّت حكام غير متجانسين لتقليل تحيز الحكم الفردي. الغرض من هذه الآلية هو جعل إشارة مكافأة التعلم المعزز قوية في مواجهة قرصنة المكافأة — نموذج يتعلم إرضاء مدقق كسول بدلاً من إكمال المهمة.

كما يوضح قسم السلامة أيضًا.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

الوكيل القادر على تشغيل هاتف أو حاسوب مكتبي لديه سطح هجوم لا يملكه نموذج التسميات التوضيحية، والإبلاغ عن معدل نجاح الهجوم هو الحد الأدنى الذي ينبغي لمختبر فعله عند طرحه. يسجّل UI-Venus 2.9B نسبة 11.3% على OSHarm و48.8% على OSBlind — والرقم الثاني مرتفع بالأرقام المطلقة، ويقوم تأطير البطاقة على مقارنة بنموذجه الأساسي بدلًا من ادعاء مطلق بالمتانة. اقرأ ذلك على أنه «أفضل بشكل ملموس مما بدأ منه»، وليس على أنه «آمن».

لا تملك بنية MiniCPM-V 4.7 ما تقوله عن أي من هذا. إن الانتباه الخطي على سياق طويل سيساعد وكيلًا يحتاج إلى تذكر تاريخ تفاعل طويل، وسيساعد MoE المتناثر على الإنتاجية إذا كنت تشغّل العديد من الحلقات. لكن البنية التي قد تكون مفيدة لوكيل ليست وكيلًا، ولا يوثّق أي جزء من الإصدار المنشور مخرجات الإجراءات، أو دقة الإرساء، أو سلوك السلامة.

التقييم الصادق لجانب MiniCPM

من المغري أن تملأ هذا القسم بأرقام 4.6. قاوم ذلك. MiniCPM-V 4.6 هو نموذج كثيف بحجم 1.3B على بنية Qwen3.5-0.8B الأساسية مع مخطط ضغط بصري قابل للتبديل 4x/16x، ونتائجه المُعلن عنها — درجة 13 على مؤشر الذكاء Artificial Analysis Intelligence Index، وفق تقارير البائع، وبتكلفة رموز (tokens) تمثل جزءًا ضئيلًا من تكلفة النماذج الصغيرة المماثلة — تصف ذلك النموذج. MiniCPM-V 4.7 يغيّر البنية الأساسية، ويغيّر نمط الانتباه، ويغيّر الضغط البصري الافتراضي. لا تنطبق أي من قياسات 4.6، ولا يصف أي منها وكيل واجهة مستخدم رسومية من الأساس.

ما يمكن قوله بأمانة عن MiniCPM-V 4.7 محدود وواقعي: الأوزان موجودة، والبنية غير معتادة بالنسبة إلى العائلة، ونافذة السياق طويلة، والإصدار غير مكتمل. غياب الترخيص هو العائق العملي؛ وغياب المعايير المرجعية هو العائق التقييمي. وهناك سبب متواضع واحد للاهتمام بدلًا من اللامبالاة — إذ تبني OpenBMB أدوات واجهات رسومية، ومن بينها AgentCPM-GUI، لذا فإن نموذج رؤية طويل السياق قائم على MoE متناثر من ذلك المختبر ليس مستبعدًا كعمود فقري لوكيل مستقبلي. هذه فرضية حول النية، ولا يؤكدها المستودع.

ما الذي ستختاره، ومتى

لأي شيء يتضمن لقطة شاشة وإجراءً — النقر، أو الكتابة، أو التمرير، أو التنقل في تطبيق أو موقع ويب، أو استخراج البيانات من واجهة مستخدم — فإن UI-Venus 2.9B هو الوحيد من بين الاثنين الذي يتناول هذه المهمة. فهو يمتلك التدريب، وآلية التحقق، وأرقام الأمان المُعلَنة، وأدوات كافية لتشغيله على vLLM اليوم. لا شيء في MiniCPM-V 4.7 يشير إلى أنه ينافس في هذا المجال، وبدون بطاقة لا يمكنك حتى التحقق مما إذا كان يُصدر إحداثيات.

بالنسبة للعمل متعدد الوسائط العام — وصف الصور، وقراءة المستندات، والتحليل طويل السياق على المواد الغنية بالصور — فإن المقارنة ليست قابلة للحسم بعد، لأن أحد الطرفين لا يملك أدلة جودة منشورة. وإذا كنت بحاجة إلى ذلك اليوم، فإن UI-Venus 2.9B على الأقل قابل للقياس، رغم أنه ضُبط للواجهات لا للاستدلال على المستندات، وهو ليس خيارًا أول بديهيًا لتلك المهمة أيضًا.

النمط في كلتا الحالتين واحد: نموذج مستضاف ذاتيًا يتولى العمل الروتيني، ونموذج حدودي مستضاف للحالات الصعبة التي يُحيلها. وهذه الإحالة هي حيث يثبت الموجّه قيمته — مفتاح واحد عبر أكثر من 200 نموذج مستضاف، يُمرَّر كل منها بسعر القائمة لدى المزوّد دون أي هامش ربح لنا، مع التحويل التلقائي عند تدهور أحد المزوّدين. لا UI-Venus 2.9B ولا MiniCPM-V 4.7 مستضاف على OrcaRouter؛ كلاهما أوزان تشغّلها بنفسك. الموجّه هو ما يتحدث إليه وكيلك عندما يقرر أن النموذج المحلي غير كافٍ.

أين يتركك هذا

هذه ليست مسألة متقاربة، والسبب بنيوي وليس حكمًا على الجودة. UI-Venus 2.9B متخصص لديه تقرير، ورخصة، وجداول معايير قياس، وتقييم أمان، ووصفة تشغيل. MiniCPM-V 4.7 معمّم لديه ملف إعدادات. أحد هذين منتج والآخر وعد، والطريقة المسؤولة الوحيدة لمقارنتهما هي قول ذلك. راقب المستودع: إذا نشر OpenBMB بطاقة تُظهر تأصيل الواجهة ومخرجات الإجراءات، فحينها تصبح مقارنة MoE متناثر بسياق 256K مقابل وكيل مقطَّر بحجم 9B سؤالًا مثيرًا للاهتمام حقًا. وحتى ذلك الحين، فإن الإجابة عن "أيّهما ينبغي أن أستخدم" هي الإجابة التي لها وجود.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا