
UI-Venus-2-9B مقابل Microsoft Mage-VL: وكيل لقطات الشاشة مقابل مراقب تدفق الترميز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
UI-Venus-2-9B وMicrosoft Mage-VL كلاهما صدرا بهدوء خلال شهر واحد من بعضهما البعض — ظهر مستودع Mage-VL في 26 يوليو 2026، وUI-Venus-2-9B في 26 أغسطس 2026 — وكلاهما بأوزان مفتوحة بترخيص Apache-2.0، وكلاهما مبني على بنى عائلة Qwen. هذا تقريبًا حيث تنتهي أوجه التشابه، والفرق ليس مسألة درجة بل مسألة أي جانب من الشاشة يعيش عليه كل نموذج. Microsoft Mage-VL هو نموذج إدراك Streaming أصلي لبرنامج الترميز: فهو يشاهد فيديو مضغوطًا، ويبقى صامتًا خلال اللقطات الروتينية، ويصدر نصًا عند اكتمال حدث ما. UI-Venus-2-9B هو وكيل واجهة رسومية: يستهلك لقطة شاشة ثابتة، ويحلل الحالة، ويصدر إجراءً منظمًا. أحدهما يراقب الشاشة ويصفها؛ والآخر يراقب الشاشة ويشغّلها. الاختيار بينهما ليس قرارًا قائمًا على معايير قياس الأداء، لأنهما لا يتشاركان أي معيار واحد — بل هو قرار بشأن ما إذا كانت أتمتتك تنتهي بإجابة أم بإجراء.
ما هو كل نموذج في الواقع
إن Microsoft Mage-VL، الذي تم إصداره تحت مستودع microsoft/Mage-VL دون أي إعلان، هو نموذج متعدد الوسائط يبلغ حجمه حوالي 4 مليارات معامل، مبني من مفكك لغوي Qwen3-4B-Instruct-2507، ومشفّر بصري مبني من الصفر يُدعى Mage-ViT، وبوابة تدفق منفصلة بحوالي 0.5 مليار معامل. يعتمد تصميمه على ترميز الفيديو (codec): فبدلاً من أخذ عينات موحّدة من الإطارات، يحتفظ بالإطارات المرجعية (I) كاملةً ويحتفظ فقط بالقطع البارزة حركيًا من الإطارات المتوقعة (P)، وهو ما تقول Microsoft إنه يقلل استهلاك الرموز البصرية بأكثر من 75% ويعطي تسريعًا يصل إلى 3.5 أضعاف في زمن الاستدلال الفعلي مقارنةً بأخذ العينات الموحّدة. كما أن تصميمه ثنائي العمليات — بوابة إدراك System 1 تراقب كل نافذة ترميز متدحرجة، بينما لا يتفعّل نظام الرؤية اللغوية System 2 (VLM) إلا عندما يستحق حدثٌ ما الاستجابة — يجعله مراقب فيديو دائم التشغيل ومنخفض التكلفة تحديدًا لأنه صامت في الغالب.
UI-Venus-2-9B، الذي أصدرته inclusionAI (مختبر فريق فينوس التابع لمجموعة أنت)، هو وكيل واجهات رسومية (GUI) عام الغرض بحجم 9B، مبني على Qwen3.5-9B. يلاحظ الواجهة، ويُعمل الفكر في حالة المهمة، وينفذ إجراءً، ويدمج التغذية الراجعة — حلقة مغلقة من الملاحظة–التفكير–التنفيذ–التغذية الراجعة — وتدّعي بطاقته تغطية تدريبية تشمل تطبيقات الهاتف المحمول ومنصات الويب وأنظمة تشغيل سطح المكتب في نقطة تحقق واحدة. على بطاقة النموذج الخاصة به، يذكر AndroidWorld 80.2 وOSWorld-Verified 70.8 وWebVoyager 90.8 وScreenSpot-Pro 73.0، وكلها أرقام مقدمة من البائع ولم يتم إعادة إنتاجها بشكل مستقل.
فجوة الإدخال: بكسلات تلتقطها مقابل بثّ تحتفظ به
الفرق الأكثر دلالةً هو ما يستهلكه كل نموذج. UI-Venus-2-9B هو وكيل لقطات شاشة: مدخلاته هي الشاشة الحالية، إطارًا واحدًا في كل مرة، ونافذة سياقه البالغة 256 ألف رمز هي وسيلته للاحتفاظ بسجل تلك الإطارات عبر مهمة طويلة. أما Mage-VL فهو وكيل تدفق: مدخلاته فيديو مضغوط، وتكمن كفاءته في معالجة الحركة بين الإطارات كبيانات — متجهات الحركة والطاقة المتبقية لبرامج الترميز التقليدية، وخرائط المعدلات المُتعلَّمة للترميز العصبي. هذا هو الفرق بين نموذج يرى اللحظات ونموذج يرى خطًا زمنيًا متصلًا. وكيل لقطات الشاشة أعمى بنيويًا عن الـ100 ميلي ثانية بين الالتقاطات — مؤشر التحميل، وانتقالية التحميل، وحالة التمرير التي لا تظهر على الشاشة إلا لحظيًا. أما مُشاهِد التدفق فيعيش داخل تلك الفجوة. ليس هذا عيبًا في أيٍّ من التصميمين؛ بل هو السبب في أن وكيل واجهة رسومية يحتاج إلى العمل على شاشة حية، ونموذج إدراك يحتاج إلى تلخيص تدفق، منتجان مختلفان بعقود إدخال مختلفة.

فجوة الناتج: الأفعال مقابل الأقوال
جانب الإخراج هو حيث يتوقف الاثنان عن كونهما قابلين للمقارنة. إخراج UI-Venus-2-9B هو إجراء منظم في فضاء إجراءات محدد — الفأرة، لوحة المفاتيح، التمرير، التنقل — يصدره بعد رموز تفكير بأسلوب Qwen3، وتدريبه مبني حول مهام الربط ومهام CAPTCHA التي تكافئ التحديد الدقيق للعناصر تحت الفوضى البصرية. إخراج Mage-VL هو نص: تعليق موجّه بالأحداث حول ما يراه. لا يمتلك فضاء إجراءات، ولا استدعاء دوال، ولا حلقة وكيل. اقرأ بطاقتي النموذجين جنبًا إلى جنب وسترى وجهين متقابلين لخط الإدراك–الفعل — ينتهي Mage-VL بوصف، وينتهي UI-Venus-2-9B بنقرة.
• وظيفة — UI-Venus-2-9B: وكيل واجهة المستخدم الرسومية، يشغّل الواجهة. Microsoft Mage-VL: إدراك متدفق، يصف الواجهة.
• الإدخال — UI-Venus-2-9B: لقطات شاشة ثابتة، سجل بطول 256 ألف توكن. Microsoft Mage-VL: تدفقات مضغوطة بترميز الفيديو، ندرة الرموز المهمة للحركة.
• المخرجات — UI-Venus-2-9B: إجراءات منظمة للماوس/لوحة المفاتيح/التنقل. Microsoft Mage-VL: تعليق نصي مُدار بالأحداث.
• الحجم — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B بوابة البث.
• العمود الفقري — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 بالإضافة إلى Mage-ViT المُطوَّر من الصفر.
• الترخيص — كلاهما Apache-2.0 (ملاحظات بطاقة Mage-VL لأغراض البحث فقط في مستودعها).
فجوة الخدمة
هنا، النموذج الأحدث والأكبر هو الأسهل تشغيلًا. يعرض UI-Venus-2-9B أمر vLLM واحدًا بنافذة سياق تبلغ 256K وواجهة برمجة تطبيقات قياسية متوافقة مع OpenAI. بينما يتطلب Mage-VL trust_remote_code لتنفيذ كود Python المخصص من Microsoft، بالإضافة إلى FFmpeg، ومسار ترميز عصبي للفيديو، وتبعيات مثل mamba-ssm، كما لا يحتوي بعد على مجموعة خدمة vLLM أو SGLang — لا انتباه مُقسّم إلى صفحات، ولا مسار خدمة إنتاجي. تشير Microsoft إلى أن إجمالي معاملات BF16 يبلغ حوالي 10.6 جيجابايت، مما يعني أن GPU بسعة 16 جيجابايت هو الحد الأدنى الواقعي للعمل على الصور، و24 جيجابايت أو أكثر للفيديو الطويل. لفريق يريد إطلاق شيء ما في الإنتاج اليوم، يوفّر UI-Venus-2-9B مسار دخول أنظف؛ أما لفريق يبني خط أنابيب مراقبة أو تلخيص يعمل على مدار الساعة، فإن مجموعة خدمة Mage-VL هي ما ستتبناه على أي حال، بكود Python المخصص وكل ما يتضمنه.
لوحة نتائج غير موجودة
لا يوجد معيار مشترك بين هذين النموذجين، واختراع واحد سيكون غير أمين. أرقام UI-Venus-2-9B تقع على لوحات توجيه الواجهات الرسومية، والهواتف المحمولة، والويب، واستخدام الكمبيوتر (ScreenSpot-Pro 73.0، AndroidWorld 80.2، WebVoyager 90.8، OSWorld-Verified 70.8، وكلها مُبلَّغ عنها من البائع). أرقام Mage-VL تقع على لوحات فهم الفيديو والمكان (Video-MME 64.0، NExT-QA 83.1، OVO-Bench 64.0، VSI-Bench +11.0 فوق Qwen3-VL-4B، وكلها مُبلَّغ عنها من البائع). الطريقة الصحيحة لقراءة المواجهة هي كمسار يتفرع: إذا كانت المهمة هي "فهم ما يحدث على هذه الشاشة عبر الزمن"، فإن Mage-VL هو الأداة المناسبة وUI-Venus-2-9B غير مبني لذلك؛ إذا كانت المهمة هي "جعل هذه الشاشة تقوم بشيء"، فالعكس صحيح.
حيث يتكوّن الاثنان
النسخة المثيرة للاهتمام من هذه المقارنة ليست مسألة إما/أو. وكيل واجهة المستخدم الذي يعمل على تطبيق حي لديه نقطة عمياء حقيقية — الوقت بين لقطات الشاشة، وأي تغيير في الحالة لا يستقر أبدًا في إطار ثابت — ومراقب الدفق الأصيل للترميز هو تحديدًا نوع النموذج الذي يمكن أن يعمل كطبقة إدراك في تلك الفجوة، ليكتشف أن الصفحة اكتمل تحميلها أو أن النافذة المشروطة اكتمل تحريكها قبل تمريرة الإرساء التالية للوكيل. لم تبنِ Microsoft نموذج Mage-VL لتلك المهمة، ولم تبنِ Ant Group نموذج UI-Venus-2-9B ليكون موجهًا بواسطة نموذج ثانٍ، لكن التوافق حقيقي. بالنسبة للأجزاء من هذه البنية التحتية التي هي بالفعل بجودة الإنتاج — نموذج LLM المخطط الذي يفكك مهمة، ونموذج الرؤية الذي يتحقق من حالة الشاشة، ونموذج النسخ الذي يسجل جلسة الوكيل — فإن واجهة برمجة تطبيقات واحدة مع تسعير بالتمرير المباشر وتجاوز تلقائي للفشل هي ما يجعل التجربة رخيصة، وهذا هو دور الموجّه. لا يتم تقديم UI-Venus-2-9B ولا Microsoft Mage-VL اليوم عبر OrcaRouter؛ كلاهما مشروعان مفتوحا الأوزان يُستضافان ذاتيًا، وكلاهما سيظهر بسعر قائمة المزود إذا وصلا إلى مزود موجَّه.


من الذي يجب أن يختار ماذا
اختر Microsoft Mage-VL عندما تكون مشكلتك هي الإدراك المستمر — بثّ كاميرا، أو تسجيل شاشة، أو بثًّا مباشرًا تحتاج إلى تلخيصه أو مراقبته في الوقت الفعلي، وبتكلفة منخفضة بما يكفي لإبقائه قيد التشغيل. واختر UI-Venus-2-9B عندما تكون مشكلتك هي التحكم — مهمة تنتهي بإجراء مكتمل، أو نموذج معبأ، أو مسار تنقّل، أو تطبيق يتم تشغيله. وإذا كانت أتمتتك تتطلب حقًا كليهما — إدراك البث ثم التصرف بناءً على الصورة الثابتة — فشغّلهما معًا كزوجين، وتعامل مع مراقب البث بصفته كاشف أحداث يغذّي وكيل لقطات الشاشة باللحظات الجديرة بالتصرف فيها. إنهما نصفان لنفس الشاشة، وليسا متنافسين على نفس المهمة.
