بطاقة عنوان مُولَّدة بأسلوب OrcaRouter تحمل “PixelUMM vs UI-Mate-27B”، مع أربع بلاطات إحصائية: “77.0” (متوسط OSWorld-Verified الذي أبلغت عنه UI-Mate-27B)، “66.2” (متوسطه في WindowsAgentArena)، “لا شيء” (فضاء حركات PixelUMM) و“Apache-2.0” (رخصة UI-Mate-27B على الكود والأوزان، مقابل نقطة تفتيش PixelUMM غير التجارية). سطر تذييل يقول “درجات الوكيل المُبلَّغ عنها من Tencent؛ أرقام PixelUMM من مسودتها. لا إعادة تشغيل مستقلة.”. شعار OrcaRouter مركَّب في الشريط المبطَّن في أسفل اليمين.
Guides & Insights

PixelUMM مقابل UI-Mate-27B: أحد النموذجين يرسم ما يراه، والآخر ينقر عليه

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يبدو Tencent UI-Mate-27B وNVIDIA PixelUMM متقاربين على ورقة المواصفات — 27 مليار معامل مقابل نحو 15.2 مليار، وكلاهما متاح للتنزيل المفتوح، وكلاهما مبني على أُسس Qwen — لكنهما ليسا متقاربين على الإطلاق. UI-Mate-27B هو وكيل واجهة رسومية أساسي: يراقب لقطات الشاشة الحية، ويخطط بناءً على ما هو معروض على الشاشة في اللحظة الراهنة، ويصدر إجراءات منظّمة بالفأرة ولوحة المفاتيح لسطح مكتب حقيقي. PixelUMM هو نموذج متعدد الوسائط موحّد بلا مُرمِّز، يقرأ الصور والفيديو في فضاء البكسل الخام ويولّد الصور والفيديو انطلاقًا من النص — فهو يُدرك ويُنشئ، لكن ليس لديه فضاء إجراءات، ولا مؤشر، ولا أي وسيلة للمس الشاشة. أحدهما يتصرّف في العالم. والآخر يصفه ويصوّره. وكل ما يلي ينتج عن هذا الانقسام، والفجوة في الترخيص بينهما هي الأمر الثاني الذي تحتاج إلى معرفته.

يُبلغ كلا المختبرين عن أرقامهما الخاصة، ولا يملك أيٌّ منهما تقييمًا مستقلاً. وقد صدر الاثنان بهدوء — لكن أسلوب الإصدار هو النقطة التي ينتهي عندها التشابه فعلاً.

الفاعل والمُدرِك

ينفّذ UI-Mate-27B مهمة انطلاقًا من تعليمة بلغة طبيعية ولقطات شاشة حية فقط. وهو يستدل على الحالة المرئية، ويعيد التخطيط مع تغيّر الواجهة، ويُخرج الاستدلال، ووصفًا موجزًا للإجراء، واستدعاءات أدوات منظّمة لاستخدام الحاسوب تشمل الفأرة ولوحة المفاتيح والتمرير والانتظار والتفاعل مع المستخدم وإكمال المهمة. السمة المميزة له هي التنفيذ الموجّه بالعرض التوضيحي: اعرض عليه سير عمل مرة واحدة، فيكيّف العرض التوضيحي المسجّل مع المهمة المطروحة، معتبرًا لقطة الشاشة الحالية مرجعًا موثوقًا عندما تكون الواجهة قد تغيّرت. وقد جرى ضبطه الدقيق انطلاقًا من Qwen3.6-27B عبر ضبط دقيق خاضع للإشراف يتبعه تعلّم معزّز عبر الإنترنت في بيئات واجهة رسومية قابلة للتنفيذ، ويُقدَّم عبر vLLM بواجهة متوافقة مع OpenAI.

• المعايير المعلنة — متوسط OSWorld-Verified 77.0، ومتوسط WindowsAgentArena 66.2، والنجاح الصارم في OSWorkerBench 41.00 والتقدّم 76.86. جميعها مُعلنة من Tencent ولم يُعَد إنتاجها.

• مساحة الإجراء — الفأرة، لوحة المفاتيح، التمرير، الانتظار، تفاعل المستخدم، إكمال المهام، ضمن فضاء إحداثيات مُوحّد مع استدعاءات مُهيكلة متوافقة مع pyautogui.

• واقع العتاد — نموذج كثيف بحجم 27B، يُخدَم بتوازٍ تنسوري عبر وحدتي معالجة رسومات في دليل البدء السريع الخاص بـ Tencent، بموجب Apache-2.0.

• تحذير مهم على البطاقة نفسها — UI-Mate-27B هو نقطة حفظ لوكيل وليس نموذج محادثة مرئية مستقل. توصي Tencent باستخدام الأمر التوجيهي الرسمي، ومحلل الاستجابة، وإطار التفاعل من مستودعها. إذا وجّهته إلى "صف هذه الصورة"، فأنت تستخدم الأداة الخاطئة.

يحتل PixelUMM القطب المقابل. هندسته بالكامل حجة حول التمثيل: لا VAE، لا مشفر رؤية، الصور كرقاعات بكسل 16×16 والفيديو كأنابيب زمكانية من 4 إطارات، مباشرة إلى محوّل بفك ترميز فقط عبر إسقاطات خطية أحادية الطبقة، مع تصميم خليط المحوّلات الذي يزاوج الانتباه المشترك مع معاملات خاصة بالمهمة. الفهم نص انحداري ذاتي؛ والتوليد مطابقة تدفق في فضاء البكسل. تُشحن أربع نقاط تفتيش، S8-F22-R05 كافتراضي يغطي نص إلى صورة، ونص إلى فيديو عند 96 إطارًا و24 إطارًا في الثانية، وكلا اتجاهي الفهم.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

نمطا الإصدار هذان مثال صارخ على التباين

ظهر UI-Mate-27B على Hugging Face في 14 أغسطس 2026 مع بطاقة نموذج، ونسخة arXiv أولية تحمل الرقم 2608.15930، وصفحة مشروع، ومستودع GitHub، ووصفة تشغيل موثّقة. وبين ذلك الحين وأوائل أكتوبر، راكم نحو 780 تنزيلًا و93 إعجابًا — وهو رقم متواضع، لكنه إصدار عادي من وكيل بحثي أوراقه مرتبة.

إن أثر PixelUMM مختلف نوعيًا. أُنشئ مستودع GitHub في 4 سبتمبر 2026؛ ونسخة arXiv الأولية مؤرخة في 29 سبتمبر؛ وأُنشئ مستودع Hugging Face في الساعة 21:40 بالتوقيت العالمي المنسق في 1 أكتوبر 2026، بعد دقائق من الالتزام النهائي للمستودع. لم يظهر له أي منشور على مدونة NVIDIA أو بيان صحفي أو سلسلة إطلاق. لا يزال مسار URL الخاص بصفحة المشروع نفسها يقرأ pixelumm-project-page-preview. كان عدد مرات تنزيله صفرًا عند كتابة هذا.

قراءة النوايا في ذلك خطأ — يمكن لمختبر أن ينشر نتاجًا بحثيًا ويحدد موعد إطلاق لاحقًا. ما يمكن معرفته أضيق وأكثر فائدة: أحد النموذجين لديه مسار تقديم رسمي وعشرة أسابيع من التنزيلات؛ والآخر لديه ورقة بحثية ومستودع، ولا يوجد أي بيان من المورّد على الإطلاق.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

لوحات النتائج التي لا تتداخل

لا يوجد أي معيار أداء يُبلّغ عنه كلا النموذجين، وهذا بحد ذاته هو المقصد: فهما لا يحلان المشكلة ذاتها.

• استخدام الحاسوب الوكيلي — UI-Mate-27B: OSWorld-Verified ‏77.0، WindowsAgentArena ‏66.2. PixelUMM: لا توجد مساحة إجراءات، لذا لا يمكن احتساب أي نتيجة.

• فهم الصور — UI-Mate-27B: يستهلك لقطات الشاشة كمدخل للوكيل، ولا يُقيَّم كنموذج VLM عام. PixelUMM: MMMU 41.67، AI2D 80.12، DocVQA 90.42، ChartQA 82.96، OCRBench 78.00.

• فيديو — UI-Mate-27B: لا شيء. PixelUMM: MVBench 70.53، Video-MME 57.33، LongVideoBench 59.61، LVBench 40.41.

• التوليد — UI-Mate-27B: لا شيء. PixelUMM: GenEval 0.83 باستخدام أداة إعادة كتابة المطالبات، DPG-Bench 85.74، جودة VBench Part 1: 84.10.

• تكلفة النشر — UI-Mate-27B: 27B كثيف عبر وحدتي معالجة رسومات تقريبًا عبر vLLM، بالإضافة إلى أداة التقييم الرسمية. PixelUMM: حوالي 30 جيجابايت من شظايا نقاط التفتيش الموزعة، CUDA 13 مع FlashAttention المبني من المصدر، نموذج حماية مقيّد لمسار الفيديو وبيئة Python ثانية له.

• الترخيص — UI-Mate-27B: Apache-2.0، الشيفرة والأوزان. PixelUMM: شيفرة Apache-2.0، NVIDIA One-Way Noncommercial License على نقطة التحقق.

• الحجم — 27B كثيف مقابل نحو 15.2B إجمالًا، ويُصاغ في جداول ورقة PixelUMM نفسها بصيغة "8B MoT".

التصريح الوحيد القابل للمقارنة حقاً هو المتعلق بمصدر البيانات، وهو ينطبق على كليهما: كل رقم مذكور أعلاه هو رقم خاص بأحد البائعين، ولم يُعَد تشغيل أي منها خارج المختبر الذي أنتجها، وأحد النموذجين يصف نتائجه صراحةً بأنها أولية.

البناء باستخدامهما، ولماذا قد ترغب في استخدام كليهما

هذان الاثنان يتكاملان أكثر مما يتنافسان. منظومة أتمتة سطح المكتب تريد UI-Mate-27B لطبقة التنفيذ، وتريد شيئًا قادرًا على الاستدلال على ما تراه؛ أما مسار المحتوى أو التفتيش فيريد قراءة PixelUMM وتوليده ولا حاجة له بمؤشر. يتقاطعان عند حدود الإدراك، حيث يكون ربط لقطة الشاشة لدى UI-Mate-27B خاصًا بالمهمة، بينما يكون لدى PixelUMM عامًا — البكسلات نفسها، ومهمتان مختلفتان تمامًا.

عندما تُشغِّل فعلاً عدة نماذج في مواجهة بعضها بعضًا — الوكيل مقابل نموذج VLM عام، أو نقطة بحثية جديدة مقابل النموذج الموجود بالفعل في الإنتاج — فإن تكلفة المقارنة عادةً ما تكون التكامل، لا الاستدلال: شكلان لواجهات API، ومخططان للمصادقة، وعقدان. هذه هي المشكلة التي توجد طبقة التوجيه لإزالتها، وهنا يُثبت تصميم OrcaRouter قيمته: مفتاح واحد عبر أكثر من 200 نموذج، وأسعار قوائم المزوّدين تمرَّر دون أي هامش ربح (0%)، وتجاوز فشل تلقائي عبر المزوّدين، ولغة DSL للتوجيه مع دمج النماذج لتكوين عدة نماذج في نداء واحد. لا يتوفر PixelUMM ولا UI-Mate-27B على أي نقطة نهاية مُستضافة اليوم، وOrcaRouter لا يوجّه أيًّا منهما — لذا فالأمر يتعلق بسير العمل عندما يتوفران، وليس ادعاءً بشأن التوفّر الآن.

أي واحدة لأي مهمة

إذا انتهت المهمة بنقرة، أو ضغطة مفتاح، أو نموذج تم تعبئته، فلا يوجد هنا سوى مرشح واحد وهو UI-Mate-27B. إنه تحت رخصة Apache-2.0، ولديه ورقة على arXiv وأداة تقييم رسمية، ونتائجه المعلنة في OSWorld وWindowsAgentArena هي من نوع الادعاءات التي يمكن لأي شخص يملك وحدتي معالجة رسوميات وصورة اختبار Windows أو Ubuntu أن يتحقق منها — وهذا بالضبط ما يجعله جديرًا بالتحقق منه لا بالثقة به.

إذا انتهت المهمة بجواب أو صورة، فإن PixelUMM هو القادر على ذلك، وهو في المقام الأول أثر بحثي. وورقته البحثية صريحة بشكل غير معتاد بشأن حدودها، إذ تسلّم بأن اختلاف بيانات التدريب يعني أن مقارنته المعيارية «لا يمكنها أن تحدد أي معمارية هي الأفضل». ونقطة تفتيشه غير تجارية. وتكمن نقاط قوته في الجِدّة المعمارية والاتساع، لا في أرقام متقدمة على أحدث ما توصل إليه المجال، وقيمته الفورية تكمن لدى أي شخص يدرس ما إذا كانت النماذج الموحّدة الخالية من المُرمِّز تعمل على نطاق الفيديو. نزّله لقراءة الشيفرة وتشغيل العروض التوضيحية؛ ولا تنزّله لشحن ميزة.

الخلاصة المكوّنة من سطرين هي نفسها التي يقدّمها الدليل: أحد النموذجين يستطيع أن يتصرف ولا يستطيع أن ينشئ، والآخر يستطيع أن ينشئ ولا يستطيع أن يتصرف، والفجوة في الترخيص والنضج بينهما تهم أكثر من أي عدد للمعاملات.