بطاقة رئيسية مُولَّدة لمقال «Muse Realtime Avatar مقابل Realtime-Venus»، تعرض بطاقتين مستديرتين على جانبي العنوان الرئيسي. تقرأ البطاقة اليسرى «Muse Realtime Avatar» فوق أيقونة إطار فيديو صادر، مع السطرين «يولّد الفيديو» و«448x768 بمعدل 25 إطارًا في الثانية، مغلق»؛ وتقرأ البطاقة اليمنى «Realtime-Venus» فوق أيقونة كاميرا واردة، مع السطرين «يقرأ الفيديو» و«2 x 9B، Apache-2.0، قابل للتنزيل». ويقول عنوان فرعي: «أحدهما يُصيّر وجهًا. والآخر يراقب وجهًا.» وشعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

Muse Realtime Avatar مقابل Realtime-Venus: خرج الفيديو مقابل دخل الفيديو

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نظامان أُعلن عنهما بفارق تسعة أيام، كلاهما يصفان نفسيهما بأنهما فوريان وكلاهما يدّعيان التصنيف السمعي-البصري، ويشيران في اتجاهين متعاكسين على نفس المحور. Muse Realtime Avatar، الذي أعلنت عنه Meta في 23 سبتمبر 2026، يلتقط صورة و يولّد فيديو لها وهي تتحدث — مخرجاته فيديو، إطارات عمودية 448×768 بمعدل 25 في الثانية، ينتجها Diffusion Transformer مدفوع بالصوت يتشارك تدفق الرموز مع Muse Realtime Voice. Realtime-Venus، الذي رُفع إلى arXiv في 12 سبتمبر 2026 من قبل Venus Team في Ant Group مع Tsinghua University، يستهلك فيديو: تقوم نسخة Realtime-Venus-Omni ببث إطارات الكاميرا عبر مُشفّر SigLIP2 وتتحدث عما تراه، بينما نسخة Realtime-Venus-Audio هي نفس الهيكل الأساسي مع إيقاف الرؤية عند التحميل. أحدهما يُنتج وجهًا. والآخر يراقب وجهًا. لا يمكن استدعاء أي منهما، وواحد فقط منهما قابل للتنزيل — وهو ما يتبين أنه الفرق الأكثر أهمية.

يستحق انقلاب الإتاحة أن يُقال بوضوح قبل أي شيء آخر، لأنه يخالف كل التوقعات حول منتج من Meta وإصدار من مختبر بحثي. نظام Meta مغلق: أُعلن عنه في Connect، وعُرض في منشور بحثي، ومُدمج في وكيل Muse، بلا API، ولا أوزان، ولا سعر، ولا تاريخ. نظام Ant Group مفتوح: نقطتا تفتيش 9B بصيغة BF16 safetensors تحت Apache-2.0 على inclusionAI/Realtime-Venus على Hugging Face، مع شيفرة Transformers مخصصة، وملف متطلبات، وصوت مرجعي، وصفحة مشروع، ومستودع GitHub مصاحب. الشركة التي تملك المنتج الاستهلاكي لم تُطلق شيئًا يمكنك الإمساك به. أما فريق البحث فقد أطلق الشيء بأكمله.

ما الذي يفعله كل واحد بإطار

اتجاه الفيديو هو الفرق المعماري بأكمله، وهو ليس مسألة تشديد.

فيديو — يولّده Muse Realtime Avatar، اعتمادًا على رموز الكلام وصورة مرجعية ونافذة متجدّدة من الكمونات الفيديوية الحديثة؛ ويدركه Realtime-Venus-Omni، مع مُرمِّز بصري SigLIP2 يبثّ الإطارات إلى النموذج إلى جانب الصوت.

الصوت — يقود Muse Realtime Avatar عملية التوليد انطلاقًا من رموز الكلام لدى Muse Realtime Voice، وهي رموز تحمل المحتوى والتنغيم معًا؛ أما Realtime-Venus فيولّد الكلام في صورة رموز S3 منفصلة يفكّ ترميزها مفكّك ترميز بأسلوb المطابقة الانسيابية المتدفقة، بدلًا من إلحاق نموذج تحويل نص إلى كلام منفصل في النهاية.

العمود الفقري — معمارية Meta هي محوّل انتشار مدفوع بالصوت بحجم غير معلن؛ بُني Realtime-Venus على عمود فقري لغوي Qwen3-8B مع مشفّر صوتي Whisper-Medium، وتذكر بطاقة نموذجه أن نقطة تفتيش Omni مقتبسة من MiniCPM-o 4.5.

الأوزان — لم تُنشَر أوزان Muse Realtime Avatar ولا يوجد ما يشير إلى أنها ستُنشَر؛ وتُوفّر Realtime-Venus نقطتَي تحقق بحجم 9B، بصيغة BF16، وسياقًا من 40,960 رمزًا في كلتيهما، بموجب Apache-2.0.

الوصول — لا يوفّر Muse Realtime Avatar أي واجهة برمجية (API) ولا تاريخًا؛ ولا يوفّر Realtime-Venus أي واجهة برمجية أيضًا، وتنصّ بطاقته صراحةً على أنه غير مُنشَر من قِبل أي مزوّد استدلال.

أين يعمل — يعمل Muse Realtime Avatar داخل تطبيق Muse للمستخدمين الذين لم تُدرجهم Meta، بموجب شروط +18؛ ويعمل Realtime-Venus على وحدات GPU الخاصة بك، اليوم، إذا كانت لديك العتاد والرغبة.

اقرأ السطرين الأخيرين معًا وسيظهر الفرق العملي. لا يمكن استدعاء أي من النظامين. يمكن تشغيل أحدهما.

تحميل 9B حقيقي، وكذلك ما يكلّفك إياه.

ليس Realtime-Venus مجرد مستودع أولي فارغ. فالأوزان موجودة، وكود التحميل المخصص موجود، والرخصة في المستوى الأعلى هي Apache-2.0. هناك أمران عنه يجدر معرفتهما قبل أن تخطط على أساسه.

الأول هو ما ليس في الأوزان. بيئة التشغيل ثنائية الحلقة التي تجعل البنية مميّزة — حلقة التفاعل ذات الثانية الواحدة بالإضافة إلى مُجدوِل خلفي تسمّيه الورقة Realtime-Venus-Harness، وهو ينفّذ المهام المفوَّضة مقابل لقطة معزولة من حالة المحادثة بحيث لا يمكن إفساد مهمة طويلة التشغيل بسبب استمرار المحادثة — توجد في مستودع GitHub كمكوّن منفصل. تصميم التفويض، الذي هو الفكرة الجديدة حقًّا في التقرير، هو الجزء الذي تجمّعه وتثق به بنفسك.

الثاني هو النسب. تشير البطاقة إلى أن نقطة تفتيش Omni مقتبسة من MiniCPM-o 4.5، النموذج متعدد الوسائط الشامل بحجم 9B الذي أطلقت OpenBMB مصدره المفتوح في وقت سابق من عام 2026. وهذا ليس حاشية. فهو يعني أن مساهمة Ant Group تتمثل في التدريب اللاحق، وبيئة التشغيل، وتصميم التفويض المضاف فوق عمود فقري للبث يخص جهة أخرى، وهو ادعاء أضيق وأكثر تحديدًا من «نموذج omni جديد بحجم 9B» — وأكثر فائدة، لأنه يخبرك أين تنظر إذا اختلّ شيء ما في المُشفّر البصري.

الأرقام، وبالتحديد لمن تعود

هنا يتقاطع النظامان بطريقة غير مفيدة: لا يملك أيٌّ منهما تقييمًا مستقلًا واحدًا. أرقام Meta الأربعة مُبلَّغ عنها من الشركة مقابل خطوط أساس اختارتها Meta. أما أرقام Realtime-Venus فهي مُبلَّغ عنها من المؤلفين في تقرير تقني، دون أن ينشر أي طرف ثالث عملية تشغيل له، ودون أي مدخل في لوحة صدارة يمكن التحقق منه. لا يوجد قياس علني لأيٍّ من النظامين من قِبل أي شخص لم يبنِه.

أرقام Meta الأربعة، كما نُشرت: 870 مللي ثانية من نهاية دورك إلى أول بايت من رد صوتي ومرئي متزامن؛ فيديو عمودي بدقة 448×768 بمعدل 25 إطارًا في الثانية؛ عمليات تقييم للنموذج أقل بمقدار 60× من خط أساس Meta الخاص؛ و12 جلسة متزامنة في الزمن الحقيقي على وحدة NVIDIA GB200 واحدة، وهو مكسب في السعة مقداره 8× مقارنةً بخط أساس Meta ثنائي الخطوات BF16. كما تُفصح Meta عن نتائج تفضيل مقابل نظامَي أفاتار تجاريين، تُفيد بأن أحدهما غير قابل للتمييز إحصائيًا عن التعادل في السلوكيات المميزة — إفصاح يستحق الإشادة، لأنه من نوع النتائج التي تغفلها معظم منشورات الإطلاق.

نتائج Ant Group، كما نُشرت: أفضل نتيجة في ستة من المعايير الثمانية للفيديو التي يستخدمها التقرير، بما في ذلك StreamingBench 70.2، وOVO-Bench 64.7، وDaily-Omni 81.3 لنقطة تفتيش Omni؛ ولنقطة تفتيش Audio، MMAU 78.0، وMMAU-Pro 63.2، وLlama Questions 83.8، وSpeech CMMLU 67.8، ودرجة VoiceBench AlpacaEval البالغة 4.81 التي يصفها التقرير بأنها تطابق أفضل رقم مقارن.

هناك عدم تناظر في الأدلة يستحق الذكر. أرقام Ant Group هي درجات معيارية بمجموعات اختبار مسماة — قابلة للتكرار من حيث المبدأ، من قبل أي شخص مستعد لتنزيل الأوزان وتشغيل المجموعة. أما الرقم البارز لدى Meta فهو قياس زمن الاستجابة على حزمة الخدمة الخاصة بـ Meta نفسها، وهو ما لا يستطيع أحد خارج Meta إعادة إنتاجه لأن لا أحد خارج Meta يملك النظام. وبعبارة أخرى، فإن الإصدار المفتوح هو أيضًا الأكثر قابلية للتحقق.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

لماذا يُعدّ هذان الأمران مشكلة توجيه متنكّرة

لا يُعد أيٌّ من النظامين وكيلاً كاملاً، وينطبق ذلك بالطريقة نفسها على كليهما. Muse Realtime Avatar طبقة عرض مُثبَّتة على Muse Realtime Voice، وهي الطبقة الحوارية لوكيل يعمل استدلاله على Muse Spark. يفوّض Realtime-Venus أي شيء يتجاوز ما يمكنه فعله داخليًا — مثل الاسترجاع، واستدعاءات الأدوات، والاستدلال المعقّد — إلى منظومة تنفيذ تقوم بالعمل في الخلفية استنادًا إلى لقطة من المحادثة. وفي كلا التصميمين، ما يخاطبه المستخدم هو واجهة أمامية، بينما يحدث التفكير في نموذج نصي منفصل.

هذا النموذج النصي المنفصل هو الجزء الذي يمكنك توجيهه. على OrcaRouter، هو نقطة نهاية واحدة لـ 196 نموذجًا عبر 15 مزوّدًا، بسعر قائمة المزوّد مُمرَّرًا دون أي هامش ربح، مع تجاوز تلقائي عند الفشل عندما يخطئ نموذج أو تنتهي مهلة استجابته — وهذا يهم أكثر من المعتاد عندما يكون الشيء على الجانب الآخر نقطة تفتيش مستضافة ذاتيًا لم يقيّمها أحد بشكل مستقل. نحن لا نستضيف Realtime-Venus: فهو ملف للتنزيل، ولا نقدّمه. ولا نستضيف Muse Realtime Avatar أيضًا، لأن لا أحد يفعل ذلك. ما نقدّمه هو الطبقة التي تُسلّم إليها كلتا البنيتين عملهما الشاق، لذا فإن مكوّنًا غير مُثبت على أي من جانبي المحادثة يصبح سطرًا واحدًا من الإعدادات بدلًا من مقامرة إنتاجية.

أيٌّ من هذه هو فعلاً الأكثر تقدّماً؟

الحدس يقتضي أن نقول إنه نظام Meta، لأن Meta تملك المنتج والفيديو التوضيحي. لكن الأدلة تقول شيئاً أكثر إثارة للاهتمام. نظام Meta لديه هندسة إنتاج أفضل — 12 جلسة متزامنة على GB200 هي نتيجة خدمة، واختبارات التفضيل المُفصح عنها ضد منتجات الأفاتار المطروحة هي الأرقام الوحيدة للمقارنة المباشرة التي يملكها أي من النظامين. نظام Ant Group لديه قابلية تحقق أفضل: معايير قياس مسماة، أوزان منشورة، ترخيص Apache-2.0، وتقرير يمكن لأي شخص محاولة إعادة إنتاجه.

ما لا يملكه أيٌّ منهما هو وسيلة لدفع ثمنه. والأقرب إلى أن يصبح قابلاً للاستخدام ليس ذلك الذي يضم تطبيق المستهلك — بل ذاك الذي يمكنك تنزيله الليلة وتكتشفه بنفسك، على عتادك الخاص، وببياناتك الخاصة، ودون الحاجة إلى أي إعلان.

إذا كنت تختار، فالسؤال ليس أيّ نموذج أفضل، بل ما إذا كنت تريد وجهًا لا يمكنك الاتصال به أو كاميرا يمكنك تشغيلها.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.