بطاقة رئيسية مُولّدة لعنوان «Muse Realtime Avatar: ميتا تمنح وكيل Muse وجهًا، عند 870 مللي ثانية لكل دور»، تعرض السطر العلوي «Meta Superintelligence Labs — 23 سبتمبر 2026»، والعنوان الرئيسي، وثلاث حقائق من المنشور البحثي لميتا: فيديو عمودي بدقة 448×768 بمعدل 25 إطارًا في الثانية، وحوالي 870 مللي ثانية من نهاية الدور إلى البايت الأول، و12 جلسة متزامنة في الوقت الفعلي على وحدة NVIDIA GB200 واحدة. ويقول عنوان فرعي: «إنها ليست رأسًا متكلمًا. إنها طبقة تصيير فوق نموذج صوتي.» وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Engineering & Research

Muse Realtime Avatar: تمنح Meta وكيلها Muse Agent وجهًا، بزمن 870 مللي ثانية للدور الواحد

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الرقم الذي اختارت Meta أن تستهل به هو 870 مللي ثانية. هذه هي المدة التيMuse Realtime Avatar يستغرقها، وفق قياس Meta نفسها، من لحظة توقفك عن الكلام إلى لحظة وصول أول بايت من رد متزامن صوتي ومرئي. إنه رقم بالغ الطموح حقًا لنظام يتعين عليه توليد الفيديو، ويستحق أن يُقرأ بدقة — لأن كل ما يثير الاهتمام تقريبًا في نموذج التجسيد الجديد لدى Meta يقع في الفجوة بين ما يقيسه ذلك الرقم وما سيفترض الناس أنه يقيسه.

أُعلن عن Muse Realtime Avatar في 23 سبتمبر 2026 في Meta Connect، وكتبت عنه Meta Superintelligence Labs في اليوم نفسه في منشور بحثي بعنوان "إحياء Muse الخاص بك". وهو يوسّع Muse Realtime Voice، الطبقة الحوارية داخل وكيل Muse من Meta، عبر منحها جسدًا. إنه ليس روبوت دردشة بصورة رمزية جاهزة: أنت تُقدّم له صورة مرجعية — صورة فوتوغرافية، أو رسم توضيحي لكامل الجسم، أو حيوان، أو غرض منزلي — فيعرض ذلك الشيء وهو يتحدث ويشير ويغيّر وضعيته في فيديو متواصل طوال مدة المحادثة. قال زوكربيرغ على المسرح إن الصورة الرمزية المرتبطة بـ Muse الخاص به تُسمى Jolly.

تدفق رموز مشترك، وليس تمريرة مزامنة الشفاه.

البنية المعمارية هي الجزء الذي يستحق الفهم، لأنها تشرح لماذا يواصل Meta استخدام كلمة "embodiment" بدلًا من "avatar". يُنتج Muse Realtime Voice تدفقًا من رموز الكلام — وتسميها المنشور VQs — تحمل كلاً من محتوى ما يُقال وإيقاعه الصوتي: السرعة، والتشديد، والصعود والهبوط. يستهلك Muse Realtime Avatar ذلك التدفق نفسه. وهو Diffusion Transformer مدفوع بالصوت ومشروط بتلك الرموز الكلامية، وبالوسائط المرجعية التي قدمتها، وبنافذة متحركة من الكامنات المرئية الحديثة، ويولّد فيديو في أجزاء سببية قصيرة، مع تمرير كل كامن جديد إلى الأمام كسياق حركة للكامن التالي.

مشاركة تدفق رموز واحد هي ما يبقي الصوت وحركة الشفاه وتعبيرات الوجه مترابطة ومتزامنة. البديل — توليد الصوت ثم تشغيل نموذج منفصل لمزامنة الشفاه عليه — هو الطريقة التي تعمل بها معظم صناعة الأفاتار، وهو السبب في أن الكثير من تلك الأفاتار تبدو وكأنها تُدبلج. تصميم Meta يزيل هذا التماس بحكم بنيته. النافذة الكامنة المتدحرجة هي النصف الثاني من الفكرة: فبدونها، ينحرف مولّد قائم على الكتل، وبحلول الدقيقة الثالثة تكون شخصيتك قد أصبحت بهدوء شخصًا آخر.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

أربعة أرقام منشورة، وما الذي يقيسه كل منها فعليًا

نشرت ميتا أرقامًا أكثر مما هو معتاد في منشور بحثي مرتبط بميزة موجّهة للمستهلكين. الأربعة الواردة أدناه جميعها مُبلَّغ عنها من الشركة، وقاستها ميتا مقابل خطوط أساس اختارتها ميتا؛ ولم يُعِد إنتاج أيٍّ منها أحد خارج الشركة.

870 مللي ثانية من نهاية الدور إلى البايت الأول. هذا مؤشر لبداية الاستجابة. وهو ليس الزمن المستغرق حتى رد كامل، وليس زمن التسليم المستمر لبقية المكالمة. يمكن لنظام أن يبلغ 870 مللي ثانية حتى البايت الأول ومع ذلك يبدو متباطئًا في الثانية الثانية عشرة. ومنشور ميتا صريح في أن هذا مقياس البايت الأول؛ والتغطية التي تُسقط هذا القيد تقرؤه على أنه استجابة من الطرف إلى الطرف، وهو ليس كذلك.

فيديو رأسي بدقة 448×768 بمعدل 25 إطارًا في الثانية. هذا إطار طويل على شكل هاتف، وليس إطارًا أفقيًا، و25 إطارًا في الثانية معدل سينمائي وليس سلسًا — وهو معدل الإطارات القياسي للأفلام، أقل من 30 أو 60 إطارًا في الثانية التي قد يوفرها بث كاميرا أصلي. تقول Meta إن العروض التوضيحية موسومة بعلامة مائية عبر طبقة شفافة حتى يستطيع المستلم أن يدرك أنه لا ينظر إلى بث كاميرا عادي.

تقييمات النموذج أقل بمقدار 60×.مُغطّى بشكل صحيح أدناه، لأن هذا هو الرقم الأكثر عرضةً لسوء القراءة.

12 جلسة متزامنة في الوقت الفعلي على NVIDIA GB200 واحدة. تذكر Meta أن أعمال الخدمة الخاصة بها — ذاكرات KV الدائمة، والتوجيه الواعي بالذاكرة المؤقتة، والتجميع الديناميكي الواعي بالكمون، والتدريب الواعي بالتكميم رباعي البتات، والنوى المدمجة والتقاط CUDA Graph، المطورة مع NVIDIA — رفعت السعة 8× مقارنة بخط الأساس الخاص بها المكون من خطوتين BF16. الحسابات الكامنة وراء ذلك واضحة: كل خطوة توليد تنتج ثمانية إطارات، أي 320 مللي ثانية من التشغيل، في 20 مللي ثانية من زمن النموذج، أو 2.5 مللي ثانية لكل إطار. كلا الرقمين 12 و8× مقابل خط الأساس المحدد من Meta، وليس مقابل أجهزة بائع آخر.

لماذا 60× ليس أسرع بـ60×

ادعاء الضغط هو الأكثر تكرارًا والأقل فهمًا. كان نموذج المعلم لدى ميتا نموذج انتشار بـ40 خطوة مع توجيه ثلاثي خالٍ من المصنف — ثلاث تمريرات لكل خطوة، أي 120 تقييمًا للنموذج لإنتاج مقطع فيديو واحد. النموذج الطالب هو نموذج سببي غير موجه من خطوتين مع ذاكرة تخزين مؤقت KV ثابتة الطول، مدرب بالتقطير والفرض الذاتي، ويحتاج إلى تقييمين لنفس المقطع. هذا خفض بمقدار 60 ضعفًا في عمليات التقييم لكل مقطع، وبجودة قريبة من جودة المعلم، حسب وصف ميتا.

إنه تقليل في الحوسبة لكل جزء. كون التقييمات أقل بستين مرة لا يعني أن المستخدم ينتظر مدة أقصر بستين مرة، لأن زمن الاستجابة كانت له عوامل مساهمة أخرى قبل التقطير وما زالت لديه بعده. يوضح الرسم البياني في منشور Meta نفسه ما الذي حققه هذا التقليل من حيث الجودة: ارتفاع تفضيل البشر من 45% إلى 55%. هذه هي الرواية الصادقة — كان الهدف من التقطير هو صنع نظام يستطيع العمل في الوقت الفعلي أصلًا، وقد حُصرت تكلفة الجودة عند نحو عشر نقاط من التفضيل بدلًا من إزالتها.

التقييم، بما في ذلك النتيجة التي سارت في الاتجاه المعاكس

اختبرت ميتا مقابل نظامين تجاريين للصور الرمزية، Runway Characters و HeyGen LiveAvatar، باستخدام هويات صور رمزية متطابقة بحيث كان المقيّمون يقارنون الرسوم المتحركة بدلاً من تصميم الشخصية. أجرى المقيّمون محادثات مباشرة استمرت من دقيقتين إلى ثلاث دقائق مع كل نظام ثم قارنوا الجودة البصرية والمزامنة واتساق الشخصية والسلوكيات.

تذكر Meta أنها مُفضَّلة بنسبة 78% مقابل 22% على Runway Characters و88% مقابل 12% على HeyGen LiveAvatar، ومُفضَّلة في كل بُعد تم تقييمه. ثم يفعل المنشور شيئًا لا تفعله معظم تقييمات البائعين: يكشف أن مقارنة السلوكيات مقابل Runway Characters لم تكن قابلة للتمييز إحصائيًا عن التعادل. التعادل داخل اكتساح شامل أمر صغير، لكنه التفصيل الذي يخبرك أن الاكتساح يُبلغ عنه بأمانة وليس بشكل مُنتقى.

حدود الاختبار تهمّ أكثر من التعادل. دقيقتان إلى ثلاث دقائق محادثة قصيرة. كان المقيّمون من ميتا. والمنشور نفسه يحذّر من أن عروضه التوضيحية «تُظهر قدرة النموذج ولا تعكس جميعها الصور الرمزية المتاحة في تطبيق Muse» — وهذا يعني أن فريق البحث يقول بصراحة إن الفيديو الذي شاهدته ليس بالضرورة هو المنتج الذي ستحصل عليه.

ما لا يمكنك فعله به

لا توجد واجهة برمجة تطبيقات (API) لـ Muse Realtime Avatar. لا يوجد سعر، ولا قائمة أسعار، ولا قائمة انتظار، ولا تاريخ نشر. لم تذكر Meta متى سيتمكن المستخدمون أو المطورون من استخدامه. تطبيق Muse للبالغين من عمر 18 عامًا فما فوق هو الواجهة الوحيدة التي يتجه إليها، وتصل الصورة الرمزية جنبًا إلى جنب مع مجموعة من ميزات Muse الأخرى — تخصيص الصوت، وعنوان بريد إلكتروني من Muse، والتحكم في كمبيوتر Mac، وتكامل النظارات — التي لها جداولها الزمنية الخاصة، وبعضها قيل إنها ستأتي خلال "الأشهر القادمة".

المقارنة المهمة هنا ليست مع Runway أو HeyGen، بل مع بقية منظومة Muse. إن Muse Spark، نموذج الاستدلال الذي يعمل عليه الوكيل، متاح للمطورين منذ أن أتاحته Meta عبر Meta Model API، ويُقدَّم Muse Spark 1.2 عبر OrcaRouter باسم meta/muse-spark-1.2 مقابل 1.25 دولار لكل مليون توكن إدخال و4.25 دولار لكل مليون توكن إخراج، بسعر قائمة المزوّد دون أي هامش ربح، داخل نافذة سياق تبلغ مليون توكن وتقبل بالفعل النصوص والصور والفيديو والصوت والملفات. هذا هو الجزء من Muse الذي يمكنك استدعاؤه اليوم. أما الواجهة فهي الجزء الذي لا يمكنك الوصول إليه.

هذا التفاوت يستحق التوقف عنده إذا كنت تخطط لأي شيء. الوكيل الذي يستدل عبر مكالمة فيديو والوكيل الذي يظهر في مكالمة فيديو هما منتجان مختلفان بقيود مختلفة، وواحد منهما فقط مُدرج في بطاقة أسعار.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

ماذا تشاهد بعد ذلك

ثلاثة أمور ستحوّل هذا من إعلان إلى قرار. الأول هو موعد إصدار الصورة الرمزية داخل Muse، لأن كل ما نشرته Meta يتعلق بنموذج، ولا شيء مما نشرته يتعلق بمنتج يمكنك استخدامه يوم الخميس. الثاني هو قياس زمن الاستجابة خلال محادثة طويلة بدلًا من قياسه عند البايت الأول — فـ 870 ms مجرد إشارة انطلاق، والسؤال الذي تطرحه أي مكالمة حقيقية هو: ماذا يحدث عند الدقيقة العاشرة. الثالث هو ما إذا كان النظام يحافظ على شخصيته في ظروف خصومية: مستخدم يغيّر الموضوع عمدًا، أو ينتقل بسرعة، أو يغذّيه بصورة مرجعية مصممة لتبدو كشخص حقيقي.

حتى ذلك الحين، الملخص الصادق هو ذاك الذي يوحي به منشور البحث دون أن يقوله. Muse Realtime Avatar عمل هندسي حقيقي تقف خلفه نتيجة ضغط حقيقية، عُرض في بيئة مضبوطة، وقيّمته الشركة التي بنته، في محادثات لم تدم أطول من طلب قهوة. إنه ليس برمجيات وهمية. وهو أيضًا ليس شيئًا يمكنك شراؤه أو توجيهه أو قياس أدائه — وهذه ادعاءات مختلفة.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.