
Muse Realtime Avatar: تمنح Meta وكيلها Muse Agent وجهًا، بزمن 870 مللي ثانية للدور الواحد
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 180 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
الرقم الذي اختارت Meta أن تستهل به هو 870 مللي ثانية. هذه هي المدة التيMuse Realtime Avatar يستغرقها، وفق قياس Meta نفسها، من لحظة توقفك عن الكلام إلى لحظة وصول أول بايت من رد متزامن صوتي ومرئي. إنه رقم بالغ الطموح حقًا لنظام يتعين عليه توليد الفيديو، ويستحق أن يُقرأ بدقة — لأن كل ما يثير الاهتمام تقريبًا في نموذج التجسيد الجديد لدى Meta يقع في الفجوة بين ما يقيسه ذلك الرقم وما سيفترض الناس أنه يقيسه.
أُعلن عن Muse Realtime Avatar في 23 سبتمبر 2026 في Meta Connect، وكتبت عنه Meta Superintelligence Labs في اليوم نفسه في منشور بحثي بعنوان "إحياء Muse الخاص بك". وهو يوسّع Muse Realtime Voice، الطبقة الحوارية داخل وكيل Muse من Meta، عبر منحها جسدًا. إنه ليس روبوت دردشة بصورة رمزية جاهزة: أنت تُقدّم له صورة مرجعية — صورة فوتوغرافية، أو رسم توضيحي لكامل الجسم، أو حيوان، أو غرض منزلي — فيعرض ذلك الشيء وهو يتحدث ويشير ويغيّر وضعيته في فيديو متواصل طوال مدة المحادثة. قال زوكربيرغ على المسرح إن الصورة الرمزية المرتبطة بـ Muse الخاص به تُسمى Jolly.
تدفق رموز مشترك، وليس تمريرة مزامنة الشفاه.
البنية المعمارية هي الجزء الذي يستحق الفهم، لأنها تشرح لماذا يواصل Meta استخدام كلمة "embodiment" بدلًا من "avatar". يُنتج Muse Realtime Voice تدفقًا من رموز الكلام — وتسميها المنشور VQs — تحمل كلاً من محتوى ما يُقال وإيقاعه الصوتي: السرعة، والتشديد، والصعود والهبوط. يستهلك Muse Realtime Avatar ذلك التدفق نفسه. وهو Diffusion Transformer مدفوع بالصوت ومشروط بتلك الرموز الكلامية، وبالوسائط المرجعية التي قدمتها، وبنافذة متحركة من الكامنات المرئية الحديثة، ويولّد فيديو في أجزاء سببية قصيرة، مع تمرير كل كامن جديد إلى الأمام كسياق حركة للكامن التالي.
مشاركة تدفق رموز واحد هي ما يبقي الصوت وحركة الشفاه وتعبيرات الوجه مترابطة ومتزامنة. البديل — توليد الصوت ثم تشغيل نموذج منفصل لمزامنة الشفاه عليه — هو الطريقة التي تعمل بها معظم صناعة الأفاتار، وهو السبب في أن الكثير من تلك الأفاتار تبدو وكأنها تُدبلج. تصميم Meta يزيل هذا التماس بحكم بنيته. النافذة الكامنة المتدحرجة هي النصف الثاني من الفكرة: فبدونها، ينحرف مولّد قائم على الكتل، وبحلول الدقيقة الثالثة تكون شخصيتك قد أصبحت بهدوء شخصًا آخر.

أربعة أرقام منشورة، وما الذي يقيسه كل منها فعليًا
نشرت ميتا أرقامًا أكثر مما هو معتاد في منشور بحثي مرتبط بميزة موجّهة للمستهلكين. الأربعة الواردة أدناه جميعها مُبلَّغ عنها من الشركة، وقاستها ميتا مقابل خطوط أساس اختارتها ميتا؛ ولم يُعِد إنتاج أيٍّ منها أحد خارج الشركة.
• 870 مللي ثانية من نهاية الدور إلى البايت الأول. هذا مؤشر لبداية الاستجابة. وهو ليس الزمن المستغرق حتى رد كامل، وليس زمن التسليم المستمر لبقية المكالمة. يمكن لنظام أن يبلغ 870 مللي ثانية حتى البايت الأول ومع ذلك يبدو متباطئًا في الثانية الثانية عشرة. ومنشور ميتا صريح في أن هذا مقياس البايت الأول؛ والتغطية التي تُسقط هذا القيد تقرؤه على أنه استجابة من الطرف إلى الطرف، وهو ليس كذلك.
• فيديو رأسي بدقة 448×768 بمعدل 25 إطارًا في الثانية. هذا إطار طويل على شكل هاتف، وليس إطارًا أفقيًا، و25 إطارًا في الثانية معدل سينمائي وليس سلسًا — وهو معدل الإطارات القياسي للأفلام، أقل من 30 أو 60 إطارًا في الثانية التي قد يوفرها بث كاميرا أصلي. تقول Meta إن العروض التوضيحية موسومة بعلامة مائية عبر طبقة شفافة حتى يستطيع المستلم أن يدرك أنه لا ينظر إلى بث كاميرا عادي.
• تقييمات النموذج أقل بمقدار 60×.مُغطّى بشكل صحيح أدناه، لأن هذا هو الرقم الأكثر عرضةً لسوء القراءة.
• 12 جلسة متزامنة في الوقت الفعلي على NVIDIA GB200 واحدة. تذكر Meta أن أعمال الخدمة الخاصة بها — ذاكرات KV الدائمة، والتوجيه الواعي بالذاكرة المؤقتة، والتجميع الديناميكي الواعي بالكمون، والتدريب الواعي بالتكميم رباعي البتات، والنوى المدمجة والتقاط CUDA Graph، المطورة مع NVIDIA — رفعت السعة 8× مقارنة بخط الأساس الخاص بها المكون من خطوتين BF16. الحسابات الكامنة وراء ذلك واضحة: كل خطوة توليد تنتج ثمانية إطارات، أي 320 مللي ثانية من التشغيل، في 20 مللي ثانية من زمن النموذج، أو 2.5 مللي ثانية لكل إطار. كلا الرقمين 12 و8× مقابل خط الأساس المحدد من Meta، وليس مقابل أجهزة بائع آخر.
لماذا 60× ليس أسرع بـ60×
ادعاء الضغط هو الأكثر تكرارًا والأقل فهمًا. كان نموذج المعلم لدى ميتا نموذج انتشار بـ40 خطوة مع توجيه ثلاثي خالٍ من المصنف — ثلاث تمريرات لكل خطوة، أي 120 تقييمًا للنموذج لإنتاج مقطع فيديو واحد. النموذج الطالب هو نموذج سببي غير موجه من خطوتين مع ذاكرة تخزين مؤقت KV ثابتة الطول، مدرب بالتقطير والفرض الذاتي، ويحتاج إلى تقييمين لنفس المقطع. هذا خفض بمقدار 60 ضعفًا في عمليات التقييم لكل مقطع، وبجودة قريبة من جودة المعلم، حسب وصف ميتا.
إنه تقليل في الحوسبة لكل جزء. كون التقييمات أقل بستين مرة لا يعني أن المستخدم ينتظر مدة أقصر بستين مرة، لأن زمن الاستجابة كانت له عوامل مساهمة أخرى قبل التقطير وما زالت لديه بعده. يوضح الرسم البياني في منشور Meta نفسه ما الذي حققه هذا التقليل من حيث الجودة: ارتفاع تفضيل البشر من 45% إلى 55%. هذه هي الرواية الصادقة — كان الهدف من التقطير هو صنع نظام يستطيع العمل في الوقت الفعلي أصلًا، وقد حُصرت تكلفة الجودة عند نحو عشر نقاط من التفضيل بدلًا من إزالتها.
التقييم، بما في ذلك النتيجة التي سارت في الاتجاه المعاكس
اختبرت ميتا مقابل نظامين تجاريين للصور الرمزية، Runway Characters و HeyGen LiveAvatar، باستخدام هويات صور رمزية متطابقة بحيث كان المقيّمون يقارنون الرسوم المتحركة بدلاً من تصميم الشخصية. أجرى المقيّمون محادثات مباشرة استمرت من دقيقتين إلى ثلاث دقائق مع كل نظام ثم قارنوا الجودة البصرية والمزامنة واتساق الشخصية والسلوكيات.
تذكر Meta أنها مُفضَّلة بنسبة 78% مقابل 22% على Runway Characters و88% مقابل 12% على HeyGen LiveAvatar، ومُفضَّلة في كل بُعد تم تقييمه. ثم يفعل المنشور شيئًا لا تفعله معظم تقييمات البائعين: يكشف أن مقارنة السلوكيات مقابل Runway Characters لم تكن قابلة للتمييز إحصائيًا عن التعادل. التعادل داخل اكتساح شامل أمر صغير، لكنه التفصيل الذي يخبرك أن الاكتساح يُبلغ عنه بأمانة وليس بشكل مُنتقى.
حدود الاختبار تهمّ أكثر من التعادل. دقيقتان إلى ثلاث دقائق محادثة قصيرة. كان المقيّمون من ميتا. والمنشور نفسه يحذّر من أن عروضه التوضيحية «تُظهر قدرة النموذج ولا تعكس جميعها الصور الرمزية المتاحة في تطبيق Muse» — وهذا يعني أن فريق البحث يقول بصراحة إن الفيديو الذي شاهدته ليس بالضرورة هو المنتج الذي ستحصل عليه.
ما لا يمكنك فعله به
لا توجد واجهة برمجة تطبيقات (API) لـ Muse Realtime Avatar. لا يوجد سعر، ولا قائمة أسعار، ولا قائمة انتظار، ولا تاريخ نشر. لم تذكر Meta متى سيتمكن المستخدمون أو المطورون من استخدامه. تطبيق Muse للبالغين من عمر 18 عامًا فما فوق هو الواجهة الوحيدة التي يتجه إليها، وتصل الصورة الرمزية جنبًا إلى جنب مع مجموعة من ميزات Muse الأخرى — تخصيص الصوت، وعنوان بريد إلكتروني من Muse، والتحكم في كمبيوتر Mac، وتكامل النظارات — التي لها جداولها الزمنية الخاصة، وبعضها قيل إنها ستأتي خلال "الأشهر القادمة".
المقارنة المهمة هنا ليست مع Runway أو HeyGen، بل مع بقية منظومة Muse. إن Muse Spark، نموذج الاستدلال الذي يعمل عليه الوكيل، متاح للمطورين منذ أن أتاحته Meta عبر Meta Model API، ويُقدَّم Muse Spark 1.2 عبر OrcaRouter باسم meta/muse-spark-1.2 مقابل 1.25 دولار لكل مليون توكن إدخال و4.25 دولار لكل مليون توكن إخراج، بسعر قائمة المزوّد دون أي هامش ربح، داخل نافذة سياق تبلغ مليون توكن وتقبل بالفعل النصوص والصور والفيديو والصوت والملفات. هذا هو الجزء من Muse الذي يمكنك استدعاؤه اليوم. أما الواجهة فهي الجزء الذي لا يمكنك الوصول إليه.
هذا التفاوت يستحق التوقف عنده إذا كنت تخطط لأي شيء. الوكيل الذي يستدل عبر مكالمة فيديو والوكيل الذي يظهر في مكالمة فيديو هما منتجان مختلفان بقيود مختلفة، وواحد منهما فقط مُدرج في بطاقة أسعار.

ماذا تشاهد بعد ذلك
ثلاثة أمور ستحوّل هذا من إعلان إلى قرار. الأول هو موعد إصدار الصورة الرمزية داخل Muse، لأن كل ما نشرته Meta يتعلق بنموذج، ولا شيء مما نشرته يتعلق بمنتج يمكنك استخدامه يوم الخميس. الثاني هو قياس زمن الاستجابة خلال محادثة طويلة بدلًا من قياسه عند البايت الأول — فـ 870 ms مجرد إشارة انطلاق، والسؤال الذي تطرحه أي مكالمة حقيقية هو: ماذا يحدث عند الدقيقة العاشرة. الثالث هو ما إذا كان النظام يحافظ على شخصيته في ظروف خصومية: مستخدم يغيّر الموضوع عمدًا، أو ينتقل بسرعة، أو يغذّيه بصورة مرجعية مصممة لتبدو كشخص حقيقي.
حتى ذلك الحين، الملخص الصادق هو ذاك الذي يوحي به منشور البحث دون أن يقوله. Muse Realtime Avatar عمل هندسي حقيقي تقف خلفه نتيجة ضغط حقيقية، عُرض في بيئة مضبوطة، وقيّمته الشركة التي بنته، في محادثات لم تدم أطول من طلب قهوة. إنه ليس برمجيات وهمية. وهو أيضًا ليس شيئًا يمكنك شراؤه أو توجيهه أو قياس أدائه — وهذه ادعاءات مختلفة.

