بطاقة رئيسية مولّدة لـ Muse Realtime Avatar، مع سطر علوي Meta AI Research - 23 سبتمبر 2026، والعنوان، وثلاث بطاقات موسومة نصّها: Muse Realtime Voice - طبقة المحادثة، بثّ رموز الكلام؛ Muse Realtime Avatar - طبقة التجسيد المبنية فوقها، للأبحاث فقط؛ Muse Spark 1.2 - نموذج Muse القابل للتوجيه على OrcaRouter اليوم. شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Engineering & Research

Muse Realtime Avatar: ما الذي بنته Meta، وما الذي يعمل عليه، ولماذا لا يزال يتعذر عليك الاتصال به

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Muse Realtime Avatar هي تقنية التجسيد من Meta. فهي تأخذ تدفق الكلام الذي Muse Realtime Voice ينتجه وترسم الأداء المطابق له: وجّهها إلى صورة شخصية فوتوغرافية فيستجيب الوجه بتغيّرات صغيرة في تعبيراته، ووجّهها إلى رسم توضيحي لكامل الجسم فيؤدي الشكل إيماءات ويغيّر وضعيته أثناء تحدّثه. أطلقتها أبحاث الذكاء الاصطناعي في Meta في 23 سبتمبر 2026 في منشور بعنوان "بثّ الحياة في Muse". وهي نتيجة بحثية وليست منتجًا — فصفحة Meta الخاصة بها لا تقدّم أي واجهة برمجة تطبيقات، ولا سعرًا، ولا قائمة انتظار، ولا تاريخ نشر لها — لذا فإن الإجابة الصادقة عن سؤال "هل يمكنني استخدامها اليوم" هي لا. نموذج Muse الذي يمكنك استدعاؤه اليوم هو نموذج مختلف، Meta Muse Spark 1.2.

تستحق تلك الإجابة أن تُذكر في الفقرة الأولى بدلًا من الأخيرة، لأن القارئ الذي يبحث عن هذا الاسم يكون عادةً في صدد تقرير ما إذا كان سيبني خططه حولها. خطط بناءً على البحث، لا بناءً على نقطة نهاية.

هناك أمر واحد يجب قوله بوضوح قبل أي شيء آخر، لأن هذه الصفحة تخرق قاعدة ينبغي أن تعترف بها. عادةً ما تكتب هذه المدونة عن النماذج في الأسبوع الذي تُطلق فيه. أُعلن عن Muse Realtime Avatar قبل أسبوع من نشر هذه الصفحة، لذا وفق قراءة صارمة لنافذة الحداثة، كان سيتم تخطي هذا العنصر. هذا ليس مقالاً إخبارياً عن حدث مؤرخ. إنها الصفحة المرجعية لنموذج حاضر في محادثة الكتالوج اليوم: الصفحة التي يصل إليها القارئ بعد كتابة اسم النموذج نفسه، والتي يستمد مبررها من طلب بحث دائم قمنا بقياسه بأنفسنا بدلاً من حداثة إطلاق. يُذكر إعلان سبتمبر هنا كواقعة تؤرخ النموذج، لا كحدث يستحق التقرير، ولا شيء مما يلي يُعد إعلاناً ثانياً. تغطيتنا لذلك اليوم مادة منفصلة، وهي تبقى منفصلة.

أين يقع ضمن عائلة Muse

Meta صريحة في أن هاتين طبقتين لنظام واحد، وليستا منتجين اثنين. وبصياغة Meta، "Muse Realtime Voice وMuse Realtime Avatar يشكلان نظام تدفق واحد يربط الذكاء والصوت والتجسيد." توفر طبقة الصوت الذكاء الحواري وتبث تدفقًا من رموز الكلام — تسميها Meta VQs — تحمل ما يُقال وكيفية أدائه. ويحوّل مفكك ترميز صوتي تلك الرموز إلى صوت، وتستهلك طبقة الأفاتار التدفق نفسه لتوليد الصورة. مشاركة تدفق رموز واحد هي ما يُبقي الصوت وحركة الشفاه وتعبيرات الوجه متناسقة؛ فلا توجد مرحلة منفصلة لمزامنة الشفاه تُضاف لاحقًا.

إذن: Muse Realtime Voice هي طبقة المحادثة. Muse Realtime Avatar هي طبقة التجسيد المبنية فوقها. لا هذا ولا ذاك هو الشيء الذي يمكنك الاتصال به.

كن حذرًا بالقدر نفسه بشأن اسم مجاور، لأنه الأرجح أن يُخلط بأي منهما. إن Muse Voice Transcribe نقطة نهاية للتفريغ النصي، وهو منتج مختلف حقًا. وثائق مطوّري Meta لا لبس فيها: "إنه تحويل الكلام إلى نص فقط؛ فهو لا يركّب الكلام ولا يوفّر واجهة برمجة تطبيقات محادثة من كلام إلى كلام." وهي تُرجع طوابع زمنية على مستوى الأدوار وليس على مستوى الكلمات، وتُدرجه Meta بسعر 0.18 دولار في الساعة على تلك الصفحة. إنها نقطة نهاية حقيقية ومسعّرة. وهي ليست صوتًا، وهي بالتأكيد ليست أفاتارًا.

نموذج Muse القابل للاستدعاء فعليًا هو Meta Muse Spark 1.2، نموذج الاستدلال الذي توفره Meta بسياق يبلغ مليون توكن ومدخلات نصية وصورية وفيديو وملفات وصوتية. هذا النموذج قابل للتوجيه هنا اليوم، بسعر القائمة لدى المزوّد دون أي هامش ربح، وعلى المفتاح نفسه الذي يعمل به كل شيء آخر في الكتالوج، وبطاقته الحية تحمل المواصفات الكاملة. نحن لا نوفّر Muse Realtime Avatar. راجعنا قائمة النماذج الحية مرة أخرى أثناء كتابة هذا، وليس فيها من مدخلات Muse سوى نقطتي التفتيش Spark، 1.2 وسابقه 1.1. أي قول أكثر تلطيفًا من ذلك — بأن العائلة «متاحة جزئيًا» — سيعني ضمنًا أننا نوجّه شيئًا لا نوجّهه.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

التقنية، كما وردت بمصطلحات Meta نفسها

وصف Meta للبنية موجز بما يكفي لاقتباسه بدلاً من إعادة صياغته. Muse Realtime Avatar هو "محول انتشار مدفوع بالصوت، مشروط بتدفق رموز الكلام، ووسائط مرجعية، ونافذة متحركة من الكامنات المرئية الحديثة،" وهو "يولّد الفيديو في أجزاء سببية قصيرة." النصف الثاني من تلك الجملة هو الجزء الأساسي: عند اكتمال كل جزء، تصبح أحدث الكامنات المولّدة فيه سياق الحركة للجزء التالي. السبب المعلن من Meta هو الاستمرارية — ينتقل مظهر الصورة الرمزية وسماتها عبر الأدوار بينما تظل الحوسبة محدودة، وهذا ما يسمح للتوليد بالاستمرار طالما استمرت المحادثة بدلاً من الانحراف أو نفاد الميزانية.

تنتمي آلية إثبات المصدر إلى الفقرة نفسها، لأن Meta تقدّمها كجزء من النظام وليس كفكرة لاحقة: فالفيديو المولَّد يحمل علامة مائية دائمة وغير مرئية تُطبَّق عبر Meta Video Seal، وتقول Meta إنها لا تضيف أي تأخير إلى المسار الفوري.

قامت Meta بقياس هذا الأمر ونشرت له أربعة أرقام. تلك الأرقام — والتحفظات المحددة التي يحتاجها كل رقم منها، بما في ذلك ذاك الذي يُقرأ كأنه تسريع وليس تسريعًا — تنتمي إلى مقال الإطلاق، الذي يحملها مع سياقها سليمًا. لن نعيد هنا ذكر الأرقام المجردة، لأن الرقم المجرد هو بالضبط ما توجد النسخة المقرونة بتحفظات لمنعه.

تناولنا الإعلان في يومه ضمن مقالتنا عن إطلاق Muse Realtime Avatar، ويظل المكان الأمثل لقراءة الادعاءات المدروسة بنصها الكامل.

ما ليس عليه الاسم

يجدر استبعاد ثلاثة جيران زائفين واحدًا تلو الآخر، لأن كلًّا منهم تخمين معقول انطلاقًا من الاسم وحده.

• إنه ليس Muse Voice Transcribe. نقطة النهاية تلك تحوّل الكلام إلى نص، ووفقًا لوصف Meta نفسه، لا تفعل شيئًا في الاتجاه المعاكس. إذا كنت تحتاج إلى نص مكتوب، فإن Meta تبيع نصًا مكتوبًا، وهو شيء مختلف بسعر مختلف.

• إنها ليست خدمة استنساخ صوتي. لا شيء في صفحات ميتا يصف تركيب صوت شخص بعينه، أو بيع نموذج صوتي، أو قبول عيّنة صوتية من مستخدم. تُوصف طبقة الصوت بأنها تنتج تدفقًا من الرموز؛ وتُوصف طبقة الأفاتار بأنها تستهلك واحدًا. شكل المنتج الذي توحي به هذه العبارة عادةً — رفع عيّنة، والحصول على نسخة مستنسخة — ليس ما يوصف هنا، والمواد التجريبية التي تنشرها ميتا فعلًا مصوغة كتوضيح لقدرة النموذج.

• إنه ليس أفاتار للمستهلكين في تطبيق Meta نفسه. وتُرفق Meta أمثلتها بتحذير يسهل إغفاله ويستحق الإبقاء عليه: توضح العروض التوضيحية "قدرة النموذج ولا تعكس جميعها الأفاتار المتاحة في تطبيق Muse"، وMuse مخصص للمستخدمين الذين تبلغ أعمارهم 18 عامًا فما فوق. اقرأ ذلك حرفيًا. بعض ما يعرضه المنشور هو قدرة، وليس مخزونًا.

هناك اسم رابع يستحق الفصل لسبب مختلف.‏ Muse Realtime Avatar ليس Muse Video، نموذج توليد الفيديو الذي ظلّ مدرجاً في لوحة ترتيب عامة طوال معظم هذا العام دون أن يُطلق. صفحتنا الخاصة عن ذلك الوضع — Muse Video: تاريخ الإصدار، والوصول عبر API، وما قد يغيّره Meta Connect — تتضمن قيداً سنكرره هنا حرفياً بدلاً من تحسينه: أي صفحة تذكر يوماً محدداً للإطلاق أو سعراً لـ Muse Video من دون إعلان أحدث من Meta إنما تخمّن. وينطبق الانضباط نفسه على موضوع هذه الصفحة، لذا لا تقتبس هذه الصفحة أياً منهما. يقدّم ذلك المقال أيضاً التاريخ الذي ليس من شأننا الخلط فيه: Muse Video تتم معاينته في 7 يوليو 2026 ولم يُصدَر، ولهذا يُظهر البحث عن هذه العائلة تواريخ تنتمي إلى نموذج مختلف.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

ما الغرض من هذه الصفحة، وما الذي قد يغيّرها

السبب في أن الصفحة المرجعية هي الشكل الصحيح هنا قابل للقياس. في الـ28 يومًا المنتهية في 25 سبتمبر 2026، حصد المصطلح الدقيق 164 ظهورًا على خاصية البحث لدينا ولا نقرة واحدة، وكان أفضل مركز له 9.3. أكثر من خمسين من صفحاتنا تذكر المقطع في مكان ما، ويكاد كل هذا القدر من الزيارات يصل إلى منشور إعلان واحد. إن مصطلحًا له طلب حقيقي ومستدام، ويحتل مركزًا قريبًا من الصفحة الأولى ولا يحوّل أي أحد، ليس مشكلة طلب ولا مشكلة جودة — إنها مشكلة صفحة. لم تكن هناك صفحة موضوعها النموذج نفسه. هذه هي تلك الصفحة.

هذا الموقف هو أيضًا السبب وراء عدم تقديم أي شيء هنا في ثوب خبر. القارئ الذي يصل من البحث عن اسم يريد ثلاثة أشياء بالترتيب: ما هذا، وهل هو متاح، وما الذي بُني عليه. وقد أُجيب عنها أعلاه، بهذا الترتيب، دون اختراع أي تواريخ ودون تسمية أي منافس.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

ما الذي قد يغيّر الصفحة هو إعلان واحد. إذا نشرت Meta نقطة نهاية، أو سعرًا، أو قائمة انتظار، أو موعدًا لـ Muse Realtime Avatar، فإن قسم التوفر يتوقف عن كونه "لا" ويصبح مواصفة، وتُعاد كتابة هذه الصفحة بدلًا من إلحاق محتوى بها. إذا أطلقت Meta Muse Video، فإن الفقرة أعلاه تتغير معه. وحتى يحدث أي من الأمرين، فإن الخطوة المفيدة للمطور هي الخطوة غير الجذابة: أبقِ الواجهة التي لديك بالفعل موجهة إلى النموذج الذي يمكنك الوصول إليه فعليًا. كل نموذج في الكتالوج، بما في ذلك Meta Muse Spark 1.2، يقع خلف نقطة نهاية واحدة متوافقة مع OpenAI ومفتاح واحد، مما يعني أن تجربة الجزء الموجود من هذه العائلة يكلفك تغيير سلسلة النموذج بدلًا من عقد جديد. عندما تصبح طبقة التجسيد قابلة للاستدعاء، ينبغي أن تكون تكلفة التبديل سلسلة أيضًا.