بطاقة رئيسية مولّدة لمقال "Muse Realtime Avatar مقابل SeedRealtime"، تُظهر بطاقتين مستديرتين على جانبي العنوان. تعرض البطاقة اليسرى "Muse Realtime Avatar" فوق أيقونة إطار فيديو صادر والسطرين "يولّد الفيديو" و"Meta، أُعلن في 23 سبتمبر"؛ وتعرض البطاقة اليمنى "SeedRealtime" فوق أيقونة شاشة وعين والسطرين "يشاهد الفيديو" و"ByteDance، طُرح في 5 أغسطس". يقول عنوان فرعي "لا يملك أي منهما بطاقة أسعار." شعار OrcaRouter مُدمج في الزاوية اليمنى السفلى.
Guides & Insights

Muse Realtime Avatar مقابل SeedRealtime: نموذجان يمكنك مشاهدتهما فقط

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لا يوجد لأيٍّ منهما جدول أسعار. Muse Realtime Avatar، الذي أعلنت عنه ميتا في 23 سبتمبر 2026 في Meta Connect، ليس له واجهة برمجية ولا نقطة نهاية ولا سعر ولا موعد — إنه قدرة ضمن وكيل Muse التابع لميتا، عُرضت في منشور بحثي بعنوان "Bringing Your Muse to Life." SeedRealtime، الذي أطلقته ByteDance Seed في 5 أغسطس 2026، ليس له واجهة برمجية ولا أوزان ولا تقرير تقني ولا عدد معاملات — إنه موجود داخل تطبيق Doubao التابع لبايت دانس، ولا يقول منشور بايت دانس سوى إنه «طُرح بالكامل». شركتان من أكبر شركات الذكاء الاصطناعي الموجّهة للمستهلك في العالم أطلقتا نظامين سمعيين بصريين فوريين خلال سبعة أسابيع إحداهما بعد الأخرى، ولا يمكن شراء أيٍّ منهما. هذه هي المقارنة، وهي مقارنة أكثر إثارة للاهتمام من جدول المعايير الذي لا يستطيع أحد بنائه.

ما يفصل بينهما هو اتجاه تدفّق الفيديو. يراقب SeedRealtime ويستمع ويتحدث عمّا يراه — صوت وفيديو ونص إلى شبكة واحدة من طرف إلى طرف، مع نقل تناوب الأدوار من كاشف نشاط صوتي خارجي إلى النموذج نفسه. يولّد Muse Realtime Avatar: تعطيه صورة مرجعية، أو صورة فوتوغرافية أو رسمة توضيحية أو جسمًا، فيجسّد ذلك الشيء وهو يتحدث ويؤدي إيماءات في فيديو مستمر طوال مدة المحادثة. فيديو SeedRealtime هو مدخل. فيديو Muse Realtime Avatar هو مخرج. يُوصف كلاهما بأنه مزدوج الاتجاه بالكامل، وكلاهما سمعي-بصري، وهما يؤديان وظيفتين متعاكستين تحت المسمّى نفسه.

ما هو كل واحد منها، وأين يوجد

ستة أسطر، والسطران الأخيران هما اللذان يحسمان أي شيء.

فيديو — يُولّده Muse Realtime Avatar بدقة عمودية تبلغ 448×768 وبمعدل 25 إطارًا في الثانية، موسومًا بعلامة مائية على شكل طبقة شفافة، بحيث يستطيع المشاهد أن يميّز أنه ليس بثًّا من كاميرا؛ ويدركه SeedRealtime، فيبثّ الإطارات إلى الشبكة نفسها التي تعالج الصوت.

الرهان المعماري — يشارك Muse Realtime Avatar تدفّقًا واحدًا من الرموز بين الصوت والفيديو، بحيث يستهلك مُحوِّل انتشار مدفوع بالصوت رموز كلام Muse Realtime Voice مباشرةً، دون أي مزامنة شفاه لاحقة؛ أما SeedRealtime فيدمج تبادل الأدوار داخل النموذج نفسه، فيكفّ تحديد مَن يتحدث ومتى عن كونه قرارًا يتخذه كاشف نشاط صوتي خارجي.

أين يعمل — Muse Realtime Avatar هي قدرة داخل وكيل Muse من Meta؛ SeedRealtime موجود داخل تطبيق Doubao من ByteDance.

وصول المطوّرين — لا يوفّر أيٌّ منهما واجهة برمجة تطبيقات (API). ولا ينشر أيٌّ منهما أوزانه. لا يوجد خيار بلا خوادم، ولا نقطة نهاية مستضافة، ولا منصة طرف ثالث تحمل أيًّا منهما.

السعر — غير معلَن لكليهما، لعدم وجود عرض تجاري من أي جانب.

تقييم مستقل — لا يوجد لأي من النظامين. كل رقم نشرته أي من الشركتين عن نموذجها الخاص هو من الطرف الأول، ولم يقم أي مُقيِّم خارجي بتشغيل أيٍّ منهما.

قاعدتا أدلة، كلتاهما من بيانات الطرف الأول، وإحداهما أضعف بكثير

هنا تتوقف المقارنة عن أن تكون متماثلة. نشرت ميتا أربعة أرقام لـ Muse Realtime Avatar، جميعها مُبلَّغ عنها من الشركة، ومقاسة مقابل خطوط أساس اختارتها ميتا، ولم يُعِد إنتاج أي منها خارج الشركة: 870 مللي ثانية من نهاية دورك إلى البايت الأول لرد صوتي ومرئي متزامن؛ فيديو عمودي بدقة 448×768 بمعدل 25 إطارًا في الثانية؛ تقييمات نموذج أقل بمقدار 60× من خط الأساس الخاص به؛ و12 جلسة متزامنة في الوقت الفعلي على وحدة NVIDIA GB200 واحدة، وهو مكسب في السعة بمقدار 8× مقارنة بخط الأساس ثنائي الخطوة BF16 من ميتا، وذلك من التدريب المدرك للتكميم بأربع بتات والتجميع الديناميكي المدرك لزمن الاستجابة. نشرت ميتا أيضًا مقارنة تفضيل مقابل نظامي أفاتار تجاريين — 78/22 مقابل أحدهما، و88/12 مقابل الآخر — وأفصحت عن أن النتيجة في ما يتعلق بالسلوكيات مقابل أحد هذين النظامين لا يمكن تمييزها إحصائيًا عن التعادل. هذا الإفصاح يستحق أكثر من الانتصارات؛ فهو نوع النتيجة الذي تتركه معظم منشورات الإطلاق.

الدليل المنشور من SeedRealtime هو تقييم بشري شامل واحد من طرف إلى طرف. تقول ByteDance إنه مقابل الأنظمة المتتالية — نموذج رؤية موصول بنموذج ASR موصول بنموذج LLM موصول بصوت تحويل النص إلى كلام — يخفض SeedRealtime مشكلات إيقاع المحادثة السمعية البصرية إلى النصف، مع انقطاعات أقل، وتنبيهات كاذبة أقل، وردود أبطأ وأكثر طبيعية. ما لم تنشره ByteDance هو حجم عينة، أو منهجية، أو عدد القائمين على التوسيم، أو رقم كمون بالمللي ثانية، أو اسم معيار قياس، أو درجة. ويشير تقرير ثانوي واحد إلى مكسب قدره 12% في طلاقة المحادثة مقارنة بنماذج الفريق السابقة. هذه هي كامل قاعدة الأدلة العامة.

إذن، يجري الترتيب الصادق لقابلية التحقق على النحو التالي: لا يملك أيٌّ منهما تشغيلًا مستقلًا؛ فما لدى Meta مجموعة من القياسات مع خطوط أساس معلنة ونتيجة سلبية مُفصح عنها؛ وما لدى ByteDance ادعاء تفضيل وحيد لم يُوصف تصميمه. لا يمكن إعادة إنتاج أيٍّ منهما، لكن واحدًا فقط منهما محدد بما يكفي للجدال بشأنه.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

الحركة التي قام بها كل واحد

كلا النظامين إجابةٌ على المشكلة نفسها، ومن الجدير أن نرى أن الإجابتين مختلفتان.

في نظامٍ يراقب، يكمن الجزء الصعب في معرفة متى ينبغي أن يتحدث. على نموذج يتلقى باستمرار إطارات الكاميرا والصوت أن يقرر، دون محفّز خارجي، ما إذا كان الشخص الذي أمامه قد انتهى، وما إذا كان قد وُجّه إليه الكلام، وما إذا كان الجسم الذي دخل الإطار للتوّ ذا صلة. تلك هي المشكلة التي نقلها SeedRealtime إلى داخل النموذج، وقد نفّذت ByteDance هذه النقلة عبر ثلاث وسائط بدلًا من اثنتين — نسخة أصعب مما فعله كلٌّ من Google وOpenAI وNVIDIA للصوت وحده. وتتبع سلوكيات العرض التوضيحي من ذلك: ربط صوت بوجه في محادثة جماعية، والتحدث من تلقاء نفسه عندما يدخل شيء إلى الإطار، وإرشاد شخص عبر متحف أو عملية إصلاح.

بالنسبة لنظام يقوم بالتصيير، الجزء الصعب هو البقاء متماسكًا. توليد الفيديو في أجزاء سببية قصيرة يعني أن كل جزء مشروط بالجزء السابق، ونمط الفشل هو الانحراف — بحلول الدقيقة الثالثة، تكون الشخصية قد أصبحت بهدوء شخصًا آخر. النافذة المتدحرجة لدى ميتا للمتجهات الكامنة الحديثة للفيديو هي الحل لذلك، وتدفق الرموز المشترك هو الحل لفشل مختلف، المظهر المدبلج الذي تحصل عليه عندما يتم توليد الصوت أولاً ثم يتم تشغيل نموذج مزامنة الشفاه عليه بعد ذلك.

لا يتوفر أيٌّ من هذين الخيارين في النظام الآخر. فلا يملك SeedRealtime صورة مرجعية ليبقى مخلصًا لها، لأنه لا يُنتج صورة لأي شخص. ولا يملك Muse Realtime Avatar عالمًا خارجيًا ليتتبعه، لأن مهمته كلها هي إنتاج وجه يطابق صوتًا.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

لماذا يظل النموذج غير القابل للاستدعاء سؤال توجيه؟

كلا هذين النظامين يفوّض المهام. يقع Muse Realtime Avatar فوق Muse Realtime Voice، وهو الطبقة الحوارية لوكيل يجري تفكيره على Muse Spark — فالنموذج يقوم بالعرض، لا بالتفكير. يحافظ تصميم SeedRealtime على استمرار المحادثة أثناء حدوث العمل في الخلفية، ما يعني أن العمل الذي يتجاوز ما يمكنه القيام به فوريًا يذهب إلى مكان آخر ثم يعود. في كلا المعماريتين، ما يتفاعل معه المستخدم هو واجهة أمامية، والذكاء نموذج نصي منفصل خلفها.

نموذج النص المنفصل ذاك هو استدلال عادي، وهو الجزء من المنظومة الذي يمكنك شراؤه فعلاً. على OrcaRouter هو نقطة نهاية واحدة تغطي 196 نموذجاً من 15 مزوّداً، بسعر قائمة المزوّد مُمرَّراً كما هو دون أي هامش ربح، مع تحويل تلقائي عند التعطل أو انتهاء المهلة للنموذج الذي اخترته. نحن لا نستضيف SeedRealtime — فهو ملك لـ ByteDance، داخل Doubao، ولا يوجد شيء لتوجيهه. ولا نستضيف Muse Realtime Avatar أيضاً، ولا يفعل ذلك أي أحد آخر. ما نوفّره هو الطبقة التي يسلّم إليها كلا النظامين عملهما الشاق، وهي الطبقة التي تتغير عندما تريد نموذجاً مختلفاً يقوم بالتفكير.

ما الذي سيغيّر الإجابة؟

بالنسبة إلى SeedRealtime، القطعة الناقصة ليست ميزة — بل هي الدليل. تقرير تقني يتضمن عدد المعلمات، ومجموعة اختبارات معيارية، وتقييمًا بشريًا موصوفًا سينقلها من "عرض توضيحي داخل تطبيق" إلى شيء يمكن لفريق أن يستدل به. كما يربط منشور ByteDance وجهات عامة "Try Dola" و"Try in Playground" دون ادعاء أوزان أو واجهة برمجة تطبيقات موثقة، وهو نمط ميزة منتج لا إصدار نموذج.

بالنسبة إلى Muse Realtime Avatar، القطعة المفقودة تجارية: بطاقة أسعار، ونقطة نهاية، وتاريخ، وشروط المنطقة والعمر التي لم توضحها Meta بالكامل. تشير منشورات Meta إلى أن عروضها التوضيحية لا تعكس جميع الصور الرمزية المتاحة في تطبيق Muse، وهذه هي الجملة التي ينبغي أن تحكم أي خطة تُبنى حول هذا.

إلى أن يتغير أحد تلك الأمور، تتخذ المقارنة شكلًا قصيرًا بشكل غير معتاد. كلا النموذجين سمعي-بصري، وكلاهما ثنائي الاتجاه الكامل، وكلاهما هندسة مبهرة حقًا، ولا يمكن لأي منهما أن يُستدعى من طرفية بواسطة أي شخص يقرأ هذا. الفرق هو ما ستفعله بهما لو استطعت: أحدهما يمنحك شخصية تتحدث، والآخر يمنحك نظامًا يلاحظ.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.