بطاقة عنوان رئيسية لـ 'Tavus Griffin مقابل Muse Realtime Avatar' مع العنوان الفرعي 'وجهان لعام 2026، مشكلتان مختلفتان'، فوق أربع شرائح: Griffin: 48% اعتقدوا أنه بشري؛ Griffin: 0.43 ثانية من الصوت إلى الفيديو؛ Muse Realtime Avatar: 870 مللي ثانية إلى أول بايت؛ Muse Realtime Avatar: 448×768 عند 25 إطارًا في الثانية.
Engineering & Research

Tavus Griffin مقابل Muse Realtime Avatar: وجهان لعام 2026، ومشكلتان مختلفتان

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يوجد كل من Tavus Griffin وMuse Realtime Avatar لحل المشكلة المحرجة نفسها — نموذج لغوي يستطيع الكلام لكنه بلا وجه — وهما يعالجانها من طرفين متقابلين. Griffin هو Human Interaction Model يعمل من فيديو إلى فيديو، يراقب مشاركًا عبر كاميرا ويولّد الجانب الآخر من المحادثة في الوقت الفعلي، وقد أعلنت عنه Tavus في أكتوبر 2026 كمعاينة بحثية لمختبرين مختارين. أما Muse Realtime Avatar فهو طبقة التجسيد الخاصة بـ Meta لوكيلها Muse، وقد أُعلن عنه في Meta Connect في 23 سبتمبر 2026، وهو يستقبل الصوت ويحوّله إلى صورة شخصية ناطقة متزامنة. لا يمكن شراء أيّ منهما. يكمن الفرق في ما يحاول كل منهما إتقانه، ويظهر ذلك في اللحظة التي تسأل فيها عمّا يتلقاه كل نموذج فعليًا كمدخلات.

النسخة المختصرة

• مُدخل Griffin هو الشخص الموجود على الطرف الآخر — الفيديو والصوت الخاصان بمشارك مباشر، وهو ما يجب قراءته والاستجابة له والمقاطعة من خلاله.

• مدخل Muse Realtime Avatar هو كلام الوكيل نفسه — تدفق من الرموز من Muse Realtime Voice يحوّله إلى وجه مطابق.

• تقيس Tavus Griffin من خلال ما إذا كان الناس يصدقونه، وتنشر رقمًا بنسبة 48% من مكالمة فيديو مدتها دقيقة واحدة.

• تقيس Meta Muse Realtime Avatar مدى قدرته على المواكبة، وتنشر أن 870 مللي ثانية تفصل بين نهاية الدور وأول بايت.

• لا يمتلك أيٌّ منهما واجهة برمجية عامة (API)، ولا سعرًا معلنًا، ولا موعدًا للتوفّر العام.

اقرأ تلك الصفوف الأربعة معًا، وسيتضح شكل الخلاف. تُحسّن Tavus من أجل ما يعتقده الشخص الآخر. وتُحسّن Meta من أجل الساعة.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

غريفين: النموذج الذي يجب أن يُصدَّق

إطار Tavus هو أن Griffin هو أول نموذج تفاعل بشري، والبنية المعمارية التي تقف خلف هذا الادعاء هي نظام من جزأين يجمع بين النمذجة الحوارية المستمرة والتوليد السمعي البصري. الجزء الأول سلوكي: فهو يقرر ما ينبغي للشخصية فعله من لحظة إلى أخرى، باستخدام ما يمكنها رؤيته وسماعه. أما الجزء الثاني فهو التصيير، ويقسّمه Tavus بدوره إلى توليد كلام متدفق وتوليد فيديو متدفق.

الأرقام التي تستهل بها Tavus ليست أرقام إنتاجية. في دراسة أجرتها الشركة مع جامعة كوين ماري في لندن، اعتقد 26 من أصل 54 مشاركًا — 48% — أن Griffin شخص حقيقي بعد مكالمة فيديو مدتها دقيقة واحدة، مقابل 1 من أصل 41 (2.4%) لمجموعتها السابقة المكوّنة من توليد الوجوه Phoenix-4.5، وتناوب الأدوار Sparrow-2، ورؤية Raven-1. أما المشاركون الذين لم يُخدعوا فعادةً ما شكّوا خلال أول 20 ثانية. وعلى معيار VideoFDB من NVIDIA، الذي سُجّل في سبتمبر 2026، تُبلِغ Tavus عن تصدّر Griffin في الذكاء الاصطناعي وجهًا لوجه بدرجة توليد 3.83 مقابل 2.80 لأقوى خط أساس مُبلَّغ عنه و3.92 مرجع بشري، ودرجة إدراك 3.73 مقابل 3.44 لأفضل خط أساس مُبلَّغ عنه و4.20 مرجع بشري. هذه الأرقام مُبلَّغ عنها من المورّد وخاصة بالمعيار، لكن نقاط المقارنة البشرية هي المثيرة للاهتمام.

الهندسة الكامنة وراء تلك الأرقام هي برنامج ترميز يُسمى Tavec ومحوّل انتشار ذاتي الانحدار. يعمل Tavec عند 48 كيلوهرتز، بـ40 قيمة لكل إطار عند 100 إطار في الثانية، من دون كتب ترميز، ومفكك ترميز سببي بالكامل، وحزم قد يصل حجمها إلى 10 مللي ثانية — مصمَّم بحيث يبدأ الوجه في التحرك قبل أن تنتهي الجملة. يدفع مسار الفيديو دقة 720p على شكل أجزاء مدتها 320 مللي ثانية، حيث يعادل الكامن الواحد ثمانية إطارات عند 25 إطارًا في الثانية، وثلاث خطوات انتشار لكل كامن، وضغطًا زمنيًا بمقدار 8× في VAE. عملية تقطير من ثلاث مراحل (مطابقة التوزيع، ثم الانحدار الذاتي بإجبار المعلّم، ثم الإجبار الذاتي) هي ما يتيح لها تشغيل تلك الخطوات الثلاث في الزمن الحقيقي على الإطلاق. الادعاء الرئيسي بشأن زمن الوصول هو متوسط 0.43 ثانية من الصوت إلى الفيديو على H100s، وهو ما تقول Tavus إنه يبلغ نحو نصف زمن أسرع طريقة تالية قاستها. يحتاج استنساخ الصوت إلى عيّنة مدتها 10 ثوانٍ تقريبًا.

ثمن كل هذا أن Tavus لا تستطيع إطلاقه. Griffin-Lite، المعاينة البحثية، متاح فقط لمجموعة مختارة من المختبِرين الأوائل؛ وفي بيان مكتوب عن الإصدار، تصرّح الشركة بوضوح أن Griffin-Lite لن يكون متاحًا لاستخدام العملاء في الوقت الحالي، وأنها تتوقع إطلاق Griffin قريبًا جدًا بعد معالجة بعض مخاوف السلامة. Griffin ليس على منصة Tavus، وسيصل إليها "بمجرد أن نتوصل إلى كيفية إطلاقه بأمان". النموذج الذي يكون مقنعًا في 48% من الوقت خلال مكالمة مدتها دقيقة واحدة هو، من منظور النشر، نموذج يكون مقنعًا في 48% من الوقت خلال مكالمة مدتها دقيقة واحدة.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar: النموذج الذي عليه أن يواكب

أُعلن عن Muse Realtime Avatar في 23 سبتمبر 2026 في Meta Connect، وكتبت عنه في اليوم نفسه Meta Superintelligence Labs تحت عنوان «إحياء Muse». تأطير Meta أضيق وأكثر آلية من تأطير Tavus: فوكيل Muse كان لديه صوت بالفعل، بفضل Muse Realtime Voice، والأفاتار هو الطبقة التي تمنح ذلك الصوت جسدًا.

الرقم المنشور هو 870 مللي ثانية من نهاية الدور إلى أول بايت — أي من اللحظة التي يتوقف فيها المستخدم عن الكلام إلى اللحظة التي يصبح فيها أول بايت فيديو للصورة الرمزية جاهزًا. تُنتج الصورة الرمزية صورة بورتريه بدقة 448×768 بمعدل 25 إطارًا في الثانية. تقول ميتا إن النظام يجري عددًا أقل بنحو 60× من عمليات التقييم لكل كتلة مقارنةً بخط أساسه، وإن وحدة NVIDIA GB200 واحدة يمكنها تشغيل 12 جلسة متزامنة في الوقت الفعلي مع زيادة في السعة تبلغ 8× مقارنةً بتنفيذ BF16 من خطوتين.

الفرق المعماري عن Griffin يكمن في مصدر المعلومات. يوسّع Muse Realtime Avatar نطاق Muse Realtime Voice ويشاركه تدفّق رموز الكلام — فالتمثيل نفسه بترميز VQ الذي ينتجه نموذج الصوت هو ما يقود الوجه، بدلًا من فهم بصري منفصل للمشارك. وهذا يجعله طبقة تجسيد DiT مدفوعة بالصوت: فعّالة، ومقترنة بإحكام بنموذج الصوت الخاص بها، ولا تحاول قراءة الإنسان على الطرف الآخر من المكالمة إطلاقًا. إنه فم ووجه لوكيل، وليس شريك محادثة يراقبك.

لم تنشر Meta أي API، ولا سعرًا، ولا تاريخ إصدار لـ Muse Realtime Avatar. منشور البحث هو كامل السجل العام.

حيث يختلف التصميمان اختلافًا حقيقيًا

أوضح طريقة لرؤية الانقسام هي أن تسأل عما يحدث عندما يقاطع المستخدم.

Griffin كامل الازدواجية ومصمم ليُقاطَع في منتصف الكلام — إذ يستطيع المشاهدة والاستماع أثناء التحدث، ولهذا يعتمد تسويق Tavus على فكرة أن Griffin يتعلّم السلوك الحواري وليس الفيديو. ولهذا أيضاً بُنيت مجموعة اختباراته المعيارية حول الإدراك وردّ الفعل، ولهذا فإن تفوقه بنسبة 37% على أفضل نظام تالٍ في ردّ الفعل اللحظي هو ادعاء تكلف الشركة نفسها عناء طرحه.

رقم نهاية الدور البالغ 870 مللي ثانية في Muse Realtime Avatar يروي لك القصة المعاكسة: فهو خط معالجة ينتهي فيه الدور، ثم تُحلّ الرموز الصوتية، وبعدها يلحق الوجه. إنه سريع — و870 مللي ثانية رقم جيد لمُصيّر بورتريه — لكن القياس نفسه يفترض وجود حدّ للدور، وهو بالضبط الافتراض الذي بُني نموذج ثنائي الاتجاه ليتخلّص منه.

هذا ليس انتقادًا لأي من التصميمين. فـ Meta تبني وجهًا لوكيل يعيش داخل واجهات المساعد الخاصة بـ Meta، حيث تُعدّ حدود الدور النظيفة نموذجًا معقولًا للتفاعل. أما Tavus فتبني شيئًا يجب أن يصمد أمام قرار شخص غريب، خلال عشرين ثانية، لما إذا كان الشخص الظاهر على الشاشة حقيقيًا.

لا يوجد أيّ منهما في قائمة أسعار — وجزء واحد فقط من Muse قابل للاستدعاء

لا يمكن وضع Tavus Griffin ولا Muse Realtime Avatar في الإنتاج اليوم. Griffin متاح فقط لمختبرين مختارين؛ Muse Realtime Avatar ليس لديه واجهة برمجة تطبيقات، ولا سعر، ولا موعد. إذا كنت تخطط لعملية بناء، فإن هاتين الحقيقتين يجب أن تكونا ضمن الخطة.

ما يستحق الإشارة إليه هو الجزء من منظومة Muse الذي يكون قابلاً للوصول. تضم عائلة Muse لدى Meta نموذج Muse Spark، وإحدى نقاط التحقق منها — meta/muse-spark-1.2 — متاحة الآن في كتالوجنا بسعر 1.25 دولار لكل مليون رمز إدخال و4.25 دولار لكل مليون رمز إخراج مع هامش ربح صفري على سعر Meta المعلن. إنه ليس الأفاتار: فهو يستقبل النص والصورة والفيديو والصوت ومدخلات PDF ويعيد النص، مع نافذة سياق بسعة مليون رمز وجهد استدلالي قابل للتكوين. لكنه الجزء من سلسلة Muse الذي يمكنك استدعاؤه فعلاً، وإذا كنت تبني الوكيل الذي سيجلس يوماً ما خلف أفاتار، فإن النصف اللغوي هو النصف الذي يمكنك البدء به. يمرر OrcaRouter أسعار القائمة الخاصة بالمزوّدين بهامش ربح 0%، لذا ينعكس أي تغيير في سعر Meta على بطاقتنا في اليوم نفسه وليس في دورة الفوترة التالية، وتُعاد محاولة الطلب الذي يفشل على أحد المزوّدين مع مزوّد سليم بدلاً من أن يظهر كخطأ مهلة.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

ينطبق المنطق نفسه على جانب الفيديو من العالم. نحن لا نوجّه Muse Realtime Avatar ولا نوجّه Tavus Griffin، ولن ندّعي خلاف ذلك. ما نوجّهه هو كتالوج يضم أكثر من مائتي نموذج عبر الوسائط نفسها، بحيث يظل نموذج أولي يتبدّل بين وكيل نصي ونموذج صوتي ومولّد فيديو على مفتاح واحد، بينما يظل النموذجان المذكوران في هذا المقال غير مُصدَرين.

أي واحد أبعد عن الشحن؟

وفق السجل العام، لا يزال Muse Realtime Avatar أبعد. فلديه منشور بحثي ولا API له، ولا سعر ولا موعد. كما لا يملك Griffin أي API ولا سعر، لكن لديه نية إصدار صريحة — «قريبًا جدًا بعد معالجة مخاوف السلامة هذه» — وطبقة معاينة مسمّاة متاحة اليوم لمختبرين مختارين، ومجموعة من نتائج القياس المنشورة من أداة اختبار مستقلة. هذا موقف أكثر تقدمًا، رغم أنه يأتي مع إقرار بأن النموذج ليس آمنًا بما يكفي لتسليمه للعملاء.

الفخ في المقارنة بينهما هو التعامل مع رقم 870 مللي ثانية كأنه قابل للمقارنة مباشرة برقم 0.43 ثانية. فهما يقيسان شيئين مختلفين: تقيس Meta المدة من نهاية الدور إلى أول بايت من صورة بورتريه، بينما تقيس Tavus زمن الوصول من الصوت إلى الفيديو داخل تدفق ثنائي الاتجاه متواصل لا تكون فيه الأدوار أحداثًا واضحة المعالم. الرقمان حقيقيان معًا، لكنهما ليسا القياس نفسه، ومن يعرضهما في عمود واحد يسيء إلى القارئ.

الخلاصة

Muse Realtime Avatar طبقة تجسيد: إدخال صوتي، وإخراج صورة شخصية، 870 مللي ثانية من نهاية الدور إلى البايت الأول، 448×768 عند 25 إطارًا في الثانية، بلا API ولا موعد. Tavus Griffin نموذج تفاعل بشري ثنائي الاتجاه: المشارك يدخل، ووجه متفاعل يخرج، بمتوسط زمن استجابة من الصوت إلى الفيديو 0.43 ثانية على H100s، ومورّد مستعدّ لنشر أن 48% من الناس ظنّوا أنه بشري، مع تصريحه أيضًا بأن العملاء لا يمكنهم استخدامه. تبني Meta شيئًا يواكب. وتبني Tavus شيئًا يجتاز. لا يمكن شراء أي منهما، ما يعني أن القرار الوحيد المتاح اليوم هو أي نصف من المشكلة نبدأ به — وبالنسبة لمعظم الفرق، هذا النصف هو النموذج اللغوي الكامن تحته.