
Tavus Griffin: أول نموذج للتفاعل البشري و48% التي اجتازت اختبار تورينغ للفيديو
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أكمل ستة وعشرون شخصًا من أصل أربعة وخمسين مكالمة فيديو مدتها دقيقة واحدة، وقالوا إن شريكهم كان شخصًا حقيقيًا. هذا هو الرقم الذي تستهل به Tavus الإعلان عن Tavus Griffin، المعلَن عنه في 1 أكتوبر 2026، وهو نتيجة لافتة حقًا: وفق البروتوكول نفسه، أنتجت منظومة الشركة السابقة — Phoenix-4.5 التي تتولى تصيير الوجه، وRaven-1 التي تتولى الإدراك، وSparrow-2 التي تتولى إدارة ديناميكيات تناوب الأدوار — مصدّقًا واحدًا من أصل واحد وأربعين، أي 2.4%. إن القراءتين البديهيتين لهذه القفزة خاطئتان كلتاهما، وفصل إحداهما عن الأخرى هو معظم ما سيأتي. Griffin ليس محرك أفاتار أفضل، وليس منتجًا يمكنك شراؤه. إنه معاينة بحثية تُسمى Griffin-Lite، متاحة لمجموعة مختارة من المختبرين الموثوقين، بلا تسعير، ولا واجهة برمجة تطبيقات عامة، ولا إدراج في أي لوحة صدارة فيديو مستقلة. كون هذين الأمرين صحيحين في آن واحد هو القصة الفعلية.
ما الذي تقيسه نسبة 48%، وما الذي لا تقيسه
الدراسة هي اختبار تورينغ وجهًا لوجه بدلًا من استبيان تفضيلات، ومن الجدير ذكر البروتوكول بدقة لأنه الادعاء الذي يحمل الثقل. جُند أربعة وخمسون مشاركًا عبر منصة بحثية مستقلة وأُخبروا بأنه سيتم مطابقتهم مع مشارك آخر لمكالمة فيديو مدتها دقيقة واحدة حول ما كانوا يتطلعون إليه هذا العام. كان شريكهم عبارة عن PAL يشغّل Griffin-Lite، ويولّد وجهًا وصوتًا واستجابات في الوقت الفعلي. ولم يُسألوا إلا في نهاية الاستبيان عما إذا كانت قد راودتهم فكرة أن الشريك قد لا يكون شخصًا حقيقيًا، ثم أُخبر كل مشارك أنه ذكاء اصطناعي. واستخدمت الجولة المقارنة البروتوكول نفسه على المكدس الأقدم، مع واحد وأربعين مشاركًا.
الأرقام الداعمة لا تقل أهمية عن العنوان الرئيسي. كان المصدّقون واثقين — 79% في المتوسط — وكذلك كان المشككون، بنسبة 81%، وهذا ما ترغبه أي دراسة: لم يكن أحد يخمّن. قال أكثر من نصف المشاركين إن الاحتمال لم يخطر ببالهم على الإطلاق أثناء المكالمة، وقالت الغالبية العظمى من تلك المجموعة إن الشريك كان حقيقياً. أما المشاركون الذين شكّوا فعلاً فقد مالوا إلى الشك خلال أول عشرين ثانية. هذا هو السطر الأقل راحة في التقرير، وهو الذي ينبغي أن يحدد كيفية قراءتك لقسم السلامة لاحقاً.
على مقياس من سبع نقاط، بلغ متوسط النموذج 5.4 من حيث الظهور بمظهر طبيعي، و5.6 من حيث الظهور بمظهر موثوق، و5.8 من حيث ما إذا كان المشاركون سيستمتعون بالتحدث معه مرة أخرى — وهي درجة بقيت عند 5.4 حتى بين المشاركين الذين تعرّفوا عليه بشكل صحيح باعتباره ذكاءً اصطناعيًا — و5.5 من حيث ما إذا كانوا يشعرون بأن شريكهم يستمع إليهم حقًا. وكانت أدنى درجة هي 4.9، من حيث ما إذا كانت المحادثة تتدفق بشكل طبيعي. وإذا قُرئت هذه الدرجات كمجموعة، فهي تشكّل صورة محددة: Griffin-Lite مقنع لحظةً بلحظة، وأقل إقناعًا بقليل بوصفه قوسًا.
المعيار المستقل، وكيفية قراءة مساريه
تأتي أرقام الجودة من VideoFDB التابع لـ NVIDIA، وهو معيار مرجعي للمحادثة السمعية البصرية كاملة الازدواجية يقيّم النموذج على مسارين منفصلين — التوليد، أي ما إذا كان النموذج ينتج السلوك الصحيح، والإدراك، أي ما إذا كان يفهم اللحظة — ولكل منهما معيار التقييم الخاص به ولوحة الصدارة الخاصة به. بنت NVIDIA المعيار المرجعي، وتجري التقييم بحَكَم خاص بها وفق المقاييس المنشورة، وتقيّم الاستجابة على مقياس من صفر إلى خمسة. لم تشغّله Tavus، وهذا هو سبب الاقتباس منه.
• التوليد — سجّل Griffin-Lite نتيجة 3.83، وسجّل ثاني أعلى نظام منشور نتيجة 2.80 (Gemini 2.5 مع Anam)، والمرجع البشري للحقيقة الأساسية هو 3.92. وهذا متقدّم بمقدار 1.03 على أفضل نظام قابل للمقارنة، وأقل بمقدار 0.09 من الأداء البشري.
• الإدراك — 3.73 مقابل مرجع بشري عند 4.20، مع 3.44 لأقوى خط أساس مُبلَّغ عنه، MiniCPM-o 4.5 في تكوينه الصوتي فقط. سجّل Gemini 2.5 Flash Native نتيجة 3.17 وسجّل gpt-realtime من OpenAI نتيجة 2.97.
• مواءمة معدل تولّي الدور — 62.8% في التوليد و73.8% في الإدراك. يقيس هذا مدى تطابق قرارات النموذج بشأن وقت التحدث مع التوقيت في المحادثات المرجعية، ويصف Tavus كليهما بأنهما الأعلى بين أي نظام على اللوحة.
ثمة تحذيران ينبغي إلحاقهما بهذه الأرقام قبل أن يكررها أحد. الفجوة التوليدية إلى الأداء البشري هي 0.09 على مقياس من خمس نقاط يقيّمه نموذج لغوي، والأفضل قراءة ذلك على أنه «قريب من البشر وفق هذا المعيار» لا «عند مستوى البشر». والمقارنة الإدراكية ليست مقارنة متماثلة: إذ يُقيَّم MiniCPM-o 4.5 وgpt-realtime في إعدادات صوتية فقط، بينما يقرأ Griffin الفيديو أيضًا. التفوق بفارق 0.29 نقطة على خط أساس صوتي فقط حقيقي، لكن جزءًا مما يقيسه هو قيمة امتلاك عينين.
سطر التلخيص الخاص بالمورّد نفسه — الأول في اختبار NVIDIA المستقل للذكاء الاصطناعي وجهًا لوجه، متقدّمًا بنسبة 37% على ثاني أفضل ذكاء اصطناعي في الاستجابة اللحظية — هو وصف للبيانات نفسها وليس نتيجة منفصلة. احتفظ بدرجات المسارات الأساسية، لا بالتأطير.

محرّكان يعملان في الوقت نفسه
الادعاء المعماري أسهل في التقييم من التسويق المحيط به، لأنه ادعاء يتعلق بما يعمل بالتزامن. يُوصف Griffin بأنه نظامان يعملان بالتوازي بدلًا من خط أنابيب يمرر العمل بين المراحل.
الأول هو محرك النمذجة الحوارية المستمرة. فهو يستوعب الصوت والفيديو الصادرين عن الشخص، ويعيد تقييم التبادل على فترات منتظمة تقل عن الثانية — وتسمّي Tavus هذه الأدوار المصغّرة — ليقرر عند كل منها ما إذا كان سيبقى صامتاً، أو يطلق إشارة، أو يقدّم تعقيباً إصغائياً، أو يأخذ الدور. والناتج ليس الكلمات فحسب، بل مجموعة من عناصر التحكم التعبيرية التي تحمل التوقيت والموقف وتعبيرات الوجه والإيماءات. وجوهر التصميم هو أن القرار المتخذ في منتصف الجملة يظهر في الصوت والوجه ضمن الدور المصغّر نفسه بدلاً من أن يظهر بعد عملية تسليم الدور، وهذا ما يمكّن النموذج من التوقف عندما يُقاطَع، والإيماء أثناء الإصغاء، والتعامل مع وقفة التفكير على أنها شيء آخر غير نهاية الدور.
الثاني هو محرك توليد سمعي-بصري يحوّل عناصر التحكم تلك إلى صوت وبكسلات معًا: مولّد كلام تدفقي ومولّد فيديو تدفقي مدفوعان بالإشارات نفسها، بحيث يتزامن تغيّر النبرة وتغيّر التعبير في النبضة ذاتها.
ملاحظة واحدة من باب الأمانة حول المادة التي نشرتها Tavus مع هذا، لأنه قد يسهل الخلط بينها وبين القياس. الرسم التفاعلي لتبادل مدته تسع ثوانٍ موصوف في نص الصفحة نفسه بأنه توضيحي، وبأنه لم يُقَس صراحةً من جلسة حقيقية. وينطبق التحذير نفسه على مخطط التوقيت المقارن بين النمط القائم على الأدوار والنمط ثنائي الاتجاه الكامل. أما ما تم قياسه فهو رقم الكمون/زمن الاستجابة الوارد لاحقًا في الأسفل.
داخل مكدس البث
تم بناء الجانب الصوتي حول برنامج ترميز يُدعى Tavec، وهو مشفر تلقائي التفافي يحوّل صوت 48 كيلوهرتز إلى كامن مستمر مكوّن من 40 قيمة لكل إطار بمعدل 100 إطار في الثانية، دون وجود كتب ترميز. وحدة فك الترميز الخاصة به سببية بالكامل، لذا فهي تحمل الحالة عبر الأجزاء وتصدر حزمًا صوتية صغيرة تصل إلى 10 مللي ثانية دون استباق. دقيقة واحدة من الكلام تساوي 6,000 إطار كامن بدلاً من 2.88 مليون عينة خام، وهذا ما يجعل التسلسل رخيصًا بما يكفي لمحول الكلام ليتنبأ أسرع من الزمن الحقيقي. مولد الكلام نفسه عبارة عن محول انتشار انحداري تلقائي يعتمد على بادئة متحدث مشفرة — يمكن استنساخ صوت من حوالي عشر ثوانٍ من الصوت — ويولّد جزءًا كامنًا واحدًا في كل مرة مع وصول عناصر التحكم، لذا يبدأ التشغيل قبل انتهاء الكلام.
يبدأ الجانب المرئي من الفرضية نفسها: فالضغط الزمني القوي هو ما يجعل نموذج انتشار سريعًا بما يكفي لخوض محادثة. يأخذ مولّد انحداري ذاتي قليل الخطوات صورة مرجعية، والصوت المتدفق وعناصر التحكم المتدفقة، وينتج تمثيلًا كامنًا واحدًا في كل خطوة عند ثلاث خطوات انتشار لكل تمثيل كامن. يضغط VAE الزمن ثماني مرات، لذا عند 25 إطارًا في الثانية يكون التمثيل الكامن الواحد ثماني إطارات، أو 320 ms من فيديو بدقة 720p. تُحفظ التمثيلات الكامنة الأقدم بدقة أدنى تدريجيًا كي تبقى عمليات التوليد الطويلة ميسورة الكلفة. والنتيجة مولّد يبث فيديو بدقة 720p على شكل أجزاء من 320 ms في الوقت الحقيقي.
استلزم الوصول إلى ذلك تقطيرًا من ثلاث مراحل من معلّم انتشار كبير ثنائي الاتجاه متعدد الخطوات: تقطير مطابقة التوزيع إلى طالب قليل الخطوات، والإجبار المعلّمي لتحويل ذلك الطالب إلى نموذج انحداري ذاتي يولّد كامنًا واحدًا في كل مرة، وأخيرًا التدريب بالإجبار الذاتي على التاريخ الذي يولّده النموذج بنفسه، مع آلية مضافة تعمل على إطارات التاريخ حتى لا تنجرف عمليات التوليد الطويلة. تلك المرحلة الثالثة هي التي تعالج نمط الفشل الذي تعاني منه هذه الفئة من النماذج عادةً — وجه يتدهور، أو خلفية تتجول ببطء، خلال محادثة تستمر لدقائق.
رقم زمن الاستجابة، الذي يمثل الادعاء الفعلي للمنتج
مقابل أربعة نماذج انتشار بثّية منشورة في إعداد تحويل الصوت إلى فيديو، حيث يتلقى كل نموذج كلامًا وصورة مرجعية ويجب أن ينتج وجهًا ناطقًا، بلغ متوسط مُولِّد Griffin-Lite 0.43 ثانية من زمن الاستجابة الحقيقي من الصوت إلى الفيديو على H100s — أي الوقت من وصول مقطع صوتي إلى ظهور تأثيره في الفيديو. ويصف Tavus ذلك بأنه نصف زمن أسرع طريقة تالية. كما يذكر حصوله على المركز الأول في الجودة الإدراكية لـ DOVER وFID وفي THEval، وهو إطار تقييم للرؤوس الناطقة، والمركز الثاني في ثقة تزامن الشفاه LSE-C عند 7.27، خلف خط أساس واحد — مع إشارة المورّد إلى أن LSE-C تكافئ حركة الفم الواضحة، بما في ذلك الحركة التي تتجاوز النقطة التي تبدو عندها طبيعية.
كل هذه قياسات Tavus الخاصة مقابل خطوط أساس اختارتها هي. وهي مفيدة لأنها محددة، ولأن رقم 0.43 ثانية هو نوع الأرقام التي إما تصمد في اختبار حي أو لا. وهي ليست مستقلة، والنتائج المستقلة الوحيدة في هذا المقال هي مسارا VideoFDB الواردان أعلاه.

لماذا لا يوجد سعر للمقارنة؟
يتوفر Griffin-Lite اليوم لمجموعة مختارة من المختبرين الأوائل كمعاينة بحثية، على أن يتبعه إطلاق أوسع لطراز أكثر قدرة. ولن يكون متاحًا لاستخدام العملاء في هذا الوقت. الوصول يكون عبر نموذج طلب. إنه ليس على منصة Tavus، ويقول سطر الشركة الختامي في الإعلان ذلك بوضوح: Griffin ليس على منصة Tavus بعد، وسيأتي بمجرد أن تتوصل Tavus إلى كيفية إطلاقه بأمان. كل ما يقارنه المشتري عادةً — التسعير لكل ثانية أو لكل طلب، ومعرّف الطراز، وحدود المعدل، واتفاقية مستوى الخدمة SLA، وقائمة المناطق — غير موجود بعد. يوجّه Tavus أي شخص يريد البناء اليوم إلى الطرازات التي يستخدمها بالفعل 150,000 مطوّر وشركة، وهي الأسلاف الثلاثة، وليس Griffin.
هذا ليس تفصيلاً تقنياً يمكن تدوينه في الحاشية. إنه يغيّر الغرض من هذا النموذج في الوقت الراهن. إنه هدف تقييمي للفرق التي يعتمد منتجها على ما إذا كان بإمكان الشخص التمييز، وإشارة إلى الاتجاه الذي تسير إليه خارطة طريق المورّد. إنه ليس شيئاً يُبنى عليه مسار موجّه للعملاء هذا الربع.
بوابة الأمان هي خطة الإصدار
أكثر ما يثير الاهتمام فيما كتبه Tavus عن Griffin ليس عن النموذج. بل هو الإقرار بأن الخصائص نفسها التي تجعل نموذج التفاعل البشري واجهة أفضل تجعله أيضاً أكثر قدرة على خداع شخص ليعتقد أنه ليس ذكاءً اصطناعياً، وأن ثمة حاجة إلى مزيد من العمل على المواءمة والسلامة قبل الإطلاق الآمن، وأن الشركة تعمل على ميزات الإفصاح وبالتعاون مع منظمات على تقييمات سلامة الذكاء الاصطناعي. وبما أن ما يقرب من نصف عينة حية لم تستطع التمييز، وأن الذين استطاعوا معظمهم أدركوا ذلك خلال عشرين ثانية، فإن آلية إفصاح تصمد أمام محادثة عابرة ليست رفاهية.
أمران سيغيّران هذا المقال جوهريًا. بطاقة نموذج منشورة تتضمن نقطة نهاية وسعرًا ستنقل Griffin من نتيجة بحثية إلى مسألة شراء. وإدخال على لوحة فيديو مستقلة — مع التحفظ بأن تلك اللوحات تُقيّم المقاطع القصيرة حسب التفضيل الزوجي ولم تُصمَّم لتقييم محادثة حية، لذا قد يكون عدم التطابق دائمًا لا مؤقتًا — سيمنح ادعاءات زمن الاستجابة والجودة تحققًا خارجيًا. وإلى أن يتحقق أحد هذين، تُعدّ مسارات VideoFDB أقوى الأدلة المتاحة، وهي تأتي بفجوة بشرية قدرها 0.09 و0.47 نقطة على التوالي.
الحجة المضادة الجديرة بالوزن هي أن تشغيل اختبار قياسي ليس نشرًا. يمنح بروتوكول NVIDIA كل نظام المهمة نفسها في تناوب الأدوار والحَكَم نفسه؛ لكنه لا يقول شيئًا عن كيفية تصرف الساعة التاسعة من مكالمة، ولا عمّا يحدث عندما يتحدث شخصان فوق بعضهما طوال دقيقة كاملة، ولا عمّا إذا كانت عناصر التحكم التعبيرية تتراجع على وجه أعادت الصورة المرجعية إنتاجه بشكل رديء. تذكر Tavus أن التدريب الخاص بالانحراف — مرحلة الفرض الذاتي وآلية السجل — هو الحل لذلك تحديدًا، والتقارير هي كل ما يملكه القارئ إلى أن يُجري شخص من خارج Tavus جلسة طويلة وينشرها. تعامل مع الاختبار القياسي باعتباره أفضل دليل متاح، لا كنتيجة نشر.
ما الذي يجب بناؤه حوله في هذه الأثناء
السؤال العملي لفريق يريد شيئًا كهذا اليوم هو ما أجزاء المكدس القابلة للشراء بالفعل. واجهة فيديو حوارية هي سلسلة — التعرف على الكلام، ونموذج لغوي، وتركيب الكلام، وفي حالة Tavus نموذج تصيير — والثلاثة الأولى سلع تجارية جاهزة. وتقع هذه خلف نقطة نهاية واحدة متوافقة مع OpenAI لدى OrcaRouter مع أكثر من 200 نموذج على المفتاح نفسه وسعر قائمة المزوّد يُمرَّر بهامش ربح 0%، لذا يصبح تخفيض سعر المورّد ساريًا هنا في اليوم نفسه بدلًا من بعد دورة تعاقد. إذا كنت تجمّع مسارًا لتفاعل وتريد إبقاء طبقة التوليد مفتوحة حتى يصبح Griffin أو شيء مثله منتجًا فعليًا، فهناك تكون تكلفة الاستبدال تغييرًا في الإعدادات بدلًا من عملية ترحيل. Tavus Griffin نفسه ليس نموذجًا موجّهًا هنا، ولن يكون كذلك ما دام معاينة خلف استمارة طلب.
الشيء الجدير بالمتابعة ليس عرضًا تجريبيًا آخر، بل ما إذا كانت أدوات الإفصاح التي تبنيها Tavus ستُنشر، وما إذا كانت مجموعة بحثية ثانية ستُعيد إنتاج بروتوكول المواجهة المباشرة. فاجتياز اختبار تورينغ بهذا الحجم هو تحديدًا نوع النتيجة التي تحتاج إلى مختبر ثانٍ لتشغيلها.

