
Tavus Griffin مقابل Alibaba Wan 2.7: نموذج حواري مقابل نموذج توليدي
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
الطريقة المغرية لمقارنة Tavus Griffin و Alibaba Wan 2.7 هي لكل ثانية من الفيديو، ولا يمكن إجراء هذه المقارنة. لدى Wan 2.7 بطاقة أسعار منشورة — 9.00 دولار للدقيقة بدقة 1080p على نقاط النهاية الدولية لـ Alibaba Cloud في سنغافورة، مع فئة أرخص في بكين وطوكيو — ولا يوجد لدى Tavus Griffin أي بطاقة أسعار على الإطلاق، لأن Griffin-Lite صدر في 1 أكتوبر 2026 كمعاينة بحثية لمختبرين موثوقين مختارين خلف نموذج طلب. ما يشتركان فيه هو كلمة: فيديو. بعد ذلك، هما إجابتان على سؤالين مختلفين. يُسأل أحدهما عما يجب أن يحدث بعد ذلك في محادثة؛ ويُسأل الآخر عن شكل مشهد موصوف. المقارنة المثيرة للاهتمام ليست الجودة، بل ما يحتاجه كل منهما منك قبل أن ينتج أي شيء، وما تحصل عليه في المقابل.
الفرق في الحلقة، وليس في الدقة.
يولّد Wan 2.7 مقطعًا تلو الآخر انطلاقًا من وصف نصي. تكتب وصفًا، فتحصل على جزء من مادة مصوّرة، وتنظر إليه، ثم تكتب وصفًا آخر. Wan 2.7 عبارة عن مجموعة من أربعة نماذج — النص إلى فيديو، والصورة إلى فيديو، والمرجع إلى فيديو، وتحرير الفيديو — والتفاعل معه تبادلي في جوهره: إدخال، وإخراج مُصيَّر، وقرار بشأن ما إذا كان سيُحتفظ به. لا يعمل منه أي شيء بينما لا تزال تقرر ما الذي ستطلبه.
غريفين مبني بالطريقة المعاكسة. إنه نظام ازدواج كامل: محرّك نمذجة تحاورية مستمرة يستقبل الصوت والفيديو ويعيد تقييم المحادثة على فترات أقل من الثانية، ويقرر ما إذا كان سيبقى صامتًا، أو يرسل إشارة، أو يُصدر إشارة استماع، أو يأخذ الدور، ويصدر عناصر تحكم تعبيرية تشغّل مولّد كلام متدفقًا ومولّد فيديو متدفقًا بالتوازي. إنه يولّد دقة 720p في أجزاء من 320 مللي ثانية من صورة فوتوغرافية مرجعية واحدة، والادعاء المهم هو أن قرارًا يُتخذ في منتصف الجملة يظهر في الصوت والوجه خلال الدور المصغّر نفسه. المعيار المرجعي لهذا ليس لوحة صدارة للمقاطع. بل هو ما إذا كان بإمكانك مقاطعته.
بعبارة واضحة: يجيب Wan 2.7 عن سؤال «كيف يبدو هذا المشهد أثناء الحركة؟»، بينما يجيب Griffin عن سؤال «ما الذي ينبغي أن يفعله هذا الوجه وهذا الصوت في المئتي ميلي ثانية القادمة، بما أن الشخص توقف للتو؟»
السعر، من الجانب الذي يوجد فيه سعر.
الأسعار المعلنة لـ Wan 2.7 محسوبة لكل ثانية من الفيديو المُنشأ، كما أن الفئات غير موحّدة عبر المجموعة كاملة، وهذا هو التفصيل الذي تتجاهله معظم صفحات المقارنة.
• wan2.7-t2v وwan2.7-i2v — تُحتسب التكلفة على مدة الإخراج فقط. سنغافورة الدولية: 0.10 دولار/ثانية عند 720p و0.15 دولار/ثانية عند 1080p، وهو ما يعادل 9.00 دولارات/دقيقة الوارد في لوحات الصدارة. بينما تُدرج بكين وطوكيو 0.086 دولار/ثانية و0.143 دولار/ثانية مقابل العمل نفسه.
• wan2.7-r2v (من مرجع إلى فيديو) — تُحتسب الرسوم بناءً على مدة فيديو الإدخال، بحد أقصى خمس ثوانٍ، يُضاف إليها الناتج. أدخل مرجعًا مدته خمس ثوانٍ في توليد مدته خمس عشرة ثانية وستُحتسب عليك عشرون ثانية.
• wan2.7-videoedit — تُحتسب التكلفة على المخرجات فقط، مع مجانية مواد الفيديو المُدخلة.
ثمة معلومتان متعلقتان بدورة الحياة يجب وضعهما بجانب تلك الأرقام. فقد طرحت Alibaba خصم إطلاق محدود المدة بنسبة 30% على واجهات Bailian وQwen Cloud الخاصة بها، وهو ساري حتى 23 سبتمبر 2026، وقد مضى هذا الموعد الآن. كما أن إشعار إيقاف Model Studio الصادر عن Alibaba Cloud (المعرّف 118434) يُخرج عدة نماذج أقدم من الخدمة في 10 أكتوبر 2026، بما في ذلك wan2.7-r2v وwan2.7-image. وهذا إيقاف على مستوى المتغيّرات لا إيقاف للجيل بأكمله — فلا يزال wan2.7-t2v وwan2.7-i2v مُدرجَين بأسعار سارية وصفحاتٍ آخر تحديث لها يعود إلى 11 سبتمبر — لكن إذا كان التحويل من المرجع إلى الفيديو هو سبب نظرك في 2.7، فإن لهذا المسار موعدًا محددًا.
المقارنة مع Griffin تتضمن عبارة صادقة واحدة: لا يوجد سعر يمكن وضعه بجانب سعر Wan 2.7، لأن Tavus لم تنشر أي سعر. Griffin-Lite ليس على منصة Tavus، ويقول الإعلان إنه لن يكون متاحًا لاستخدام العملاء في هذا الوقت، كما أن الجملة الختامية للشركة نفسها تقول إن Griffin سيأتي بمجرد أن تتوصل إلى طريقة لإطلاقه بأمان. لا يوجد سعر لكل ثانية، ولا سعر لكل طلب، ولا فئة مجانية، ولا فئة للمؤسسات. أي شخص يذكر سعرًا لـ Griffin فهو يختلقه.
درجات الجودة: لوحان لا يستوفيان
تم تقييم النموذجين باستخدام أدوات مختلفة تمامًا، ولهذا السبب لا توجد مقارنة Elo بينهما.
يحتوي Wan 2.7 على مدخلين في ساحة الفيديو التابعة لـ Artificial Analysis، وهما ليسا في المكان نفسه — وهذا هو الفخ في الاستشهاد برقم واحد له. إن Elo هناك مستمدّ من تصويتات تفضيل بشري عمياء ثنائية، وهي منهجية مصممة لمقاطع مولّدة قصيرة، وكلا القراءتين أدناه مأخوذتان من لوحات تمت قراءتها في 2 أكتوبر 2026.
• Wan2.7-260612 (إصدار يونيو) في تحويل النص إلى فيديو (مع الصوت) — المركز 13–14، Elo 1,032 (±10) عبر 4,645 صوتًا، 9.00 دولار/دقيقة.
• Wan 2.7 (إصدار أبريل) في تحويل الصورة إلى فيديو (مع الصوت) — المركز 12 من 34، إيلو 1,077 بناءً على 4,571 صوتًا، 9.00 دولار/دقيقة، لوحة تحمل عدد الأصوات نفسه تقريبًا لكنها تضعه في مرتبة أعلى بفارق ملموس.
• Wan 3.0، الشقيق الأحدث — الأول عند إيلو 1,157 في تحويل النص إلى فيديو والسادس عند 1,164 في تحويل الصورة إلى فيديو، وكلاهما بسعر 12.00 دولار/دقيقة. هذا هو الرقم الذي يستحق أن تعرفه قبل أن تقارن Wan 2.7 بأي شيء: الجيل التالي من Alibaba نفسه يتصدر الجدول، و2.7 إصدار في منتصف الجدول.

يأتي Griffin على VideoFDB التابع لـ NVIDIA، وهو معيار مرجعي للمحادثة السمعية البصرية كاملة الازدواج، طوّرته NVIDIA وقيّمته بشكل مستقل في سبتمبر 2026، باستخدام حَكَم من نموذج لغوي وفق مقياس تقييم من صفر إلى خمسة. سجّل Griffin-Lite 3.83 في مسار التوليد مقابل مرجع بشري عند 3.92، و2.80 لثاني أعلى نظام منشور، وسجّل 3.73 في مسار الإدراك مقابل مرجع بشري عند 4.20. كما تُفيد Tavus أيضًا بزمن تأخير فعلي من الصوت إلى الفيديو قدره 0.43 ثانية للمولّد مقابل أربعة خطوط أساس منشورة للانتشار التدفقي على H100s.
كلا مجموعتي الأرقام مشروعتان، ولا تصلح أي منهما للانتقال إلى سياق آخر. إن Elo في الساحة هو عدد أصوات يتعلق بتفضيل المقطع؛ أما VideoFDB فهو درجة تقييم وفق معايير يمنحها قاضٍ وتتعلق بالسلوك الحواري. لا يوجد جسر بينهما، وفخ العينة الصغيرة يعمل في الاتجاه المعاكس أيضًا: فنطاق ±10 في الساحة على Wan 2.7 واسع بما يكفي بحيث لا يكون موضعه مقابل الأنظمة المجاورة محسومًا بدقة، وفجوة التوليد البالغة 0.09 نقطة لدى NVIDIA مقابل الإنسان صغيرة بما يكفي على مقياس تقييم من خمس نقاط بحيث تكون القراءة الصادقة هي «قريب من المرجع البشري»، وليست «عند المستوى البشري». كذلك، مقارنة الإدراك ليست بين متماثلين — فالعديد من الأنظمة التي وُضع Griffin متقدمًا عليها، بما في ذلك gpt-realtime من OpenAI وMiniCPM-o 4.5، تُقيَّم في إعدادات صوتية فقط بينما يدرك Griffin الفيديو أيضًا. جزء من التقدم البالغ 0.29 نقطة إنما يقيس امتلاك عيون.
ما يحتاجه كل واحد منك
هنا تصبح المقارنة مفيدة، لأن المدخلات هي المنتجات.
• المدخل — يأخذ Wan 2.7 نصًا وصورة وفيديو وصوتًا. أما Griffin فيأخذ شخصًا مباشرًا عبر الكاميرا والميكروفون، ولا يولّد مقطعًا عند الطلب على الإطلاق.
• الإخراج — يُنتج Wan 2.7 ملف فيديو، من 2 إلى 15 ثانية لكل عملية توليد، بدقة تصل إلى 1080p، مع صوت أصلي. يُنتج Griffin محادثة مستمرة: فيديو بدقة 720p بمعدل 25 إطارًا في الثانية في مقاطع من 320 مللي ثانية، يُولَّد في الوقت الفعلي ويُشغَّل أثناء فك ترميزه.
• ما الذي يوجّهه — يُوجَّه Wan 2.7 عبر المطالبة النصية وما يصل إلى خمس صور للموضوع وخمس مقاطع مرجعية، ضمن حدّ أقصى قدره عشرة أصول مرجعية لكل طلب. أما Griffin فيُوجَّه بما يفعله الشخص: وقفة، أو نظرة بعيدًا، أو إيماءة، أو مقاطعة.
• الأفق الزمني — وحدة العمل لدى Wan 2.7 هي مقطع لا يتجاوز خمس عشرة ثانية، ثم تقوم بتجميعها. وحدة العمل لدى Griffin هي محادثة، ولهذا كان على البنية المعمارية أن تحل مشكلة الانحراف — التقطير على ثلاث مراحل إلى مولّد انحداري ذاتي، مدرَّب على تاريخه المُولَّد الخاص به كي تبقى عمليات التوليد الطويلة مستقرة — بدلًا من النضال من أجل توليد فردي أطول.
• حاوية الإخراج — يُعيد Wan 2.7 ملفًا تملكه ويمكنك تحريره وتصحيح ألوانه وتوزيعه. أما Griffin فيُعيد جلسة مُصيَّرة. لا يوجد ملف لتحريره، لأن البكسلات تُولَّد لكل مقطع من صورة مرجعية ومن سجل النموذج نفسه، والخلفية والظلال والكرسي الذي يجلس عليه الشخص جزء من التوليد.
ثمة فرق بنيوي واحد جدير بالذكر: تتناسب تكاليف Wan 2.7 مع مدة المخرجات، وتتناسب جودته مع مدى تحديد التوجيه الذي تكتبه. أما تكاليف Griffin فغير مقيسة، وتتناسب جودته مع مدى تلقائية الشخص الموجود على الطرف الآخر. يمكنك تحسين أحدهما بكتابة موجزات أفضل، والآخر لا يمكن تحسينه إلا باستخدامه مع أشخاص حقيقيين.

المرجعية والاتساق، حيث يتصادم التصميمان
يتحكم Wan 2.7 في اتساق الموضوع من خلال المراجع المزوّدة: خمس صور للموضوع، وخمسة مقاطع مرجعية، وعشرة أصول إجمالًا. إنه نهج فوتوغرافي — تُظهر له كيف يبدو الموضوع فيحافظ على ذلك المظهر عبر التوليد.
يتحكم Griffin بالشيء نفسه لكن بالطريقة المعاكسة. فهو يولّد كل بكسل في كل إطار من صورة مرجعية واحدة في الوقت الفعلي، ويوضّح الإعلان صراحةً أنه يتحكم بالمشهد كاملًا لا بالوجه: الذراعين والأصابع، وحركة الكرسي، والظلال المسقَطة والخلفية الكائنة خلفه. ويُحقَّق الاتساق هناك بجعل البيئة هدفًا للتوليد بدلًا من لوحة مركّبة.
لا يوجد نهج أفضل بشكل مطلق، وكلاهما يفشل بطريقة مختلفة. يفشل التوليد المعتمد على المرجع بالانحراف بعيداً عن الموضوع المقدم خلال مقطع طويل. يفشل التوليد المُجزَّأ مع سجل انحداري ذاتي بالتيه خلال جلسة طويلة إذا كانت معالجة الانحراف خاطئة، وهو بالضبط الفشل الذي توجد مرحلة التقطير الثالثة لمنعه. Wan 2.7 هو الخيار الأكثر أماناً عندما يكون المطلوب تسليمه شخصاً معيناً بمظهر معين. Griffin لا ينافس على هذا الموجز.
السلامة، والمنشأ، ووضعية الإصدار
لا يحمل Wan 2.7 أي نظام مُعلَن لتوثيق المصدر يُضاهي العلامة المائية التي تظل صامدة بعد الضغط — إذ يُشير الإعلان إلى جودة الصوت ودقة النص الظاهر على الشاشة بوصفهما مجالين لا يزالان بحاجة إلى تطوير، وهو تحفّظ يتعلق بمدى الدقة والإتقان لا بالأمان.
قصة السلامة الخاصة بـ Griffin معكوسة: السبب المعلن لدى Tavus للإبقاء عليه في المعاينة هو أن الخصائص نفسها التي تجعله واجهة أفضل تجعله أفضل في إقناع شخص بأنه يتحدث إلى إنسان، والأرقام تدعم هذا القلق. في دراسة الشركة الحية الخاصة بها، اعتقد 26 من 54 مشاركًا أن الطرف الآخر شخص حقيقي، مقابل 1 من 41 في منظومة Phoenix-4.5 / Raven-1 / Sparrow-2 السابقة. أما المشاركون الذين شكّوا فعلًا، فقد كانوا يميلون إلى الشك في غضون العشرين ثانية الأولى. يقول Tavus إن هناك حاجة إلى مزيد من العمل على المواءمة والإفصاح قبل الإطلاق، وإنه يبني ميزات إفصاح، وإنه يعمل مع مؤسسات على تقييمات السلامة. وهذا أكثر شيء جوهري نشره أي أحد عن هذا النموذج، وهو أيضًا السبب في عدم وجود منتج يمكن شراؤه.
لمن يقارن بينهما كأداتين، فالنتيجة العملية بسيطة: يمكن توليد إحداهما عند الطلب وتسليمها اليوم، أما الأخرى فهي هدف تقييمٍ يتوقف إطلاقه على مشكلة لم يحلّها المورّد بعد.
أي واحد، لأي غرض؟
• اختر Wan 2.7 إذا كان المُخرَج النهائي عبارة عن مادة فيديو. فالمونتاج القائم على التعليمات للمواد الموجودة هو عبء العمل الذي يتفوّق فيه بشكل استثنائي ويكون رخيصًا للغاية، لأن المونتاج يُحتسب على الإخراج فقط ويتعامل مع مادة الفيديو المُدخَلة على أنها مجانية. ويستحق متغيّره الخاص بالتحويل من مرجع إلى فيديو أن تتحقق منه مقابل الإيقاف المقرر في 10 أكتوبر قبل أن تلتزم به.
• لا تختر Griffin لأي شيء هذا الربع، لأنك لا تستطيع. اطلب الوصول إذا كنت بحاجة إلى معرفة ما إذا كان بإمكان شخص أن يميّز، أو إذا كانت خارطة طريقك تعتمد على طبقة التفاعل بدلًا من طبقة اللقطات.
• راقِب الفجوة، لا أيّاً من النموذجين. وصول Griffin يجعل المقارنة الأكثر إثارة واحدة مستقبلية: نظام يولّد المحادثة كاملة في مقابل حزمة تولّد المشهد كاملاً. أول منتج يفعل الاثنين معًا سيكون هو الجدير بإعادة قراءة هذا على ضوئه.
أين يتناسب جهاز التوجيه، وأين لا يتناسب
لا يوجد أيّ من هذين النموذجين في كتالوج OrcaRouter، ويجدر ذكر ذلك قبل أي شيء آخر في هذا القسم. يمكن الوصول إلى Wan 2.7 عبر منصات Alibaba الخاصة — Model Studio على Alibaba Cloud وQwen Cloud — وعبر أدوات إبداعية تابعة لجهات خارجية دمجته بعد الإطلاق؛ بينما لا يمكن الوصول إلى Tavus Griffin إلا عبر نموذج طلب. وإذا أصبح أيّ منهما قابلاً للتوجيه، فسيظهران بسعر قائمة المزوّد.
الجزء من مسار الفيديو الذي يُعدّ مشكلة توجيه هو النص المحيط به. قوائم اللقطات، وتوسيع المطالبات، وتوليد التسميات التوضيحية، وملخصات مراجعة الجودة، والعمل على النص المكتوب أو الحوار الذي يغذّي تمريرة تحويل المرجع إلى فيديو، كلها استدعاءات نصية، وهي تعمل على نفس نقطة النهاية المتوافقة مع OpenAI لدى OrcaRouter مثل أكثر من 200 طراز آخربسعر قائمة المزوّد مع هامش ربح مضاف بنسبة 0%، لذا يصبح تخفيض سعر المورّد ساريًا في اليوم نفسه بدلًا من الانتظار حتى انتهاء دورة تعاقد. إن تقسيم طراز رخيص على تمريرة جماعية وطراز متقدم على التمريرة النهائية هو تغيير في الإعدادات هناك بدلًا من علاقة مع مورّد ثانٍ — وهي الحجة نفسها التي تنطبق على طبقة التوليد، بمجرد أن تصبح طبقة التوليد شيئًا يمكنك استدعاؤه.
ما الذي يجب مراقبته: ما إذا كانت النسختان المرجعية والتحريرية في حزمة Wan 2.7 ستنجوان من إيقاف Model Studio في 10 أكتوبر دون تغيير، وما إذا كانت بوابة الأمان لدى Griffin ستنتج بطاقة نموذج منشورة تتضمن نقطة نهاية. هذان الحدثان هما ما سيحوّل هذه المقارنة من مقال تصميمي إلى قرار شرائي.

