
Tavus Griffin مقابل Seedance 2.5: أحدهما يولّد ثلاثين ثانية، والآخر ينتظرك حتى تكمل جملتك
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أسرع طريقة لفهم الفجوة بين Tavus Griffin و Seedance 2.5 هي النظر إلى ما يفعله كل منهما عندما تتوقف عن الكلام. Seedance 2.5، الذي أطلقه فريق Seed التابع لـ ByteDance في 31 يوليو 2026، يستمر في العمل: أعطِه موجهًا وسينتج ما يصل إلى ثلاثين ثانية من الفيديو في تمريرة واحدة، مع صوت مشترك، وبدقة ومعدل إطارات اخترتهما قبل أن تضغط على مفتاح الرجوع. Tavus Griffin، الذي أعلنت عنه Tavus في أكتوبر 2026 كمعاينة بحثية، يتوقف — ثم يبدأ مرة أخرى، لأنه كان يستمع طوال الوقت ولديه شيء ليقوله ردًا. أحد النموذجين هو محرك إنتاج يعمل دون إشراف. والآخر مشارك لا يعمل إلا إذا كنت موجودًا.
ثلاثون ثانية في لقطة واحدة
العنوان الرئيسي لـ Seedance 2.5 هو المدة. فبينما كان الإصدار السابق يقتصر على خمس عشرة ثانية كحد أقصى، ينتج 2.5 ثلاثين ثانية في جيل واحد — أي ضعف النافذة الزمنية، وهو الفرق بين لقطة ومشهد. وإلى جانب ذلك، يدعم التمديد متعدد الجولات، وقد عرضت ByteDance وضعًا فائق الطول في النسخة التجريبية حيث يُطلب من النموذج مواصلة مخرجاته الخاصة بدلًا من البدء من جديد.
سطح الإدخال واسع حتى بمعايير 2026. يمكن لطلب واحد أن يحمل ما يصل إلى نحو ثلاثين صورة وعشرة مقاطع فيديو وعشرة مقاطع صوتية كمراجع، مع أن الفيديو والصوت المرجعيين يمتد كل منهما إلى نحو ثلاثين ثانية. هذه مادة كافية لتحديد شخصية وموقع وحركة وموسيقى تصويرية دفعة واحدة. كما يأتي النموذج بمجموعة من الأوضاع المسماة التي تبدو أقرب إلى مجموعة تركيب مرئي منها إلى مربع المطالبة: وضع النموذج الأبيض والطيني للمعاينة المسبقة، والشاشة الخضراء، ومرجع الحركة، والمرجع الإبداعي. وفوق ذلك يقع التحكم على مستوى الطوابع الزمنية والتحرير على مستوى المناطق، وهنا تتوقف نافذة الثلاثين ثانية عن كونها مجرد طول وتبدأ تكون خطًا زمنيًا.
يخرج الصوت والفيديو من المسار نفسه بدلًا من دمجهما لاحقًا، وذلك عبر أكثر من عشر لغات من الحوار، وقائمة شركاء الإطلاق — XCMG، وXPeng، وLingchu Intelligence، وWeifen Zhifei، وQiongche Intelligence — تبدو وكأنها قاعدة عملاء في قطاعي الصناعة والسيارات لا في أدوات الإبداع. وإطار ByteDance نفسه هو أن Seedance 2.5 مخصص لمن يحتاج إلى مقطع مصوّر جاهز، لا إلى تفاعل.

النموذج الذي لا يوجد إلا أثناء حديثك
غريفين نظام على شكل معاكس، وتافوس صريحة بشكل غير معتاد بشأن هذا الشكل. وتسمّي غريفين أول نموذج تفاعل بشري: نظام من فيديو إلى فيديو يراقب مشاركًا ويستمع إليه أثناء محادثة ويولّد الجانب الآخر منها في الزمن الحقيقي. تنقسم المعمارية إلى النمذجة الحوارية المستمرة، التي تقرر ما ينبغي أن تفعله الشخصية لحظة بلحظة، والتوليد السمعي البصري، الذي يبثّ الكلام والوجه المتطابقين. وهو كامل الازدواجية، لذا يمكن مقاطعته، ولا يحتاج إلى إشارة نظيفة لنهاية الدور كي يستجيب.
كل شيء في التنفيذ مضبوط على الجزء التالي من الثانية بدلًا من اللقطة التالية. يعمل مرمّز الصوت Tavec عند 48 كيلوهرتز بـ40 قيمة لكل إطار عند 100 إطار في الثانية، دون كتب شيفرات، ومفكّك ترميز سببي بالكامل، وحزم لا تتجاوز 10 مللي ثانية. تُبثّ الفيديوهات بدقة 720p في كتل مدتها 320 مللي ثانية، وكامن واحد لكل ثمانية إطارات عند 25 إطارًا في الثانية، وثلاث خطوات انتشار لكل كامن، مع ضغط زمني بمقدار 8× في VAE. التقطير على ثلاث مراحل — مطابقة التوزيع، ثم الانحداري الذاتي بإجبار المعلّم، ثم الإجبار الذاتي — هو ما يجعل ثلاث خطوات انتشار قابلة للتطبيق في الوقت الفعلي. يبلغ متوسط زمن الاستجابة من الصوت إلى الفيديو 0.43 ثانية على H100s، وهو ما تقول Tavus إنه نحو نصف أسرع طريقة تالية قاستها. يحتاج استنساخ الصوت إلى عيّنة مدتها عشر ثوانٍ تقريبًا.
وبعد ذلك تأتي الجملة التي تحدد كيفية التخطيط بناءً عليه: تذكر Tavus أن Griffin-Lite، المعاينة البحثية، متاح لمجموعة مختارة من المختبرين الأوائل، وأن Griffin-Lite لن يكون متاحًا للعملاء للاستخدام في الوقت الحالي، وأن إطلاقًا أوسع لنموذج أكثر قوة سيأتي لاحقًا، وأن Griffin ليس على منصة Tavus بعد — وسيصل بمجرد أن تتوصل الشركة إلى كيفية إصداره بأمان.
الادعاءات التي يقدمها كل واحد، وقيمتها
أدلة Seedance 2.5 تتمحور في معظمها حول القدرة: ما يمكنه قبوله، وكم يمكنه العمل، وكم يكلف. أما أدلة Griffin فتتمحور في معظمها حول التأثير. في دراسة مع جامعة كوين ماري في لندن، تذكر Tavus أن 26 من 54 مشاركًا — 48% — اعتقدوا أن Griffin شخص حقيقي بعد مكالمة فيديو مدتها دقيقة واحدة، مقابل 1 من 41 (2.4%) على منظومتها السابقة Phoenix-4.5 وSparrow-2 وRaven-1، وكان المرتابون عادةً يشكّون خلال أول عشرين ثانية. معيار VideoFDB من NVIDIA، الذي سُجّل في سبتمبر 2026، يضع Griffin في المرتبة الأولى في الذكاء الاصطناعي وجهًا لوجه وفق حسابات Tavus: التوليد 3.83 مقابل 2.80 لأقوى خط أساس مُبلَّغ عنه و3.92 لبشري، والإدراك 3.73 مقابل 3.44 و4.20، وتقدّم بنسبة 37% على أفضل نظام تالٍ في التفاعل اللحظي. مُبلَّغ عنه من البائع، على معيار بنته NVIDIA — لكن المقارنات مع البشر هي التي تحمل الثقل.
لا يوجد اختبار مستقل مماثل عن "هل صدّق الجمهور ذلك؟" على Seedance 2.5، لأن هذا ليس الغرض منه. فالنموذجان يجيبان عن سؤالين مختلفين، ولا تنتقل أي من مجموعتي الأرقام إلى الأخرى.
ما يمكنك شراؤه فعليًا
Seedance 2.5 منتج له قائمة أسعار. على منصة ModelArk التابعة لـ ByteDance، يبلغ سعره 10.70 دولارات لكل مليون توكن دون إدخال فيديو و6.40 دولارات لكل مليون مع إدخال الفيديو، أي ما يعادل نحو 0.51 دولار لمقطع مدته خمس ثوانٍ بنسبة 16:9 وبدقة 480p، ونحو 1.16 دولار للمقطع نفسه بدقة 720p. يتم الوصول إليه عبر تطبيقات ByteDance للمستهلكين وعبر API على Volcano Engine Ark في الصين وBytePlus ModelArk دوليًا. يذكر موزّع واحد على الأقل أنه غير متاح في الولايات المتحدة، وتختلف المصادر حول ما إذا كانت أعلى دقة هي 720p أم 1080p — وكلاهما جدير بالمعرفة قبل كتابته في المواصفات.
غريفن ليس لديه بطاقة أسعار، ولا واجهة برمجية عامة، ولا تاريخ محدد. هذا هو قرار الشراء بأكمله، وهو يختصر السؤال أكثر مما تعترف به معظم مقالات المقارنة.

حيث يستحق جهاز التوجيه مكانه
إذا كنت تبني أي شيء يحتاج إلى كليهما — وكيل يجري محادثة وينتج أيضًا لقطات نهائية — فأنت تنظر إلى مورّدين، ولوحتي تحكم، ونظامي فواتير، ومفهومين مختلفين لما يعنيه الطلب. هذه هي نقطة الوصل حيث يكون OrcaRouter مفيدًا حقًا وليس للزينة: مفتاح واحد عبر أكثر من مائتي نموذج، مع تمرير أسعار قوائم المزودين بهامش ربح 0% بحيث يصل تخفيض سعر المورّد إلى البطاقة في اليوم نفسه، التحويل التلقائي عند الفشل بحيث لا يصبح مزوّد واحد مشبع انقطاعك، ولغة توجيه (DSL) لتثبيت المهام الحرجة على خلفية محددة بينما تذهب المسودات إلى حيث السعة الأرخص. يهم اندماج النماذج عند الهوامش هنا أيضًا — بالنسبة لمولّد مسعّر لكل رمز أو لكل ثانية، إنفاق نموذج نصي رخيص لصقل المطالبة قبل إنفاق التوليد المكلف هو عادةً أعلى سطر عائد في خط الأنابيب.
لكي نكون دقيقين بشأن النموذجين المذكورين في العنوان: لا يُعدّ Seedance 2.5 ولا Griffin مسارًا في OrcaRouter. يمكن الوصول إلى Seedance عبر منصات ByteDance الخاصة وموزّعين من أطراف ثالثة؛ أما Griffin فلا يمكن الوصول إليه إطلاقًا. ما يحمله الكتالوج فعلًا في جانب الفيديو هو minimax/minimax-h3، مولّد MiniMax الشامل متعدد الوسائط، بسعر 0.08 دولار لكل ثانية من المخرجات عند 768P و0.13 دولار لكل ثانية عند 2K، ويُباع بوحدات الثواني نفسها التي يُباع بها Seedance ومتاح الآن.

الأسئلة الشائعة، باختصار
هل يمكنني تشغيل Seedance 2.5 وGriffin في المنتج نفسه؟معماريًا نعم، وهذا هو التقسيم البديهي: Seedance لأي شيء يمكن تحضيره مسبقًا، وGriffin للسطح المباشر. تجاريًا لا، لأن Griffin ليس قابلاً للبيع لك بعد.
هل Griffin مجرد مولّد لرؤوس متحدثة؟ لا، وTavus حريصة على التمييز — مولّد الرؤوس المتحدثة يأخذ النص ويعيد فيديو، بينما يأخذ Griffin فيديو المشارك وصوته كمدخلات، ويُقيَّم على ما إذا كان يتفاعل في اللحظة.
هل يقوم Seedance 2.5 بالمعالجة في الوقت الفعلي؟ لا. فهو مُولِّد دفعي بسقف ثلاثين ثانية ووضع تمديد متعدد الجولات؛ فزمن الاستجابة ليس المحور الذي يتنافس فيه.
الخلاصة
Seedance 2.5 هو محرك إنتاج تم إطلاقه فعليًا: ثلاثون ثانية في تمريرة واحدة، وصوت متزامن، وما يصل إلى ثلاثين صورة وعشر مراجع فيديو وصوت، وتحكم على مستوى الطوابع الزمنية والمنطقة، ونحو 0.51 دولار لمقطع مدته خمس ثوانٍ بدقة 480p ونحو 1.16 دولار بدقة 720p على ModelArk، وهو متاح الآن عبر منصات ByteDance الخاصة، وليس في الولايات المتحدة بحسب ما استطاع أي شخص تأكيده. Tavus Griffin ليس منتجًا: بل هو نموذج تفاعل بشري ثنائي الاتجاه، وإنجازاته المنشورة هي أن 48% من المشاركين اعتقدوا أنه بشر في مكالمة مدتها دقيقة واحدة، ومتوسط زمن استجابة من الصوت إلى الفيديو قدره 0.43 ثانية على H100s، وقد قال مورّده كتابةً إن العملاء لا يستطيعون استخدامه بعد. إذا كنت بحاجة إلى لقطات اليوم، فإن Seedance هو الجواب، وسعره معلن للعموم. وإذا كنت بحاجة إلى وجه يتفاعل أثناء حديثك، فالجواب أنه لا أحد يبيع واحدًا بعد.
