بطاقة عنوان رئيسية لـ 'Tavus Griffin vs Seedance 2.5' مع عنوان فرعي: 'أحدهما يولّد ثلاثين ثانية، والآخر ينتظرك حتى تُكمل جملتك'، فوق أربع شرائح: Seedance 2.5 ‏30 ثانية في تمريرة واحدة؛ Seedance 2.5 نحو 0.51 دولار لكل 5 ثوانٍ بدقة 480p؛ Griffin ‏0.43 ثانية من الصوت إلى الفيديو؛ Griffin غير قابل للبيع للعملاء بعد.
Guides & Insights

Tavus Griffin مقابل Seedance 2.5: أحدهما يولّد ثلاثين ثانية، والآخر ينتظرك حتى تكمل جملتك

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أسرع طريقة لفهم الفجوة بين Tavus Griffin و Seedance 2.5 هي النظر إلى ما يفعله كل منهما عندما تتوقف عن الكلام. Seedance 2.5، الذي أطلقه فريق Seed التابع لـ ByteDance في 31 يوليو 2026، يستمر في العمل: أعطِه موجهًا وسينتج ما يصل إلى ثلاثين ثانية من الفيديو في تمريرة واحدة، مع صوت مشترك، وبدقة ومعدل إطارات اخترتهما قبل أن تضغط على مفتاح الرجوع. Tavus Griffin، الذي أعلنت عنه Tavus في أكتوبر 2026 كمعاينة بحثية، يتوقف — ثم يبدأ مرة أخرى، لأنه كان يستمع طوال الوقت ولديه شيء ليقوله ردًا. أحد النموذجين هو محرك إنتاج يعمل دون إشراف. والآخر مشارك لا يعمل إلا إذا كنت موجودًا.

ثلاثون ثانية في لقطة واحدة

العنوان الرئيسي لـ Seedance 2.5 هو المدة. فبينما كان الإصدار السابق يقتصر على خمس عشرة ثانية كحد أقصى، ينتج 2.5 ثلاثين ثانية في جيل واحد — أي ضعف النافذة الزمنية، وهو الفرق بين لقطة ومشهد. وإلى جانب ذلك، يدعم التمديد متعدد الجولات، وقد عرضت ByteDance وضعًا فائق الطول في النسخة التجريبية حيث يُطلب من النموذج مواصلة مخرجاته الخاصة بدلًا من البدء من جديد.

سطح الإدخال واسع حتى بمعايير 2026. يمكن لطلب واحد أن يحمل ما يصل إلى نحو ثلاثين صورة وعشرة مقاطع فيديو وعشرة مقاطع صوتية كمراجع، مع أن الفيديو والصوت المرجعيين يمتد كل منهما إلى نحو ثلاثين ثانية. هذه مادة كافية لتحديد شخصية وموقع وحركة وموسيقى تصويرية دفعة واحدة. كما يأتي النموذج بمجموعة من الأوضاع المسماة التي تبدو أقرب إلى مجموعة تركيب مرئي منها إلى مربع المطالبة: وضع النموذج الأبيض والطيني للمعاينة المسبقة، والشاشة الخضراء، ومرجع الحركة، والمرجع الإبداعي. وفوق ذلك يقع التحكم على مستوى الطوابع الزمنية والتحرير على مستوى المناطق، وهنا تتوقف نافذة الثلاثين ثانية عن كونها مجرد طول وتبدأ تكون خطًا زمنيًا.

يخرج الصوت والفيديو من المسار نفسه بدلًا من دمجهما لاحقًا، وذلك عبر أكثر من عشر لغات من الحوار، وقائمة شركاء الإطلاق — XCMG، وXPeng، وLingchu Intelligence، وWeifen Zhifei، وQiongche Intelligence — تبدو وكأنها قاعدة عملاء في قطاعي الصناعة والسيارات لا في أدوات الإبداع. وإطار ByteDance نفسه هو أن Seedance 2.5 مخصص لمن يحتاج إلى مقطع مصوّر جاهز، لا إلى تفاعل.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

النموذج الذي لا يوجد إلا أثناء حديثك

غريفين نظام على شكل معاكس، وتافوس صريحة بشكل غير معتاد بشأن هذا الشكل. وتسمّي غريفين أول نموذج تفاعل بشري: نظام من فيديو إلى فيديو يراقب مشاركًا ويستمع إليه أثناء محادثة ويولّد الجانب الآخر منها في الزمن الحقيقي. تنقسم المعمارية إلى النمذجة الحوارية المستمرة، التي تقرر ما ينبغي أن تفعله الشخصية لحظة بلحظة، والتوليد السمعي البصري، الذي يبثّ الكلام والوجه المتطابقين. وهو كامل الازدواجية، لذا يمكن مقاطعته، ولا يحتاج إلى إشارة نظيفة لنهاية الدور كي يستجيب.

كل شيء في التنفيذ مضبوط على الجزء التالي من الثانية بدلًا من اللقطة التالية. يعمل مرمّز الصوت Tavec عند 48 كيلوهرتز بـ40 قيمة لكل إطار عند 100 إطار في الثانية، دون كتب شيفرات، ومفكّك ترميز سببي بالكامل، وحزم لا تتجاوز 10 مللي ثانية. تُبثّ الفيديوهات بدقة 720p في كتل مدتها 320 مللي ثانية، وكامن واحد لكل ثمانية إطارات عند 25 إطارًا في الثانية، وثلاث خطوات انتشار لكل كامن، مع ضغط زمني بمقدار 8× في VAE. التقطير على ثلاث مراحل — مطابقة التوزيع، ثم الانحداري الذاتي بإجبار المعلّم، ثم الإجبار الذاتي — هو ما يجعل ثلاث خطوات انتشار قابلة للتطبيق في الوقت الفعلي. يبلغ متوسط زمن الاستجابة من الصوت إلى الفيديو 0.43 ثانية على H100s، وهو ما تقول Tavus إنه نحو نصف أسرع طريقة تالية قاستها. يحتاج استنساخ الصوت إلى عيّنة مدتها عشر ثوانٍ تقريبًا.

وبعد ذلك تأتي الجملة التي تحدد كيفية التخطيط بناءً عليه: تذكر Tavus أن Griffin-Lite، المعاينة البحثية، متاح لمجموعة مختارة من المختبرين الأوائل، وأن Griffin-Lite لن يكون متاحًا للعملاء للاستخدام في الوقت الحالي، وأن إطلاقًا أوسع لنموذج أكثر قوة سيأتي لاحقًا، وأن Griffin ليس على منصة Tavus بعد — وسيصل بمجرد أن تتوصل الشركة إلى كيفية إصداره بأمان.

الادعاءات التي يقدمها كل واحد، وقيمتها

أدلة Seedance 2.5 تتمحور في معظمها حول القدرة: ما يمكنه قبوله، وكم يمكنه العمل، وكم يكلف. أما أدلة Griffin فتتمحور في معظمها حول التأثير. في دراسة مع جامعة كوين ماري في لندن، تذكر Tavus أن 26 من 54 مشاركًا — 48% — اعتقدوا أن Griffin شخص حقيقي بعد مكالمة فيديو مدتها دقيقة واحدة، مقابل 1 من 41 (2.4%) على منظومتها السابقة Phoenix-4.5 وSparrow-2 وRaven-1، وكان المرتابون عادةً يشكّون خلال أول عشرين ثانية. معيار VideoFDB من NVIDIA، الذي سُجّل في سبتمبر 2026، يضع Griffin في المرتبة الأولى في الذكاء الاصطناعي وجهًا لوجه وفق حسابات Tavus: التوليد 3.83 مقابل 2.80 لأقوى خط أساس مُبلَّغ عنه و3.92 لبشري، والإدراك 3.73 مقابل 3.44 و4.20، وتقدّم بنسبة 37% على أفضل نظام تالٍ في التفاعل اللحظي. مُبلَّغ عنه من البائع، على معيار بنته NVIDIA — لكن المقارنات مع البشر هي التي تحمل الثقل.

لا يوجد اختبار مستقل مماثل عن "هل صدّق الجمهور ذلك؟" على Seedance 2.5، لأن هذا ليس الغرض منه. فالنموذجان يجيبان عن سؤالين مختلفين، ولا تنتقل أي من مجموعتي الأرقام إلى الأخرى.

ما يمكنك شراؤه فعليًا

Seedance 2.5 منتج له قائمة أسعار. على منصة ModelArk التابعة لـ ByteDance، يبلغ سعره 10.70 دولارات لكل مليون توكن دون إدخال فيديو و6.40 دولارات لكل مليون مع إدخال الفيديو، أي ما يعادل نحو 0.51 دولار لمقطع مدته خمس ثوانٍ بنسبة 16:9 وبدقة 480p، ونحو 1.16 دولار للمقطع نفسه بدقة 720p. يتم الوصول إليه عبر تطبيقات ByteDance للمستهلكين وعبر API على Volcano Engine Ark في الصين وBytePlus ModelArk دوليًا. يذكر موزّع واحد على الأقل أنه غير متاح في الولايات المتحدة، وتختلف المصادر حول ما إذا كانت أعلى دقة هي 720p أم 1080p — وكلاهما جدير بالمعرفة قبل كتابته في المواصفات.

غريفن ليس لديه بطاقة أسعار، ولا واجهة برمجية عامة، ولا تاريخ محدد. هذا هو قرار الشراء بأكمله، وهو يختصر السؤال أكثر مما تعترف به معظم مقالات المقارنة.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

حيث يستحق جهاز التوجيه مكانه

إذا كنت تبني أي شيء يحتاج إلى كليهما — وكيل يجري محادثة وينتج أيضًا لقطات نهائية — فأنت تنظر إلى مورّدين، ولوحتي تحكم، ونظامي فواتير، ومفهومين مختلفين لما يعنيه الطلب. هذه هي نقطة الوصل حيث يكون OrcaRouter مفيدًا حقًا وليس للزينة: مفتاح واحد عبر أكثر من مائتي نموذج، مع تمرير أسعار قوائم المزودين بهامش ربح 0% بحيث يصل تخفيض سعر المورّد إلى البطاقة في اليوم نفسه، التحويل التلقائي عند الفشل بحيث لا يصبح مزوّد واحد مشبع انقطاعك، ولغة توجيه (DSL) لتثبيت المهام الحرجة على خلفية محددة بينما تذهب المسودات إلى حيث السعة الأرخص. يهم اندماج النماذج عند الهوامش هنا أيضًا — بالنسبة لمولّد مسعّر لكل رمز أو لكل ثانية، إنفاق نموذج نصي رخيص لصقل المطالبة قبل إنفاق التوليد المكلف هو عادةً أعلى سطر عائد في خط الأنابيب.

لكي نكون دقيقين بشأن النموذجين المذكورين في العنوان: لا يُعدّ Seedance 2.5 ولا Griffin مسارًا في OrcaRouter. يمكن الوصول إلى Seedance عبر منصات ByteDance الخاصة وموزّعين من أطراف ثالثة؛ أما Griffin فلا يمكن الوصول إليه إطلاقًا. ما يحمله الكتالوج فعلًا في جانب الفيديو هو minimax/minimax-h3، مولّد MiniMax الشامل متعدد الوسائط، بسعر 0.08 دولار لكل ثانية من المخرجات عند 768P و0.13 دولار لكل ثانية عند 2K، ويُباع بوحدات الثواني نفسها التي يُباع بها Seedance ومتاح الآن.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

الأسئلة الشائعة، باختصار

هل يمكنني تشغيل Seedance 2.5 وGriffin في المنتج نفسه؟معماريًا نعم، وهذا هو التقسيم البديهي: Seedance لأي شيء يمكن تحضيره مسبقًا، وGriffin للسطح المباشر. تجاريًا لا، لأن Griffin ليس قابلاً للبيع لك بعد.

هل Griffin مجرد مولّد لرؤوس متحدثة؟ لا، وTavus حريصة على التمييز — مولّد الرؤوس المتحدثة يأخذ النص ويعيد فيديو، بينما يأخذ Griffin فيديو المشارك وصوته كمدخلات، ويُقيَّم على ما إذا كان يتفاعل في اللحظة.

هل يقوم Seedance 2.5 بالمعالجة في الوقت الفعلي؟ لا. فهو مُولِّد دفعي بسقف ثلاثين ثانية ووضع تمديد متعدد الجولات؛ فزمن الاستجابة ليس المحور الذي يتنافس فيه.

الخلاصة

Seedance 2.5 هو محرك إنتاج تم إطلاقه فعليًا: ثلاثون ثانية في تمريرة واحدة، وصوت متزامن، وما يصل إلى ثلاثين صورة وعشر مراجع فيديو وصوت، وتحكم على مستوى الطوابع الزمنية والمنطقة، ونحو 0.51 دولار لمقطع مدته خمس ثوانٍ بدقة 480p ونحو 1.16 دولار بدقة 720p على ModelArk، وهو متاح الآن عبر منصات ByteDance الخاصة، وليس في الولايات المتحدة بحسب ما استطاع أي شخص تأكيده. Tavus Griffin ليس منتجًا: بل هو نموذج تفاعل بشري ثنائي الاتجاه، وإنجازاته المنشورة هي أن 48% من المشاركين اعتقدوا أنه بشر في مكالمة مدتها دقيقة واحدة، ومتوسط زمن استجابة من الصوت إلى الفيديو قدره 0.43 ثانية على H100s، وقد قال مورّده كتابةً إن العملاء لا يستطيعون استخدامه بعد. إذا كنت بحاجة إلى لقطات اليوم، فإن Seedance هو الجواب، وسعره معلن للعموم. وإذا كنت بحاجة إلى وجه يتفاعل أثناء حديثك، فالجواب أنه لا أحد يبيع واحدًا بعد.