
Tavus Griffin مقابل MiniMax H3: نموذج محادثة ثنائي الاتجاه يلتقي بمولّد فيديو مطروح.
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
يضع كلٌّ من Tavus Griffin وMiniMax H3 إنسانًا يتحرك ويتحدث على الشاشة، وبعد هذا الانطباع الأول، لا يكادان ينتميان إلى الفئة نفسها من المنتجات. Griffin هو نموذج تفاعل بشري — نظام فيديو-إلى-فيديو مصمم لإجراء محادثة ثنائية الاتجاه في الوقت الفعلي، أعلنت عنه Tavus في أكتوبر 2026، وهو حاليًا مقتصر على مجموعة مختارة من المختبِرين الأوائل. MiniMax H3 هو مولّد فيديو متعدد الوسائط: تعطيه موجّهًا نصيًا مع مراجع اختيارية من الصور والفيديو والصوت، فيعيد لك مقطعًا جاهزًا. يخضع أحدهما للتقييم خلف أبواب مغلقة، أما الآخر فمتاح للتنزيل والترخيص والفوترة منذ أشهر. هذا الفرق — وليس الدقة أو معدل الإطارات — هو ما يحدد أيهما ينتمي إلى منظومتك التقنية.
ما هو كل واحد منها في الحقيقة
يُعد Griffin محاولة Tavus لبناء نموذج يتصرّف كطرف مشارك بدلًا من كونه أداة عرض. تصفه الشركة بأنه أول نموذج للتفاعل البشري (Human Interaction Model)، وتقسم البنية التي نشرتها المهمة إلى قسمين: النمذجة الحوارية المستمرة (Continuous Conversational Modeling)، التي تقرر ما ينبغي للشخصية أن تفعله من لحظة إلى أخرى، والتوليد السمعي البصري (Audio-Visual Generation)، الذي يبث الكلام والوجه المتطابقين. والأهم أنه ثنائي الاتجاه بالكامل — فهو يراقب ويستمع أثناء تحدثه، لذا يمكن مقاطعته، ويمكنه التفاعل في منتصف الكلام، ولا ينتظر إشارة نظيفة لنهاية الدور قبل أن يرد. الإطار الذي تطرحه Tavus نفسها هو أن الأنظمة السابقة تعلمت توليد الوجوه؛ أما Griffin فقد بُني ليتعلم السلوك الحواري من البشر.
MiniMax H3 هو الجيل Hailuo 3، صدر في 31 يوليو 2026 وأُتيح مصدره المفتوح في 3 أغسطس 2026 بموجب رخصة MiniMax H3 Community License، مع نشر النسختين H3-Base-FL2VA وH3-Base-Ref2VA علنًا. يقرأ النصوص والصور والفيديو والمراجع الصوتية كسياق موحّد واحد، ويُعيد مقطعًا مدته من 4 إلى 15 ثانية بدقة 768P أو 2K مع صوت ستيريو أصلي، يُولَّد عبر مسار من ثلاث مراحل (H3-Context-IR، ثم H3-Base بدقة 768p، ثم H3-Regenerate-2K). إنه مولِّد بمساحة إدخال واسعة على نحو غير معتاد ورخصة متسامحة حقًا — أي كل ما لا يمتلكه Griffin حاليًا.
المواصفات، جنبًا إلى جنب

لماذا تُعدّ كلمة "duplex" هي الكلمة المثيرة للاهتمام
كل مُولِّد فيديو، بما في ذلك H3، يُحكم عليه بناءً على ما يبدو عليه المقطع بعد اكتماله. أما Griffin فيُحكم عليه بناءً على شيء لا يستطيع المقطع إظهاره: ما يحدث في الـ200 مللي ثانية التي تلي مقاطعتك له. هذه هي المشكلة التي يشير إليها تأطير Human Interaction Model، ولهذا فإن أرقام Tavus الرئيسية سلوكية وليست بصرية.
الرقم الأكثر اقتباسًا هو أن 48% من الأشخاص اعتقدوا أن Griffin شخص حقيقي بعد مكالمة فيديو مدتها دقيقة واحدة — 26 من 54 مشاركًا — مقابل 2.4% لحزمة Tavus السابقة المكوّنة من Phoenix-4.5 وSparrow-2 وRaven-1، التي لم تحقق سوى 1 من 41. كما تذكر Tavus أن الأشخاص الذين لم يقتنعوا كانوا يميلون إلى الشك خلال أول 20 ثانية، وهو تفصيل أكثر فائدة من العنوان الرئيسي: فهو يعني أن الوهم إما يصمد مبكرًا أو ينهار مبكرًا.
تأتي المجموعة الثانية من الأرقام من معيار VideoFDB من NVIDIA، الذي جرى تسجيله في سبتمبر 2026، حيث تقول Tavus إن Griffin حلّ أولاً في اختبار مستقل للذكاء الاصطناعي وجهاً لوجه. وفي جانب التوليد، سجّل Griffin 3.83 مقابل 2.80 لأقوى خط أساس مُبلّغ عنه (إعداد Gemini 2.5 مع Anam) مع مرجع بشري قدره 3.92، ومعدل تحقيق الأهداف الموكلة 62.8%. وفي الإدراك، سجّل 3.73 مقابل 3.44 لـ MiniCPM-o 4.5، و3.17 لـ Gemini 2.5 Flash Native، و2.97 لإعداد OpenAI gpt-realtime الصوتي فقط، مقابل مرجع بشري قدره 4.20 ومعدل تحقيق الأهداف الموكلة 73.8%، عبر خمسة عشر نموذجاً جرى تقييمها. وتدّعي Tavus أيضاً أن Griffin يتقدم بنسبة 37% على أفضل نظام تالٍ في التفاعل اللحظي. هذه أرقام مُبلّغ عنها من المورّد وتستند إلى معيار طوّرته NVIDIA، وينبغي قراءتها على هذا الأساس — لكن نقاط المقارنة البشرية هي الجديرة بالاحتفاظ بها، لأن 3.83 مقابل نتيجة بشرية 3.92 تمثل فجوة أصغر بكثير مما أظهره توليد الفيديو تاريخياً.
ما يمكنك شراؤه اليوم
هنا يتوقف النموذجان عن كونهما قابلين للمقارنة على الإطلاق.
MiniMax H3 هو منتج. إنه مستضاف، ويُسعَّر لكل ثانية من المخرجات المُولَّدة، ونسخه المفتوحة موجودة على مركز نماذج في انتظار التنزيل. إذا أردت مقطعًا مدته خمس عشرة ثانية بدقة 2K وصوت ستيريو لشيء غير موجود، فيمكنك الحصول على واحد بعد ظهر هذا اليوم، ويمكنك تشغيل الأوزان بنفسك إذا كنت تفضّل ألّا تستأجرها.
Tavus Griffin ليس منتجًا. توضح Tavus في مقال Griffin أن Griffin-Lite، المعاينة البحثية، متاح اليوم لمجموعة مختارة من المختبرين الأوائل، وأن إطلاقًا أوسع لنموذج أكثر قوة سيأتي لاحقًا، وأن Griffin ليس على منصة Tavus بعد ولن يصل إلا بعد أن تتوصل الشركة إلى كيفية إطلاقه بأمان. هذا قدر غير معتاد من الصراحة من مورّد حول نتيجته الأكثر إبهارًا، وهو أمر مهم عند التخطيط: لا يمكنك إدراج Griffin في خارطة طريق منتج كتبعية، ولا يمكنك تحديد سعر له، لأنه لا يوجد سعر.
إذن فسؤال التخطيط الصادق ليس «أيّهما أفضل» بل «أيّهما موجود في الطبقة التي أحتاجها».

أين يتناسب OrcaRouter
MiniMax H3 موجود في كتالوجنا. صفحة الطراز موجودة على minimax/minimax-h3، ويُحتسب سعره بالطريقة نفسها التي يفوتر بها المزوّد: 0.08 دولار لكل ثانية من المخرجات المولّدة عند دقة 768P و0.13 دولار لكل ثانية عند دقة 2K. ويمرّر OrcaRouter أسعار قائمة المزوّد بهامش ربح 0%، لذا يظهر أي تغيير في سعر MiniMax على بطاقتنا في اليوم نفسه الذي يُعلن فيه بدلًا من دورة الفوترة التالية. Griffin ليس في الكتالوج ولن يكون حتى تطرحه Tavus للعملاء — فنحن لا نستضيف طرازًا لا نستطيع تقديمه، والمعاينة البحثية المقتصرة على مختبرين مختارين ليست شيئًا يمكن لموجّه أن يوجّه إليه.
النتيجة العملية هي أن أحد هذين النموذجين لا يفصله عن تطبيقك سوى سطر كود واحد، بينما الآخر ورقة بحثية مرفقة برقم هاتف. إذا كنت توجّه بالفعل عدة نماذج فيديو ولغة، فإن الفوترة لكل ثانية على H3 تجعل هذا المسار أيضًا جديرًا بأن يوضع خلف التجاوز التلقائي عند الفشل: فالطلب الذي يصطدم بمزوّد مشبع يُعاد تنفيذه لدى مزوّد سليم بدلًا من إظهار مهلة انتهاء، وتتيح لك لغة توجيه DSL تثبيت مهام 2K على مزوّد معيّن مع ترك مسودات 768P تستقر حيث تكون السعة أرخص. ودمج النماذج هو الرافعة الأخرى الجديرة بالذكر هنا — فسعر H3 لكل ثانية منخفض بما يكفي ليكون إنفاق نموذج نصي على إعادة كتابة موجّه وإعادة قطعه قبل التوليد أرخص غالبًا من الثواني المهدورة بسبب محاولة أولى سيئة.

حيث قد تنقلب المقارنة
ثلاثة أشياء ستغيّر هذه المقارنة، وثلاثة فقط.
أولاً، إذا طرحت Tavus منتج Griffin عبر واجهة برمجة تطبيقات تجارية بسعر معلن، فإن الإطار الكامل لـ«محادثة مقابل مقطع» يصبح قرار شراء حقيقياً بدلاً من قرار جدولة، وتبدأ نسبة 48% للتفاعل وجهاً لوجه في المنافسة مباشرة مع جودة المخرجات التوليدية. ثانياً، إذا تحسنت قصة H3 في الزمن الحقيقي — وقد كانت MiniMax تطلق منتجاتها بوتيرة عدوانية — فإن مولّداً لكل ثانية يمكنه البث المباشر سيقوّض ميزة Griffin الأساسية. ثالثاً، إذا أعادت NVIDIA أو طرف محايد آخر تشغيل VideoFDB مع تضمين H3 أو خليفته، فإن الادعاء بأن Griffin هو الأول في الذكاء الاصطناعي وجهاً لوجه يتوقف عن كونه غير قابل للدحض. تقول Tavus إنها تتوقع إطلاق Griffin قريباً جداً بعد معالجة مخاوف السلامة الخاصة به؛ تلك الجملة هي الجدول الزمني بأكمله.
الخلاصة
MiniMax H3 وTavus Griffin ليسا متنافسين الآن، لأن واحدًا منهما فقط قابل للشراء. H3 هو مُولِّد شامل متعدد الوسائط، مفتوح الأوزان، يُحاسب لكل ثانية، ومُطلق تجاريًا، بسعر منشور ونافذة إخراج من 4 إلى 15 ثانية؛ أما Griffin فهو نموذج محادثة ثنائي الاتجاه بأفضل أرقام تفاعل وجهًا لوجه نشرها أي شخص، بلا API، وبلا سعر، وبيان صريح من البائع نفسه بأن العملاء لا يمكنهم استخدامه بعد. إذا كنت بحاجة إلى توليد الفيديو اليوم، فإن H3 هو الجواب ويمكن قياسه بالسنتات في الثانية. إذا كنت بحاجة إلى وجه في الوقت الفعلي يمكن مقاطعته، راقب Tavus — لكن ابنِ بقية المنتج أولاً، لأن تاريخ الإصدار جملة، وليس تاريخًا.
