MiniMax H3 (Hailuo 3.0): نموذج الفيديو بالذكاء الاصطناعي بدقة 2K مع الإشارة الشاملة، شرح
Guides & Insights

MiniMax H3 (Hailuo 3.0): نموذج الفيديو بالذكاء الاصطناعي بدقة 2K مع الإشارة الشاملة، شرح

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

MiniMax H3 — المعروف أيضًا باسم Hailuo 3.0 — هو أحدث نموذج لتوليد الفيديو بالذكاء الاصطناعي من MiniMax؛ أُزيح الستار عنه في WAIC 2026 (17 يوليو 2026)، وأُتيح للجمهور في 31 يوليو، وأصبح متاحًا الآن بأربع طرق في آن واحد: عبر منصة Hailuo من MiniMax، وعبر Luma Agents، وتنزيل الأوزان المفتوحة، وعبر AI Gateway من Vercel منذ 30 أغسطس، حيث أُطلق إلى جانبه نموذج MiniMax H3 Max الجديد الذي يعطي الأولوية للسرعة. يدفع هذا النموذج خط إنتاج الفيديو من MiniMax إلى دقة 2K أصلية، ويضيف صوتًا متزامنًا في تمريرة واحدة، ويقدّم نظام تحكم «omni-reference» ثريًا بشكل غير مألوف. وتتمثل أحدث التطورات في جانب الاستضافة الذاتية: فمنذ 1 سبتمبر، يمكن تقديم أوزان H3-Base المفتوحة عبر vLLM-Omni مع FastH3 من FastVideo، وهو سريع بما يكفي لتوليد ملف MP4 كامل بفيديو وصوت لمدة 10.1 ثانية في حوالي 8.7 ثوانٍ — أي أسرع من مدة تشغيله. يشرح هذا الدليل ما هو H3 في الحقيقة، وما الجديد حقًّا فيه، وأين يقع بين نماذج الفيديو الحدودية لعام 2026 — مع توثيق مصادر القدرات ووسم ادعاءات الجودة بوضوح.

ملاحظة بشأن الدقة: قدرات H3 مستمدة من إعلان MiniMax ووثائق منصته. توفر Vercel AI Gateway مؤكد — إذ يضم كتالوج نماذج Vercel كلاً من MiniMax H3 وMiniMax H3 Max، كما يوثّق سجل تغييرات Vercel خصم الإطلاق — على أن شروط العرض الترويجي نفسها معلنة من البائع. أما تكامل Luma Agents وإصدار الأوزان المفتوحة فلا يزالان معلنَين من البائع فقط حتى وقت كتابة هذا النص؛ فوثائق منتجات Luma الخاصة لا تدرج H3 بعد، وشروط الوصول إلى التكامل غير واضحة. جودة الفيديو ذاتية إلى حد كبير وتُقيَّم عبر حلبات التفضيل البشري؛ ولدى H3 الآن درجات مبكرة في حلبات Artificial Analysis — نحو 1,184 لتحويل الصورة إلى فيديو و1,226 لتحويل النص إلى فيديو مع الصوت، سُجّلت في 27 أغسطس 2026 — غير أن ترتيب الحلبات يتغير مع تراكم الأصوات. أما الرقم الصادر في 1 سبتمبر عن الخدمة الأسرع من زمن التشغيل — أي إنتاج مقطع MP4 كامل مدته 10.1 ثانية مع صوت متزامن في نحو 8.7 ثوانٍ — فقد أورده فريق vLLM-Omni في منشور على مدونته الخاصة، وقيس على خادم يتكوّن من 8 وحدات NVIDIA B300؛ وهو معيار من الفريق لم يُكرَّر بعد بشكل مستقل، ويقيس FastH3، وهو النسخة المُكيَّفة المقطَّرة من FastVideo ذات الخطوات الأربع، لا النموذج الأساسي الكامل. تعامل مع الادعاءات المقارنة حول «أيُّها يبدو أفضل» بوصفها أولية. المواصفات والأسعار قابلة للتغيّر — تحقّق قبل أن تبني.

الخلاصة: H3 هو نموذج أصلي بدقة 2K وبمعدل 24 إطارًا في الثانية لتوليد الفيديو من النص ومن الصور، وينتج مقاطع من 5 إلى 15 ثانية (قابلة للتمديد إلى ~30 ثانية) مع حوار متزامن ومؤثرات صوتية وأجواء محيطة في تمريرة واحدة. أبرز ميزاته هي المرجع الشامل (حتى 9 صور مرجعية، و3 مقاطع فيديو، و3 مقاطع صوتية لضمان الاتساق) والتحرير المستند إلى التعليمات (تغيير الشخصيات أو الأشياء أو المشاهد أو الصوت أو الإيقاع دون إعادة التوليد). ومنذ إطلاقه انتشر بسرعة: أصبحت الأوزان الأساسية مفتوحة في 3 أغسطس، وأعلنت MiniMax عن H3 في Luma Agents في 6 أغسطس (حتى 15 ثانية من فيديو بدقة 2K مع صوت ستيريو أصلي، رغم أن شروط الوصول ليست علنية بعد)، وفي 30 أغسطس، وصل H3 وH3 Max من MiniMax إلى بوابة AI Gateway من Vercel مع خصم إطلاق 50% لمدة أسبوعين. ومنذ 1 سبتمبر، يمكن أيضًا استخدام الأوزان الأساسية المفتوحة للتوليد في الوقت الفعلي: عبر vLLM-Omni مع FastH3 من FastVideo، يُصيّر مقطع MP4 كامل مدته 10.1 ثانية (فيديو وصوت) في حوالي 8.7 ثوانٍ — أي أسرع من مدة التشغيل، وفقًا لمعيار فريق vLLM-Omni. ويُعد خطوة كبيرة مقارنةً بـ Hailuo 2.3 (الذي كان بدقة 1080p ومدته ~10 ثوانٍ دون مرجع شامل)، وينافس Kling 3.0 وGoogle Veo 3.1 وByteDance Seedance 2.0 وغيرها — وهو قوي على صعيدي التحكم والصوت، بينما لا تزال نتائج التصنيف المستقلة المبكرة بحاجة إلى الثبات.

النقاط الرئيسية

• H3 = Hailuo 3.0، أحدث نموذج فيديو من Mini​Max، تم الكشف عنه في WAIC 2026 وأُصدر في 31 يوليو؛ وهو متاح عبر Hailuo وLuma Agents والأوزان المفتوحة وبوابة Vercel للذكاء الاصطناعي.

• 2K أصلي بمعدل 24 إطارًا في الثانية، مقاطع مدتها 5–15 ثانية (قابلة للتمديد حتى ~30 ثانية)، نسب عرض متعددة، تحويل النص إلى فيديو وتحويل الصورة إلى فيديو.

• مرجع شامل: ما يصل إلى 9 صور و3 مقاطع فيديو و3 مقاطع صوتية كمراجع لتناسق الأسلوب والشخصية والحركة والصوت.

• حوار متزامن، مؤثرات صوتية، وأجواء تم إنشاؤها في مسار واحد؛ تحرير قائم على التعليمات دون إعادة توليد كاملة.

• الأوزان الأساسية أصبحت مفتوحة المصدر في 3 أغسطس بموجب ترخيص مجتمعي؛ بينما تبقى وحدتا Context-IR و2K-regeneration متاحتين عبر واجهة برمجة التطبيقات فقط.

في 30 أغسطس، تم إطلاق MiniMax H3 وMiniMax H3 Max على AI Gateway من Vercel مع خصم إطلاق بنسبة 50% حتى 13 سبتمبر.

منذ 1 سبتمبر، يمكن خدمة أوزان H3-Base المفتوحة للتوليد في الوقت الفعلي — حيث يتم عرض ملف MP4 للفيديو والصوت مدته 10.1 ثانية في حوالي 8.7 ثانية، أسرع من زمن التشغيل — عبر vLLM-Omni وFastH3 من FastVideo (معيار مُبلغ عنه من الفريق، ولم يُعاد إنتاجه بشكل مستقل بعد).

• ترقية كبيرة مقارنة بـ Hailuo 2.3 (1080p، ~10 ثوانٍ)؛ تنافس Kling 3.0، Veo 3.1، Seedance 2.0، Wan 2.7، وغيرها.

ما هو MiniMax H3 في الواقع

Mini​Max هي شركة صينية كبرى في مجال الذكاء الاصطناعي (أكملت اكتتابًا عامًا أوليًا في بورصة هونغ كونغ في يناير 2026، ويُقال إنها جمعت نحو 619 مليون دولار أمريكي بتقييم يبلغ حوالي 4 مليارات دولار، مع مستثمرين يشملون Alibaba وTencent). علامتها التجارية الاستهلاكية للفيديو هي Hailuo، المعروفة بمحاكاة الفيزياء الرائدة في فئتها، والتوليد السريع، والأسعار المناسبة. H3 هو الجيل الثالث من نموذج Hailuo، الذي كُشف عنه إلى جانب نموذج النصوص M3 من Mini​Max وحلول الوسائط المتعددة الأخرى في WAIC 2026، وأُطلق للجمهور في 31 يوليو 2026. وبينما M3 هو نموذج لغة نصي/وكيل، فإن H3 هو نموذج لتوليد الفيديو بامتياز.

ما الجديد: 2K، omni-reference، وصوت تمريرة واحدة

ثلاثة أشياء تحدد H3. أولاً، دقة 2K أصلية بمعدل 24 إطارًا في الثانية — وهي خطوة تصاعدية عن دقة 1080p لـ Hailuo 2.3 — بمعدل إطارات سينمائي، مع مقاطع من 5 إلى 15 ثانية (قابلة للتمديد إلى حوالي 30 ثانية عبر أداة Extend) ونسب عرض إلى ارتفاع من 21:9 إلى 9:16. ثانيًا، المرجع الشامل: يمكنك إدخال ما يصل إلى 9 صور مرجعية و3 مقاطع فيديو و3 مقاطع صوتية في وقت واحد لتثبيت الأسلوب وهوية الشخصية والحركة أو الصوت — سطح تحكم كريم بشكل غير معتاد للحفاظ على شخصية أو مظهر متسق عبر اللقطات. ثالثًا، الصوت المتزامن في تمريرة واحدة: يقوم H3 بتوليد الحوار والمؤثرات الصوتية والأجواء المحيطة الموقوتة مع الحركة على الشاشة، بدلاً من الحاجة إلى خطوة صوتية منفصلة.

التحرير القائم على التعليمات

من الميزات المهمة غير البارزة التحرير القائم على التعليمات: فبدلاً من إعادة إنشاء مقطع من الصفر لإجراء تغيير، يمكنك وصف تعديل — استبدال شخصية، تغيير كائن، تبديل المشهد، ضبط الصوت، أو إعادة توقيت اللقطة — ويقوم H3 بتطبيقه. بالنسبة للعمل الإبداعي التكراري، فإن التحرير في المكان بدلاً من إعادة رمي النرد على توليد جديد يمثل ميزة حقيقية في سير العمل.

كيف يقارن بـ Hailuo 2.3

القفزة الجيلية واضحة: H3 ينتقل من 1080p إلى 2K أصلي، ويمدّ الحد الأقصى لطول التوليد الواحد من حوالي 10 ثوانٍ إلى 15 (مع تمديد 30 ثانية)، ويضيف كلًا من المدخلات المرجعية الشاملة والتحرير القائم على التعليمات، وهو ما افتقر إليه 2.3. إذا كنت تستخدم Hailuo 2.3، فإن H3 هو ترقية مباشرة من حيث الدقة والطول والتحكم والصوت.

أين يقع H3 في حدود 2026

يحمل H3 الآن نتائج مبكرة من منصة Artificial Analysis arena — حوالي 1,184 في تحويل الصورة إلى فيديو و1,226 في تحويل النص إلى فيديو مع الصوت، التُقطت في 27 أغسطس 2026 — ومع أن ترتيبات المنصة تتغير مع تراكم الأصوات، فاحكم عليه عبر تجاربك الخاصة بدلًا من أي ادعاء منفرد.

ملاحظة حول O​penAI Sora

إذا كنت ترسم خريطة المجال: أوقفت O​penAI تجارب الويب والتطبيقات الخاصة بـ Sora في أبريل 2026، ومن المقرر أن ينتهي واجهة برمجة التطبيقات (API) في سبتمبر 2026 — لذا فإن Sora ليس نموذجًا للبدء في سير عمل فيديو جديدة. الحدود الحية هي المجموعة المذكورة أعلاه، وH3 ينضم إليها.

كيفية الوصول إلى H3 وبقية الحقل

أصبح H3 الآن قابلًا للوصول بأربع طرق، وقد ازدادت هذه القائمة منذ الإطلاق.

• Hailuo (منصة MiniMax الخاصة): المنتج الكامل، بما في ذلك التحرير القائم على التعليمات ورفع الدقة إلى 2K باستخدام H3-Regenerate-2K.

• Luma Agents: أعلنت MiniMax في 6 أغسطس 2026 أن H3 أصبح متاحًا الآن في منتج Agents متعدد النماذج من Luma، حيث ينتج ما يصل إلى 15 ثانية من فيديو بدقة 2K مع صوت ستيريو أصلي. هذا إعلان من البائع، وشروط الوصول غير معلنة بعد — وثائق منتجات Luma نفسها لا تدرج H3 حتى كتابة هذه السطور — لذا توقع أن تتضح تفاصيل التسعير والأهلية قريبًا. استضافة Luma لنموذج فيديو منافس داخل منتج Agents الخاص بها هو مؤشر على مدى قابلية التبادل في سوق نماذج الفيديو لعام 2026.

• بوابة Vercel AI Gateway: في 30 أغسطس 2026، أعلنت Mini​Max وVercel أن كلاً من MiniMax H3 وMiniMax H3 Max متاحان عبر بوابة Vercel AI Gateway، مع احتساب الطلبات الممرَّرة عبر البوابة بخصم 50% من 30 أغسطس حتى 13 سبتمبر 2026. معرّفات الطرازات — minimax/minimax-h3 وminimax/minimax-h3-max — لم تتغيّر، لذا فإن عمليات التكامل الحالية مع البوابة ستحصل على السعر المخفَّض دون أي تغيير في الكود. تم تأكيد توفّر النماذج في كتالوج نماذج Vercel وسجل التغييرات؛ وشروط العرض أعلنها البائع.

• الأوزان المفتوحة: في 3 أغسطس 2026، أصدرت MiniMax الأوزان الأساسية لنموذج H3 — محولًا كثيفًا بحجم 33B باسم H3-Base — على Hugging Face وModelScope بموجب رخصة مجتمع MiniMax H3، على شكل نسختين: H3-Base-FL2VA لتوليد الفيديو/الصوت من النص وتوليد الإطارات المفتاحية، وH3-Base-Ref2VA للتوليد المستند إلى المرجع. اثنتان من وحدات النظام الثلاث — H3-Context-IR (المعالج المسبق للمطالبة) وH3-Regenerate-2K (وحدة رفع الدقة إلى 2K) — غير مشمولتين في الإصدار المفتوح وتبقيان متاحتين عبر API فقط، لذا يظل التشغيل الذاتي مقصورًا على دقة أقل من 2K. ومنذ 1 سبتمبر، يمكن تشغيل نفس الأوزان الأساسية للتوليد اللحظي عبر vLLM-Omni وFastH3 من FastVideo — وهو مهايئ مقطّر رباعي الخطوات يولّد ملف MP4 كاملًا يجمع بين فيديو وصوت بمدة 10.1 ثانية في نحو 8.7 ثانية على خادم يضم 8 معالجات NVIDIA B300، أي أسرع من مدة تشغيله (وفقًا لما أبلغه الفريق، ولم تُستنسَخ النتيجة بشكل مستقل بعد).

MiniMax H3 متاح على OrcaRouter بسعر القائمة لدى المزوّد — 0.08 دولار في الثانية بدقة 768p و0.13 دولار في الثانية بدقة 2K — يُمرَّر السعر بهامش ربح 0% مع تجاوز تلقائي للفشل، لذا يمكنك استدعاء عائلة H3 عبر واجهة برمجة تطبيقات واحدة متوافقة مع O​penAI بدلاً من توصيل نقطة نهاية من أحد المزوّدين عمرها أيام. ولأنه لا يوجد مزوّد واحد يستضيف كل نموذج، فإن النمط العملي هو تمرير حركة نماذج اللغة الكبيرة والوكلاء عبر نقطة نهاية واحدة (يحمل OrcaRouter أيضًا نموذج النص M3 الخاص بـ Mini​Max) واستخدام أفضل نموذج فيديو لكل مشروع مباشرة. MiniMax H3 Max ليس موجَّهًا عبر OrcaRouter بعد — إذ يُقدَّم حاليًا عبر قنوات طرف ثالث — لذا إذا كنت تختبر نموذجًا أوليًا بالاعتماد عليه، فإن عادة التجاوز التلقائي تؤتي ثمارها: جرّب نموذجًا عمره أيام دون أن تراهن بخط إنتاج عليه.

البث في الوقت الفعلي: فيديو أسرع من التشغيل

التطوير وراء هذا التحديث يتمحور حول جانب الاستضافة الذاتية. نقطة التحقق الأساسية المفتوحة لنموذج MiniMax H3 هي محول كثيف بحجم 33 مليار معلمة، وتوليد مقطع بالطريقة القياسية يعني تشغيل نحو 49 تمريرًا أماميًا لمحول الانتشار عبر جدول إزالة تشويش طويل. نشر مشروع FastVideo، وهو مشروع مفتوح المصدر لتدريب الفيديو واستنتاجه، نموذجًا مقطرًا مشتقًا من H3-Base يُدعى FastH3: نموذج من أربع خطوات (بأسلوب DMD2) يعيد استخدام مشفر النصوص وVAE الفيديو وVAE الصوت والمجزئات والمجدولات الخاصة بـ H3، لكنه يختصر حلقة إزالة التشويش إلى أربعة تمريرات أمامية للمحول عبر خمسة مواضع سيجما. أما vLLM-Omni، وهو بيئة تشغيل خدمة النماذج متعددة الوسائط، فيدمج مهايئ FastH3 عند وقت التحميل (طلب السحب #6714) ويعرضه عبر نقطة نهاية /v1/videos المتوافقة مع O​penAI، إلى جانب دعمه السابق لقاعدة H3-Base.

الرقم الرئيسي يُقاس على أجهزة كبيرة. على خادم 8× NVIDIA B300 بدقة 1344×768 ومعدل 24 إطارًا في الثانية، يبلغ فريق vLLM-Omni عن عرض ملف MP4 كامل مدته 10.1 ثانية — مع فيديو وصوت متزامن — تم تجسيده من البداية إلى النهاية في حوالي 8.7 ثانية، وهو أسرع من مدة التشغيل. هذا معيار أبلغ عنه الفريق بتاريخ 1 سبتمبر 2026 ولم تتم إعادة إنتاجه بشكل مستقل بعد؛ كما يلاحظ الفريق نفسه أن حزمة المعايير الخام ما زالت في انتظار النشر، ولا يقدم أي ادعاء بتكافؤ الجودة بين النسخة الأساسية وFastH3. أما على الأجهزة الأقل قوة، فالأرقام أقل إثارة — إذ تغطي الوصفة المجتمعية أيضًا إعدادات بطاقتي RTX 5090 وإعدادات بطاقة واحدة — ويغطي FastH3 v1 تحويل النص إلى فيديو وصوت (T2VA) فقط، بدقة 1344×768 بدلاً من 2K التي تظل حصرية عبر واجهة API.

بالنسبة للقارئ، هذا يغيّر معنى "استضافة H3 ذاتيًا". سابقًا، كانت أوزان القاعدة المفتوحة تعمل لكن ببطء — جيدة للعمل الدفعي، وليست لأي شيء تفاعلي. مع FastH3 على vLLM-Omni، يمكن لخط أنابيب H3 محلي أن يُتمّ معالجة مقطع من عشر ثوانٍ في وقت أقصر بكثير من مدة المقطع، وهذا هو الحد الذي تصبح عنده حلقات المنتج في الوقت الفعلي — المعاينة المسبقة المباشرة، والتكرار السريع للقطات، والفيديو الموجَّه بالوكلاء — عملية. إذا كنت تفضّل عدم تشغيل خادم بثماني وحدات GPU، فإن المسار المُدار لم يتغير: MiniMax H3 متاح على OrcaRouter بسعر القائمة لدى المزوّد، ويُمرَّر بهامش ربح 0% مع تجاوز الفشل تلقائيًا، لذا يمكنك استدعاء عائلة H3 من خلال واجهة برمجة تطبيقات واحدة متوافقة مع O​penAI دون امتلاك العتاد.

ثلاثة سيناريوهات حيث يتألق H3

1. أفلام قصيرة متسقة في الشخصية والأسلوب

المرجع الشامل (حتى 9 صور، 3 مقاطع فيديو، 3 مقاطع صوتية) مصمم للحفاظ على تناسق الشخصية والمظهر والصوت عبر لقطات متعددة - مثالي للمحتوى القصصي القصير والحلقات المتسلسلة.

2. الإبداع الاجتماعي والإعلاني المصحوب بالصوت

حوار متزامن لمرة واحدة، مؤثرات صوتية، وأجواء بالإضافة إلى نسب أبعاد مرنة (9:16 إلى 21:9) تناسب سير العمل السريع في وسائل التواصل الاجتماعي والإعلانات التي تحتاج إلى صوت منتهٍ، وليس مجرد صور.

٣. التحرير الإبداعي التكراري

يتيح التحرير القائم على التعليمات للفرق تحسين مقطع وصفيًا بدلاً من إعادة التوليد، مما يسرع الإنتاج الثقيل بالمراجعات.

الأسئلة الشائعة

ما هو MiniMax H3؟

H3 هو هايلو 3.0، أحدث نموذج من Mini​Max لتوليد الفيديو بالذكاء الاصطناعي، تم الكشف عنه في WAIC 2026 (17 يوليو 2026) وتم إصداره في 31 يوليو 2026. ينتج فيديو بدقة 2K أصلية بمعدل 24 إطارًا في الثانية مع صوت متزامن، من النصوص أو الصور، مع تحكم مرجعي شامل وتحرير قائم على التعليمات.

هل H3 هو نفس Mini​Max M3؟

لا، M3 هو نموذج Mini​Max اللغوي الكبير للنصوص/الوكيل؛ بينما H3 (Hailuo 3.0) هو نموذج توليد الفيديو. وقد تم الكشف عنهما في نفس الفعالية لكنهما يؤدّيان وظائف مختلفة.

أين يمكنني استخدام H3 الآن؟

أربعة أماكن: منصة Hailuo من Mini​Max (المنتج الكامل)، وVercel AI Gateway (كلًا من H3 وMini​Max H3 Max، مع خصم 50% بمناسبة الإطلاق حتى 13 سبتمبر)، وLuma Agents (أُعلن عنه في 6 أغسطس 2026 — حتى 15 ثانية من فيديو بدقة 2K مع صوت ستيريو أصلي، وما تزال شروط الوصول إليه غير واضحة)، والاستضافة الذاتية عبر أوزان H3-Base المفتوحة على Hugging Face وModelScope — والتي يمكن، منذ 1 سبتمبر، تقديمها بسرعة تفوق سرعة التشغيل عبر vLLM-Omni مع FastH3 من FastVideo (مقطع MP4 مصحوب بالصوت مدته 10.1 ثانية في حوالي 8.7 ثوانٍ على 8× B300، وفقًا لفريق vLLM-Omni). كما يتم توجيه النموذج الأساسي على OrcaRouter بسعر قائمة المزوّد.

ما هي مدة ودقة مقاطع H3؟

دقة 2K أصلية بمعدل 24 إطارًا في الثانية، من 5 إلى 15 ثانية لكل توليد، قابلة للتمديد إلى حوالي 30 ثانية، بنسب أبعاد تتراوح من 21:9 إلى 9:16.

ما هو omni-reference؟

نظام تحكم يقبل حتى 9 صور مرجعية، و3 مقاطع فيديو، و3 مقاطع صوتية في وقت واحد للحفاظ على تناسق الأسلوب والشخصية والحركة والصوت.

هل H3 أفضل من Kling 3.0 أو Veo 3.1؟

يعتمد ذلك على المعيار. تقدّم Kling 3.0 دقة 4K أصلية وتتصدّر بعض الحلبات؛ بينما Veo 3.1 قوية في حوارات 48kHz. أمّا H3 فتركّز على التحكم المرجعي الشامل، والصوت بمرور واحد، والتحرير، والسعر. ولدى H3 نتائج مبكرة في حلبة Artificial Analysis (نحو 1,184 لتحويل الصورة إلى فيديو و1,226 لتحويل النص إلى فيديو مع الصوت حتى أواخر أغسطس) ستتغيّر مع تراكم الأصوات — جرّبها على استفساراتك الخاصة.

هل H3 مفتوح الوزن؟

جزئيًا. في 3 أغسطس 2026، جعلت Mini​Max الأوزان الأساسية لنموذج H3 مفتوحة المصدر، وهو محول من 33 مليار معامل أُطلق على Hugging Face وModelScope بموجب رخصة MiniMax H3 المجتمعية، مع نقطتي فحص FL2VA وRef2VA. ووفقًا لشروط ترخيص Mini​Max، يقيد هذا الإصدار مناطق النشر، ويمتد إلى المخرجات المولدة، مع اشتراط الإسناد. أما الوحدتان اللتان تكملان تجربة الرائد للنموذج — H3-Context-IR (معالجة مسبقة للمطالبة) وH3-Regenerate-2K (الترقية إلى 2K) — فغير مدرجتين في الإصدار المفتوح وتظلان متاحتين عبر API فقط. منذ 1 سبتمبر، يمكن أيضًا تقديم الأوزان الأساسية المفتوحة للتوليد الفوري عبر vLLM-Omni وFastH3 من FastVideo (يقتصر FastH3 v1 على تحويل النص إلى فيديو وصوت فقط). إذن نعم بالنسبة للنموذج الأساسي، مع بعض التحفظات.

خلاصة القول

MiniMax H3 (Hailuo 3.0) هو ارتقاء جوهري في خط فيديو Mini​Max: دقة 2K أصلية، وصوت متزامن بمرور واحد، وتحكم شامل متعدد المراجع، وتحرير قائم على التعليمات، بسعر في المتناول. ومنذ إطلاقه، أصبح الوصول إليه أسهل بكثير — فهو موجَّه عبر OrcaRouter بسعر القائمة من المزوّد، ويعمل داخل Luma Agents، وأوزانه الأساسية مفتوحة للاستضافة الذاتية (ومنذ 1 سبتمبر أصبح سريعًا بما يكفي لتوليد مقطع مدته 10.1 ثانية أسرع من زمن تشغيله، عبر vLLM-Omni وFastH3 من FastVideo)، وهو وMiniMax H3 Max متاحان الآن على Vercel AI Gateway، مع خصم 50% على الإطلاق لمدة أسبوعين. لن يتفوق تلقائيًا في الدقة على المنافسين المعتمدين على دقة 4K أصلية، وما تزال نتائجه المبكرة في المنافسات تتبلور — لكنه مقنع من حيث التحكم والصوت وسرعة التكرار. قيّم H3 في مواجهة Kling 3.0 وVeo 3.1 وSeedance 2.0 وغيرها على لقطاتك الخاصة، وحافظ على مجموعة نماذجك الأوسع محايدة تجاه المزودين عبر نقطة وصول واحدة مثل OrcaRouter.