
كيفية استخدام MiniMax H3: البرومبتات، التشغيل المحلي، وصوتيات غير رديئة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
في 4 أغسطس، قام سايمون ويليسون بتنزيل حوالي 115 غيغابايت من الأوزان، ووجّه منفذ MLX غير رسمي لـMiniMax H3 على جهاز M5 Max MacBook Pro الخاص به، وطلب ظربانًا بألوان قوس قزح يقفز فوق جذع شجرة مغطى بالطحالب في متجر كبير. وبعد أقل من 45 دقيقة حصل على مقطع وصفه بأنه مذهل حقًا — مع مسار صوتي وصفه بأنه غريب، هراء يشبه الكلام. وكان تشخيصه الخاص هو الجزء المفيد: لم يكن قد أعطى النموذج أي توجيه صوتي، ولم يقرأ دليل التلقين أولاً. هذا هو أقصر ملخص ممكن لما يعنيه البدء في استخدام H3، الذي يُباع أيضًا باسم Hailuo 3.0. الصورة تأتي مجانًا إلى حد كبير. كل شيء آخر — الصوت، وتوقيت اللقطات، ودقة 2K، والشخصية التي يجب أن تنجو من أربع لقطات متتالية — عليك أن تطلبها صراحةً، بتنسيق أكثر صرامة من أي نموذج فيديو آخر تقريبًا قيد الاستخدام حاليًا.
هذا دليل استخدام، وليس تغطية إطلاق. تمر عبره ثلاث طبقات من المصادر، وهي موسومة في كل مرة: وثائق الشركة الخاصة (بطاقة النموذج، ودليلا كتابة المطالبات المرفقان في المستودع، ووثائق واجهة برمجة التطبيقات للمنصة)؛ نتائج المجتمع من الأشخاص الذين شغّلوه فعليًا — القائمون على صيانة ComfyUI، والمقيّمون المستقلون، ووثائق الموزعين، وخيوط النقاش على Hugging Face، وكلها مؤرخة بين 31 يوليو و5 أغسطس 2026؛ وعدد قليل من المواضع التي قرأنا فيها ملفًا أوليًا بأنفسنا وذكرنا ذلك. أرقام المجتمع هي تقارير منفردة على عتاد غير مضبوط ما لم يُذكر خلاف ذلك. وحين يختلف الممارسون فيما بينهم، يُورَد الاختلاف بدلًا من حسمه.
قبل أي شيء آخر: من المحتمل أنك لا تشغّل النموذج بأكمله
معظم الالتباس في الأسبوع الأول من H3 يعود إلى حقيقة بنيوية واحدة تطمسها النصوص التسويقية. H3 ليس نموذجًا واحدًا. وفقًا لبطاقة النموذج الخاصة به، فهو نظام من ثلاثة أجزاء، ولم يُطرح سوى الجزء الأوسط كمصدر مفتوح:
• H3-Context-IR — معالج تعليمات متعدد الوسائط. يقرأ نصوصك وصورك وصوتك وفيديواتك، ويفهم كيفية ارتباطها ببعضها، ثم يُخرج تمثيلًا منظمًا وغنيًا دلاليًا لما طلبتَه. متاح عبر API مستضاف فقط. يُقدَّم كنوع مهام مستقل يُرجع موجهًا (Prompt) مُثرى دون أي فيديو.
• H3-Base — نموذج التوليد بمعاملات 33 مليار الذي يصنع الإطارات والصوت فعليًا. هذا هو جزء الأوزان المفتوحة.
• H3-Regenerate-2K — مرحلة إعادة توليد ضمن السياق ترفع نتيجة 768p إلى 2K.متاح عبر API مستضاف فقط.
تنتج عن هذا نتيجتان فورًا، وهما تحددان سير عملك بالكامل. أولًا، التوليد المحلي له سقف 768p. اللوحة الأصلية لـ H3 تعتمد حافة قصيرة بطول 768 بكسل، بحد أقصى 768×1344 — أي ما يقارب 1344×768 لنسبة 16:9. إذا لم يكن مخرج ComfyUI لديك بدقة 2K، فلا شيء معطل؛ الحزمة التي نزّلتها هي H3-Base، ووحدة رفع الدقة ليست ضمنها. ثانيًا، واجهة البرمجة المستضافة ستصحح الطلب غير المحكم، بينما تثبيتك المحلي لن يفعل ذلك. كل ما يفعله Context-IR لاستدعاء API مدفوع — استنتاج البنية، وتحديد أي مرجع يعود إلى ماذا، وملء الأجزاء التي تركتها غامضة — هو خطوة تؤديها الآن يدويًا، أو باستخدام نموذج آخر، قبل أن تصل كلماتك إلى H3-Base. هذا التباين الوحيد يفسر معظم التقارير التي تقول «الطلب نفسه يعمل على Hailuo لكن يبدو معطلًا في ComfyUI».

من الجدير بالملاحظة من المستودع نفسه: أن الأوزان تحمل وسمًا باسم minimax-h3-community-license-agreement بدلاً من Apache أو MIT (المزيد عن ذلك أدناه، لأنه الجزء الذي يحدد ما إذا كان يمكنك الشحن على الإطلاق)، والموديل مُدرج بحجم 33B معلمةً بصيغة F32/BF16، وحتى اليوم، هناك موفر استدلال واحد فقط — fal — مُدرج على أنه يقدمه. يوجد بالفعل ثلاثة وعشرون ضبطًا دقيقًا وعشرون عملية تكميم وواحد وثلاثون Space مبنيًا فوقه، وهو مؤشر عادل على مدى سرعة تحرك المجتمع.
صيغة التلقين: كتل لقطات، وليست أكوادًا زمنية.
هنا حيث يتعارض المجتمع والتوثيق علنًا، وهذا الأمر أكثر أهمية من أي شيء آخر في هذه المقالة.
القالب الذي انتشر بشكل أسرع — عبر Reddit، ثم إلى عدة أدلة منشورة — يقسّم المقطع إلى أقواس زمنية: [0s-2s]، [2s-5s]، وهكذا، متبوعًا بهيكل من ستة أجزاء: عقد الأسلوب، والخط الزمني، والكاميرا، والصوت، والنص المكتوب حرفيًا، وقائمة السلبيات. وقد تمت هندسته عكسيًا من خلال قراءة أمثلة الطلبات الـ45 التي أصدرتها الشركة، وهو ليس هراءً: تلك الأمثلة هي في الواقع قوائم لقطات مرفق بها جدول إشارات صوتية، بمتوسط طول يبلغ حوالي 130 حرفًا صينيًا، وأطولها يصل إلى 657 و858 حرفًا.
لكن الملف الخاص بالشركة VIDEO_PROMPT_WRITING_GUIDE_base_en.mdالموجود في مجلد المستودع docs، يصف شيئًا مختلفًا. إنه ينظم حسب كتلة اللقطة، وليس حسب النطاق الزمني. قرأناه مباشرة؛ البنية التي يطلبها هي:
• التعليمات — قواعد محاذاة الصورة، تُستخدم لأوضاع الإطارات الرئيسية (I2VA, FL2VA, L2VA) وتُحذف لتحويل النص الخالص إلى فيديو.
• integrated_multimodal_description — النص الرئيسي، مقسم إلى [Shot 1], [Shot 2], وهكذا دواليك.
• overall_soundscape — من جملة إلى أربع جمل من الصوت الحكائي.
• non_diegetic_music — جملة إلى ثلاث جمل من الموسيقى التصويرية.
ضمن هذا الإطار، تكون الاتفاقيات محددة بما يكفي لتكون قابلة للتحقق. [اللقطة 1] لا تأخذ أي طابع زمني على الإطلاق — تبدأ اللقطات اللاحقة بقطع مطلق، بصيغة مثل "عند 00:03.500، تقطع الكاميرا إلى…". تُكتب حركة الكاميرا كنوع الحركة مع السعة والسرعة، مصاغة في لغة إنجليزية طبيعية بدلاً من تكديسها كتسميات: دفع أمامي بطيء صغير السعة، وليس الكاميرا: دفع داخلي، بطيء. الحركات المتاحة هي المجموعة المألوفة — تكبير، تحريك أفقي، إمالة، تتبع، قوس، زاوية رؤية، واهتزاز بنسختين خفيفة أو قوية. يُغلَّف الحوار بوسوم: <d>[الإنجليزية] اركب السيارة.</d>، مع حفظ علامات الترقيم بدقة تامة وعدم ترجمتها أو إعادة صياغتها أبدًا. يحصل المتحدثون على معرّفات ثابتة — (S1)، (S2)، و(S1,S2) لسطر مشترك — مع وصف العمر والجنس ونبرة الصوت واللهجة عند أول ظهور. يُعلَّم التعليق الصوتي كسطر حوار خارج الشاشة مع ملاحظة صريحة بأن الشفاه تبقى مغلقة، وهكذا تمنع النموذج من مزامنة الشفاه مع السرد على الوجه. المحادثات المتقاطعة تستخدم وسم <scenetrans> بالإضافة إلى بيان استمرارية.
محظورات الدليل الصريحة مفيدة بقدر قواعده: لا تضع علامة زمنية على اللقطة الأولى، ولا تكرر الحوار أو الغناء أو الموسيقى الظاهرة على الشاشة داخل overall_soundscape، ولا تستخدم كلمات مزاجية مجردة في non_diegetic_music، ولا تعِد كتابة أي سطر حوار أبدًا. وهناك غياب ملحوظ — لا يحتوي الدليل الرسمي على قسم للبرومبت السلبي على الإطلاق، مما يعني أن قائمة "الانتقالات المحظورة" في القالب المجتمعي الشهير هي ابتكار مجتمعي، وليست ميزة موثقة.
ما مدى جدية هذا الخلاف؟ في نقاش على Hugging Face في مستودع H3، نشر أحد أعضاء المجتمع بنية بأسلوب الطابع الزمني كدليل، وردّ ممارس آخر بصراحة أنه استخدم بنية مشابهة، وأنها خاطئة تمامًا، وينبغي للناس قراءة الدليل المرفق بدلاً من ذلك. هذا شخص يناقض شخصًا آخر، وليس حكمًا من المشرف. قراءتنا للأدلة: كلاهما يعمل عبر واجهة برمجة التطبيقات المستضافة، لأن Context-IR يطبّع أي شيء ترسله؛ فقط الصيغة الموثقة هي الموثوقة مباشرة مع H3-Base. إذا كنت تشغّل أوزانًا محلية، فاتبع الملف الموجود في المستودع. إذا كنت على واجهة برمجة التطبيقات وكانت مطالبة الطابع الزمني تحقق لك مقاطع جيدة، فإن المعالج الأولي يقوم بهذا العمل نيابة عنك، ولا ينبغي أن تستنتج أن الصيغة هي ما يستحق الفضل.
تجميع موجز كسول إلى لهجة H3
خذ الموجه المكوَّن من اثنتي عشرة كلمة لويليسون كمدخل — ظربان بألوان قوس قزح يقفز فوق جذعٍ مُغطىً بالطحلب في سوبرماركت. عند كتابته بالطريقة الموثّقة، يصبح تقريبًا: [Shot 1] كتلة تبدأ بتسمية الأسلوب (الحركة الحيّة، التصوير باليد، إضاءة الفلورسنت) والإطار (ممر سوبرماركت، جذع مُغطىً بالطحالب ممدد عبر المشمع، رفوف متراجعة)، ثم الموضوع والفعل بالترتيب الفيزيائي — خطوتان خفيفتان، انحناءة، القفزة، الهبوط — مع حركة كاميرا تتبّع بطيئة منخفضة السعة تنتهي على الجانب البعيد من الجذع؛ وoverall_soundscape من مخالب على المشمع، وصوت احتكاك الجذع الرطب، وهمهمة التبريد، وعجلات عربة بعيدة؛ وnon_diegetic_music سطر لإشارة وترية نقرية قصيرة خفيفة بلا غناء. لا شيء في ذلك عبقرية إبداعية. إنها الفكرة نفسها، مع توفير الأمور الأربعة التي يطلبها H3 فعليًا — وهذا هو الفرق بين نغمة غرفة لم تُطلب وموسيقى تصويرية صممتها.
هذه الخطوة ميكانيكية ومتكررة وتمثل إهدارًا للجهد البشري، وهذا هو بالضبط سبب إصدار الشركة أداةً لها لم تلتقطها أي تغطية تقريبًا. يحتوي المستودع على دليلمهارات يضم تسع مهارات للوكلاء، وأولها — h3-prompt-writing — تفعل هذا بالضبط: تأخذ طلبًا وتكتب موجه H3 منظمًا عبر أوضاع التوليد الخمسة جميعها، مع قسمي المشهد الصوتي والموسيقى. أما المهارات الثماني الأخرى فهي وصفات لأنواع فنية (إعلان منتج، فيلم رسوم متحركة قصير ثلاثي الأبعاد، فيديو تفسيري بالفن الورقي، ترجمة فيديو موسيقي، مقدمة لعبة تعاونية، هجين بين الرسم اليدوي والتصوير المباشر، وغيرها) تغلف التنسيق نفسه في سير عمل.
تشغيل هذه المهارة يتطلب نموذج نصوص، وليس نموذج فيديو، وهنا يكون الراوتر مفيدًا فعليًا بدلًا من كونه مجرد إضافة. نموذج اللغة الخاص بالشركة، MiniMax M3، هو اختيار منطقي لهذه المهمة، وهو متاح على OrcaRouter بسعر 0.30 دولار لكل مليون رمز إدخال و1.20 دولار لكل مليون رمز إخراج — سعر القائمة من المزود، حيث نمرره بهامش ربح 0% — مع نافذة سياق تبلغ مليون رمز، وبشكل غير معتاد، قبول الفيديو كنوع إدخال. هذه التفاصيل الأخيرة هي ما يجعله مناسبًا: يمكنك تسليمه دليل المطالبات الرسمي، وموجزك، ومقطعًا مرجعيًا فعليًا في استدعاء واحد، وتحصل على [Shot N] الكتلة التي تصفه. تجميع المطالبة يكلف جزءًا من السنت مقارنةً بتوليد الفيديو الذي يُدفع عنه بالثانية، لذلك لا يوجد سبب لكتابتها يدويًا. تحفظان صريحان: توليد فيديو H3 نفسه لا يعمل على OrcaRouter — المقاطع تأتي من منصة الشركة، أو fal، أو بطاقة الرسوميات الخاصة بك — وخطوة التجميع هي ميزة إضافية وليست ضمانًا للجودة. ما يوفره لك الراوتر هنا هو أن الجزء النصي من خط المعالجة يقع خلف مفتاح واحد مع تجاوز تلقائي للأعطال، لذلك فإن انقطاع المزود في منتصف الدفعة لا يوقف قائمة انتظار العرض، واستبدال M3 بنموذج مختلف لمقارنة المطالبات المجمّعة هو مجرد تغيير سلسلة نصية وليس عقدًا جديدًا.

الصوت هو المجال الذي يضيع فيه الجميع في اليوم الأول
نمط الفشل الأكثر تأكيدًا في الأسبوع الأول هو ذلك الذي صادفه ويليسون: اترك الصوت غير محدد، فيخترع H3 شيئًا ما بشكل سيئ. حصل على ضوضاء تشبه الكلام من موجه لا يتضمن أي توجيه صوتي. ويشير التحليل العكسي للأمثلة الرسمية إلى نفس فئة الفشل بشكل أخف — عند حذف كتلة الصوت، يصدر النموذج صوت غرفة غير مطلوب — ويعتبر هذه الحالات غيابات وليست أخطاءً، وهي الطريقة الصحيحة للتفكير في نموذج صوتي-فيديو مشترك. إنه يولّد دائمًا مسارًا صوتيًا. خيارك الوحيد هو ما إذا كنت تحدده أم لا.
من خلال الجمع بين الإرشادات الواردة في دليل المطالبات الرسمي وما تذكره وثائق الموزعين ويؤكده المراجعون حول ما ينجح فعليًا:
• الحوار هو أصعب ما يمكن طلبه. اجعل الجمل المنطوقة في حدود جملة أو جملتين لكل خمس ثوانٍ من المقطع. فالجمل المفرطة في الطول تؤدي إلى إلقاء متسرع، أو مسار صوتي يمتد بعد الإطار الأخير، أو مزامنة شفاه متوترة — وهي مشكلة أبلغ عنها المراجعون باستمرار.
• صِف المتحدث قبل السطر، وطريقة الإلقاء معه.العمر، الجنس، نبرة الصوت واللهجة عند أول ظهور وفقًا للدليل الرسمي؛ ملاحظات إلقاء بسيطة ومباشرة (بوضوح، بدفء، بشكل مسطح) بدلاً من توجيه أداء مفصّل، الذي يُقال إنه يضعف المزامنة.
• اربط كل تأثير بحدث مرئي. "فرقعة الفلين تحدث تمامًا عندما يطير الفلين" بدلاً من "صوت: فرقعة". الكلمات كما، عندما و ثم هي التي تحمل التزامن.
• موسيقى موجزة حسب النوع والإيقاع والمزاج والآلات الموسيقية — وليس أبدًا حسب الفنان أو الأغنية. أضف «بدون غناء» عندما يجب أن تقود الصورة؛ فهذه طريقة موثقة للحفاظ على المزيج نظيفًا.
• أدرج الأجواء المحيطة في جملة واحدة. المطر على الزجاج، وهمهمة محادثة منخفضة، وقعقعة فنجان بين الحين والآخر، وجاز هادئ في الخلفية — جميعها مكدّسة في جملة واحدة بدلاً من تعدادها.
• لا تكرر الحوار في قسم المشهد الصوتي. هذا نهي صريح في الدليل الرسمي؛ الأقسام مُصممة لتكون منفصلة، وتكرار سطر هناك يعني وروده مرتين.
• إذا كان يجب أن تكون الكلمة مقروءة على الشاشة، اكتب الكلمة بين علامتي اقتباس. أفاد المراجعون أن السلاسل النصية المحددة تُعرض بوضوح بينما الطلبات الغامضة (مثل "HUD elements" و"a sign") تعود كضوضاء على شكل حروف.
حيث يقدّم الصوت أداءً حقيقيًا، وفقًا لعدة مراجعين، هو الصوت المادي الملموس — المؤثرات الصوتية (فولي) المرتبطة بشيء مرئي — والأجواء المحيطة. وهو أضعف في الطلبات المجردة أو المتعلقة بالأجواء. المشاهد متعددة المتحدثين تحتاج غالبًا إلى تعديل لترتيب المتحدثين بشكل صحيح، وجودة النطق تختلف حسب اللغة، لذا اختبر لغتك المستهدفة على مقطع تجريبي قبل الالتزام بمشروع عليها. كما يلاحظ عدة مراجعين السقف الصادق: الصوت جيد بما يكفي للتوزيع عبر وسائل التواصل الاجتماعي، وغير جيد بما يكفي عمومًا لشحنه كمزيج بث أو إعلان مدفوع دون استبدال. ولا شيء من ذلك هو توجيه من البائع؛ بل هو ما يبلّغ به الممارسون.
المراجع: أعطِ كل ملف وظيفةً
نظام المراجع في H3 هو أقوى عامل تمييز له، وهو الموضع الذي تتكرر فيه أخطاء الإعداد أكثر من غيره. الحدود الموثقة من وثائق API للمنصة: حتى 9 صور، و3 مقاطع فيديو، و3 مقاطع صوتية، بحد أقصى 12 ملفًا إجمالاً، حيث يتراوح كل فيديو أو صوت مرجعي بين 2 و15 ثانية، وألا يتجاوز مجموعها 15 ثانية. يتطلب التحويل المرجعي إلى الفيديو وجود صورة أو فيديو واحد على الأقل؛ أما الصوت وحده فلا يُقبل.
الأسلوب الذي يتفق عليه كل من الدليل المرجعي الرسمي وتقارير المجتمع هو وسم كل مدخل وتعيين مهمة له. وارجع إلى الوسوم بالترتيب الدقيق الذي أُرفقت به الملفات — <Picture 1>، <Video 1>، <Audio 1> — ثم اذكر في التلقينة أي مرجع يحدد أي خاصية: الهوية، الأسلوب، الحركة، الكاميرا، أو الصوت. تبدأ أمثلة التلقينات الرسمية بهذه الطريقة تمامًا، معلنةً أن الصورة الأولى هي مرجع المزاج والأسلوب العام، والصورة الثانية هي الشخصية الرئيسية. ويشير الممارسون إلى أن التعيين الصريح يعمل بشكل أفضل بكثير من إلقاء تسع صور والأمل في نتيجة جيدة.
تفصيلان يُكلِفان الناس عمليات العرض:
• <Picture 1> ليست لوحة مزاجية — بل هي الإطار الأول حرفيًا عند 0.000 ثانية، وهو ينتمي إلى [Shot 1]. صِف ما بداخله (النمط، الموضوعات، التكوين، مثبتات المشهد) قبل وصف الحركة التي تليه. تعامل معه كإطار ثابت تقوم بتحريكه، وليس كتلميح.
• هناك نقطتا تفتيش منفصلتان، واستخدام النقطة الخاطئة منهما يفشل بصمت. fl2va يتعامل مع تحويل النص إلى فيديو ومعالجة الإطار الأول/الأخير؛ ref2va يتعامل مع التحويل من المرجع إلى فيديو. هذا هو الخطأ الأكثر شيوعًا في ComfyUI: مخطط R2V يعمل بينما لا يزال نموذج FL2VA محددًا. ومن الجدير أيضًا معرفة أن أحد المعلقين على إعلان ComfyUI أشار إلى أن قالب R2V المرفق يعرض فقط خانتين لمرجع الصورة، على الرغم من أن النموذج يقبل تسعة — قيد في القالب، وليس قيدًا في النموذج.
في الجانب المستضاف، ملاحظتان عمليتان إضافيتان من وثائق البائع: معامل ratioمطلوب على نقاط نهاية ref2va ولا يمكن تركه على الوضع "adaptive"، والوظائف المتداخلة تُرجع خطأ 429 لتزامن المهام بدلاً من وضعها في قائمة انتظار — لذا نفّذها على دفعات بالتتابع، أو أنشئ قائمة انتظار خاصة بك. محليًا، ref_image_sizeالافتراضي هو match، وهو أسرع؛ maxيحافظ على حافة قصيرة يصل حجمها إلى 2048 بكسل في الصورة المرجعية ويكلف وقتًا.
كم يكلف التشغيل المحلي فعليًا من حيث زمن الساعة؟
تنزيل المستودع الرسمي الكامل يبلغ 498 جيجابايت، والمرآة المعاد حزمها من ComfyUI تبلغ 343 جيجابايت. لست بحاجة إلى أيٍّ منهما بالكامل. الملفات الأربعة التي يسردها البرنامج التعليمي الخاص بـ ComfyUI لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو يبلغ مجموعها حوالي 42.5 جيجابايت:
• نموذج الانتشار — minimax_h3_fl2va_pruned_int8_convrot.safetensors، 20.97 جيجابايت، إلى models/diffusion_models.
• مشفر النصوص — qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors، 15.69 جيجابايت، إلى models/text_encoders.
• Video VAE — minimax_h3_video_vae_fp16.safetensors، 5.21 جيجابايت، إلى models/vae.
• Audio VAE — minimax_h3_audio_vae_fp32.safetensors، 0.61 جيجابايت، أيضًا في models/vae.
• إضافة للإشارة إلى الفيديو — minimax_h3_ref2va_pruned_int8_convrot.safetensors، بحجم إضافي 20.97 جيجابايت.
إن مقدار 42.5 غيغابايت ليس رقماً لذاكرة VRAM — بل هو للقرص، والأجزاء تُبث وتُفرَّغ. السبب في أن النموذج يعمل على البطاقات الاستهلاكية أصلاً هو حيلة هندسية وثّقها ComfyUI: نحو 40% من المعاملات تكمن في فروع تعديل AdaLN التي يمكن حساب مخرجاتها مسبقاً واستبدالها بجداول بحث مكافئة وظيفياً، مما يخفض النموذج المُحمَّل من 33.12B إلى حوالي 20.11B مع، وفقاً لـ ComfyUI، عدم فقدان الجودة. الدقة الكاملة ستكون 123.6 غيغابايت. توجد نقاط تفتيش int8 غير مشذبة (34.04 غيغابايت لكل منها) وأخرى bf16 (66.28 غيغابايت لكل منها) إذا كنت تُجري ضبطاً دقيقاً أو تسعى لآخر بضع نسب مئوية من الإخلاص.
يلزم توفير ComfyUI 0.30.0 أو إصدار أحدث، وهو يأتي مزوّدًا بثلاثة قوالب: T2V وI2V وR2V. خط الأساس الذي يجتمع عليه كل دليل ومطوّر لأول تشغيل يكون صغيرًا عمدًا: 16:9 بدقة 0.4 ميغابكسل (864×480)، و5 ثوانٍ، و20 خطوة، ومُعيّن res_multistep مع المجدول simple، وdenoise 1.0، وbatch 1.احصل على ملف MP4 واحد يحتوي على الفيديو وصوت ستيريو معًا قبل أن تمسّ الدقة أو الطول. ثمة غرابة حسابية يجب توقّعها: المدد تنضغط على شبكة إطارات 17k+5، لذا فإن طلب 5 ثوانٍ يصبح 124 إطارًا — أي نحو 5.17 ثانية بمعدل 24 إطارًا في الثانية — وطلب 10 ثوانٍ يستقر عند 243 إطارًا، أي 10.125 ثانية. الطلبات في نطاق 5–15 ثانية هي المنطقة الأكثر أمانًا.

ما تكلفة ذلك في الوقت الفعلي، وفقًا لتقارير المجتمع (جميعها عمليات تشغيل مفردة، غير مضبوطة، على إعدادات مختلفة — يعرض الرسم البياني أعلاه كل إعداد بجانب شريطه): بطاقة RTX 3060 بسعة 12 جيجابايت مع 32 جيجابايت من ذاكرة النظام وقرص NVMe سريع أكملت خط الأساس 864×480 / 124 إطارًا / 20 خطوة في أقل من تسع دقائق باستخدام التفريغ الديناميكي. أما كمبيوتر محمول مزود بـ RTX 4090 بسعة 16 جيجابايت مع تفعيل SageAttention فقد أنجز 960×540 و5 ثوانٍ و20 خطوة في 182 ثانية. وأنتج إصدار NVFP4 على بطاقة RTX 5090 واحدة مقطعًا بدقة 864×480 و243 إطارًا (10.1 ثانية) و10 خطوات في 175 ثانية، ليبلغ ذروة استخدام ذاكرة الفيديو 26.9 جيجابايت مع ملفات بحجم 31.7 جيجابايت فقط على القرص. المرجع الخاص بدليل SGLang — 1344×768 و124 إطارًا و50 خطوة عبر بطاقتي RTX 5090 مع التفريغ حسب الطبقات — استغرق 559.67 ثانية. أما مسار Apple Silicon، عبر منفذ MLX غير الرسمي، فاستغرق أقل من 45 دقيقة لمقطع واحد.
ملاحظات عملية مستخلصة من تلك التقارير:
• ذاكرة النظام وسرعة القرص عنصران حاملان للأحمال وليسا خياريين. على بطاقة بسعة 12 جيجابايت، تتجاوز الملفات المحددة ذاكرة الفيديو (VRAM) عن قصد، لذا يمر مسار التفريغ عبر ذاكرة الوصول العشوائي ثم عبر قرص SSD. تظهر ذاكرة وصول عشوائي بسعة 32 جيجابايت في كل من التقريرين الناجحين لانخفاض ذاكرة الفيديو. لا توجد نتيجة مؤكدة بسعة 8 جيجابايت.
• SageAttention هو التسريع المجاني الوحيد — حوالي 2× في ComfyUI، وأقل إذا كان تشغيلك يهيمن عليه نقل البيانات (offload). ثبّت الحزمة (wheel) المطابقة تمامًا لإصدار PyTorch وCUDA لديك بالإضافة إلى ComfyUI-KJNodes، ثم أدخل Patch Sage Attention KJ بين محمّل UNET والموجّه (guider) واضبطه على الوضع التلقائي. توقع تحذيرات بأن بعض طبقات H3 ليست FP16/BF16؛ هذا التراجع موثّق وطبيعي.
• الخطوات قابلة للتفاوض. معيار 5090 شغّل 10 والخط الأساسي لـ ComfyUI يشغّل 20، بينما يستخدم تكوين مرجع SGLang 50. لم ينشر أحد منحنى الجودة لكل خطوة، لذا حدد الحد الأدنى الخاص بك قبل أن تفترض أنك بحاجة إلى 50.
• غيّر متغيرًا واحدًا في كل مرة للتخلص من OOM. الأسلوب الموثق للاسترداد هو التراجع إلى 0.4 MP و5 ثوانٍ وbatch 1، وتحريك مقبض واحد في كل محاولة.
• الصوت الصامت يعني أن الترميز الصوتي VAE غير موصول بعقدة إخراج الفيديو. إنه فشل مختلف عن الصوت الرديء، ويسهل إساءة فهمه على أنه رفض النموذج توليد الصوت.
• Apple Silicon غير رسمي. كان مسار ويليسون PipeNetwork/minimax-h3-mlx، وهو منفذ مجتمعي، يُشغَّل عبر uv على ملف متطلبات MLX. تذكر مواد الشركة الرسمية SGLang وvLLM وDiffusers وComfyUI، مع نشر نموذجي لأربع وحدات معالجة رسومية بصيغة BF16، ولا تذكر شيئًا عن Metal أو MPS. اعتبر دعم Mac صيانة مجتمعية.
المحلي مقابل المستضاف، مع الأرقام
نظرًا لأن وحدة 2K والمعالج الأولي للمطالبات لا يتوفران إلا كخدمة مستضافة، فإن هذا ليس حقًا خيارًا إما/أو. النمط الذي تدفعك البنية نحوه هو: كرر العمل محليًا بدقة 768p، حيث تكلف كل محاولة كهرباء وثلاث دقائق، ثم اشترِ النتيجة النهائية. الرسوم بالثانية مناسبة للقطة التي تحتفظ بها، ومدمرة للأربعين التي تتخلص منها.
فيما يخص السعر، كن حذرًا، لأنه يتفاوت بنحو الضعفين (2×) حسب جهة الشراء، ولا يذكر منشور مدونة البائع نفسه أي رقم بالدولار — فقط أن دقة 2K تأتي بأقل من ثلث أسعار النماذج السائدة، ودقة 768p بأقل من نصف سعر منافسيها بدقة 720p. المنشور بشكل ملموس: fal، حاليًا مزوّد الاستدلال الوحيد المدرج في مستودع Hugging Face، يفرض $0.16 في الثانية بدقة 768p و$0.26 في الثانية بدقة 2K. وتشير أدوات تتبّع ثانوية إلى أن السعر الرسمي المعلن من الشركة أقل بشكل ملموس — حوالي $0.09–$0.10 في الثانية بدقة 768p و$0.13–$0.14 في الثانية بدقة 2K — وهي لا تتطابق مع بعضها بدقة حتى السنت، لذا تعامل معها كمؤشرات تقريبية وتفقّد صفحة تسعير المنصة قبل بناء ميزانيتك. واحسب أيضًا في ميزانيتك أن الفيديو المرجعي يُحتسب على مدته الخاصة وكذلك على الناتج المُولَّد.
جرّبه على رقم حقيقي. مئة مقطع محتفظ به بمعدل ثماني ثوانٍ لكل مقطع يساوي 800 ثانية مُولَّدة: حوالي 112 دولارًا بسعر 2K البالغ 0.14 دولار، وحوالي 208 دولارات بسعر fal البالغ 0.26 دولار، وحوالي 76 دولارًا إذا سلّمت بدقة 768p بسعر القائمة المنخفض. المرفوضات الأربعون لكل محتفظ به هي التي تحدّد الفاتورة، وهي تلك التي يجب توليدها محليًا. وهذا أيضًا سبب إبقاء السعر الذي تقارن به صادقًا — على OrcaRouter، يُمرَّر الجانب النصي من خط الأنابيب عبر قائمة المزود بهامش ربح 0%، فعندما يخفض البائع سعره، يصبح السعر ساريًا في اليوم نفسه بدلاً من إعادة حساب الهامش. توليد الفيديو، مجددًا، ليس من عملنا؛ الهدف فقط هو ألا تكون خطوة التجميع هي البند الذي عليك التفكير فيه.
اقرأ الترخيص قبل أن تبني منتجًا على هذا.
هذا هو الجزء الذي تتجاهله معظم أدلة "كيفية الاستخدام"، وبالنسبة للكثير من القرّاء هو الجزء الوحيد الذي يغيّر القرار. لقد قرأنا ملف LICENSE في المستودع مباشرةً. يتم توفير الأوزان بموجب H3 Community License Agreement، وهي ليست رخصة مفتوحة المصدر، وتحتوي على بنود غير مألوفة لدرجة تستدعي اقتباس جوهرها:
• الإقليم. يُعرّف الترخيص «الإقليم المُطبَّق» على أنه في جميع أنحاء العالم باستثناء الاتحاد الأوروبي، والمملكة المتحدة، وجمهورية كوريا، والولايات المتحدة الأمريكية. وبقراءة واضحة، فإن ذلك يستبعد شريحة كبيرة من الأشخاص الذين ينشرون حاليًا نتائج التوليد المحلي — والقيد مكتوب ليشمل المخرجات، وليس الأوزان فقط.
• الإسناد. يتطلب الاستخدام التجاري عرض "H3" على واجهة المنتج؛ كما يشجع الترخيص على إشعار "Powered by H3".
• حد الإيرادات. يجب على المؤسسات التي تحقق أكثر من 20 مليون دولار سنويًا من المنتجات أو الخدمات المبنية عليه الحصول على إذن كتابي منفصل من الشركة.
• لا تقطير. لا يجوز لك استخدام H3 أو مخرجاته لتحسين أي نموذج ذكاء اصطناعي آخر، باستثناء مشتقات H3. وهذا يستبعد الأسلوب القياسي للبيانات الاصطناعية.
• القانون الحاكم. منطقة هونغ كونغ الإدارية الخاصة، مع الاختصاص القضائي الحصري لمحاكم هونغ كونغ.
• مكوّن واحد مفتوح حقًا.مشفّر النصوص Qwen3-VL-32B مرخّص بموجب Apache 2.0؛ والقيود المذكورة أعلاه تنطبق على أوزان H3.
نحن لسنا محاميكم وهذه ليست نصيحة قانونية — اقرأوا الترخيص ووثيقة الأسئلة والأجوبة التي ترفقها الشركة إلى جانبه، وإذا كنتم تبنون منتجًا تجاريًا في منطقة مستثناة، فاستشيروا محاميًا بدلًا من قراءة مدونة. الفارق العملي: واجهة API المستضافة هي معاملة مختلفة بشروط مختلفة عن الترخيص المجتمعي للأوزان، لذا إذا لم يناسبكم الترخيص المحلي، فقد يظل مسار API متاحًا. تحققوا من شروط أي منصة تشترون منها.
خطة اختبار الأسبوع الأول
خمس عمليات تشغيل، بهذا الترتيب، كافية لمعرفة ما إذا كان H3 يناسب خط أنابيبك:
• تشغيل 1 — إثبات سلامة التوصيلات الأساسية. قالب T2V، 864×480، 5 ثوانٍ، 20 خطوة، res_multistep/simple. معيار النجاح هو ملف MP4 يحتوي على صوت ستيريو، وليس مقطعًا جيدًا.
• الاختبار 2 — أثبت أن الصيغة مهمة. نفس الموضوع مرتين: مرة كوصف من سطر واحد غير محكم، ومرة مكتوبًا كـ [لقطة 1] بالإضافة إلى المشهد الصوتي العام و الموسيقى غير الحكائية. إذا لم تكن الثانية أفضل بوضوح من H3-Base، فثمة خطأ ما في إعداداتك.
• تسجيل 3 — سطر واحد من الحوار. متحدث واحد، جملة واحدة، وصف الأداء، خمس ثوانٍ. هذه أسرع طريقة لمعرفة ما إذا كان الصوت جيدًا بما يكفي لاستخدامك، وللتعرف على نطق اللغة الهدف.
• Run 4 — انضباط المرجع. R2V مع ref2va، نقطة التفتيش، ومرجعين أو ثلاثة مراجع، كلٌّ منها موسوم صراحةً ومُكلف بمهمة، مع وصف <Picture 1> بوصفه الإطار الأول الفعلي. ثم اكسر ذلك عمدًا: اربط نفس المراجع دون مهام وقارن.
• التشغيل 5 — النهاية. خذ أفضل مطالبة محلية لديك بدقة 768p إلى واجهة برمجة التطبيقات المستضافة بدقة 2K ولاحظ ما تضيفه Context-IR ومرحلة إعادة التوليد. هذا الفارق هو ما تحصل عليه مقابل السعر لكل ثانية، وهذا هو السبيل الوحيد لتسعير سير العمل الهجين بإنصاف.
الأسئلة الشائعة
هل يمكنني الحصول على 2K من الأوزان المحلية؟
لا. الحزمة المفتوحة هي H3-Base، التي يبلغ طول حافتها القصيرة الأصلية 768 بكسل (حتى 768×1344). تأتي دقة 2K من H3-Regenerate-2K، وهي وحدة إعادة توليد منفصلة ضمن السياق، أبقَتْها الشركة على واجهة برمجة التطبيقات المستضافة. يمكنك رفع الدقة محليًا باستخدام أي أداة رفع دقة عامة، لكن ذلك عملية مختلفة عن مرحلة إعادة التوليد الخاصة بـ H3 ولن تطابقها.
لماذا يتصرف نفس الموجه بشكل مختلف على API وفي ComfyUI؟
نظرًا لأن واجهة برمجة التطبيقات (API) تشغّل H3-Context-IR أولاً. فهي تقرأ نصك ومراجعك، وتفكر في كيفية ارتباطها ببعضها، ثم تمرّر إلى H3-Base تعليمات منظمة ومثرية. محليًا لا توجد مثل هذه المرحلة — إذ يستقبل H3-Base كلماتك الخام. إن المطالبة الغامضة التي تنتج مقطعًا بارعًا عبر واجهة برمجة التطبيقات إنما يتم إنقاذها بواسطة معالج مسبق لم تقم بتثبيته، ولهذا السبب فإن تنسيق المطالبة الموثّق أكثر أهمية بكثير للمستخدمين المحليين منه لمستخدمي واجهة برمجة التطبيقات.
هل قالب الرمز الزمني [0s-2s] خاطئ؟
ليس هذا ما يطلبه الدليل المُرفَق. ملف الشركة VIDEO_PROMPT_WRITING_GUIDE_base_en.md ينظّم المحتوى في كتل [Shot N]، ولا يمنح Shot 1 أي طابع زمني، ويعبّر عن القطع اللاحقة بأوقات مطلقة (مثل: "عند 00:03.500، تقطع الكاميرا إلى..."). كما أنه لا يتضمن قسمًا للموجهات السلبية، لذا فإن قائمة "الانتقالات المحظورة" في القالب الشائع هي إضافة من المجتمع. ومع ذلك، يبلغ الممارسون عن نتائج جيدة من واجهة برمجة التطبيقات مع نموذج الطابع الزمني — ومن المحتمل أن ذلك يعود إلى أن Context-IR يطبّعه. قراءتنا: استخدم الصيغة الموثقة مع الأوزان المحلية، ولا تنسب الفضل إلى أقواس الطابع الزمني في نتائج واجهة برمجة التطبيقات التي ربما يكون المعالج المسبق هو من حقّقها.
هل يمكن لشركة في الولايات المتحدة أو الاتحاد الأوروبي استخدام الأوزان المفتوحة تجارياً؟
نص الترخيص الذي اطّلعنا عليه يستثني الاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية والولايات المتحدة من منطقة التطبيق، والاستثناء مصاغ ليشمل المخرجات وكذلك الأوزان. وهذا يشكّل عقبة خطيرة أمام النشر التجاري في تلك المناطق، وهي مسألة قانونية لا تقنية — اقرأ الترخيص وملف الأسئلة والأجوبة بنفسك واستشر أهل الخبرة. أما واجهة برمجة التطبيقات المستضافة فتحكمها شروط المنصة نفسها، وليس الترخيص المجتمعي، لذا من الأفضل تقييمها بشكل منفصل بدلاً من افتراض أنها تخضع للقيود نفسها.
ما يجب التحقق منه قبل التنفيذ
H3 يوفر قيمة جيدة بشكل غير معتاد لنوع محدد من العمل: مقاطع قصيرة، مصممة الصوت بعناية، ومتسقة المرجع، عندما تكون مستعدًا لكتابة قائمة لقطات حقيقية. وهو متطلب بشكل غير معتاد في طريقة طلبك. الأمور الثلاثة التي تستحق التحقق منها بنفسك، لأنها الأسرع تغيرًا: ما إذا كانت موفرو استدلال إضافيون سيظهرون إلى جانب fal (وهو ما سيخفض السعر لكل ثانية)، وما إذا كان قالب ComfyUI R2V سينمو ليتجاوز فتحتي المرجع إلى فتحات النموذج التسع، وما إذا كانت عادة الطابع الزمني لدى المجتمع أم تنسيق كتلة اللقطات الموثق هو ما سيفوز بمجرد أن يجري شخص ما مقارنة محكومة ضد الأوزان المحلية. لم ينشر أحد تلك المقارنة بعد. وحتى يحدث ذلك، فإن الدليل في المستودع هو الخيار الأفضل — وهو موجود في نفس التنزيل الذي أنفقت عليه 42 جيجابايت بالفعل.
