
دخول Utopai X في المرتبة الثانية في مجال النص إلى الفيديو: داخل مرحلة التدريب اللاحق لنموذج MiniMax H3 في استوديو أفلام
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 121 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1124 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Utopai X هو نموذج فيديو لم يكن موجودًا الأسبوع الماضي، ولم يُدرَّب من الصفر بواسطة مختبر رائد، ولا يُباع عبر واجهة برمجة تطبيقات — وهو حاليًا مصنّف الثاني عالميًا في تحويل النص إلى فيديو. يأتي النموذج من Utopai Studios، وهو استوديو أفلام وتلفزيون أصلي بالذكاء الاصطناعي يقع في Mountain View، وهو نموذج مُدرَّب لاحقًا لـ MiniMax H3، النموذج الفيديو متعدد الوسائط من MiniMax. على لوحة صدارة Artificial Analysis لتحويل النص إلى فيديو مع الصوت (اللوحة التي تسميها Artificial Analysis الآن AA-Video-T2V v2.0، نتائج 29 سبتمبر 2026)، يحل Utopai X في موقع Elo 1,150 — خلف Alibasba's Wan 3.0 فقط عند 1,157، ومتقدّمًا على ByteDance's Dreamina Seedance 2.5 عند 1,143 وMiniMax H3 (768p) النموذج الأساسي الذي ضُبط انطلاقًا منه عند 1,138. وصل في 2026-09-30، وهو اليوم نفسه الذي جُدِّدت فيه لوحة الصدارة، وهو متاح في مكان واحد بالضبط: داخل PAI، منصة الإنتاج الخاصة بـ Utopai. لا توجد واجهة برمجة تطبيقات عامة، ويقرأ عمود التسعير الخاص بـ Artificial Analysis لهذا الصف: "No API available."
هذه التركيبة — المركز الثاني في العالم، قناة توزيع واحدة، ولا تسعير لكل ثانية بالمعنى المعتاد — هي القصة كاملة. فاستوديو يصنع الأفلام أخذ نموذجًا أساسيًا مملوكًا لشخص آخر، وضبطه وفق حكمه الإنتاجي الخاص، فقفز في الطابور. وما إذا كان ذلك نتيجة مستدامة أم لقطة من ساحة جديدة كليًا هو السؤال الجدير بالطرح، والإجابة تعتمد على قراءة لوحة الصدارة لا البيان الصحفي.
ما تعرضه اللوحة فعليًا
تصنّف Artificial Analysis نماذج الفيديو باستخدام Elo المستمد من تصويت بشري أعمى ثنائي على التفضيلات. يرى المصوّتون مقطعين تم توليدهما من النص التوجيهي نفسه، ويختارون المقطع الذي يفضّلونه، دون معرفة النموذج الذي أنتج أيًّا منهما. تتغيّر اللوحة مع تراكم الأصوات، ويحمل كل صف فاصل ثقة يبيّن مقدار ما يُسمح للمركز أن يتحرّك. بالتقط بتاريخ 2026-10-01، تقرأ لوحة تحويل النص إلى فيديو مع الصوت كما يلي:

• المركز الأول Wan 3.0 — Elo 1,157 (±10)، 6,391 عينة، صدر في أغسطس 2026، 12.00 دولار/دقيقة.
• #2 Utopai X (استنادًا إلى MiniMax H3) — Elo 1,150 (±11)، 5,455 عينة، صدر في سبتمبر 2026، لا يتوفر API.
• #3 Dreamina Seedance 2.5 — Elo 1,143 (±10)، 6,375 عينة، صدر في يوليو 2026، 34.12 دولار/دقيقة.
• #4 MiniMax H3 (768p) — إيلو 1,138 (±10)، 6,343 عينة، صدر في يوليو 2026، 4.80 دولار/دقيقة.
• #5 FLUX 3 — إيلو 1,129 (±10)، 5,628 عينة، صدر في يوليو 2026، 17.40 دولار/دقيقة.
هناك تفصيلان يهمّان أكثر من الترتيب. أولًا، الفارق بين المركز الأول والثاني سبع نقاط Elo، والفترتان متداخلتان صراحةً — إذ تطبع Artificial Analysis نطاق Utopai X عند 1,139 إلى 1,161، وهو يتضمّن التقدير النقطي لـ Wan 3.0 البالغ 1,157. وتُسمّي اللوحة ترتيب Utopai X كنطاق، #1–3، لا كمركز ثابت. ثانيًا، الفارق بين Utopai X والنموذج الذي دُرّب لاحقًا انطلاقًا منه اثنتا عشرة نقطة، مع مشكلة التداخل نفسها، لذا فإن "النموذج المدرَّب لاحقًا يتغلّب على أصله" صحيح من حيث الاتجاه لكنه ضعيف إحصائيًا. وما كتبته Utopai بنفسها عن هذا أكثر حرصًا من معظم منشورات الإطلاق: فهي تقول إن نتيجة Elo "توفّر تقييمًا مستقلًا لكيفية تفاعل الناس مع اللقطات المولّدة"، وهو قراءة منصفة لما تقيسه ساحة التفضيل البشري وليست ادعاءً بشأن صناعة الأفلام.
أما الطبقة المستندة إلى ما يبلّغ عنه المورّد، في المقابل، فهي واثقة. يصف Utopai نقاط قوة في الانعكاسات والكاوستيك — الأنماط المركّزة التي تتشكّل عندما ينعكس الضوء أو ينكسر — وفي الاتساق المكاني داخل المقطع، وكلاهما هدفان تطويريان وليسا نتائج قياس مرجعية. تلك كلمات المورّد، وليست قياسات Artificial Analysis.
استوديو بدلاً من مختبر
تطوّر Utopai Studios وتموّل وتنتج مشاريعها الخاصة للأفلام والتلفزيون، وتبني نماذجها داخل ذلك العمل لا إلى جانبه. والآلية المعلَنة هي التغذية الراجعة: تولّد الإنتاجات سيناريوهات، وتصاميم شخصيات ومواقع معتمدة، وخطط لقطات، ولقطات متتالية، ويسجّل مخرجو الاستوديو ومديرو التصوير والفنانون لا اللقطات التي تم الإبقاء عليها فحسب، بل سبب رفض اللقطات الأخرى أيضًا. ويصبح هذا السجل إشارة تدريب وتقييم. كما يدير فريق البحث نظام Elo داخليًا يجمع بين تقييم التفضيل البشري والتصويت الآلي بواسطة نماذج الرؤية واللغة، مع مشاركة الفنانين في الجانب البشري.
إنها ميزة معقولة، لكنها غير قابلة للتحقق من الخارج. يمكن للتدريب اللاحق أن يوجّه نموذج فيديو عام نحو تفضيلات مستخدمي الأفلام والإعلانات دون استبدال النموذج الأساسي — وهذا القدر متسق مع لوحة الصدارة. أما مقدار ما يعود من فارق النقاط الاثنتي عشرة على MiniMax H3 إلى بيانات التدريب، أو تحسين التفضيلات، أو التعامل مع الأوامر النصية، أو إعدادات الاستدلال، أو تغييرات وقت الخدمة، فليس مما تقوله مواد الإطلاق. لم تنشر Utopai أي إفصاح عن بيانات التدريب اللاحق، ولا أي طريقة تحسين، ولا أي ميزانية حوسبة، ولا أي تقييم للسلامة. لا يستطيع الباحثون المستقلون إعادة إنتاج هذا المكسب، ولا يوجد تقرير تقني للجدال معه.
طبقة التوزيع هي حيث تتحوّل أطروحة الاستوديو إلى واقع ملموس. PAI — Production Assistive Intelligence هي المنصة التي أطلقتها Utopai إلى جانب النموذج، وهي تحتفظ بسياق المشروع: تفكيك المشروع إلى مشاهد ولقطات، ومكتبة إنتاج من الشخصيات والمواقع والعناصر، وسجل الإصدارات، وموافقات مشتركة لفرق المؤسسات، وجدول زمني يُصدَّر إلى Premiere Pro أو DaVinci Resolve. الفكرة المطروحة هي أن توليد مقطع هو الجزء الرخيص، بينما الحفاظ على اتساق اللقطة مع بقية الفيلم هو الجزء المكلف. يولّد Utopai X المواد المصوّرة داخل مساحة العمل هذه "عندما يختاره صانع الفيلم"، وفق صياغة الشركة نفسها — النموذج خيار واحد من بين عدة نماذج للصور والفيديو والصوت متاحة في PAI، وليس الخيار الوحيد.
ما هي تكلفة Utopai X، وكيفية قراءتها

يُباع PAI كاشتراك مع أرصدة، وليس كـ API يُحتسب بالثانية. الباقات المعلنة هي 15 دولارًا/شهريًا مقابل 1,000 رصيد، و49 دولارًا/شهريًا مقابل 3,500 رصيد، و129 دولارًا/شهريًا مقابل 10,000 رصيد، و379 دولارًا/شهريًا مقابل 35,000 رصيد، مع خصم يتراوح بين نحو 8 و10 بالمئة عند الفوترة السنوية، إضافة إلى عمليات تعبئة إضافية بسعر 15 دولارًا لكل 1,000 رصيد. ولـ Utopai X بند خاص به في جدول أرصدة PAI: 93 رصيدًا لكل ثانية من الفيديو بدقة 1080p. أما نماذج الفيديو الأخرى على المنصة فأسعارها أقل — 50 رصيدًا لكل ثانية بدقة 1080p ضمن الطبقة القياسية و76 ضمن طبقة pro.
إن تحويل ذلك إلى رقم لكل دقيقة عملية حسابية يستطيع أي شخص إجراؤها، ولا ينبغي لأحد تقريبًا أن يذكره كسعر. عند 93 رصيدًا في الثانية، تكلّف دقيقة واحدة من مخرجات Utopai X نحو 5,580 رصيدًا. خطة الدخول البالغة 15 دولارًا تمنح 1,000 رصيد شهريًا، أي نحو 10.8 ثوانٍ من اللقطات إذا خُصص كل رصيد لهذا النموذج. وعند تطبيق معدل رصيد خطة الدخول خطيًا، تكون التكلفة الضمنية في حدود أكثر من 80 دولارًا لكل دقيقة من الفيديو المُولَّد. لا يجدر ذكر هذا الرقم إلا مصحوبًا بمحاذيره: فهو يفترض تحويلًا خطيًا صرفًا من الرصيد إلى الدولار، ويتجاهل أن الأرصدة مجمّعة عبر كل نموذج في PAI وتنتهي صلاحيتها أو تبقى دون استخدام، ويتجاهل الخصومات السنوية وحزم الشحن الإضافية، ولا يقول شيئًا عن حدود الدقة أو الطول، التي لم تحددها Utopai بشكل منفصل لـ Utopai X. إنه مفيد كرتبة مقدار، وليس قائمة أسعار.
للمقارنة، على نفس لوحة Artificial Analysis، تم إدراج MiniMax H3 (768p) بسعر 4.80 دولارًا في الدقيقة وWan 3.0 بسعر 12.00 دولارًا، بينما تم إدراج Dreamina Seedance 2.5 بسعر 34.12 دولارًا. تلك هي خلاصات تسعير آلية من واجهات برمجة التطبيقات الخاصة بالبائعين أنفسهم، وليست تقديرات مستمدة من الاشتراكات، لذا فإن المقارنة توجيهية في أفضل الأحوال — لكن الاتجاه واضح: في الفئة المبتدئة، لا يتنافس التوليد داخل منصة استوديو قائمة على الأرصدة مع تسعير واجهة برمجة التطبيقات لكل ثانية. ما يدفع المشتري مقابله هو مساحة العمل المحيطة بالنموذج، وليس الثانية الحدية للنموذج.
الجزء غير العام
ثلاث فجوات جديرة بالتسمية، لأن كل واحدة منها تعوق قرارًا مختلفًا.
• لا توجد واجهة برمجة تطبيقات، ولا مسار تكامل.لا يمتلك Utopai X حاليًا أي مسار تكامل مباشر. فلا تستطيع أي فرق منتجات ترغب في استدعائه ضمن خط سير عملها أن تفعل ذلك. وتصنّفه Artificial Analysis على أنه "لا تتوفر واجهة برمجة تطبيقات"، كما لا تصف مواد الإطلاق أي وصول للمطورين.
• لا توجد مواصفة منفصلة. يُنتج MiniMax H3 مقاطع تتراوح مدتها بين 4 و15 ثانية وبدقة تصل إلى 2K مع صوت ستيريو أصلي. ولم تنشر Utopai حدًّا أقصى خاصًّا بها للمدة أو الدقة في Utopai X، ما يعني أن قيمة 1080p الواردة في جدول الأرصدة هي بيان الدقة الوحيد المتاح، في حين يظل طول المقطع غير معروف.
• لا يوجد تقييم خارج الساحة. نتيجة Elo هي قياس مستقل لتفضيل البشر للمقاطع القصيرة. وهي ليست مقياسًا لما إذا كانت اللقطات تخدم لقطة مقصودة، أو تدخل في مونتاج، أو تصمد أمام مراجعة. ويعترف منشور Utopai نفسه بهذا مباشرةً — "يستمر التقييم أيضًا بعد إنشاء المقطع" — وهو تأطير صادق على نحو غير معتاد لإطلاق، وكذلك تحذير بشأن المدى الذي يمتد إليه التصنيف.
على جانب الاستوديو، هناك مزيد من التاريخ الذي يمكن الإشارة إليه. أطلقت Utopai نموذج PAI 2.0 في 2026-06-02، وقالت حينها إن المنصة بلغت 11 مليون دولار من الإيرادات السنوية المتكررة بعد أقل من شهرين من انطلاقتها في أبريل، مدفوعةً بتراخيص تجارية بيعت لشركات إنتاج. وتقول الشركة إن لديها ثلاثة أفلام سينمائية ومسلسلين مبرمجين لعام 2027، وإنها تطبّق PAI وUtopai X على إنتاجاتها الخاصة، بما في ذلك الضرطة الأكثر جدية، فيلم رسوم متحركة طويل كتبه وأخرجه مايك بندر. تلك هي أرقام الاستوديو وجدول الاستوديو الزمني، وهي السبب في أن نموذجًا مُدرَّبًا لاحقًا من دون واجهة برمجة تطبيقات يستحق الكتابة عنه أصلاً: النموذج يُستخدم لصنع أفلام تعتزم الشركة إصدارها، وهو اختبار أصعب من لوحة الصدارة.
حيث لا يزال الطراز الأساسي هو الخيار العملي

بالنسبة لأي شخص يحتاج فعلاً إلى توليد الفيديو هذا الأسبوع، فإن النصف القابل للتوجيه من هذه العائلة هو النموذج الأساسي. MiniMax H3 متاح على OrcaRouter عند سعر قائمة المزوّد — 0.08 دولار للثانية بدقة 768p، أي 4.80 دولارات للدقيقة، وهو الرقم نفسه الذي تدرجه Artificial Analysis — بدون أي هامش ربح بنسبة 0%، لذا يصل أي تخفيض سعري من البائع في اليوم نفسه بدلاً من بعد دورة إعادة تسعير، مع تحويل تلقائي عند الفشل عبر المزوّدين بحيث لا يؤدي انقطاع نقطة نهاية واحدة إلى تعطيل خط أنابيبك. يقبل مراجع النصوص والصور والفيديو والصوت كسياق موحّد واحد، ويعيد مقاطع من 4 إلى 15 ثانية بدقة 768P أو 2K مع صوت ستيريو أصلي، ويُحتسب السعر لكل ثانية من المخرجات المولّدة.
لا يتم توجيه Utopai X، وليس في هذه المقالة ما ينبغي قراءته على أنه ادعاء بأنه كذلك. ما يمنحك إياه النموذج الأساسي هو طريقة لاختبار الخصائص الجمالية والحركية لعائلة H3 — الأساس نفسه الذي انطلق منه Utopai، قبل أي تدريب لاحق كان قد طبّقه — عبر مفتاح API واحد إلى جانب أكثر من 200 نموذج آخر، دون اشتراك PAI. إذا وصل Utopai X يوماً إلى مزوّد قابل للتوجيه، فسيظهر بسعر القائمة في اليوم نفسه، مع تمرير سعر المورّد كما هو بدلاً من رفعه. وحتى ذلك الحين، يكون التقسيم الصادق كالتالي: Utopai X للاستوديوهات داخل PAI، وMiniMax H3 لكل من يجمّع خط أنابيب.
ما الذي يحدد ما إذا كان هذا أول ظهور أم لحظة؟
تجدر متابعة ثلاثة أمور خلال الربع القادم. أولًا، ما إذا كانت الفجوة البالغة سبع نقاط في الصدارة ستصمد أمام بضعة آلاف من الأصوات الإضافية — فالفترات متداخلة اليوم، ولوحة تُعاد ترتيبها عند وصول دفعة جديدة من المقارنات لم تحسم شيئًا. ثانيًا، ما إذا كانت Utopai ستفتح أي وصول للمطورين على الإطلاق؛ فنموذج يحتل المركز الثاني في العالم ولا يستطيع استدعاءه سوى مشترك في PAI هو قرار منتج، وهو قابل للتراجع. ثالثًا، ما إذا كانت المنافسة تتحرك في الاتجاه المعاكس. Wan 3.0 تولّد بالفعل ما يصل إلى 30 ثانية بدقة 1080p مع صوت أصلي، وتقبل النصوص والصور والفيديو والصوت والمستندات وصفحات الويب كمراجع، وتتصدر لوحة الصدارة في الإضاءة والمواد والتحكم بالكاميرا ضمن التفصيل حسب حالات الاستخدام. إن تحسّنًا بمقدار اثنتي عشرة نقطة بعد التدريب مقارنةً بنموذج أساسي أمر مثير للدلالة؛ أما الحفاظ على المركز الثاني أمام نموذج أساسي ذي نطاق مدخلات أوسع فهو مهمة مختلفة.
ما الجديد حقًا هنا ليس Elo. بل شكل الادعاء: استوديو لديه خط إنتاج يجادل بأن امتلاك القرارات الكامنة خلف اللقطات — أي لقطة، وأي مرجع، وأي تنقيح — أكثر قيمة من امتلاك عملية التدريب المسبق. هذا الادعاء قابل للاختبار، وإيرادات شباك التذاكر لقائمة أفلام 2027 أحد هذه الاختبارات.
