بطاقة عنوان مُولّدة لـ Vidu Q4 Preview، بعنوان فرعي 'المركز الثالث على لوحة تحويل الصورة إلى فيديو في اليوم الأول'، مع بطاقات تحمل 'AA-Video-I2V v1.0: #3, Elo 1,179' و'Vidu Q3 Pro: #19, Elo 1,056'، ومع صف من مربعات المواصفات يحمل 'أقصى مقطع: 16 ثانية'، و'أقصى دقة: 4K'، و'الصور المرجعية: حتى 15'، و'تحويل النص إلى فيديو: غير متاح'. يقع شعار OrcaRouter في الشريط المبطّن أسفل اليمين.
Guides & Insights

Vidu Q4 Preview يظهر لأول مرة في المركز الثالث على قائمة تحويل الصور إلى فيديو — ويغيب عن القائمة الأخرى

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Vidu Q4 Preview دخل لوحة متصدري Artificial Analysis AA-Video-I2V v1.0 في المرتبة الثالثة بتقييم Elo قدره 1,179، والنموذج الذي حلّ محلّه كأفضل مشاركة لـ Vidu، Vidu Q3 Pro، يحتل المرتبة التاسعة عشرة بـ 1,056. هذا تحرّك بمقدار 123 نقطة في إصدار واحد، على لوحة يبلغ عرض فترات الثقة فيها نحو عشرين نقطة، وقد حدث بسعر 7.20 دولار للدقيقة من الفيديو المولّد بدلاً من 9.60 دولار التي يحملها النموذج الأقدم. أطلقت Shengshu Technology Vidu Q4 Preview في 7 أكتوبر 2026 كأول معاينة عامة لطرازها الرئيسي من الجيل التالي، متقدّمةً صراحةً على نموذج Q4 الكامل، وتطلب من المبدعين استخدامه في مشاريع حقيقية بينما لا يزال الإصدار النهائي قيد التشكيل.

رقم الظهور الأول هو العنوان الرئيسي. أما الغياب فهو الحقيقة الأكثر إثارة للاهتمام، وهو السبب في أن هذا مقال لا رسم بياني.

ما الذي تم شحنه فعليًا في 7 أكتوبر

Vidu Q4 Preview هو نموذج لتوليد الفيديو مزوّد بصوت أصلي، ويُطرح عبر منتج Vidu الإلكتروني الخاص به ومنصته للواجهات البرمجية API. وتصف مواد الإطلاق الخاصة بـ Shengshu ثلاثة مجالات عمل: أداء الشخصيات (تنسيق تعابير الوجه والمشاعر وحركة الجسد والصوت معًا بدلًا من تراكبها)، وتماسك الكاميرا والقطعات في الحركة السريعة، والمؤثرات البصرية — الانفجارات والجزيئات والألعاب النارية — التي تكون داخل المشهد لا فوقه.

المواصفة، كما ينصّ عليها المورّد:

• أقصى دقة — 4K، مع توفير 2K و4K عمق ألوان 10 بت؛ السلسلة الكاملة هي 540p، 720p، 1080p، 2K، 4K

• الحد الأقصى لطول المقطع — 16 ثانية، مقسّم بشكل غير متساوٍ: يعمل Image-to-Video من 3 إلى 16 ثانية، ويعمل Reference-to-Video من 1 إلى 16

• ميزانية المراجع — حتى 15 صورة مرجعية (الشخصيات، الأزياء، الدعائم، المنتجات، البيئات في إعداد واحد) وحتى 3 مقاطع صوتية مرجعية

• أسعار الإطلاق — بدءًا من 0.014 دولار لكل ثانية، وهو رقم المورّد وترويجي بشكل صريح

ويقدّم المورّد أيضًا ادعاءً مقارنًا لا يمكن مساءلته عنه بسهولة: مفاده أنه في ظل مواصفات مخرجات وشروط فوترة مماثلة، يقدّم Vidu Q4 Preview «ما يصل إلى خمسة أضعاف المخرجات مقابل الميزانية نفسها». هذا ادعاء كفاءة، لا ادعاء جودة، ولأن عبارة «مواصفات مخرجات وشروط فوترة مماثلة» هي التي تقوم بالعمل كله في تلك الجملة، فإنه يجدر التعامل معه كصياغة تسويقية إلى أن يتمكن أحد من إعادة إنتاجه. وتحذير Shengshu نفسه، المنشور إلى جانب ذلك، هو أن الأسعار النهائية والدقات المدعومة وتوافر الميزات وشروط الاستخدام قد تختلف حسب الخطة والمنطقة.

A generated single-column scoreboard titled 'Vidu Q4 Preview — the scoreboard' with six rows reading 'AA I2V rank: 3rd, Elo 1,179', 'Max resolution: 4K at 10-bit', 'Max clip: 16 seconds', 'Reference images: up to 15', 'Reference audio: up to 3' and 'Measured rate: $7.20 per minute', with a footer reading 'Elo, rank and rate per Artificial Analysis, 8 October 2026; resolution and clip length are vendor-stated.' The OrcaRouter logo sits in the bottom-right padded strip.

يختلف المجلسان حول الغرض من هذا النموذج

تُدير Artificial Analysis لوحات صدارة منفصلة للفيديو، بمقاييس Elo منفصلة ومجموعات تصويت منفصلة، والفرق بينها هو بيت القصيد هنا.

On AA-Video-I2V v1.0 — image-to-video, ranked from pairwise human preference votes with audio kept in — Vidu Q4 Preview is third at 1,179 ±10 over 5,543 samples, dated October 2026, priced at $7.20 per minute. Only two models are above it: MiniMax H3 Max at 1,195 ±9 over 5,894 samples ($4.80/min, August 2026) and MiniMax H3 at 1,181 ±8 over 7,284 samples ($7.80/min, July 2026). Gem​ini Omni Flash is fourth at 1,178 ±7 over 12,327 samples. The board's own notice says two models were added in the last 30 days: Vidu Q4 Preview and HiDream-O1-Video-1.0, which is sixth at 1,175 ±10.

على AA-Video-T2V v2.0 — تحويل النص إلى فيديو، لوحة مختلفة مبنية على تصنيف مختلف لحالات الاستخدام — لا يظهر Vidu Q4 Preview إطلاقًا. أفضل إدخال لـ Vidu هناك هو Vidu Q3 Pro، في المرتبة الخامسة والعشرين عند 941 ±10 عبر 4,088 عينة. يتصدر Wan 3.0 تلك اللوحة عند 1,156 ±9.

اقرأ هاتين الجملتين معًا وتتضح ملامح الإصدار. هذا نموذج يعتمد على الصور والمراجع. تسرد صفحة منتج Vidu الخاصة به وضعين بالضبط، وهما Image-to-Video وReference-to-Video، دون أي تبويب للتحويل من نص إلى فيديو، وتوثيق API يطابق ذلك. الإطلاق الذي يبدو في تسويق المورّد وكأنه إطلاق رائد عام هو، على المنتديات المستقلة، إطلاق موجَّه.

ملاحظة تحذيرية أخرى حول الترتيب نفسه. تتداخل الفواصل البالغة عشر نقاط في لوحة I2V بشكل كبير من المركز الثالث حتى السادس — 1,179، 1,178، 1,176، 1,175 — لذا فإن «الثالث» موضع يقع ضمن الضجيج، وليس فصلًا واضحًا عن الرابع. وما ليس ضمن الضجيج هو الفجوة إلى النموذج الذي حلّ محلّه. إن فارق 123 نقطة Elo بين Vidu Q3 Pro وVidu Q4 Preview أكبر من كامل الفارق عبر المراكز الستة الأولى في اللوحة.

The Artificial Analysis image-to-video board on 8 October 2026, with Vidu Q4 Preview third at Elo 1,179 and Vidu Q3 Pro nineteenth at 1,056.

ما الذي تتصل به فعليًا، وما تكلفته

واجهة API غير براقة ومحددة. تُرسل ميزة Image-to-Video طلبات إلى /ent/v2/img2video باسم الطراز viduq4-preview، وتأخذ صورة إطار بداية واحدة (png أو jpeg أو jpg أو webp، حتى 50 ميغابايت)، ووصفًا نصيًا يصل إلى 20,000 حرف، ومدة من 3 إلى 16 ثانية مع افتراضي 5، ودقة من 540p إلى 4K مع افتراضي 720p. تُرسل ميزة Reference-to-Video طلبات إلى /ent/v2/reference2video، وتأخذ من صورة واحدة إلى خمس عشرة صورة بالإضافة إلى صفر إلى ثلاثة مراجع صوتية mp3 بمدة تتراوح من ثلاث إلى اثنتي عشرة ثانية لكل منها، وتوفر نسب أبعاد 1:1 و9:16 و16:9 و3:4 و4:3 مع افتراضي 16:9.

المعامل الذي يستحق الانتباه هو audio، الذي تكون قيمته الافتراضية true. يُنشئ Vidu Q4 Preview الصوت مع الصورة افتراضيًا — بما في ذلك الحوار والمؤثرات الصوتية — وتقوم بإيقافه عمدًا. تظل روابط الإنشاء المُعادة صالحة لمدة 24 ساعة، وهي مدة قصيرة بما يكفي لتكون ذات أهمية إذا كنت تُنشئ على دفعات وتُصيّر لاحقًا.

في ما يتعلق بالسعر، الحساب الصادق هو أن الرقمين المطروحين — «$0.014 لكل ثانية» و«$7.20 لكل دقيقة» الذي تسجله Artificial Analysis — ليسا المنتج نفسه. $0.014 لكل ثانية يساوي $0.84 لكل دقيقة، أي نحو تُسع رقم لوحة النتائج، وهو ما يبدو عليه حد أدنى ترويجي عند أدنى دقة مقارنةً بمعدل مقيس عند دقة إنتاجية. أي رقم تُدرجه في ميزانيتك انطلاقًا من رقم الإطلاق ينبغي إعادة اشتقاقه من دقتك ومدتك الخاصة، لا من العنوان.

Vidu's own API documentation for the Image-to-Video and Reference-to-Video endpoints behind Vidu Q4 Preview.

المشكلة العملية المتعلقة بـ SKU المعاينة

إن Vidu Q4 Preview، وفقًا لصياغة البائع نفسه، ليس مكتملًا. صدر قبل Q4 لكي تُسهم الملاحظات حول الأداء والتحكم الإبداعي واحتياجات الإنتاج اليومي في تشكيل الإصدار النهائي. التسعير ترويجي. يختلف توفر الميزات حسب الخطة والمنطقة. حتى إن وثائق API تحتوي على اسم مستعار مكتوب بشكل خاطئ — viduq4-previerw يظهر في وصف معامل النموذج إلى جانب viduq4-preview — وهو أمر صغير يخبرك بشيء حقيقي عن موقع هذه البنية في خط الأنابيب.

هذا ليس حجة ضد استخدامه. بل هو حجة ضد وضعه على مسار حرج دون خطة لما سيحدث عندما ينتهي السعر الترويجي أو تُستبدل نسخة المعاينة، وهو أمر بالنسبة لنموذج يُطرح بهذه الطريقة مسألة أسابيع، لا أرباع.

إذا أردت تجربته دون المجازفة بخط إنتاج كامل عليه، فقد صُمّم OrcaRouter لهذه الحالة تحديدًا: نقطة نهاية واحدة متوافقة مع OpenAI عبر أكثر من 200 نموذج، وتحويل تلقائي عند الفشل بين المزوّدين، وأسعار قوائم المزوّدين تُمرَّر كما هي دون إضافة أي هامش. ويكتسب شق التحويل عند الفشل أهمية أكبر من المعتاد مع نسخة معاينة، لأنه ما يتيح لك توجيه الطلب إلى نموذج مستقر على المفتاح نفسه عندما يكون مسار المعاينة غير متاح. ولنكن صريحين بشأن التوجيه: إن Vidu Q4 Preview ليس مسارًا في OrcaRouter اليوم. أما نماذج الفيديو التي نقدّمها فعلًا — بما فيها MiniMax H3، النموذج الأعلى تصنيفًا على هذه اللوحة نفسها — فيمكن استدعاؤها على نقطة النهاية نفسها التي تُستدعى عليها النماذج النصية، وسعر الفيديو لكل ثانية بند في الفاتورة، لا عقد منفصل.

ماذا تشاهد

ثلاثة أمور من شأنها أن تحرّك هذه القصة.

أولاً، لوحة النص إلى الفيديو. قالت Artificial Analysis إن AA-Video-I2V v2.0 قادم، متوافقًا مع تصنيف T2V v2.0 ويغطي فيديو 1080p بالكامل. إذا كان Vidu Q4 Preview نموذجًا للصورة والمرجع، فلن يظهر هناك أيضًا — وإن ظهر، فهذا يخبرك بأن Shengshu أطلقت نموذجًا أوسع مما توحي به المعاينة.

ثانياً، الإصدار الكامل للربع الرابع. الانتقال من النسخة التجريبية إلى النسخة النهائية هو النقطة التي ينتهي عندها عادةً التسعير الترويجي، والتي إما تصمد فيها مجموعة الميزات أو تضيق بهدوء. وإن سقف المراجع البالغ 15 صورة و3 مقاطع صوتية هو الجزء من المواصفات الأرجح للبقاء، لأنه الميزة التفريقية التي يقوم عليها الإطلاق بأكمله.

ثالثًا، حجم العينة. 5,543 صوتًا قياس حقيقي لكنه حديث العهد؛ ستضيق الفواصل وستتحرك المرتبة، في أيٍّ من الاتجاهين، مع امتلاء القائمة. ومن يقتبس «المركز الثالث» كحقيقة مستقرة عليه أن يذكر تاريخ قراءته لها.

السؤال الجدير بالتمسك به أضيق مما يوحي به التسويق. إن Vidu Q4 Preview هو أفضل نموذج لتحويل الصورة إلى فيديو أنتجته Vidu حتى الآن بشكل قابل للقياس، وبهامش أكبر من الفارق بين المراكز الستة الأولى في لوحة الصدارة الخاصة به، وبسعر أدنى للدقيقة من سابقه. أما إن كان ذلك سيصبح مكانة دائمة أم مجرد انتعاشة إصدار تجريبي، فليس أمرًا يمكن لأي من الأرقام الحالية الإجابة عنه.