بطاقة عنوان مُولّدة تحمل النص 'Kandinsky 6.0 Video vs Alibaba Wan 2.7' مع عنوان فرعي 'أوزان مفتوحة مقابل مجموعة من أربعة نماذج'. يقع شعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

Kandinsky 6.0 Video مقابل Alibaba Wan 2.7: أوزان مفتوحة في مواجهة مجموعة من أربعة نماذج

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Kandinsky 6.0 Video يمنحك نقطة تحقق (checkpoint) تضم 29 مليار معامل يمكنك تنزيلها، ويُعيد لك مقطعًا مدته خمس ثوانٍ. Wan 2.7 يمنحك أربعة متغيّرات مخصّصة لمهام محددة، ومقاطع يصل طولها إلى خمس عشرة ثانية، وفاتورة تُحسب لكل ثانية. هاتان الجملتان هما المقارنة، والسبب في أن تدوينها يستحق العناء هو أن معظم صفحات المقارنة المباشرة تقارنهما على الجودة البصرية، حيث لا يملك أيٌّ منهما تقييمًا مستقلًا كفيلًا بحسم الأمر — وتتخطى المحور الذي يختلفان فيه فعليًا، ألا وهو ما يتوقع كلٌّ منهما أن تجلبه معك.

أصدر مختبر Kandinsky التابع لـ Sber نموذج Kandinsky 6.0 Video بوصفه مفتوح المصدر في الأسبوع الأول من أكتوبر بموجب رخصة MIT، وبحجمين — Pro بسعة 29B وLite بسعة 3B، مع الشيفرة ونقاط التحقق وتكامل diffusers. وطُرحت Wan 2.7 من Alibaba في 3 أبريل 2026 كمجموعة: نص إلى فيديو، وصورة إلى فيديو، ومرجع إلى فيديو، وتحرير فيديو، مع فوترة لكل ثانية من الفيديو المولّد. أحد هذين نموذج تشغّله بنفسك؛ والآخر خدمة تشتريها. والسؤال المثير للفضول ليس أيهما أفضل، بل أيهما الشكل الملائم للعمل.

المحور الوحيد الذي يمكن المقارنة بينهما فيه مباشرةً

كلا النموذجين يولّدان فيديو مصحوبًا بالصوت، وليس فيديو تقوم بعد ذلك بإضافة الموسيقى التصويرية إليه. هذا أندر مما يبدو، وهو سبب ذكرهما معًا من الأساس — إذ لا يزال معظم هذا المجال ينتج ملف MP4 صامتًا ويترك الصوت لمرحلة منفصلة.

يحقق Kandinsky 6.0 Video ذلك باستخدام CrossDiT ثنائي المسار: مسار فيديو يُهيَّأ من نقطة حفظ Kandinsky 5.0 Video، ومسار صوت مدرَّب من الصفر على مجموعات كبيرة من البيانات الصوتية، وانتباه متقاطع ثنائي الاتجاه يربط بينهما، ويُدرَّبان معًا بعد مرحلة تدريب مسبق مستمر. الناتج صوت بتردد 44 kHz مع مزامنة الشفاه، انطلاقًا من موجّه نصي (T2AV) أو صورة مرجعية (I2AV).

ينتج Wan 2.7 صوتًا أصليًا أيضًا، دون أن ينشر الآلية بالتفصيل نفسه. وتذكر وثائقه الخاصة جودة الصوت ودقة النص المعروض على الشاشة باعتبارهما المجالين اللذين ما زالا بحاجة إلى عمل — وهو تحفّظ على الأمانة يستحق التمسك به، لأنه قول الجهة المورّدة نفسها، لا تخمين من مراجع.

هنا ينتهي التشابه. كل ما يقع أسفل هذا السطر هو اختلاف، وليس ترتيبًا.

خمس ثوانٍ مقابل خمس عشرة ثانية، وما يفعله ذلك بقائمة اللقطات

تم تدريب Kandinsky 6.0 Video على 121 إطارًا بمعدل 24 إطارًا في الثانية — أي خمس ثوانٍ — ولا يتضمن الإصدار وضع تمديد. إن الورقة البحثية، ووصفة التشغيل المدمجة في vLLM-Omni، وجدول الأداء في المستودع، كلها مبنية حول طول المقطع الواحد هذا. العمل البالغ ثلاثين ثانية هو ست عمليات توليد وخمس عمليات وصل، وإخفاء الوصلات متروك لك.

يغطي Wan 2.7 مدة تتراوح من ثانيتين إلى خمس عشرة ثانية في توليد واحد، ويُحدَّد ذلك حسب الطلب. بالنسبة لمقطع لمتحدث، أو لقطة إدراجية لمنتج، أو حركة كاميرا واحدة، فإن هذا الفارق ليس مجرد تسهيل — بل هو الفرق بين تصيير واحد وخطوة تجميع. وبالنسبة لأي عمل يُبنى لقطة بلقطة، فإن خمس ثوانٍ هي وحدة عمل طبيعية، ويكاد هذا الفارق يختفي.

• الحد الأقصى للمقطع — Kandinsky 6.0 Video: 5 ثوانٍ، ثابت، 121 إطارًا بمعدل 24 إطارًا في الثانية. Wan 2.7: من 2 إلى 15 ثانية، يُحدَّد حسب الطلب.

• الدقة — Kandinsky 6.0 Video: SD وHD وFull HD (1920×1080) عبر نموذج منفصل للدقة الفائقة. Wan 2.7: حتى 1080p.

• التكييف المرجعي — Kandinsky 6.0 Video: صورة واحدة، تُطبَّق كإطار خلفي مقنَّع. Wan 2.7: حتى خمس صور للموضوع وخمس مقاطع مرجعية، عشرة أصول لكل طلب.

• المهام — Kandinsky 6.0 Video: T2AV وI2AV. Wan 2.7: تحويل النص إلى فيديو، وتحويل الصورة إلى فيديو، وتحويل المرجع إلى فيديو، وتحرير الفيديو كمتغيرات منفصلة بفوترة منفصلة.

• الأوزان — Kandinsky 6.0 Video: MIT، قابلة للتنزيل، Pro وLite. Wan 2.7: لا.

أربع مهام مقابل وضعين

عدد المهام هو الجزء من Wan 2.7 الذي يُقلَّل من شأنه في جداول المقارنة، لأنه ليس ادعاءً بالجودة — بل ادعاء بالنطاق. إن التحرير القائم على التعليمات للقطات الموجودة، حيث تصف تغييرًا فتحصل على اللقطة نفسها وقد طُبِّق عليها ذلك التغيير، هو عبء عمل لا تحاول Kandinsky 6.0 Video معالجته على الإطلاق. أما التحويل من المرجع إلى الفيديو، حيث يقود أداءٌ مُقدَّم موضوعًا مُولَّدًا، فهو أيضًا خارج وضعيها.

تعكس فوترة Wan 2.7 النطاق. تُحاسَب متغيّرات تحويل النص إلى فيديو وتحويل الصورة إلى فيديو من Wan 2.7 على مدة الإخراج فقط — 0.15 دولار/ثانية عند 720p و0.15 دولار/ثانية عند 1080p على نقاط النهاية الدولية، بينما تُدرج بكين وطوكيو 0.086 دولار/ثانية و0.143 دولار/ثانية للعمل نفسه. تحاسب نسخة المرجع إلى الفيديو الفيديوَ المُدخَل أيضًا، بحد أقصى خمس ثوانٍ. ويُحاسب مرجع مدته خمس ثوانٍ يوجّه مقطعًا مدته خمس عشرة ثانية على أنه عشرون ثانية من العمل. أما نسخة تحرير الفيديو فتحاسب على المخرجات فقط وتعتبر اللقطات المُدخلة مجانية — وهو المعدل الأكثر ملاءمة على الإطلاق في العائلة، والتحرير هو المجال الذي يكون فيه 2.7 الأقوى.

تنتمي حقيقتان عن دورة الحياة إلى جانب تلك الأرقام. أضافت Alibaba خصم إطلاق لفترة محدودة نسبته 30% على واجهات Bailian وQwen Cloud الخاصة بها، وانتهى في 23 سبتمبر 2026. وبشكل منفصل، فإن إشعار إيقاف Model Studio من Alibaba Cloud (المعرّف 118434) يضع عدة نماذج أقدم خارج الخدمة في 10 أكتوبر 2026، وwan2.7-r2v و wan2.7-image على تلك القائمة. هذا على مستوى المتغيرات لا إيقاف كامل للجيل — wan2.7-t2v و wan2.7-i2v لا يزالان مدرجين بأسعار سارية — لكن إذا كان reference-to-video هو سبب بحثك عن 2.7، فإن هذا المسار لم يتبق له سوى أربعة أيام.

ما تُظهره المجالس المستقلة وما لا تُظهره

هذا هو القسم الذي تغش فيه معظم المقارنات بين هذين الطرازين بصمت، لذا يجدر بنا أن نكون دقيقين بشأن ما هو موجود.

يمتلك Wan 2.7 درجات مستقلة على ثلاث لوحات فيديو منفصلة من Artificial Analysis، وهي لا تتفق مع بعضها البعض لأنها تقيس أشياء مختلفة:

• تحويل النص إلى فيديو — Wan2.7-260612 (إصدار يونيو) يحتل المرتبة 13–14 عند Elo 1,030 (±9) بناءً على 5,571 صوتًا، بتكلفة $9.00/دقيقة.

• تحويل الصورة إلى فيديو — يحتل Wan 2.7 (إصدار أبريل) المركز الثاني عشر بتصنيف Elo البالغ 1,077 (±8) بناءً على 4,571 صوتًا، بسعر 9.00 دولارات/دقيقة.

• تحرير الفيديو — يحتل Wan 2.7 المرتبة الخامسة عند Elo 1,077 (±5) عبر 17,988 صوتًا، بتكلفة 16.90 دولار/دقيقة.

اقرأ تلك الثلاثة معًا، والخلاصة المفيدة ليست «Wan 2.7 في المرتبة الثانية عشرة في الفيديو». بل إن النموذج أقوى بشكل ملحوظ في التحرير منه في التوليد، على لوحات مُعدّة لكلٍّ منهما، وأن اقتباس رقم واحد بشأنه خطأ في أيٍّ من الاتجاهين.

Kandinsky 6.0 Video ليس له أي نتيجة على أيٍّ منها. أدلته المنشورة صادرة من جهة المورّد، ويجدر أن نقول بدقة ما هي: تشغيل VABench يذكر فيه المختبر أن Pro في الصدارة في جودة الكلام، وجماليات الصوت، ومحاذاة النص مع الفيديو والصوت مع الفيديو، ودقة مزامنة الشفاه، وعدم التزامن، والواقعية البصرية بين الأنظمة الثلاثة التي جرى تقييمها — والنظامان الآخران هما نموذجه Lite و LTX 2.5 — وتقييم بشري جنبًا إلى جنب أجراه المختبر بنحو 200 مقارنة ثنائية أو أكثر لكل معيار، يكون فيه Pro منافسًا لـ Kling 2.6 و Veo 3.1 Fast، ويتخلف عن MiniMax H3 و Dreamina Seedance 2.0 في المعايير البصرية، ويظل منافسًا في جودة الكلام والمزامنة بين الصوت والفيديو. لم يُعَد إنتاج أيٍّ من ذلك خارج Sber، ولا أيٌّ منه تصنيف Elo على لوحة عامة عمياء. القراءة الصحيحة هي "واعد وغير مدقّق"، لا "يضاهي Veo".

كم تبلغ تكلفة كل واحد، معبرًا عنها بالمصطلحات التي يستخدمها كل طرف

لا يمكن اختزال نموذجَي التسعير في رقم واحد، والتظاهر بغير ذلك هو تحديداً كيف تتخذ الفرق قراراً خاطئاً.

Wan 2.7 تسعيرته لكل ثانية. مقطع بدقة 1080p مدته خمس عشرة ثانية يكلّف نحو $2.25. أما المقطع الذي مدته ثلاثون ثانية فهو عمليتا توليد زائد تحرير — $4.50 من التوليد الخام زائد وقت التجميع لديك، أو أقل إذا كانت نسخة التحرير هي التي تقوم بالعمل، لأنها لا تحتسب تكلفة المدخلات.

Kandinsky 6.0 Video ليس له سعر على الإطلاق، لأنه لا توجد خدمة للشراء. ما يملكه هو تكلفة ساعة GPU التي توفرها أنت. أرقام المستودع نفسه تحدد الحد الأدنى: مقطع Pro Full HD مدته خمس ثوانٍ يستغرق حوالي 402 ثانية من وقت العمل على H100 بعد الإحماء، و854 على RTX 5090، و1,247 على RTX 4090. نقطة التحقق المقطرة — التي قاستها الورقة البحثية على قدم المساواة مع النموذج الكامل، بمتوسط تفضيل 51% مقابل 49% دون أن يصل أي معيار إلى الدلالة الإحصائية — هي التي ستخدمها فعليًا. أي شيء أقل من 72.8 GiB من ذروة التخصيص يحتاج إلى تفريغ الكتل، والإعداد المسبق 16 GB يكمم مشفر النص إلى NF4، وهو ما تؤكده الورقة البحثية باعتباره التغيير الوحيد في الإعداد المسبق الذي يغير المقطع نفسه.

بعبارة واضحة: تكلفة Wan 2.7 هي بند في فاتورة يمكنك التنبؤ به. أما تكلفة Kandinsky 6.0 Video فهي آلة تملكها، وعملية عرض تستغرق دقائق لكل خمس ثوانٍ، وخيار الضبط الدقيق — لا إلزام به.

أين يقع الراوتر في هذا

لا يقدّم OrcaRouter خدمة Kandinsky 6.0 Video ولا Alibaba Wan 2.7، ولا يُطرح هنا أيٌّ من هذين الادّعاءين. Kandinsky متاح لك لتنزيله وتشغيله؛ أما Wan 2.7 فيُوصَل إليه عبر منصات Alibaba الخاصة. ما يحتاجه أي خط أنابيب مبني على أيٍّ من النموذجين من الراوتر هو طبقة النص التي تحيط بالتوليد: توسيع المطالبة الذي يحوّل وصف المشهد إلى التعليق الطويل أو القصير الذي دُرّبت عليه هذه النماذج، وعمل التعليقات والحوار الذي يغذّي تمريرة الصورة إلى الفيديو، وملخصات المراجعة التي تحدّد أيًّا من عدة عمليات توليد هو الناتج الذي يُحتفظ به. تلك استدعاءات نصية عادية، وتعمل عبر نقطة نهاية واحدة متوافقة مع OpenAI على أكثر من 200 نموذج مع أسعار المزوّدين المعلنة التي تُمرَّر بهامش 0%، لذا يصبح تخفيض المورّد ساريًا في اليوم نفسه بدلًا من بعد دورة تعاقدية. التحويل التلقائي عند الفشل أكثر قيمة هنا منه في عبء عمل دردشة، لأن استدعاء تعليق يفشل في الدقيقة الرابعة من جلسة أسئلة وأجوبة يجب أن يُعاد توجيهه بدلًا من فقدان التوليد.

القرار، كلٌّ في سطر واحد

إذا كان المُخرَج النهائي مقطعًا منتهيًا مع صوت، وكنت تفضّل ألا تمتلك وحدة معالجة رسوميات (GPU)، فإن Wan 2.7 هو الوحيد من بين الاثنين الذي يبيعك ذلك، ونسخته الخاصة بالتحرير هي أقوى شيء في العائلة استنادًا إلى الأدلة المتاحة. تحقق من الإيقاف المقرر في 10 أكتوبر قبل الالتزام بـ reference-to-video.

إذا كان المُخرَج النهائي عبارة عن خط معالجة تتحكم به أنت، وإذا كانت وحدات مدتها خمس ثوانٍ تناسب قائمة اللقطات لديك، وإذا أردت ضبطه ضبطًا دقيقًا أو تشغيله دون اتصال، فإن Kandinsky 6.0 Video هو الوحيد بين الاثنين الذي يتيح ذلك — على حساب تصيير بطيء على الأجهزة الاستهلاكية وادعاء جودة لا يزال بالكامل خاصًا بالمختبر نفسه. والحدث الجدير بالمتابعة على ذلك الجانب بسيط: تصنيف Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

هناك لا تماثل واحد يجدر ذكره قبل الختام، لأنه سيبقى بعد كلا الطرازين. سقف Wan 2.7 هو من يحدده Alibaba تعاقديًا وتقنيًا — وعندما تُسحب متغيرات المجموعة أو يُعاد تسعيرها، يرث خط الأنابيب لديك القرار. أما سقف Kandinsky 6.0 Video فهو عتادك أنت، ورخصة MIT تعني أن نسخة متفرعة يمكن أن تعيش أطول من خريطة طريق المختبر. الفرق التي اكتوت من اختفاء طراز من كتالوج تميل بعد عام إلى إعطاء هذا الفرق وزنًا أكبر مما فعلت يوم اختارت.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.