بطاقة عنوان مُولَّدة تحمل النص 'Kandinsky 6.0 Video vs Grok Imagine Video' مع عنوان فرعي 'انقلبت لوحة الصدارة'، فوق صف أيقونات مُوسوم بـ'توليد الفيديو' و'الصوت المتزامن' و'النشر مفتوح الأوزان'. يقع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Kandinsky 6.0 Video مقابل Grok Imagine Video: انقلبت لوحة الصدارة

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في يناير 2026، عندما Grok Imagine Video أُطلِق، تصدّر ساحة فيديو Artificial Analysis في كلا الوضعين. اليوم، تضع لوحة الصدارة نفسها إصداره الحالي في المرتبة الحادية عشرة أو الثانية عشرة في التحويل من النص إلى الفيديو. هذه ليست فضيحة وليست فشلاً — بل هو ما يحدث لفئة سريعة الحركة خلال تسعة أشهر، وهو السبب الصادق لمقارنة نموذج التوليد لدى xAI بـKandinsky 6.0 Video الآن. أحدهما خدمة مُحسَّنة لمدى سرعة إنتاجك مقطعاً آخر؛ والآخر نقطة حفظ مرخّصة بموجب MIT، بـ29 مليار معامل في إصدار Pro و3 مليارات في إصدار Lite، أصدرها مختبر Kandinsky التابع لـSber في الأسبوع الأول من أكتوبر 2026، وتولّد خمس ثوانٍ من الفيديو مع صوت متزامن بتردد 44 كيلوهرتز ومزامنة شفاه. السؤال المثير للاهتمام ليس أيهما متقدم على لوحة الصدارة — بل ما يستطيع كل منهما بنيوياً فعله بعد ذلك.

اللوح الذي تحرك تحته

Grok Imagine Video هو نموذج التوليد الخاص بـ xAI، صدر لأول مرة في 29 يناير 2026 ومستقر عند الإصدار 1.5 منذ 16 يونيو. على لوحة المتصدرين للنص إلى فيديو الخاصة بـ Artificial Analysis، يحتل إصداره 1.5 المركزين الحادي عشر والثاني عشر بتصنيف Elo 1,045 (±9) من أصل 4,056 صوتًا، ومُدرج بسعر 15.00 دولارًا للدقيقة. الإصدار الأصلي غير موجود على تلك اللوحة.

تحويل الصور إلى فيديو هو المجال الذي تكون فيه العائلة أقوى، وهو النقطة التي يفترق عندها الإصداران بطريقة تستحق قراءة متأنية:

• grok-imagine-video-1.5 — من السابع إلى التاسع، إيلو 1,098 (±8)، 5,267 صوتًا، 8.40 دولار/دقيقة.

• grok-imagine-video (إصدار يناير) — الترتيب 12–17، إيلو 1,072 (±7)، 14,371 صوتًا، 4.20 دولار/دقيقة.

• على سبيل القياس، تتصدّر MiniMax H3 Max لوحة I2V تلك عند Elo 1,195 (±9) بعد 5,894 صوتًا، بينما يأتي Wan 3.0 في المركز السادس عند 1,164.

فيما يلي قراءتان، وكلتاهما صحيحة. البناء الأحدث من xAI متقدم حقًا على سابقه في تحويل الصور إلى فيديو، بمقدار 26 Elo، ويكلف ضعف ذلك في الدقيقة ليكون كذلك. وقصة أسبوع الإطلاق — نموذج وصل إلى القمة — لم تصمد: تحرك الميدان، وجمعت الساحة عشرات الآلاف من الأصوات عبر اثني عشر نظامًا أحدث، وموقع في منتصف الجدول هو ما تضع فيه تسعة أشهر من المنافسة مولّدًا سريعًا متعدد الأغراض.

لا يملك Kandinsky 6.0 Video أي تصنيف Elo على أي لوحة صدارة. أدلته هي تشغيل VABench وتقييم بشري أجراه المختبر، وكلاهما نشرته Sber، ولم يُعَد إنتاجهما خارجها. إن وضع نموذج مفتوح غير مدقَّق إلى جانب نموذج تجاري مُقيَّم هو بالضبط المقارنة التي ينبغي التعامل معها بحذر: فموقع النموذج المُقيَّم حقيقي وغير مُجمِّل، وموقع النموذج غير المُقيَّم مجهول. "المجهول" ليس "أفضل".

نوعان من السرعة، وواحد منهما فقط يُقاس بالثواني.

هدف تصميم Grok Imagine Video هو الإنتاجية لكل منشئ. إنه مدمج في X، ويعيد مقطعًا نهائيًا مع الصوت، ومجموعة ميزاته تبدو وكأنها قائمة بالأشياء التي يفعلها الناس فعليًا في التدفق: نسب أبعاد متعددة، حركة الكاميرا، إضافة الكائن وإزالته وتبديله، نقل النمط، التوليد المشروط بالمراجع من عدة صور لاتساق الشخصية، صوت أصلي مع حوار ومؤثرات وموسيقى. يصل طول المقطع إلى خمس عشرة ثانية، ويبلغ الحد الأقصى للدقة 1080p. المنتج بأكمله مبني بحيث تكلفك المحاولة الثانية بضع دقائق وبضعة سنتات.

Kandinsky 6.0 Video سريع بمعنى مختلف — ليس لكل محاولة، بل لكل وحدة ملكية. لا شيء فيه فوري. إن أوقات التشغيل الخاصة بالمستودع نفسه للنموذج غير المقطّر، بعد الإحماء وباستثناء تحميل الأوزان وترميز MP4، تضع مقطع Pro Full HD مدته خمس ثوانٍ عند نحو 402 ثانية على H100، و854 على RTX 5090، و1,247 على RTX 4090، و3,530 على RTX 5060 Ti. ويبلغ Lite Full HD 284 ثانية على H100. الأداة التي تجعل ذلك محتملاً هي نقطة التحقق المقطّرة، التي قاستها الورقة البحثية على قدم المساواة مع النموذج الكامل — مُفضَّلة أو متعادلة في أغلبية المعايير، بمتوسط تفضيل 51% مقابل 49%، دون أن يبلغ أي فرق فردي دلالة إحصائية. ما تحصل عليه مقابل التصيير البطيء هو نموذج على قرصك الخاص دون أي عدّاد لكل مقطع يعمل على الإطلاق.

هذا هو الشكل الحقيقي لهذه المواجهة. يُحسّن Grok Imagine Video تكلفة المحاولة العاشرة. أما Kandinsky 6.0 Video فيُحسّن تكلفة المحاولة رقم عشرة آلاف، ويفرض عليك الثمن عتادًا وصبرًا مقابل المحاولة الأولى.

كلاهما يولّدان الصوت — وهما ليسا الادعاء نفسه

هذا هو المحور الذي قد تقول فيه مقارنة كسولة "تعادل" وتكون مخطئة.

ينتج Grok Imagine Video صوتًا أصليًا مع الحوار والمؤثرات والموسيقى كواحدة من بين ميزات عديدة. إنه مُولِّد متعدد الأغراض يتضمن الصوت ضمنًا.

تتمحور Kandinsky 6.0 Video حول الصوت. تقوم المعمارية على CrossDiT ثنائي التيار، يقرن مسار فيديو مُهيأ من Kandinsky 5.0 Video بمسار صوتي دُرّب من الصفر على مجموعات صوتية كبيرة، ويربط بينهما انتباه تقاطعي ثنائي الاتجاه، ويُدرّبان معًا. المخرجات بتردد 44 كيلوهرتز مع مزامنة شفاه صريحة، ويُقال إن مرحلة التعلم المعزز في الورقة البحثية تخفض معدل خطأ الكلمات في الكلام المُولَّد بنسبة 47% — مقيسًا بـ Whisper-large-v3، وهو أحد نماذج المكافأة في التعلم المعزز، وهو تفصيل مهم لأن الورقة تُبلغ عن معدل خطأ كلمات ثانٍ غير قابل للمقارنة إلى جانب VABench باستخدام Qwen3-ASR-1.7B. الكلام هو ما دُرّب عليه النموذج في مرحلة التدريب اللاحق.

في المقابل، تتسم دراسة Sber الخاصة بالصراحة بشأن مواضع خسارتها. في التقييم المقارن جنبًا إلى جنب الذي أجراه المختبر، يُفضَّل MiniMax H3 وDreamina Seedance 2.0 وفق المعايير البصرية بفوارق كبيرة، ويوصف النموذج بأنه منافس لا متقدم. أما الادعاء الذي يستحق الأخذ به بجدية فهو أضيق نطاقًا وأكثر فائدة: ففي مواجهة Kling 2.6 وVeo 3.1 Fast، تتبادل النتائج الأفضلية معيارًا بمعيار، ويظل Kandinsky 6.0 Video منافسًا في جودة الكلام والمزامنة بين الصوت والصورة، حيث تنتهي نسبة كبيرة من المقارنات بالتعادل.

خمس عشرة ثانية مقابل خمس، وما تكلفة الوصول إلى كل منهما

• الحد الأقصى للمقطع — {{1}}Grok Imagine Video{{/1}}: حتى 15 ثانية. {{2}}Kandinsky 6.0 Video{{/2}}: 5 ثوانٍ ثابتة، 121 إطارًا بمعدل 24 إطارًا في الثانية، لا يوجد وضع تمديد في الإصدار.

• الدقة — Grok Video: حتى 1080p. Kandinsky 6.0: SD وHD وFull HD عبر نموذج مخصص للدقة الفائقة، مع رفع دقة خمسة مقاطع بمقدار x4 أو x2.25.

• مدخل مرجعي — Grok Imagine Video: توليد مشروط بالمرجع من عدة صور لاتساق الشخصية، بالإضافة إلى إضافة/إزالة/استبدال الكائنات. Kandinsky 6.0 Video: صورة واحدة، تُطبَّق كإطار ذيل مقنّع.

• التسعير — Grok Imagine Video: لكل ثانية من الإخراج، بدءًا من الطرف الأدنى للنطاق وصولًا إلى 0.30 دولار/ثانية بدقة 1080p، مع رسوم إضافية لكل صورة مُدخَلة؛ والوصول المجاني يقع خلف مستويات اشتراك X. Kandinsky 6.0 Video: لا شيء — لا خدمة، ولا سعر، فقط وقت GPU الذي توفره.

• الأوزان — Grok Imagine Video: لا. Kandinsky 6.0 Video: MIT، وPro وLite، مع تكامل diffusers.

العلاوة الخاصة بإصدار Grok الأحدث هي الرقم الذي يستحق وضع دائرة حوله. الانتقال من إصدار يناير إلى 1.5 يكلف ضعف المبلغ لكل دقيقة على لوحة تحويل الصورة إلى فيديو، ويحقق 26 نقطة إيلو. هذا تحسن حقيقي بسعر حقيقي، وهي نفس المقايضة التي يطلب كل مورّد فيديو من المشترين القيام بها الآن.

أين يتناسب جهاز التوجيه، وأين لا يتناسب

لا يقدّم OrcaRouter خدمة Grok Imagine Video أو Kandinsky 6.0 Video، ولا يدّعي أي شيء هنا خلاف ذلك: أما Kandinsky فهو لك لتنزيله وتشغيله، ويُوصَل إلى Grok Imagine Video عبر واجهات xAI الخاصة. وكل ما يحتاجه أي خط أنابيب مبني على أي من هذين النموذجين من الموجّه هو النص المحيط بعملية التصيير — قائمة اللقطات، وتوسيع المطالبة الذي يحوّل فكرة إلى الوصف الطويل أو القصير الذي دُرّبت عليه هذه النماذج، وأعمال وضع التعليقات والنسخ، وملخصات المراجعة التي تحدد أي عملية توليد يتم الاحتفاظ بها. تعمل هذه على نقطة نهاية واحدة متوافقة مع OpenAI عبر أكثر من 200 نموذج نصي بسعر قائمة المزوّد مع هامش ربح 0%، لذا يكون أي تخفيض من المزوّد فعّالاً على المفتاح نفسه في اليوم الذي يصدر فيه، مع تحويل تلقائي عند الفشل بحيث يُعاد توجيه استدعاء فاشل في منتصف قائمة انتظار التصيير بدلاً من تعطيل الدفعة. إن التنسيق حول نموذج فيديو يمثل مشكلة توجيه حتى عندما لا يكون نموذج الفيديو نفسه قابلاً للتوجيه، وهذا هو الحال بالنسبة لكليهما اليوم.

أيّ واحد، ولأيّ غرض؟

اختر Grok Imagine Video عندما يكون العمل قائمًا على الكمّ: مقاطع للسوشيال ميديا، وتكرارات سريعة، ولقطة ستعيد توليدها ست مرات قبل أن تصل إلى الصورة الصحيحة، وموعد نهائي لا يقبل التمديد. سعرها لكل محاولة هو المنتج نفسه، وكونها الآن في منتصف الجدول لا في قمته هو الثمن الطبيعي لفئة تتحرك بهذه السرعة.

الجأ إلى Kandinsky 6.0 Video عندما يكون العمل مسار معالجة: وحدة ثابتة مدتها خمس ثوانٍ يمكنك معالجتها بالدفعات، وتمريرة من صورة إلى فيديو حيث تكون مطابقة صورة ساكنة مقدمة هي ما يهم، وكلامًا تريد أن يكون مفهومًا، وناتجًا نهائيًا تفضّل ألا تستأجره. خصّص ميزانية للتصيير، وتوقّع أن يكون بطيئًا على أي عتاد استهلاكي، وتعامل مع كل رقم جودة في هذا النص على أنه خاص بـ Sber حتى يقيّمه شخص من خارج المختبر.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

ما يجعل هذه المواجهة جديرة بالمتابعة هو أيّهما قادر على استيعاب ربع سيئ. إذا تراجع Grok Imagine Video أكثر في الساحة، فالجواب هو نموذج أفضل وسعر جديد — هكذا تعمل هذه الفئة، وقد أظهرت xAI بالفعل أنها ستطلق واحدًا. إذا اتضح أن Kandinsky 6.0 Video في منتصف الجدول بعد تقييمه، فنقطة التحقق لا تزال موجودة، ولا تزال تعمل، ولا يزال بالإمكان ضبطها ضبطًا دقيقًا؛ ولا يتغير أي شيء في الترخيص مع الرقم. هذان نوعان مختلفان من المتانة، وواحد فقط منهما يقيسه Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.